🤖 AI · 大模型

🔥 DeepSeek V4 Pro正式转正,推理深度大幅跃升,但幻觉率也创下新高——强是真的强,坑也要认。

一、V4 Pro正式版转正,补齐推理短板

8月13日,DeepSeek V4 Pro-0813正式GA,结束长达近4个月的预览期,旗舰模型正式转正。同月21日,V4-Flash-Vision-Exp补上视觉短板,成为首个开放API的视觉理解模型。这一套组合拳下来,DeepSeek的API矩阵终于完整了——Pro负责想得深,Flash Vision负责看得见。关于#如何评价 Deepseek V4Pro 正式版?#,很多技术圈的人第一反应都是:终于转正了。

从官方口径看,V4 Pro在Agent能力、世界知识与推理性能三大维度均达到国内及开源领域的领先水平,两个版本都支持百万级超长上下文,推理FLOP降低73%、KV缓存内存占用降低90%,算力门槛被大幅压低。

二、实测数据:推理强,但代价不小

海外评测平台Artificial Analysis的专项测评显示,V4 Pro智能指数斩获52分,相较V3.2的42分实现10分跃升,成为仅次于Kimi K2.6的全球第二大开源推理模型;在真实场景智能体任务中更是以1554分位居所有开源权重模型首位,超越Kimi K2.6、GLM-5.1等一众对手。

但硬币的另一面同样扎眼:V4 Pro幻觉率飙升至94%,V4-Flash更是高达96%,而前代V3.2的幻觉率是82%。这意味着模型在未知问题场景下几乎都会强行生成答案,"会答错也要答"成了最大的隐患。知识储备在升级,回答准确率在提升,幻觉却同步恶化,这一矛盾值得每一位开发者在生产环境里警惕。

三、价格账与落地建议

成本方面,V4 Pro运行成本约1071美元,不到Claude Opus 4.7的四分之一,但对比同类开源模型仍偏高;V4-Flash仅约113美元,成本优势显著。另有消息称V4-Pro调用量已达47.9亿Token,市场热度可见一斑。

综合来看,DeepSeek V4 Pro正式版在推理深度和智能体能力上确实站上了开源第一梯队,性价比依旧能打。但如果你要在高准确率要求的场景落地,务必加上幻觉检测与人工兜底,别让"答得快"掩盖了"答得错"。

综合51CTO、Artificial Analysis评测报道 | 2026-08-26