🎯 人工智能 · 大模型评测

🔥 DeepSeek V4 Pro 正式版Agent能力暴涨近50分,用「比我强的没我便宜」补齐了开源旗舰的最后一块短板。

一、深夜悄悄上线,架构没变能力暴涨

8月13日凌晨,DeepSeek官网悄悄刷新了API文档,模型名还是那个deepseek-v4-pro,但fingerprint已变成fp_v4pro_20260812。从4月24日预览版上线算起,整整111天的等待,正式版就这么在一个周三深夜静默落地。硬参数与预览版完全一致——1.6T总参数、49B激活参数的MoE结构,支持1M上下文、384K最大输出,变的只是后训练,但变化大到像换了个模型。

最夸张的数字来自Agent相关评测:DeepSWE从预览版的12.8飙到62.7,涨了近50分;Cybergym从52.7到83.3,Terminal Bench从72.1到87.9。这些测试有一个共同点——都涉及长链路的代码修改、环境操作和工具调用,恰好是预览版最容易翻车的地方。

二、代码与数学双料第一,短板也很坦诚

翻开成绩单,V4 Pro正式版在编程领域几乎无对手:LiveCodeBench深度思考模式得分93.5,Codeforces竞技编程达到3206分,人类排名第23,都创下开源模型新纪录。数学推理同样硬核,IMOAnswerBench拿到89.8分,HMMT 2026达到95.2分,是国产同代模型里的最强选手。

但短板同样写得明白:HLE不使用工具时42.7分,落后Claude Opus 4.8的49.8;纯知识推理和最复杂的软件工程任务,V4 Pro还没坐上头把交椅。它从来不是靠「最强」赢,而是靠那条定律——比我强的没我便宜。

三、性价比与生态,才是真正的杀手锏

价格方面,正式版每百万token输入3元、输出6元,大约是Fable 5的十分之一、Kimi K3的三分之一。虽然8月6日已预告「计划近期整体上调API定价」,但目前0813版本还没动,窗口期能撑多久不好说。更值得关注的是隐藏在多模态升级和Agent能力补齐背后的信号——DeepSeek正在把模型与Agent运行框架「Harness」打包,竞争正从「谁更聪明」转向「谁能真正替人干活」。

综合极客公园、DataLearner、人人都是产品经理报道 | 2026年8月24日