没有预告,没有倒计时,甚至连更新日志都没来得及写好。DeepSeek V4 Pro 的正式版,就这么悄悄的来了。
8 月 13 日凌晨,DeepSeek 官网悄悄刷新了 API 文档。模型名还是那个 deepseek-v4-pro,但 fingerprint 已经变成了 fp_v4pro_20260812。打开社区一看,消息已经炸开—— V4 Pro 正式版,来了。
从 4 月 24 日预览版上线算起,整整 111 天。
这期间 Kimi K3 高调发布抢走了开源头条,V4 Flash 正式版先行一步在 7 月 31 日上线,API 涨价的预告更是悬在所有开发者头顶。
所有人都在问同一个问题:Pro 的正式版到底什么时候来?
答案是一个周三的深夜。
01 架构没变,能力暴涨
先说硬参数。V4 Pro 正式版的模型架构和预览版完全一致——1.6T 总参数、49B 激活参数的 MoE 结构,支持 1M 上下文、384K 最大输出。 变的是后训练,而且变化大到像换了个模型。
最夸张的数字来自 Agent 相关评测。DeepSWE(DeepSeek 自家的软件工程基准)从预览版的 12.8 飙到 62.7,涨了将近 50 分。Cybergym 从 52.7 到 83.3,Terminal Bench 从 72.1 到 87.9,DSBench-Hard 翻了一倍多达到 67.2。
这些测试项有一个共同特点——它们都涉及长链路的代码修改、环境操作和工具调用。 恰好是预览版最容易翻车的地方。
DeepSeek V4 Pro 正式版 Agent 能力大幅增强|图片来源:DeepSeek
从 V4 Flash 正式版的更新日志可以推断,这轮升级的核心就是面向代码 Agent 场景的大规模后训练。Flash 版已经用同样的方法把 Agent 能力做到了「基准测试远超 V4-Pro-Preview」的程度,Pro 版只是补上了同一课。
价格方面,每百万 token 输入 3 元、输出 6 元,和预览版持平。
虽然 8 月 6 日 DeepSeek 已经预告「计划近期整体上调 API 定价,预计涨幅较大」,但目前 0813 版本还没动。窗口期能撑多久不好说,想薅的趁早。
02 天花板和脾气
跑分好看只是门票,真正有意义的是拿真实任务去试。
极客公园用 V4 Pro 正式版跑了三个不同方向的测试,试图回答一个问题—— 这个模型在「一次性生成完整可运行代码」这件事上,到底到什么水平了?

第一个任务是 Boids 群体涌现模拟。 要求在 Canvas 上实现 200 个三角形 boid 的群体行为,带分离/对齐/凝聚三个可调参数、彩色轨迹、点击生成捕食者、glassmorphism 风格控制面板。这是一个涉及物理模拟、实时渲染和 UI 设计的综合任务。
V4 Pro 用了大约 170 秒,生成了 761 行完整 HTML。打开浏览器,200 个彩色三角形在黑色背景上游动、聚散、避障,拖动滑块可以实时改变群体行为模式。效果流畅,代码一次运行通过。
第二个任务故意模糊——用中文告诉它「我想要一个好看的番茄钟工作面板」, 只给了「能计时、能记录、有白噪音、中文界面、要有质感」这几个方向,其余让模型自行决定。
V4 Pro 交回来 1223 行代码,除了基础的 25/5 分钟计时功能,它自己加了任务标签、专注统计图表、快捷键支持、甚至用 Web Audio API 从零合成了几种白噪音。
对模糊需求的「产品化补全」能力,确实比预览版有明显进步。
第三个任务是寻路算法可视化, 要求实现 BFS、DFS、A* 三种算法的逐步动画、可交互的网格画墙、迷宫自动生成。这个任务的代码量最大,也是翻车最多的地方——但翻车的方式本身就很有意思。
开着默认的 thinking 模式,V4 Pro 用了 16384 个 token 的输出配额,其中 13394 个花在了「思考」上。留给实际代码的不到 3000 个 token,直接截断,HTML 写到一半就断了。
关掉 thinking 模式重跑,54 秒就输出了完整的 715 行代码,寻路动画、迷宫生成、暗色主题一应俱全。
这不是一个 bug,而是 V4 Pro 正式版的一个真实特征——thinking 模式在复杂代码生成场景下,推理 token 可能占到输出的 80% 以上,反而挤压了实际内容的空间。
对于需要大段代码输出的任务,开发者可能需要主动关闭 thinking,或者大幅提高 max_tokens 来兜底。
03 大鲸鱼的位置
经过 API 实测之后,坦率地说,V4 Pro 0813 不是一张「全面碾压」的成绩单。
HLE 不使用工具时 42.7 分,落后 Claude Opus 4.8 的 49.8 和 Fable 5 的 53.3。NL2Repo 以 61.5 落后 Opus 4.8 的 69.7。有 Kimi K3 在前,它在部分测试上也存在轻微差距。
纯知识推理和最复杂的软件工程任务,V4 Pro 还没有坐上头把交椅。
但 DeepSeek 从来不是靠「最强」赢的。它靠的是那条所有人都背得出来的定律——比我强的没我便宜,比我便宜的没我强。
每百万 token 输入 3 元的价格,大约是 Fable 5 的十分之一、Kimi K3 的三分之一。
在 Agent 能力从「几乎不可用」暴涨到,「能和头部闭源模型正面对打」之后,这条定律的杀伤力比预览版时期大了一个量级。
更值得关注的是藏在 V4 Flash 正式版更新日志里的一行小字——评测使用了「DeepSeek Harness 极简模式(即将发布)」作为 Agent 框架。结合前两天注册的「DeepSeek Harness 团队」公众号和此前的招聘信息, DeepSeek 正在准备把模型和 Agent 运行框架打包推出。
如果说过去大家的竞争还停留在「谁的模型更聪明」这个维度,那 Harness 的出现意味着竞争正式进入下一阶段—— 不是比谁的大脑更好,而是比谁能把大脑、手脚和工具箱组装成一个真正能替人干活的系统。
V4 Pro 正式版补齐了大脑这一环。接下来,就看那个「即将发布」还要等多久了。



