🎯 AI · 人工智能 · 大模型

🔥 AI正从"会聊天"走向"能干活",DeepSeek用一次Agent能力的暴力拉升,宣告大模型进入执行时代。

一、Agent能力从"不及格"到"领跑"

8月13日凌晨,DeepSeek毫无预告地放出了V4 Pro正式版,底层版本号为DeepSeek-V4-Pro-0813。这次最炸裂的不是参数堆得多高,而是软件工程基准DeepSWE从12.8分直接飙到62.7分,暴涨390%。要知道预览版在这项测试里几乎"不及格",现在却一脚踩进主流Agent产品的竞争区间。AI从"更会答题"变成了"更能把一件事干完"。

所谓#DeepSeek重磅更新 V4Pro正式版上线#,本质是后训练的针对性重构。架构仍是1.6万亿总参数、490亿激活参数的MoE,1M上下文和384K最大输出都没变,变化的全在Agent相关的训练策略上。Cybergym、Terminal Bench、NL2Repo等长链路基准全线大涨,直白点说:模型终于学会像工程师一样持续干活了。

二、双协议兼容,迁移成本归零

正式版在API层面憋了个大招——同时兼容OpenAI和Anthropic两套接口格式,还原生支持Responses API并针对性适配了Codex。这意味着你之前给Claude Code写好的整套工作流,改一个base_url和api_key就能直接喂给V4 Pro,代码零改动。对开发者来说,换模型最大的阻力从来不是模型好坏,而是迁移成本,这一刀直接给砍平了。

与此同时,官方还引入了峰谷定价机制:闲时价格是高峰时段的一半,鼓励用户错峰调度。再配上三档思考强度(low/high/max)按需调节,简单任务用low能把成本和延迟降一半以上。这套组合拳,摆明了是从"拼参数"转向"拼落地成本"。

三、行业风向:进入"干活时代"

V4 Pro的发布是整个AI行业重心迁移的一个缩影。2024年各家拼的是对话质量,2025到2026年,竞争焦点已经转向Agent能力——模型能否自主规划、调用工具、持续执行复杂任务。用户不再只问"AI能不能回答我",而是开始问"AI能不能帮我完成一件事"。

当然,第三方综合评测的分数相对保守,说明模型在通用对话上的提升并没有Agent那么夸张,专项工程能力的进步速度已超过通用智能。这场没有发布会的发布,或许才是AI竞争进入"干活时代"的真正发令枪。

综合DeepSeek官方、CSDN、光明网报道 | 2026-08-26