8月12日深夜,AI大模型公司DeepSeek官方API文档悄然更新,版本号从V4-Pro预览版切换为正式版DeepSeek-V4-Pro-0813。这一动作标志着该模型正式进入生产可用阶段,而最引人注目的变化在于其Agent能力的全面跃升——不仅补全了此前预览版缺失的Responses功能接口,更在多个关键基准上实现了近乎“暴力”的性能突破,被开发者社区视为对当前AI智能体范式的一次直接冲击。
具体数据层面,正式版在Terminal Bench 2.1上拿下87.9分,距离全球第一的Anthropic Fable 5仅差0.1分,相比预览版72.1分跃升了15.8分;而更夸张的是DeepSWE软件工程基准,从12.8分飙升至62.7分,接近5倍的增幅。同时,模型支持100万Token上下文,输出定价为0.87美元/百万Token,延续了DeepSeek一贯的性价比策略。这些数字背后,是强化学习对工具调用、多步推理与代码修正链路的深度优化。
此次升级的行业意义在于:AI Agent不再是“能调API的聊天机器人”,而是开始逼近“可独立完成复杂软件工程任务”的实体。DeepSWE近5倍的分数跃升,意味着大模型在真实仓库环境下的问题定位、代码生成与自检修复能力已发生质变。结合Responses功能的正式开放,开发者可以更稳定地构建长周期、多工具协同的自主智能体。0.87美元的低价进一步降低了试错成本,可能会加速中小团队从“调用大模型”转向“部署Agent流水线”的决策。
一句话总结:DeepSeek-V4-Pro正式版以接近全球顶尖的Agent得分和近5倍的软件工程能力跃升,宣告了高性价比自主智能体时代的加速到来。
AI 生成 . DeepSeek | 搜索综合