🤖 人工智能 · 大模型评测

🔥 DeepSeek Pro正式版用暴涨的Agent跑分、百万级上下文和地板级价格,把国产开源旗舰的天花板又砸低了一截。

一、正式版到底强在哪

8月13日,DeepSeek官方悄然把API里的deepseek-v4-pro更新为0813版本,Pro正式版就此上线,网页、App、API同步可用。相比预览版,最直观的变化是Agent跑分几乎全面翻倍:Terminal Bench 2.1从72.1直接冲到87.9,DeepSWE从12.8暴涨到62.7,接近原来的4.9倍。用句大白话说,预览版在长任务代码上基本属于"不会做",正式版已经能和全球第一梯队的代码Agent正面碰一碰。

这背后是技术架构的持续加码。Pro采用总参数1.6T、激活49B的MoE架构,配合同步开源的混合注意力机制与稀疏注意力方案,在1M上下文场景下,单token推理计算量仅为上一代V3.2的27%,KV缓存占用更是压到10%。长效机制做扎实了,模型才敢把百万级上下文当成默认配置。

二、参数好看,价格更狠

跑分归跑分,真正让开发者坐不住的是价格。Pro版现行定价为缓存命中输入0.025元、未命中3元、输出6元每百万token,横向看,Claude Fable 5输出价高达50美元,DeepSeek仅为它的零头,综合算下来便宜约46倍。1M上下文加上最高384K输出,对长任务Agent是硬刚需——大型代码库、几十份资料、连续工具调用,窗口不够大,模型就只能不断压缩记忆,压着压着前面做过的就忘了。

不过要泼点冷水:官方已明确预告近期将整体上调API价格,预计涨幅较大。换句话说,现在的低价更像一个窗口期,不能当成永久承诺。已经有报道,V4全系正式版上线后,DeepSeek对旗舰输出的调价幅度一度高达350%。

三、该怎么客观评价它

评价一个模型,不能只看单项第一。有人代码强、有人工具强、有人推理分高,难的是在终端操作、代码工程、工具调用、安全攻防、长任务执行上同时不瘸腿。V4 Pro在这点上做得相当均衡:CyberGym安全攻防83.3甚至略超Fable 5,NL2Repo拿到61.5站稳第一梯队,HLE带工具推理60.0,几乎没有明显短板。

当然代价也有——账号并发上限只有500,明显低于Flash版的2500,意味着它更适合接复杂高价值的Agent工作流,而非无脑承接高频小请求。整体看,DeepSeek Pro正式版是一次"能力上探、成本下探"的组合拳,它把一个过去的判断题交给了行业:当开源旗舰能在多数硬指标上和闭源冠军对线、价格却只有对方零头时,请给"国产大模型"四个字重新标个价。

综合掘金、36氪、Global Times报道 | 2026-08-24