🤖 人工智能 · 大模型 · DeepSeek

🔥 DeepSeek V4-Flash以不到Pro版六分之一的参数完成反超,"规模法则"再遭正面挑战,行业真的梦回2025年春天。

一、参数没变能力暴涨,代码能力接近全球顶流

7月31日,DeepSeek在API文档更新日志中低调挂出通知:V4-Flash-0731正式版上线公测。开发者第一时间上手后发现一个反常事实——该版本的总参数和激活参数与预览版完全一致,但代码和智能体能力却"突变式"达到了全球顶尖水平。九项智能体与代码基准测试中,V4-Flash正式版全部超过自家1.6万亿总参数的V4-Pro预览版,其中"DeepSWE"基准分差高达41.6分,而在"ALE"基准上距离Claude Opus 4.8仅差半分。

换个说法,仅用Pro预览版六分之一的总参数、不到四分之一的激活参数,V4-Flash就实现了反超。这不止是"以小博大",更是不动参数架构、单靠后训练优化就撕开了性能天花板。

二、从"大力出奇迹"到"慢工出细活",规模法则再次被踩刹车

2026年以来,头部开源模型一路狂飙进入万亿参数时代:DeepSeek V4-Pro以1.6万亿参数开局,阿里Qwen 3.8-Max推到2.4万亿,月之暗面Kimi K3以2.8万亿登顶。行业默认"更大=更强"的逻辑重掌话语权——直到7月31日,V4-Flash正式版一脚刹车踩下去。它证明了一件事:AI发展不只需要大力出奇迹,还得慢工出细活

从价格端看,V4-Flash输入(缓存未命中)每百万Token仅0.14美元、输出0.28美元,与Claude Opus 4.8相比分别是后者的36分之一和89分之一。SuperCLUE智能体终端编程测评中,V4-Flash以0.64元/题的代价拿到46.46分,排名第三但单位成本仅为前两名的1/30和1/36。

三、调用量5天暴涨10倍,DeepSeek再划"斩杀线"

OpenRouter平台数据显示,发布后仅5天,V4-Flash日调用量从1170亿词元飙升至近1.26万亿词元,推动DeepSeek整体日调用量从1.64万亿增至2.59万亿,增幅达57%。测评机构Artificial Analysis指出,对比128款主流模型,V4-Flash以智能指数50分、单次任务成本约3美分的表现,成为新一代"斩杀线"——约70%的大模型产品落在这条线以下,面临被快速替代的风险。

但硬币的另一面是,DeepSeek已首次预告整体提价。有业内人士分析,梁文锋团队提升"斩杀线"之后适当拉高水位,既对冲自身算力压力,也为全行业拓宽容错空间。毕竟如果价格屠刀挥得太狠,行业生态反而加速塌缩。你怎么看这次更新——是技术奇迹,还是价格屠夫的又一次出刀?

综合21世纪经济报道、经济参考报、SuperCLUE、Artificial Analysis报道 | 2026年8月9日