🤖 人工智能 · 大模型前沿
一、后训练魔法:同等参数下的性能质变🔥 DeepSeek-V4-Flash正式版在参数、架构不变的情况下实现性能跃升,综合基准测试多项指标超越GLM-5.2,以极致性价比重塑大模型行业定价逻辑。
7月31日,深度求索公司宣布DeepSeek-V4-Flash正式版API上线公测。这并非一次简单的版本迭代——在模型参数和底层架构完全不变的前提下,正式版通过重新后训练实现了效能的显著跃升。据大模型评测机构SuperClUE的基准测试,V4-Flash正式版在智能体终端编程、长文本理解等多项指标上全面超越智谱GLM-5.2,且单题推理成本仅为GLM-5.2的三十分之一。
这一现象印证了业界一个关键判断:大模型竞争正从"堆参数"转向"拼训练"。有分析师指出,"充分的预训练研究可以在同等算力下大幅释放模型能力",中训练和后训练环节的重要性正在快速上升,成为拉开差距的核心战场。
二、斩杀线效应:七成大模型被划入淘汰区AI评测机构ArtificialAnalysis将128款主流模型纳入对比后发现,V4-Flash正式版的智能指数达到50分,而单次任务的成本仅约3美分。以此为坐标画出的"斩杀线",直接将约70%的大模型产品划在了线以下——这些模型价格更贵,表现反而更差,面临被快速替代的风险。
调用量数据更有说服力。OpenRouter平台显示,V4-Flash正式版上线后,日调用量从1170亿Token暴涨至近1.26万亿Token;8月1日单日处理总量达8万亿Token,其中5万亿来自免费试用。一个模型的单日消耗量已超过容纳数百款模型平台的总和,供需矛盾一触即发。
三、告别白菜价:DeepSeek预告全面提价就在正式版上线不到一周,DeepSeek于8月6日发布公告,计划"整体上调API服务定价,预计涨幅较大"。这是该公司首次以公告形式预告全面涨价,与此前高峰时段调价不同,本次直接指向全线产品。当前V4-Flash输入1元/百万Token、输出2元/百万Token的定价,有业内人士测算大概率低于真实成本,毛利率为负。
涨价的底层逻辑也不复杂:Agent类应用的爆发使单次任务Token消耗从不足2000个跃升至50万到100万个,推理成本被指数级放大。正如梁文锋此前所言"十个月收回设备成本"——当调用量突破万亿级,贴钱换规模的路终究要走完。市场真正的疑问是:涨价之后的DeepSeek,核心竞争力究竟是性价比还是硬实力?
综合中国经济网、经济参考报、经济观察报报道 | 2026年8月9日