🤖 AI大模型 · 科技评测

🔥 DeepSeek V4-Flash正式版用不到GPT百分之一的成本,实现了接近顶级闭源模型98%的性能,Agent能力更是暴涨6倍,国产大模型正在用"效率革命"改写竞争规则。

一、Agent能力爆发:相同任务,40秒对1分47秒

7月31日,DeepSeek官宣V4-Flash正式版API开启公测。在模型架构和2840亿总参数完全不变的前提下,仅凭重新后训练,Agent智能体终极测试得分从预览版的15.8分飙升至25.2分,直逼Claude Opus 4.8的25.7分。DeepSWE编程测试更是从7.3分暴涨至54.4分,增长超6倍。

开发者张泽的实测数据最具说服力:同一项本地文件阅读加全网信息检索任务,V4-Flash接入Hermes后仅用40秒完成,而GPT-5.6 Sol配合Codex耗时1分47秒,速度差距超过一倍。交付结果达到可用水平,对大多数日常场景完全够用。

二、价格屠杀:成本差距数十倍至上百倍

性能追平的同时,V4-Flash的价格却低得离谱。API定价输入每百万Token仅1元,输出2元;对比GPT-5.6 Sol输入5美元(约36元)、输出30美元(约216元),成本差距达到数十倍乃至上百倍。更狠的是缓存命中折扣高达98%——命中后输入低至0.02元/百万Token。张泽实测51万Token的复杂任务,总花费仅0.53元,不到一瓶矿泉水的钱。

即使OpenAI在V4-Flash发布前一天紧急将GPT-5.6 Luna降价80%,Flash的单任务成本依然比Luna低约60%。在Artificial Analysis的"能力-成本"定位图上,V4-Flash画下了一条"斩杀线":智能指数50分以上的模型中,它是最便宜的,中间层模型的商业空间被直接挤压。

三、后训练红利:不堆参数也能打

这次升级的底层逻辑引人深思:MoE稀疏激活架构使得推理时只激活130亿参数,同样的硬件能同时处理三四百个长文本请求。DeepSeek证明了大模型不需要无脑堆参数,后训练的工程优化能挖掘出模型上限之外的潜力。AI竞争正从"谁参数多"转向"谁更聪明地干活"。

当然V4-Flash并非完美——在多模态识别和复杂长链路规划上,GPT-5.6仍保持领先。但对于代码工程、文档处理、批量自动化Agent等高频场景,这套"1%成本换98%性能"的打法已经足够颠覆市场格局。

综合新浪财经、DoNews、IT之家、雪球报道 | 2026年8月6日