🤖 AI大模型 · 深度评测

🔥 DeepSeek V4-Flash以GPT-5.6 Luna百分之一的价格,拿到了仅差1分的Agent能力评分,性价比碾压级领先。

一、V4-Flash正式版:Agent能力质的飞跃

7月31日,DeepSeek官宣V4-Flash正式版API开启公测。模型架构与预览版一致——2840亿总参数、130亿激活、100万Token上下文,但重新后训练后Agent能力暴涨:DeepSWE从7.3分飙升至54.4分,Terminal Bench从61.8升至82.7,九项智能体基准全面超越V4-Pro预览版。有开发者实测后感叹:"以前让它改bug还得手把手教,现在直接丢代码说'修'就行。"

更值得注意的是,V4-Flash原生支持Responses API和Codex接口,开发者无需更换调用名称即可升级,迁移成本几乎为零。不过目前正式版只发了Flash版,V4-Pro正式版仍在路上,DeepSeek表示"尽快发布",App和网页端模型也尚未同步更新——这也是外界调侃"正式版来了,但只来了一半"的原因。

二、正面硬刚GPT-5.6 Luna:差1分,省60%

GPT-5.6 Luna于7月30日刚完成一轮大降价,价格直降80%。按Artificial Analysis最新评测,Luna智能指数得51分,V4-Flash得50分,两者仅差1分,但在每任务成本上V4-Flash只需约0.09美元,Luna即便降价后也要约0.22美元,V4-Flash便宜了60%。如果把对比维度拉大到旗舰梯队:Claude Opus 4.8每任务1.78美元、GPT-5.6 Sol约1.86美元,V4-Flash的成本不足它们的百分之一。

钛媒体一篇分析用"毒圈缩圈"来形容当前格局:Agent任务消耗的Token是单轮问答的千倍量级,模型之间的单价差距被巨量Token消耗放大成了美元级差额。V4-Flash正是在这个"斩杀线"上完成了精准卡位——能力够用,价格压到极致。

三、价格战的终局:性价比才是硬通货

国内市场上,阿里Qwen3.6-Flash输出每百万Token 7.2元,字节Seed-Evolving面向Agent任务要30元,月之暗面Kimi K3更是到了100元。V4-Flash输出每百万Token仅2元人民币,而它提供的是100万上下文+强Agent能力,这个价格段的竞品要么能力不够、要么上下文短。有知情人士透露,DeepSeek API年度经常性收入已达4-5亿美元,毛利率超50%,背后是极致的工程优化和国产算力部署。

当然,V4-Flash也并非完美。8月4日曾因访问量激增出现短暂性能下降,说明随着用户涌入,服务稳定性还需要时间打磨。但总体而言,如果你需要"够强、够便宜、够长上下文"的Agent底座模型,V4-Flash目前没有对手。

综合新华网、观察者网、钛媒体、财闻、金融界报道 | 2026年8月5日