今
🤖 AI大模型 · 深度技术
🔥 架构不动、参数不增,仅靠后训练就让Agent能力飙升6倍,V4-Flash用实战证明:大模型下半场拼的不是模型有多大,而是后训练有多"卷"。
一、不改架构,靠"后训练... 展开 ▼
🤖 AI大模型 · 深度技术
🔥 架构不动、参数不增,仅靠后训练就让Agent能力飙升6倍,V4-Flash用实战证明:大模型下半场拼的不是模型有多大,而是后训练有多"卷"。
一、不改架构,靠"后训练"逆天改命
7月31日,DeepSeek正式推出V4-Flash正式版API,随即在AI圈引发热议。很多人都在问 #为什么DeepSeek-V4-Flash-0731的后训练如此有效?# 答案是:它在预览版基础上,模型架构和参数规模纹丝不动,仅通过后训练优化就实现了Agent能力大幅跃升。
V4-Flash采用MoE混合专家架构,总参数2840亿,激活仅130亿,支持100万Token上下文窗口。在DeepSWE基准测试中,其后训练版本较V4-Pro预览版提升了超过6倍——这种"不换底座的性能飞跃",在业界极为罕见。
二、极致性价比,智能得分50但成本只要3美分
美国研究机构Artificial Analysis的独立评测显示,V4-Flash智能指数得分为50分,与谷歌Gemini 3.6 Flash持平。虽然距Opus 5的61分仍有差距,但它的加权平均任务成本仅为3美分,不到Claude Fable 5的百分之一,甚至比GPT-5.6 Luna降价80%后还便宜40%。
不过短板同样明显:在长流程Agent任务中仍不够稳,连续几百轮的工具调用容易累积小错。业内人士评价它适合"低成本重来"型场景——财报分析、卷宗处理这类任务,多跑几次总比用高价模型划算。
三、涨价前夜的信号与行业启示
就在大家为性价比欢呼时,DeepSeek于8月6日公告计划整体上调API定价,预计涨幅较大。这释放了一个信号:低成本模型的红利窗口可能正在收窄,企业需要尽快评估接入策略。
更深层的意义在于,V4-Flash的成功证明后训练正从"锦上添花"变为"核心竞争力"。当模型规模增长趋缓,谁能在有限参数下榨出更多智能,谁就能主导下一轮竞争。
综合21世纪经济报道、Artificial Analysis评测、财联社报道 | 2026年8月6日
收起 ▲