🤖 人工智能 · 模型发布
🔥 DeepSeek V4.1 Flash 正式转正,用更小激活参数把“更强+更快+更便宜”三件事一起做了。
一、为什么这次更新值得关注
9月10日,DeepSeek 正式发布 DeepSeek V4.1 Flash 并完成转正上线。#DeepSeek V4.1 Flash发布提速降费# 这组关键词之所以重要,是因为它同时涉及开发者最敏感的三件事:能力上限、推理速度、调用成本。官方把它定位为新架构家族里的最小尺寸模型,却要求在多数实用场景里拿到更好性价比,这对 Agent、代码助手、多模态应用都会形成直接刺激。
从公开信息看,这次升级不是简单“把模型做大”,而是把结构做对:总参数达到 552B,但输入侧只激活 8B、输出侧激活 16B,明显是冲着“低成本高吞吐”去的。对平台方来说,这意味着同样的算力预算可以承接更多并发;对应用方来说,意味着同样产品体验下,账单可能更可控。
二、价格和缓存,才是开发者最关心的变量
这次更新最扎眼的,不只是性能提升,还有 定价下调。按照最新公开价格,空闲时段输入缓存命中单价降至 0.02 元,输入缓存未命中单价 1 元,输出单价 4 元,高峰时段价格翻倍。更关键的是,官方明确提到缓存命中输入价格相较此前下降 60%,这基本就是在告诉市场:高频复用上下文的 Agent 场景,接下来会更“划算”。
与此同时,架构升级把 KV Cache 压得很狠:与上一代相比,对 HBM 的需求降到 1/4,对 SSD 的需求降到 1/8。这个变化的意义,不只在技术白皮书里,而是在真实部署里——当缓存命中费用曾是 Agent 成本大头时,压缩缓存往往比单纯压 token 单价更能直接改善 ROI。
三、接下来要看什么
一个更具信号意义的动作是,官方计划有序下线 V4 Pro,并把相关请求逐步路由到 V4.1 Flash。这其实说明,新模型不是“Flash 系列小修小补”,而是已经在相当一部分场景里拿到性价比交班权。与此同时,腾讯旗下 WorkBuddy、CodeBuddy 以及 OpenCode 全量接入,也会把模型推到更多真实开发工作流中去验证。
当然,也别把这次发布吹成“全场景通杀”。官方测试同样显示,在 GPQA Diamond 这类强调研究生级跨学科推理的任务上,它与顶级闭源模型仍有差距。更准确的理解是:V4.1 Flash 把“高性价比实用模型”的边界往外推了一格,尤其是在代码、自动化和 Agent 调用链路上更像一把快刀,而不是一把万能钥匙。
从产业角度看,接下来最有看头的有三件事:第一,价格战会不会继续往下卷;第二,更多平台是否会跟进“缓存定价”做差异化;第三,围绕 DeepSeek Harness 的插件生态,能不能长出真正的标准化 Agent 工具链。模型能力是一回事,开发者生态能不能接住,才是决定这波热度能走多远的关键。
综合 DeepSeek 官网、第一财经、澎湃新闻报道 | 2026-09-10
收起 ▲