🤖 人工智能 · 大模型
🔥 DeepSeek V4 Flash正式版Agent能力暴涨,DeepSWE基准从7.3飙升至54.4,以开源姿态和极致性价比重新定义AI数字员工标杆。
一、Agent能力脱胎换骨,代码和工具调用飞跃式升级
7月31日,DeepSeek V4 Flash正式版悄然上线API公测,这次升级跟Preview版相比堪称"重生"。模型结构保持2840亿总参数、130亿激活参数的MoE架构不变,但经过重新后训练,Agent能力发生了质变。#DeepSeek V4 flash 正式版发布#后,最引人注目的是DeepSWE基准从7.3直接飙到54.4,翻了七倍多;Terminal Bench终端操作得分82.7,Cybergym网络安全攻防模拟76.7,工具调用综合测试Toolathlon Verified也达到70.3。用大白话说就是——这个模型现在像个真正会干活的数字员工,不只嘴上聪明,手上也利索。
在开发者最关心的编程场景中,内部全栈开发测试DSBench-FullStack达到68.7分,高难度编码专项DSBench-Hard拿下59.6。这意味着无论是写前端页面、搭后端架构,还是啃复杂算法题,V4 Flash正式版都比预览版靠谱得多。而且原生支持Responses API并适配了Codex生态,一次配置就能在Codex CLI、ChatGPT桌面端和VS Code插件中直接调用。
二、极致性价比:2000万token的Agent任务折前只要3.5美元
DeepSeek这次不光拼能力,还把价格打到了地板。API定价每百万token输入仅1元、输出2元人民币,折合缓存命中0.0028美元、未命中0.14美元、输出0.28美元。跑一个需要2000万token的Agent任务,折前总成本才约3.5美元。对比同类产品动辄数十美元的成本,这简直是降维打击。尤其值得注意的是,模型延续了100万Token上下文窗口,在处理超长文档、代码库分析等场景中优势明显。
这种性价比路线正在拉动整个产业。中国联通北京市分公司已依托京元Token服务平台快速完成V4 Flash部署,基于国产算力服务器并引入DSpark推测解码加速框架优化推理效率。界面新闻报道指出,随着企业部署、云端调用和国产芯片适配同步推进,国产算力需求正在被持续点燃,中国AI模型的全球市场份额已超美国,占据约三分之二。
三、开源策略与产业生态:MIT协议+国产化双轮驱动
V4 Flash正式版延续了MIT开源许可,权重完全开放。这意味着任何企业和开发者都可以零成本商用,无论是本地部署还是二次开发都毫无障碍。从前瞻产业研究院的数据来看,国产模型以开源策略、低成本与便于本地化部署的优势,正在全球开发者社区掀起"东升西降"的潮流。值得一提的是,DeepSeek官方还透露V4-Pro正式版将尽快发布,届时能力和生态完整度有望再上一个台阶。
不过目前公测仅限API接口,App和网页端暂无法体验最新能力——这大概是唯一的"美中不足"。但对开发者和企业用户来说,一个价格仅为竞品几十分之一、Agent能力逼近Claude Opus的开源模型,已经足够改变游戏规则了。
综合新华网、界面新闻、潮新闻、前瞻产业研究院报道 | 2026年8月4日
收起 ▲