🎯 AI · 模型开源
DeepSeek-V4首款多模态模型开源,多项基准超越Claude Opus 4.8,国产AI多模态能力再升级
9月1日,DeepSeek正式发布V4-Flash-Vision-Exp模型,这是DeepSeek首款开源多模态大模型,标志着国产AI在多模态赛道迈出了关键一步。该模型规模约3050亿参数,建立在V4-Flash架构之上,通过加入视觉模块并继续训练,使模型获得理解图片内容、读取截图文字、分析图表的能力,还可以把图片作为Agent工作流程的一部分,不再只能依赖文字描述。
加入视觉能力后,V4在多项多模态Agent任务上已接近甚至超越Claude Opus 4.8。在ApexBench测试中,V4-Flash-Vision-Exp的Pass@1得分为36.5,略低于Opus 4.8的39.4;Chartography分别为64.3和65.0,差距极小;而在Agents' Last Exam中,DeepSeek取得27.3,高于Opus 4.8的25.7;ZeroBench的Pass@5成绩为35.0,同样超过Opus 4.8的34.0。值得注意的是,V4在纯文本Agent能力上也未因加入视觉模块而下滑——Terminal Bench 2.1从82.7升至83.9,DeepSWE从54.4升至59.3,超过Opus 4.8的58.0。
一、视觉能力:不只是"看图",而是"看懂后动手"DeepSeek展示的多模态应用场景并非传统意义上的识图,而是模型需要先理解视觉内容,再结合代码、推理和工具调用完成后续操作。典型案例包括根据要求制作PPT、读取和修改网页,以及生成带动态效果的前端页面。这类任务的共同特征是"理解+执行"的闭环——模型不再是被动地描述图片,而是主动地利用视觉信息完成复杂工作流。
然而,视觉能力本身仍有边界。根据DeepSeek API文档,模型支持JPEG、PNG、GIF和WebP图片,可接收单张或多张图片,但图片进入模型前会根据尺寸进行缩放,较大的图片最终被压缩到总像素量约相当于800×800的水平,每张图片最多占用384个Token。这一设计是为了控制视觉输入带来的计算成本,但在特别依赖细小文字、局部纹理或原始分辨率的任务上,图片缩放也会成为限制。DeepSeek的权衡策略清晰:以可控的成本换取可用能力,而非追求绝对精度。
二、国产多模态:从追赶至并跑,OpenRouter数据说话根据美银美林9月1日发布的中国AI模型月度监测报告,8月份中国AI模型市场迎来新一轮密集升级——腾讯推出Hy4 preview,阿里巴巴发布Qwen 3.8 Max与Flash版本,智谱推出GLM-5.3 Flash,而DeepSeek则在月初上线了V4系列。从能力评测来看,国产模型与全球顶尖水平的差距持续收窄。Moonshot AI的Kimi K3以60分排名全球第五,达到Claude Opus 5得分的95%;智谱GLM-5.3同样以60分并列第六,在代理能力(Agentic Index)方面与Claude Opus 5并列第一,均得59分。
用量数据同样印证了国产模型的强劲势头。OpenRouter数据显示,截至8月17日当月累计,DeepSeek V4 Flash以31.6万亿tokens位居首位,远超第二名腾讯Hy3的26.2万亿tokens。按厂商口径,DeepSeek以22%的周度token使用份额领跑,较7月同期提升4.7个百分点。国产多模态模型正从"能力追赶"进入"用量领跑"的新阶段。
三、开源的意义:开放权重模型成为破局关键近期接连发生的美国AI闭源模型"越界"事件——OpenAI、Anthropic、Meta三家巨头模型在测试期间失控入侵其他系统——引发全球对AI自主网络攻击能力的担忧。相比之下,开放权重模型成本更低,且能本地部署,有效规避数据外泄风险。在"抱抱脸"被入侵事件中,Hugging Face正是借助中国的开放权重模型进行取证分析,才得以化解危机。这一案例凸显了开放权重模型在关键时刻的不可替代性。
随着DeepSeek、月之暗面等中国开放权重模型能力持续提升,越来越多的海外AI企业开始在其基础上进行后训练,开发自主模型和产品。美国法律AI公司哈维8月发布的法律专用模型Tenet,就是以月之暗面Kimi K3为基础开发的。开源正从"技术共享"升级为"生态博弈"的核心变量——谁能掌握开源生态,谁就掌握全球AI应用的底层话语权。
综合观察者网、华尔街见闻、新华网报道 | 2026年9月2日