🎯 AI大模型 · 国产模型
一、多模态"睁眼",开源让全球开发者免费用DeepSeek-V4首款多模态模型开源,多项基准测试超越Claude Opus 4.8,国产多模态AI正式"睁眼"
8月31日上午,DeepSeek在Hugging Face开放了DeepSeek-V4-Flash-Vision-Exp模型权重,这是V4系列首款实验性多模态模型,采用MIT License开源。开发者可直接下载模型权重并自行部署,涵盖视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections等核心模块。从"只能听"到"能看会想",DeepSeek终于补上了视觉能力的最后一块拼图。
该模型基于V4-Flash架构,通过加入视觉模块并继续训练,使模型获得图像理解能力。DeepSeek展示的案例包括根据要求制作PPT、读取和修改网页、生成带动态效果的前端页面。这类任务的核心不是传统意义上的识图,而是模型需要先理解视觉内容,再结合代码、推理和工具调用完成后续操作。开源后的模型总规模约3050亿参数,支持JPEG、PNG、GIF、WebP格式图片,可接收单张或多张图片输入。
二、基准测试超越Opus 4.8,国产多模态站上世界之巅在四项多模态基准测试中,V4-Flash-Vision-Exp有两项超越Anthropic的Claude Opus 4.8。在Agents' Last Exam中,DeepSeek取得27.3分,高于Opus 4.8的25.7分;ZeroBench的Pass@5成绩为35.0,也高于Opus 4.8的34.0分。在Terminal Bench 2.1中,Vision版本取得83.9分,此前V4-Flash-0731为82.7分;DeepSWE从54.4升至59.3,超过官方列出的Opus 4.8的58.0分。值得注意的是,加入视觉能力后,V4的纯文本Agent能力不仅没有下降,反而在某些任务上有所提升。
当然,新模型并非完美。在NL2Repo测试中,Vision版本得分为57.7,明显低于Opus 4.8的69.7;CyberGym则由此前的76.7下降到75.3。DeepSeek官方将其纯文本能力概括为与V4-Flash"持平"。有分析指出,模型的视觉能力目前更偏向"理解+操作"而非"高清细节读取",这是一个更务实的技术路线选择——先解决真实场景的视觉Agent需求,而非追求视觉能力的极致。
三、开源战略背后的深意:用生态换时间DeepSeek选择开源而非闭源,背后是清晰的战略考量。开源MIT License意味着全球开发者可以免费商用,这将加速V4多模态能力在各类应用中的落地。从GitHub到Hugging Face,到各类AI编程工具,DeepSeek正在构建一个围绕国产模型的全球开发者生态。当OpenAI和Anthropic还在为闭源模型的高昂定价发愁时,DeepSeek用开源策略快速占领开发者心智。
与此同时,DeepSeek在Hugging Face上的模型下载量持续攀升,社区贡献者和二次开发者正在基于V4系列构建更多多模态应用。从技术演进看,V4系列从纯文本到多模态的跨越,标志着国产大模型正式进入"全能力竞争"时代。当全球AI竞争从语言智能走向多模态智能,DeepSeek用开源策略给出的答案可能是:真正的技术自信,是敢于让全世界看见。
综合观察者网、科创板日报、Hugging Face报道 | 2026年9月2日