🤖 领域 · AI大模型

🔥 DeepSeek-V4首款多模态模型权重开源,3050亿参数"睁眼"后在多模态Agent任务上逼近Claude Opus 4.8

一、视觉能力补齐,V4系列完成拼图

8月31日上午,DeepSeek在Hugging Face开放了DeepSeek-V4-Flash-Vision-Exp模型权重,开发者可以直接下载模型权重并自行部署。这是V4系列首款实验性多模态模型,建立在V4-Flash架构之上,通过加入视觉模块并继续训练,使模型获得处理图片的能力。

在纯文本任务上,官方称V4-Flash-Vision-Exp与V4-Flash整体保持相近水平,主要区别是新模型能够识别照片内容、读取截图中的文字、分析图表,也可以把图片作为Agent工作流程的一部分,而不再只能依赖文字描述。DeepSeek-V4-Flash-Vision-Exp规模约3050亿参数,开源仓库除了模型文件,还包括视觉编码器和Aligner等组件的参考推理实现,并覆盖DFlash Attention、MoE、Hyper-Connections和DSpark等核心模块。

二、从"看图"到"动手",多模态Agent成新战场

DeepSeek展示的案例包括根据要求制作PPT、读取和修改网页,以及生成带动态效果的前端页面。这类任务的共同点并不是传统意义上的识图,而是模型需要先理解视觉内容,再结合代码、推理和工具调用完成后续操作。

从DeepSeek公布的基准测试来看,加入视觉能力后,V4在部分多模态Agent任务上已经接近其选择对比的Anthropic多模态大模型Claude Opus 4.8。在ApexBench测试中,V4-Flash-Vision-Exp的Pass@1得分表现亮眼,标志着中国开源多模态模型正式进入国际第一梯队。多模态Agent能力正在成为下一代大模型竞争的核心分水岭,DeepSeek用开源方式让全球开发者都能参与到这场技术竞赛中。

三、开源生态的"中国力量"持续增强

继V4-Flash在推理和代码能力上引发全球关注后,V4-Vision再次证明中国AI模型的持续突破能力。开源权重意味着企业可以本地部署、二次开发,避免数据外泄风险,这与近期频发的闭源模型"越界"事件形成鲜明对比。

随着国产芯片集群持续发力,DeepSeek系列模型正在从"性价比之选"向"能力标杆"转变。在全球AI开源生态中,中国模型的权重调用量占比已突破54%,这一趋势在V4-Vision开源后将进一步加速。开源多模态模型正在重塑全球AI竞争格局,而DeepSeek无疑是这一变革的核心推手之一。

综合观察者网、每日经济新闻、DeepSeek官方报道 | 2026年9月2日