🎯 科技 · AI大模型

🔥 DeepSeek V4视觉模型上线:补齐多模态最后一块拼图,Agent能力逼近Claude Opus

2026年8月21日,DeepSeek正式推出V4系列多模态视觉模型DeepSeek-V4-Flash-Vision-Exp,并同步开放API调用。这是DeepSeek首款具备图像理解能力的模型,标志着其完成了从纯文本处理到多模态Agent系统的关键能力补全。

根据官方公布的数据,新模型在纯文本推理、Agent能力和世界知识上与标准版V4-Flash基本持平,而在需要视觉理解的多模态Agent任务上出现明显提升。DeepSeek官方称其多模态Agent能力已逼近Claude Opus 4.8,引发业界广泛关注。

二、视觉能力补齐,Agent闭环正式打通

回顾DeepSeek V4的演进历程,4月份发布的V4系列主打纯文本推理和百万token超长上下文,在SuperCLUE等测评中斩获国产第一的成绩。然而,视觉能力一直是这套体系中最明显的短板

V4-Flash-Vision-Exp的上线,彻底改变了这一局面。新模型支持JPEG、PNG、GIF、WebP四种图片格式,单次请求最多可输入600张图,最长边支持8192像素。图片可通过Base64、公开URL或Files API传入,单张图片最多折算为384个Token,计费与文本Token一致。

更值得关注的是,DeepSeek同步上线了免费Files API,开发者可上传图片并通过file_id引用,在多个请求中重复调用,大幅降低多模态开发门槛。这意味着开发者只需修改模型名称,即可在现有Agent框架中无缝接入视觉能力

三、性能实测:不只是"看图问答"

从评测数据来看,新模型的提升主要体现在Agent任务的复杂视觉处理上。在Terminal Bench 2.1基准测试中,新模型从V4-Flash的82.7分提升至83.9分;在面向真实软件工程长任务的DeepSWE上,从54.4分升至59.3分。

而在视觉相关基准上,提升更为显著。考察专业图表理解能力的Chartography中达到64.3分,ApexBench Pass@1为36.5分,Agents' Last Exam为27.3分。DeepSeek特别说明,旧版V4-Flash在这些任务中会直接忽略多模态信息,因此这部分差距更能反映视觉能力带来的实际变化。

官方展示的典型案例包括:自动制作高端西藏自驾游PPT、根据视觉要求重新设计Harness官网、制作带3D黏土怪物动态效果的前端Demo。这些都不是简单的"看图问答",而是需要模型在长链条任务中同时处理视觉信息、代码和工具调用,形成完整的执行闭环。

综合DeepSeek官方API文档、新浪财经、36氪报道 | 2026年8月30日