🎯 科技 · AI大模型
🔥 DeepSeek V4发布视觉模型Exp版本,ApexBench跑分暴涨至36.5,多模态Agent能力突破
9月2日,DeepSeek正式发布DeepSeek-V4-Flash-Vision-Exp,这是V4系列首个实验性视觉模型,标志着国产头部大模型正式迈入多模态Agent时代。该模型通过引入视觉模块并进行持续训练,在保留原有文本智能体能力的基础上,进一步解锁视觉理解能力,能够结合图像、图表等视觉信息执行复杂任务。
性能方面,新模型在ApexBench (Pass@1) 评测中从26.2提升至36.5,Agents' Last Exam达到27.3,Chartography和ZeroBench等多模态评测分别取得64.3和35.0的成绩。在DeepSWE、NL2Repo、Toolathlon-Verified等文本智能体测试中,新模型同样展现出具有竞争力的表现,实现了文本与多模态Agent能力之间的进一步平衡。
一、FP4精度+Blackwell优化,V4架构再升级在此之前,DeepSeek研究团队在官方仓库DeepGEMM更新了110个文件,透露了V4系列的更多技术细节。首先是大量FP8、FP4精度支持——FP4放在2026年属于比较新且激进的支持,性能更强,对显存的要求理论上比FP8还要再低一倍,这意味着V4大模型的规模会很大。其次是对NVIDIA SM100/Blackwell GPU进行了优化,此前传闻V4会首发国产AI平台(尤其是华为昇腾),但这不意味着V4只支持国产平台,NVIDIA的AI平台依然是重要支撑。
架构方面,V4将使用新的Mega MoE及HyperConnection架构,这两个都是适合超大规模参数量的设计,暗示V4的参数量不会小。综合判断,V4在万亿参数级别是基本盘,如果突破到2万亿参数,性能会有更惊艳的表现。
二、国产大模型竞争进入"周三更"时代9月以来,国产大模型迭代速度令人瞩目。谷歌发布Gemini 3.8 Flash推理模型,编程能力大幅提升;腾讯发布混元Hy4 preview轻量量化版本并开源,原版BF16权重1.5TB压缩后仅214GB,可在本地轻松部署;阿里云更新旗舰模型Qwen3.8-Max,文本输入价格从0.7元/百万tokens下调至0.5元。
与此同时,李飞飞创办的World Labs发布全球首个多模态世界模型Atlas,Anthropic与英伟达支持的云服务商Lambda签署350亿美元云计算协议。国产大模型一周三更的节奏,正在缩小与海外顶尖模型的差距。多模态Agent能力成为下一代大模型竞争的核心战场。
综合超神经、36氪、界面新闻报道 | 2026-09-03