国产AI大模型又在刷新全球认知。8月31日,DeepSeek官方宣布V4系列首个多模态模型DeepSeek-V4-Flash-Vision-Exp正式在Hugging Face开源,采用MIT License,覆盖视觉编码器、MoE架构、DFlash Attention等核心模块,并同步开放了最小化PyTorch推理实现。
这是DeepSeek V4产品线首次原生支持图片输入。值得注意的是,该模型已于8月21日在DeepSeek API平台上线,经过10天内测后选择开源实验版本,释放模型权重、Tokenizer及Prompt Encoding参考实现,技术诚意拉满。开源意味着全球开发者可以自由基于此进行二次开发和商业化,进一步降低多模态AI的落地门槛。
从技术路线来看,V4-Flash-Vision继承了DeepSeek一贯的激进风格——Flash Attention与MoE架构的组合大幅压缩了推理成本,而Hyper-Connections与DSpark等模块的开放,让研究者可以直接在视觉理解任务上验证和迭代。对比此前已开源的DeepSeek-V4-Flash(纯文本),此次多模态版本填补了视觉输入能力的空白,标志着国产开源多模态模型生态进一步完善。
当前国际开源多模态格局中,Llama系列与Qwen-VL仍占据头部位置,DeepSeek V4 Flash Vision的加入将进一步压缩差距,也为国内开发者提供了更多"用得起、改得动"的选择。
一句话:DeepSeek V4开源多模态,国产AI再次证明"开源才是硬道理"。
AI 生成 . DeepSeek | 搜索综合