9月1日消息,DeepSeek V4系列首个多模态模型DeepSeek-V4-Flash-Vision-Exp正式在Hugging Face上线,采用MIT License开源。
据了解,该模型是DeepSeek V4系列首款原生支持图片输入的视觉模型,官方明确标注为"Exp"实验版本,已于2026年8月21日率先上线DeepSeek API平台。

本次开源内容包括模型文件、Tokenizer、Prompt Encoding参考实现,以及最小化PyTorch推理实现,覆盖视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections与DSpark等核心模块。
功能方面,该模型支持在文本之外输入图片,可完成描述图片、识别截图中的文字、分析图表等任务,支持JPEG、PNG、GIF、WebP四种图片格式。
官方表示,V4-Flash-Vision-Exp在各类Agent框架内展现出较好的多模态适配能力,能够有效支持用户借助多样化的Agent工具解锁更多实用工作场景。同时,模型在Agent、推理、世界知识等纯文本任务上与V4-Flash正式版持平,原有优势完整保留;在需要视觉理解的Agent基准测试中较V4-Flash大幅提升,多模态Agent能力已接近Opus-4.8。

微信扫一扫
支付宝扫一扫 