9月9日消息,蚂蚁集团今日宣布推出并开源百灵系列首个原生多模态大模型Ling-3.0-flash-VL。
该模型基于Ling-3.0-flash的MoE(混合专家)架构拓展,总参数量为124B,单次推理仅激活5.5B参数,原生支持图像、文本与视频输入,上下文窗口达到256K Token。

据介绍,模型围绕“更可靠、更高效完成真实任务”的方向,引入了视觉反馈闭环机制。不同于一次性的“看图生成”,该机制将任务推进为“观察→行动→验证→修正”的持续闭环,使模型在医疗报告解读、前端代码生成及GUI自动化等场景中能够基于视觉反馈持续修正执行结果。
在训练层面,蚂蚁集团表示,通过原生多模态联合训练,视觉信息的引入对模型的文本能力带来了正向提升。在Artificial Analysis Intelligence Index v4.1.1评估中,Ling-3.0-flash-VL较纯文本版本(Ling-3.0-Flash)提升了4分。
实际应用测试中,该模型在图片转网页任务中可理解布局与组件关系并生成代码,且能通过渲染结果对比进行自我修正——在Image-to-WebDev Arena官方评测中,模型(代号linthium)的评测得分高于GPT-5.4。作为GUI Agent时,模型可识别界面结构并完成跨工具操作;在医疗报告解读场景中,模型支持跨文档数据整合与风险标识。
技术架构上,Ling-3.0-flash-VL引入了任意分辨率视觉编码器与VideoRoPE,语言主干沿用42层混合架构(交替排列KDA与Gated MLA,比例5:1),在实时视频对话、多轮视觉交互及长时任务中可保持低延迟响应,256K上下文窗口支持长文档与长视频分析。
目前,Ling-3.0-flash-VL已在Ling Studio上线并提供免费体验。模型的BF16和FP8版本已在Hugging Face及ModelScope平台开源,FP4和INT4版本计划于近期发布。

微信扫一扫
支付宝扫一扫 