蚂蚁集团开源百灵首个原生多模态大模型Ling-3.0-flash-VL:124B参数MoE架构,支持256K上下 - 果核剥壳

9月9日消息,蚂蚁集团今日宣布推出并开源百灵系列首个原生多模态大模型Ling-3.0-flash-VL。

该模型基于Ling-3.0-flash的MoE(混合专家)架构拓展,总参数量为124B,单次推理仅激活5.5B参数,原生支持图像、文本与视频输入,上下文窗口达到256K Token。

蚂蚁集团开源百灵首个原生多模态大模型Ling-3.0-flash-VL:124B参数MoE架构,支持256K上下

据介绍,模型围绕“更可靠、更高效完成真实任务”的方向,引入了视觉反馈闭环机制。不同于一次性的“看图生成”,该机制将任务推进为“观察→行动→验证→修正”的持续闭环,使模型在医疗报告解读、前端代码生成及GUI自动化等场景中能够基于视觉反馈持续修正执行结果。

在训练层面,蚂蚁集团表示,通过原生多模态联合训练,视觉信息的引入对模型的文本能力带来了正向提升。在Artificial Analysis Intelligence Index v4.1.1评估中,Ling-3.0-flash-VL较纯文本版本(Ling-3.0-Flash)提升了4分。

实际应用测试中,该模型在图片转网页任务中可理解布局与组件关系并生成代码,且能通过渲染结果对比进行自我修正——在Image-to-WebDev Arena官方评测中,模型(代号linthium)的评测得分高于GPT-5.4。作为GUI Agent时,模型可识别界面结构并完成跨工具操作;在医疗报告解读场景中,模型支持跨文档数据整合与风险标识。

技术架构上,Ling-3.0-flash-VL引入了任意分辨率视觉编码器与VideoRoPE,语言主干沿用42层混合架构(交替排列KDA与Gated MLA,比例5:1),在实时视频对话、多轮视觉交互及长时任务中可保持低延迟响应,256K上下文窗口支持长文档与长视频分析。

目前,Ling-3.0-flash-VL已在Ling Studio上线并提供免费体验。模型的BF16和FP8版本已在Hugging Face及ModelScope平台开源,FP4和INT4版本计划于近期发布。

 

如果您喜欢本站,点击这儿不花一分钱捐赠本站

这些信息可能会帮助到你: 下载帮助 | 报毒说明 | 进站必看

修改版本安卓软件,加群提示为修改者自留,非本站信息,注意鉴别

(0)
上一篇 1天前
下一篇 1天前

相关推荐

发表回复

评论问题之前,点击我,能帮你解决大部分问题

您的电子邮箱地址不会被公开。 必填项已用*标注