小米发布并开源MiMo-V2.6系列:AA智能指数46分登顶开源模型,超越Kimi K3与GLM-5.3 - 果核剥壳

9月22日消息,小米今日凌晨正式发布并开源全新Xiaomi MiMo-V2.6系列,包含Pro与Flash两款原生全模态模型。小米称这是其探索RSI(递归自我改进)路径的关键一步——通过规模化扩展强化学习算力,让模型在持续的探索与反馈中拓展智能边界。

小米发布并开源MiMo-V2.6系列:AA智能指数46分登顶开源模型,超越Kimi K3与GLM-5.3

基准成绩登顶开源阵营

得益于RL算力扩展,MiMo-V2.6-Pro在Artificial Analysis Intelligence Index(AA综合智能指数)v4.3.2中取得46分,超越Kimi K3(44分)和GLM-5.3(45分),成为当前AA指数上排名最高的开源权重模型,较前代MiMo-V2.5-Pro的26分高出20分。小米官方同时坦承,与Claude Fable 5.1和GPT-6 Astra(均为53分)等顶级闭源模型相比仍有差距。

不到6天的高强度RL训练

MiMo-V2.6可能是国产开源模型中投入RL算力最多的模型之一:Pro与Flash训练历时不到6天,成本分别约262万美元与85万美元,各完成30步更新,累计约75万条轨迹。训练任务平均通过率分别提升25%和12%,样本外的长程软件工程评测基准DeepSWE v1.1分别提升约17分(48.8至65.7)和约14分(58.4至72.6)。

本次训练从三个维度扩展RL算力:一是更大的Batch与更高吞吐,单次更新使用1568个样本,支持100万上下文长度训练,单步训练Token达3.5至3.7B;二是更多任务与复杂环境,构建覆盖Code、General、Visual、Cyber等方向的多任务训练体系;三是更大的Grader算力,通过组内相对比较为长程RL任务提供更精准的奖励信号。

全模态与具身智能能力

能力扩展上,MiMo-V2.6融合了3D空间推理、多模态感知与计算机操作能力。在游戏开发中,用户输入图片、视频或文字后,模型可将需求拆解为多个任务,由多智能体协作完成3D场景搭建、交互逻辑编写与视觉验证。在具身仿真环境中,模型可直接以多视角相机画面为输入,通过视觉反馈闭环控制Franka Panda机械臂,完成物体抓取、颜色匹配与精准放置。(注:全模态模型指可同时处理文本、图像、视频和音频等多种输入形式的模型。)

科研落地案例

科研方面,MiMo-V2.6-Pro协助研究人员完成了PFAS吸附用MOF材料的设计方案筛选,并在Lean 4中完整形式化了Li-Yorke经典论文《周期三蕴含混沌》的原始主定理,形成6000余行Lean源码,完整证明通过Lean内核核验——值得注意的是,该模型并未接受过针对Lean的专项后训练。

定价与开源内容

定价方面,MiMo-V2.6系列沿用V2.5系列API价格:Flash为每百万词元输入1元、输出2元;Pro为输入3元、输出6元,并提供99%缓存折扣,同等智能水平下价格仅为海外模型的1/20至1/60。

伴随新模型发布,MiMo Desktop桌面客户端(支持Windows与Mac)及会员订阅方案同步上线,订阅会员可使用Pro和Flash模型,也可配置自己的API Key。客户端同步上线Pro版UltraSpeed超高速模式,提供最高20倍推理速度。原邀测活动将在1周后结束。

开源方面,小米全面开放MiMo-V2.6-Pro、Flash模型权重与技术报告,并同步开放MiMo-V2.6-Distill-Qwen-9B及配套RL研究资源,包括:7k+高质量RL任务环境(覆盖软件工程、漏洞复现、知识型工作、网页设计开发四类智能体任务,以Distill-Qwen-9B为起点训练后,SWE-bench Verified从61.1提升至66.2,MiMo Cyber Bench从31.3提升至47.0,Terminal Bench 2.1从37.1提升至52.8,MiMo Visual Coding从64.0提升至72.4);基于verl、uni-agent和mini-swe-agent的端到端RL训练框架;以及将系统提示、工具与上下文管理解耦的轻量可组合mini-harnesses,支持社区通过Multi-Harness Training提升模型泛化能力。

 

如果您喜欢本站,点击这儿不花一分钱捐赠本站

这些信息可能会帮助到你: 下载帮助 | 报毒说明 | 进站必看

修改版本安卓软件,加群提示为修改者自留,非本站信息,注意鉴别

(0)
上一篇 3小时前
下一篇 3小时前

相关推荐

发表回复

评论问题之前,点击我,能帮你解决大部分问题

您的电子邮箱地址不会被公开。 必填项已用*标注

评论列表(1条)

  • 大汉小将军
    大汉小将军 2026年9月22日 下午1:47
    Microsoft Edge 152.0.0.0 Microsoft Edge 152.0.0.0 Windows 10 x64 Edition Windows 10 x64 Edition

    无论哪个模型,只有DeepSeek缓存命中率最高,爽歪歪