产品简介
MiMo-V2.6-Pro 是小米 9 月 22 日发布并开源的原生全模态模型,走稀疏 MoE 路线:总参数 1.02 万亿,每次推理只激活 420 亿。文本、图像、视频、音频四种输入进同一个模型,上下文窗口 100 万 token,输出侧用 5 层多 token 预测做投机解码,权重按 MIT 许可开放,商用没有附加门槛。
官方把这一代的核心动作叫 Scaling RL,不再针对单一能力做后训练,而是把编码、通用 Agent、视觉、网络安全这些任务混在同一套强化学习里,同时扩大 batch、环境数量和评分器的算力投入。训练用异步 GRPO 一轮跑完,每步 1568 条提示、每条采样 16 次,Pro 跑了 30 步、累计约 75 万条轨迹,不到 6 天完成,官方公布的 RL 成本约 262 万美元,训练框架和 7000 多个任务环境也一并开放。
第三方口径上,Artificial Analysis 智能指数 v4.3.2 给它 46 分,是当前开放权重模型里最高的一位,上代 MiMo-V2.5-Pro 只有 26 分。Code Arena 的 WebDev 竞技场实测 1628 分,总榜约第 10、开放权重第 3,比上代的 1475 分涨了 153 分。官方自报的还有长程软件工程 DeepSWE v1.1 从 58.4 提升到 72.6、安全攻防 CyberGym 94.0、桌面操作 OSWorld 82.0,这些属于厂商口径,等社区复跑更稳妥。
API 价格沿用 V2.5 那一档没动,输入 3 元、输出 6 元每百万 token,缓存命中 0.025 元。官方称同等智能水平下价格约为海外模型的二十分之一到六十分之一。桌面上还有 MiMo Desktop 客户端与会员订阅同期上线。
核心功能
- 原生全模态:文本、图像、视频、音频进同一个模型,不用为每种模态拼不同的编码器链路。
- 万亿级稀疏 MoE:1.02T 总参数、42B 激活,容量与单次推理成本分开,长程任务不用为参数量买单。
- 1M 上下文:面向大型代码仓库、长工具轨迹和多轮 Agent 任务,减少中途摘要造成的信息损失。
- Scaling RL 训练:编码、Agent、视觉、安全混在同一套强化学习里,扩大采样与环境规模,而不是只做单点后训练。
- Computer Use 与 3D 推理:官方演示覆盖操作办公软件、在 Blender 里建模,以及从文字或参考图生成可运行的 3D 开放世界。
- MIT 许可开源:权重与技术报告开放,配套蒸馏模型 Distill-Qwen-9B 与 RL 任务环境一并放出。
适合谁用
以下类型的用户会特别受益于 小米 MiMo-V2.6-Pro:
- 长程编码 Agent:在大型代码仓库里跨文件改代码、跑测试、失败后自我修正
- 桌面操作自动化:理解图形界面并在办公与生产力软件里完成任务
- 3D 与创意生产:从文字或参考图出发生成 3D 场景、建模与视觉素材
- 科研与工程仿真:材料设计筛选、Lean 4 形式化证明这类长链条推理任务
优点亮点
- 开放权重里智能指数最高的一档,MIT 许可商用没有附加条件
- 原生全模态加 1M 上下文,长任务里省掉模态拼接与频繁摘要
- 价格沿用上一代,能力提升没有反映在 API 账单上
- 训练框架与 RL 任务环境一并开源,后训练过程可检视、可复现
价格与方案
API 按 Token 计费,价格沿用 V2.5 系列:输入 3 元、输出 6 元每百万 token,缓存命中 0.025 元。权重按 MIT 许可开放,可自行部署。具体价格与配额以官方公示为准。
总结与建议
MiMo-V2.6-Pro 是小米新一代原生全模态开源模型,1.02T 总参数、42B 激活的稀疏 MoE,1M 上下文,文本图像视频音频统一进同一个模型。第三方智能指数 46 分是目前开放权重里的最高位,Code Arena WebDev 1628 分,比上代涨了 153 分。编码、Agent、视觉、安全混在一次大规模强化学习里训练,官方公开了约 262 万美元的 RL 成本和完整任务环境。价格沿用上一代,适合把长程编码与 Computer Use 任务迁过来。
版本演进
- 小米发布并开源 MiMo-V2.6 系列,Pro 登顶开放权重智能指数 (2026-09-22):小米正式发布并开源 Xiaomi MiMo-V2.6 系列,包含 Pro 与 Flash 两个原生全模态模型,官方称这是探索 RSI 递归自我改进路径的关键一步。Pro 为 1.02T 总参数 / 42B 激活的稀疏 MoE,1M 上下文,权重按 MIT 许可开放,Artificial Analysis 智能指数 46 分为开放权重最高,Code Arena WebDev 1628 分。训练采用大规模异步 GRPO,每步 1568 条提示乘 16 次采样,不到 6 天完成,官方公布 RL 成本约 262 万美元,并同步开放 7000 多个 RL 任务环境与端到端训练框架。API 价格与前代持平,MiMo Desktop 客户端与会员订阅同期上线。