产品简介
MiMo-V2.5-Pro UltraSpeed 是小米与 **TileRT** 联合发布的极速推理版本,**全球首个在 1T 参数规模上跑出 1000 tokens/s 解码速度的模型**(峰值 1200 t/s)。它的产品哲学是「**用原始速度换思维深度**」——在 1 万亿参数 MoE 的能力底座上,把推理延迟压到「人眼追不上输出」的级别,让编码会话里 AI 的思考过程可以**实时跟进**而不是「等几十秒看一段」。
这背后是 TileRT 自研的推理加速栈:**算子融合 + 推测解码 + 投机采样 + 量化共生**多项工程技术的组合。对开发者最直观的影响是 Coding Agent 体验的质变——以前在 Cursor / Claude Code 里等 AI 想 30 秒才输出一段代码,现在 UltraSpeed 让等待变成「刚问完就刷屏」,长对话和 200+ 步的长程编程任务的总耗时被压缩到 1/3 以内。
这是 2026 年 LLM 工程化的代表性成果之一:**模型能力到了天花板之后,下一波竞争是推理基础设施**。
核心功能
- 1000 t/s 解码速度:全球首个 1T 参数规模上跑出 1000 t/s 解码速度的模型,峰值 1200 t/s,远超主流前沿模型 30-100 t/s 的常态
- 1T 参数 MoE 底座:底座是 MiMo-V2.5-Pro 万亿参数 MoE 模型,能力对标 Claude Opus 4.6,UltraSpeed 不牺牲底层能力换速度
- TileRT 自研推理栈:算子融合 + 推测解码 + 投机采样 + 量化共生多项工程技术组合,把推理延迟压到极致
- Coding Agent 实时跟进:在 Coding Agent 场景里 AI 思考过程可被实时跟进,长对话和 200+ 步长程编程任务总耗时压缩到 1/3 以内
- MiMo 开放平台可用:通过小米 MiMo 开放平台直接调用,与 MiMo-V2.5-Pro 同套 API,可平滑切换
适合谁用
以下类型的用户会特别受益于 MiMo-V2.5-Pro UltraSpeed:
- 高频 Coding Agent 场景(200+ 步长程编程、长对话)
- 对推理延迟敏感的实时辅助(IDE 内联补全、实时翻译、对话式 BI)
- 海量批处理任务(文档处理、数据清洗、内容生成流水线)需要降本增效
- AI 客服 / 虚拟助手等需要「无感等待」体验的产品
- 重度使用 MiMo-V2.5-Pro 的开发者升级到 UltraSpeed 提升效率
优点亮点
- 1000 t/s 是 1T 参数规模上的全球首次,工程意义重大
- 底座能力不打折(仍然是 MiMo-V2.5-Pro 万亿 MoE)
- Coding Agent 场景体验质变
- TileRT 自研推理栈对国产推理基础设施意义重大
- MiMo 开放平台直连,迁移成本低
价格与方案
通过小米 MiMo 开放平台调用,价格在 MiMo-V2.5-Pro 标准 API 基础上做差异化定价(速度档比标准档贵)。MiMo 平台 2025/5/27 永久降价 99% 后,整体单价仍处于行业低位。具体单价以 platform.xiaomimimo.com 公告为准。
总结与建议
MiMo-V2.5-Pro UltraSpeed 代表了 2026 年大模型工程化的新方向——**模型能力卷到一定阶段,下一波是推理基础设施**。1000 t/s 不是简单的「快」,是把 AI 编程体验从「等 → 看 → 改」变成「问完即得」的范式跃迁。如果你重度使用 Coding Agent、对延迟敏感、做高频批处理或实时助手类产品,UltraSpeed 是当前能找到的「能力 + 速度」最佳平衡点之一。如果你只是日常对话,MiMo-V2.5-Pro 标准档完全够用。