产品简介
MiMo-V2.5-Omni 是小米 MiMo-V2.5 系列里的**原生全模态感知模型**,承接 2026 年 6 月 30 日退场的 MiMo-V2-Omni,成为小米全模态能力的主力入口。「原生」的意思是图像、视频、音频、文本四类模态从架构层面就联合建模,跨模态推理是默认能力,而不是给文本模型外挂一排编码器。
规格上,MiMo-V2.5-Omni 支持**1M 超长上下文、最大输出 128K tokens**,限速档位 RPM 100 / TPM 10M,适合几十分钟级视频、长会议录音、整本图文手册这类「一次喂进去」的活。
与同系列的 **MiMo-V2.5-Pro**(推理 / 编程旗舰)、**MiMo-V2.5-Flash**(高性价比轻量档)、**MiMo-V2.5-TTS**(语音合成,含 Base TTS / VoiceDesign / VoiceClone 三种子模型)和 **MiMo-V2.5-ASR**(语音识别,方言支持扎实)共同构成小米完整的多模态矩阵。整个 V2.5 系列走 **MIT 协议**,并提供 OpenAI 与 Anthropic 双兼容端点,迁移成本低。
核心功能
- 原生全模态联合建模:图像 / 视频 / 音频 / 文本从架构层面联合理解,跨模态推理是默认能力而非外挂模块
- 1M 超长上下文:支持 1M tokens 上下文、最大输出 128K tokens,长视频、长音频、多图长文档可整段处理
- 视频与长音频理解:原生支持几十分钟级视频与长音频的理解、摘要、问答、关键片段定位
- 图文交错推理:可处理「文本 + 图 + 文本 + 图」交错输入做复杂推理,覆盖论文、技术文档、多图说明书等场景
- 双协议兼容端点:同时提供 OpenAI 与 Anthropic 兼容接口,已有工程几乎不用改代码就能切过来
- MIT 协议开源:V2.5 系列权重与推理代码以 MIT 协议开放,可商用、可二次微调
- 端云协同部署:蒸馏版可在小米澎湃 OS 端侧运行,云端版提供完整能力,支撑小米手机 / 汽车 / 智能家居一致体验
适合谁用
以下类型的用户会特别受益于 小米 MiMo-V2.5-Omni:
- 小米手机 / 汽车 / 智能家居端侧的全模态助手能力
- 视频内容理解:自动摘要、章节切分、问答、关键帧定位
- 长会议录音的转写、分段与要点提取
- 教育场景:图文 + 公式交错推理、科目问答、视频课讲解
- 工业 / 制造:从摄像头视频或图像直接做缺陷识别 + 文字报告生成
- 无障碍:图像描述、视频解说、跨模态对话,惠及视障 / 听障用户
- 开发者基于开源权重做行业垂直全模态模型微调
优点亮点
- 原生全模态架构,跨模态任务能力处于国产模型第一档
- 1M 上下文 + 128K 输出,长视频长音频场景容量充裕
- MIT 协议开源,国内大厂里发布姿态较为开放的一档
- OpenAI 与 Anthropic 双兼容端点,接入与迁移成本低
- 与 V2.5-Pro / Flash / TTS / ASR 组合,可覆盖推理、编程、全模态、语音全场景
- 端云协同:端侧蒸馏 + 云端完整版,对小米全产品矩阵价值放大
价格与方案
**开源权重免费**(MIT 协议,HuggingFace / GitHub 可下载)。**官方 API**(mimo.xiaomi.com)提供免费体验额度,超量按 Token 计费,并按 RPM 100 / TPM 10M 限速。小米手机 / 汽车端用户在系统内置场景下使用全模态能力**完全免费**。企业私有化部署可按 GPU 节点报价。
总结与建议
MiMo-V2.5-Omni 是目前国产开源全模态模型里规格比较扎实的一档——**原生统一架构 + 1M 上下文 + MIT 开源 + 双协议端点**。如果你做跨模态应用(视频问答、多模态 Agent、图文音综合理解),Omni 是现在能直接拿的开源首选;如果你做推理与编程,可以考虑同系列的 **MiMo-V2.5-Pro**;做语音合成与识别,则分别用 **MiMo-V2.5-TTS** 和 **MiMo-V2.5-ASR**。
版本演进
- MiMo-V2.5-Omni 成为全模态主力 (2026-06-30):MiMo-V2 系列(V2-Pro / V2-Omni / V2-Flash)于北京时间 2026 年 6 月 30 日 00:00 正式下线,原模型名失效。小米此前已将 V2 系列请求转发至 V2.5 系列并按 V2.5 定价计费,V2.5 家族由此成为唯一在役版本,包含 Pro / Flash / Omni / TTS / ASR 五条线。
- MiMo-V2.5 系列发布 (2026-05-20):小米发布 MiMo-V2.5 全家桶:V2.5-Pro 推理编程旗舰、V2.5-Flash 高性价比档、V2.5-Omni 原生全模态(1M 上下文 / 128K 输出 / RPM 100 / TPM 10M)、V2.5-TTS 三子模型(Base TTS / VoiceDesign / VoiceClone)、V2.5-ASR 开源方言识别。全系 MIT 协议,提供 OpenAI 与 Anthropic 双兼容端点。