产品简介
MiMo-V2-Omni 是小米在 2026 年上半年发布的全模态基座模型,也是小米第一代把图像、视频、音频、文本放进同一个架构里联合建模的产品。跨模态推理在这一代就被设计成默认能力,而不是给文本模型外挂编码器——看一段视频回答语音提问、读一张图生成音频解说这类任务,是它最初立住的差异点。
需要说明的是:MiMo-V2 系列已于 2026 年 6 月 30 日 00:00 正式下线,原模型名不再可用。小米在此之前已将 V2 系列请求转发至 MiMo-V2.5 系列并按 V2.5 定价计费(V2-TTS 更早,于 6 月 27 日 00:00 起转发)。本页保留 V2-Omni 这一代的产品记录,当前在役的全模态主力是 MiMo-V2.5-Omni。
与它同代的是 MiMo-V2-Pro(推理 / 编程旗舰)与 MiMo-V2-Flash,三者共同支撑了小米手机、汽车、智能家居的第一代端云协同 AI 体验。
核心功能
- 原生全模态统一架构:图像 / 视频 / 音频 / 文本任意输入 + 任意输出,跨模态推理是架构自带能力
- 视频与长音频理解:原生支持几十分钟级视频和长音频的理解、摘要与问答,是这一代 Omni 的主要卖点
- 图文交错推理:可处理「文本 + 图 + 文本 + 图」交错输入做复杂推理,覆盖论文、技术文档、多图说明书等场景
- MIT 协议开源:权重与推理代码以 MIT 协议开放,可商用、可二次微调
- 端云协同部署:蒸馏版可在小米澎湃 OS 端侧运行,云端版提供完整能力,支撑小米全产品线一致体验
适合谁用
以下类型的用户会特别受益于 小米 MiMo-V2-Omni:
- 小米手机 / 汽车 / 智能家居端侧的全模态助手能力
- 视频内容理解:自动摘要、章节切分、问答、关键帧定位
- 教育场景:图文 + 公式交错推理、科目问答、视频课讲解
- 工业 / 制造:从摄像头视频或图像直接做缺陷识别 + 文字报告生成
- 无障碍:图像描述、视频解说、跨模态对话,惠及视障 / 听障用户
- 开发者基于开源权重做行业垂直全模态模型微调
优点亮点
- 第一代原生全模态架构,为小米后续多模态产品线定下技术路线
- 视频与长音频理解是这一代的主要长项
- MIT 协议开源,权重开放、可商用可微调
- 与 V2-Pro / V2-Flash 同代配套,覆盖推理、编程与全模态场景
- 端云协同:端侧蒸馏 + 云端完整版,对小米全产品矩阵价值放大
价格与方案
开源权重免费(MIT 协议,HuggingFace / GitHub 可下载)。官方 API(mimo.xiaomi.com)提供免费体验额度,超量按 Token 计费。小米手机 / 汽车端用户在系统内置场景下使用全模态能力完全免费。企业私有化部署可按 GPU 节点报价。
注意:MiMo-V2 系列已于 2026-06-30 00:00 下线,原模型名失效,请改用 MiMo-V2.5 系列并按 V2.5 定价结算。
总结与建议
MiMo-V2-Omni 是小米全模态路线的第一代产品,把图 / 视 / 音 / 文四模态放进同一个架构并 MIT 开源,当时的定位是国产开源全模态里比较有诚意的一档。该系列已于 2026-06-30 下线,模型名失效,当前在役的全模态主力是 MiMo-V2.5-Omni(1M 上下文 / 128K 输出 / 双协议端点)。需要推理与编程用 MiMo-V2.5-Pro,语音合成与识别分别用 MiMo-V2.5-TTS 与 MiMo-V2.5-ASR。
版本演进
- MiMo-V2 系列正式下线,全模态能力由 V2.5-Omni 承接 (2026-06-30):MiMo-V2-Pro / V2-Omni / V2-Flash 于北京时间 2026 年 6 月 30 日 00:00 正式下线,原模型名称失效。此前 V2 系列请求已转发至 V2.5 系列并按 V2.5 定价计费;V2-TTS 更早,自 2026 年 6 月 27 日 00:00 起自动转发至 MiMo-V2.5-TTS。全模态主力由此切换为 MiMo-V2.5-Omni。
- MiMo-V2-Omni 发布 (2026-03-18):小米发布第一代原生全模态基座 MiMo-V2-Omni,图像 / 视频 / 音频 / 文本任意输入输出,跨模态推理为架构自带能力,MIT 协议开源权重,与 MiMo-V2-Pro、MiMo-V2-Flash 组成第一代 MiMo 产品矩阵。