产品简介
MiMo-V2.5-TTS 是小米于 **2026/4/24 正式发布**的**端到端语音合成大模型**,属于 MiMo-V2.5 全链路语音模型系列(TTS 合成 + ASR 识别双能力)——这是小米在 Agent 时代对「语音输入输出全链路」的正式布局。
**MiMo-V2.5-TTS 核心卖点**:
- **自然语言调度声音**:不像传统 TTS 需要复杂参数配置(音高、语速、情感强度、停顿……),MiMo-V2.5-TTS 可以**直接用自然语言指令控制**——比如「用一个 30 岁女性温柔的语气,稍微加快语速,带一点惊喜感」,模型能理解并输出对应效果。这是 TTS 领域首次真正做到「导演式调度」
- **原生方言支持**:粤语、四川话、河南话、台湾腔等主流方言原生输出,不是简单的口音模仿而是真实方言语法与发音(这对内容创作、短视频、有声书场景是重大突破)
- **情感切换与歌唱能力**:可在同一段文本中做情感切换(比如「这里假装生气再假装哭」),支持歌唱音高控制(可以让模型唱歌,非说话)
- **限时免费 API**:TTS API 目前限时免费开放,ASR 全面开源(`mimo.xiaomi.com`)
**三款子模型**:
- **基础版**:多音色精细控制(预置多种音色 + 参数微调)
- **VoiceDesign 音色设计版**:通过描述生成新音色(想要什么声音就用文字描述出来)
- **音色复刻版**:一句话(3 秒)克隆任意人声
**产品定位**:面向 AI Agent 时代的语音输出需求——Agent 不再只用固定合成音回复,而是**根据场景动态选择合适的声音表现**。搭配 MiMo-V2.5-ASR 语音识别模型,形成完整的语音 IO 闭环。
是国内 TTS 领域 2026 年最值得关注的开源/免费产品之一。
核心功能
- 自然语言调度声音(首创):用「像和导演对话」的方式调整音色/情感/语速/停顿,无需复杂参数
- 原生方言支持:粤语、四川话、河南话、台湾腔真实语法与发音(不是口音模仿)
- 情感切换:同一段文本内可做情感变化(生气→哭→笑),符合真人表达
- 歌唱音高控制:可让模型唱歌(非说话),音高精细控制
- 一句话音色复刻:3 秒音频即可克隆任意人声(VoiceDesign 版)
- 音色设计版本:用文字描述生成从未存在的新音色(VoiceDesign)
- TTS 限时免费 + ASR 全面开源:TTS API 目前限时免费;ASR 语音识别模型完全开源,MIT 协议
适合谁用
以下类型的用户会特别受益于 小米 MiMo-V2.5-TTS:
- 有声书 / 播客制作(多角色 + 情感切换)
- 短视频配音(方言 + 情感 + 歌唱)
- AI 数字人语音输出(导演式调度)
- 游戏 / 动漫角色配音
- 无障碍辅助(视障用户的自然语音输出)
- Agent 语音助手的动态声音选择
- 教育 / 培训场景的多样化语音内容
优点亮点
- 自然语言调度声音是行业首创,用户体验跨代提升
- 原生方言输出(粤语/四川话/河南话/台湾腔)填补市场空白
- 情感切换 + 歌唱能力覆盖内容创作全场景
- 一句话音色复刻门槛极低(3 秒)
- TTS 限时免费降低尝试成本,ASR 完全开源
- 小米背书,模型能力与稳定性有保障
- 面向 Agent 时代设计,与语音 IO 生态深度绑定
价格与方案
**TTS API 限时免费**(`mimo.xiaomi.com` 官网可直接申请):三款子模型(基础版、VoiceDesign、音色复刻)均可免费调用,具体额度以官网公告为准。**ASR 语音识别模型完全开源**(MIT 协议,Hugging Face / GitHub 可下载权重)。**商业化定价方案**未来推出,届时会区分个人开发者与企业客户。
总结与建议
MiMo-V2.5-TTS 是国内 TTS 领域 2026 年的现象级产品——**自然语言调度声音 + 原生方言 + 情感切换 + 歌唱能力 + 限时免费**五件套让它成为内容创作者、AI 数字人开发者、Agent 语音产品团队的首选。**如果你在做短视频配音、有声书、播客、游戏配音**,MiMo-V2.5-TTS 是必测项——尤其是方言场景国内几乎没有对手。搭配 MiMo-V2.5-ASR 形成完整的语音 IO 闭环,是小米在 Agent 时代对语音全链路的完整布局。
版本演进
- MiMo-V2.5 全链路语音系列发布 (2026-04-24):TTS(三款子模型:基础版 + VoiceDesign + 音色复刻)+ ASR 双能力发布;自然语言调度声音行业首创;原生方言支持;TTS 限时免费 + ASR 全面开源