ChengRang
EN

小米 MiMo-V2.5-TTS 新增

AI 开发平台 免费试用

MiMo 端到端语音合成模型,支持情感切换、原生方言(粤语/四川话/河南话/台湾腔)和歌唱音高控制;TTS 限时免费、ASR 全面开源

小米 TTS 语音合成 情感 方言
访问 小米 MiMo-V2.5-TTS 官网

免责声明:测评内容仅代表编辑个人观点和使用体验,不构成任何商业推荐或投资建议。产品信息和价格可能随时变动,请以官方最新信息为准。

产品简介

MiMo-V2.5-TTS 是小米于 **2026/4/24 正式发布**的**端到端语音合成大模型**,属于 MiMo-V2.5 全链路语音模型系列(TTS 合成 + ASR 识别双能力)——这是小米在 Agent 时代对「语音输入输出全链路」的正式布局。

**MiMo-V2.5-TTS 核心卖点**:

- **自然语言调度声音**:不像传统 TTS 需要复杂参数配置(音高、语速、情感强度、停顿……),MiMo-V2.5-TTS 可以**直接用自然语言指令控制**——比如「用一个 30 岁女性温柔的语气,稍微加快语速,带一点惊喜感」,模型能理解并输出对应效果。这是 TTS 领域首次真正做到「导演式调度」

- **原生方言支持**:粤语、四川话、河南话、台湾腔等主流方言原生输出,不是简单的口音模仿而是真实方言语法与发音(这对内容创作、短视频、有声书场景是重大突破)

- **情感切换与歌唱能力**:可在同一段文本中做情感切换(比如「这里假装生气再假装哭」),支持歌唱音高控制(可以让模型唱歌,非说话)

- **限时免费 API**:TTS API 目前限时免费开放,ASR 全面开源(`mimo.xiaomi.com`)

**三款子模型**:

- **基础版**:多音色精细控制(预置多种音色 + 参数微调)

- **VoiceDesign 音色设计版**:通过描述生成新音色(想要什么声音就用文字描述出来)

- **音色复刻版**:一句话(3 秒)克隆任意人声

**产品定位**:面向 AI Agent 时代的语音输出需求——Agent 不再只用固定合成音回复,而是**根据场景动态选择合适的声音表现**。搭配 MiMo-V2.5-ASR 语音识别模型,形成完整的语音 IO 闭环。

是国内 TTS 领域 2026 年最值得关注的开源/免费产品之一。

核心功能

适合谁用

以下类型的用户会特别受益于 小米 MiMo-V2.5-TTS:

优点亮点

价格与方案

**TTS API 限时免费**(`mimo.xiaomi.com` 官网可直接申请):三款子模型(基础版、VoiceDesign、音色复刻)均可免费调用,具体额度以官网公告为准。**ASR 语音识别模型完全开源**(MIT 协议,Hugging Face / GitHub 可下载权重)。**商业化定价方案**未来推出,届时会区分个人开发者与企业客户。

总结与建议

MiMo-V2.5-TTS 是国内 TTS 领域 2026 年的现象级产品——**自然语言调度声音 + 原生方言 + 情感切换 + 歌唱能力 + 限时免费**五件套让它成为内容创作者、AI 数字人开发者、Agent 语音产品团队的首选。**如果你在做短视频配音、有声书、播客、游戏配音**,MiMo-V2.5-TTS 是必测项——尤其是方言场景国内几乎没有对手。搭配 MiMo-V2.5-ASR 形成完整的语音 IO 闭环,是小米在 Agent 时代对语音全链路的完整布局。

版本演进

分类
AI 开发平台
价格
免费试用
标签
小米 · TTS · 语音合成