产品简介
StepAudio 3 是阶跃星辰于 2026 年 9 月 15 日发布的新一代语音大模型系列,包含五款模型:StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen 与 StepAudio 3 Music,分别对应实时语音交互、复杂场景语音理解、真人级语音生成、完整音频内容生成与音乐创作。五款模型均已上线阶跃星辰开放平台。
Realtime 是这一系列里最能说明方向的一款。它支持原生全双工实时对话,可以同时理解语义、语气、情绪、副语言特征与环境声音,据此判断什么时候该接话、什么时候该等待,也能处理用户打断与连续反馈。复杂问题上它支持推理与语音生成并行,Tool Call 与长任务可以异步执行而不阻塞当前会话。在 Artificial Analysis Conversational Dynamics 榜单上,它以 98.9% 的综合得分位列全球第一;Speech Reasoning 榜单上以 99.7% 的语音推理准确率同样位列第一。
另外四款围绕音频生产的不同环节展开。ASR 把高精度语音识别与大模型的上下文理解能力结合,覆盖中文、英文、方言、中英混说、长音频,以及医疗、法律、金融、汽车、编程等专业场景,也能处理低音量、快语速、吐字不清、唱歌、带背景音乐等复杂输入,非流式语音识别的词错率(WER)为 1.7%,并列全球第一。TTS 面向实时交互场景,在音色、语调层次、节奏与停顿上贴近自然口语,能还原笑声、迟疑、结巴、重复、改口等副语言表现,也可以根据语义内容自主调整情绪语气,采用流式生成架构边生成边播放。
Gen 与 Music 面向内容生产。Gen 把传统音频制作里录制、剪辑、混音的链条压缩成一步,用自然语言描述加参考音频即可统一生成角色人声、音效、环境音与背景音乐,并支持指定对白、音效与背景音乐出现的时间与顺序。Music 支持零样本生成与基于 ABC 记谱法的多轮交互创作,输入可以是歌词、清唱、参考歌曲或乐谱,用自然语言控制曲风、人声、旋律、节奏、乐器与情绪;在清唱配乐场景下,一段清唱即可自动补出和声、节奏、乐器与完整编曲。
核心功能
- 原生全双工实时对话:StepAudio 3 Realtime 支持双向同时说话,能处理打断与连续反馈,判断何时接话、何时等待,在 Artificial Analysis Conversational Dynamics 榜单以 98.9% 综合得分位列全球第一。
- 副语言与环境声理解:在语义之外同时理解语气、情绪、副语言特征与环境声音,让语音交互的节奏判断更接近真人对话。
- 推理与语音并行、长任务异步:复杂问题支持推理与语音生成并行,Tool Call 与长任务异步执行且不阻塞当前会话,语音推理准确率 99.7%,在 Speech Reasoning 榜单位列全球第一。
- 专业场景语音识别:ASR 融合语音识别与大模型上下文理解,覆盖中英文、方言、中英混说与长音频,适配医疗、法律、金融、汽车、编程等领域,非流式词错率 1.7%,并列全球第一。
- 复杂输入环境下的识别鲁棒性:可处理低音量、快语速、吐字不清,以及唱歌、带背景音乐等复杂音频输入。
- 副语言可还原的语音合成:TTS 还原笑声、迟疑、结巴、重复、改口等副语言表现,能按语义自主调整情绪语气,采用流式架构边生成边播放。
- 一体化音频生成与声音时序控制:Gen 用自然语言加参考音频统一生成人声、音效、环境音与背景音乐,支持多角色,并可指定各声部出现的时间与顺序。
- 基于 ABC 记谱法的多轮音乐创作:Music 支持歌词、清唱、参考歌曲或乐谱输入,用自然语言控制曲风、旋律、节奏、乐器与情绪;清唱场景可自动补充和声、节奏与完整编曲。
适合谁用
以下类型的用户会特别受益于 StepAudio 3:
- 实时语音助手:全双工对话配合打断处理,构建接近真人语感的语音入口
- 智能客服与坐席辅助:长任务异步执行,查询与办理不阻塞通话
- 会议与长音频转写:覆盖方言、中英混说与专业领域的语音识别
- 有声内容生产:用一套自然语言描述同时生成人声、音效与环境音
- 短视频与广告配音:依赖副语言还原能力表达情绪与语气
- 音乐创作:从一段清唱或一段歌词扩展成带编曲的完整歌曲
优点亮点
- Realtime 在 Artificial Analysis Conversational Dynamics 榜单以 98.9% 综合得分位列全球第一
- 语音推理准确率 99.7%,在 Speech Reasoning 榜单位列全球第一
- ASR 非流式词错率 1.7%,并列全球第一,并覆盖方言与专业领域
- 全双工对话支持打断处理与长任务异步执行,语音体验接近真人节奏
- 五款模型覆盖识别、合成、实时交互、音频生成与音乐创作,可按需单独接入
- TTS 支持流式生成与副语言还原,适合实时交互场景
- 均已上线阶跃星辰开放平台,有对应文档可查
价格与方案
五款模型均已上线阶跃星辰开放平台(platform.stepfun.com),按模型分接口调用,ASR 与 TTS 接入门槛较低,Realtime 需要处理双向音频流与会话状态。具体价格与免费额度以阶跃星辰开放平台公告为准。
总结与建议
StepAudio 3 把语音模型从单一识别或生成扩展成完整的音频内容生产与实时交互能力,五款模型各管一段:Realtime 管实时对话,ASR 管听得准,TTS 管说得像,Gen 管一条指令生成整套声音,Music 管把清唱补成编曲。三个全球第一都落在 Artificial Analysis 的榜单上,Realtime 的 98.9% 对话动态得分与 99.7% 语音推理准确率是这一代最硬的指标。做语音助手、客服、有声内容或音乐创作的产品,可以按需求先接 ASR 或 TTS,把实时对话放到下一步;需要评估实时语音体验时,这份系列值得与 Gemini 3.8 Live 放在一起对比测试。
版本演进
- StepAudio 3 系列发布:Realtime、ASR、TTS、Gen、Music 五款模型上线开放平台 (2026-09-15):阶跃星辰发布 StepAudio 3 系列五款语音模型并同步上线开放平台。Realtime 支持原生全双工实时对话,在 Artificial Analysis Conversational Dynamics 榜单以 98.9% 综合得分位列全球第一,Speech Reasoning 榜单词语音推理准确率 99.7% 同样第一,支持推理与语音生成并行、Tool Call 与长任务异步执行;ASR 非流式词错率 1.7% 并列全球第一,覆盖方言、中英混说与医疗、法律、金融等专业场景;TTS 面向实时交互,还原笑声、迟疑、结巴、改口等副语言表现并支持流式生成;Gen 统一生成人声、音效、环境音与背景音乐,支持多角色与声音时序控制;Music 支持基于 ABC 记谱法的多轮音乐创作与清唱自动编曲。