产品简介
Qwen3.8-LiveTranslate 是通义千问团队 2026 年 9 月 18 日发布的实时同声传译模型。它把同声传译重构成一条音频与文本交错的单一序列:已经听到的音频、已经产出的译文都会被缓存复用,理解与翻译在同一序列里完成,官方称平均同传延迟 LAAL 从上一代的 2.8 秒降到 2.3 秒。
语言覆盖上,模型接受 60 种语言的音频输入并产出译文文本,其中 29 种语言可以用保留原说话人音色的合成语音输出。这一代新增三个面向真实会议场景的能力:实时说话人分离,每句译文标注归属;源文与译文同屏同步输出,方便双语对照;长上下文消歧,结合先前历史判断姓名与术语,跨轮次保持表述一致。
评测方面,官方给出的数据是多说话人长音频评测 Omnilingua-MSpeaker(14 个语向)的忠实度、流畅度、简洁性与说话人分离错误率四个维度均超过现有主流实时口译系统;公开测试集 FLEURS(70 个语向)在翻译质量、延迟、识别与合成质量上领先上一代与主流系统。模型经阿里云百炼实时 API 提供,实时模型名为 qwen3.8-livetranslate-flash-realtime,收录时未见开源权重。
核心功能
- 单流 Interleave 架构:音频与译文在同一因果序列里交错生成,已听到的音频与已产出的译文缓存复用,质量与延迟同时受益。
- Thinker-Talker 双模块:Thinker 把视频、音频、源文本与译文排成单一序列做流式理解与翻译,Talker 结合源音频合成保留原说话人音色的语音。
- 实时说话人分离:服务端随译文一并返回说话人标识与源语文本,不用再单独接一套语音识别,多人会议每句话归属清晰。
- 源文译文同屏对齐:双语同步输出,字幕、会议纪要与译员辅助场景直接可用,通过会话配置即可开启。
- 长上下文消歧:跨轮次链接历史,姓名与术语指代更准;另支持热词注册与图像帧输入作为视觉上下文辅助判断。
- 60 语输入 / 29 语语音输出:文本译文覆盖中、英、日、韩、德、法、西、俄、阿拉伯语、粤语等 60 种语言,29 种语言可输出带音色的语音。
适合谁用
以下类型的用户会特别受益于 Qwen3.8-LiveTranslate:
- 国际会议与直播的同传字幕:低延迟产出双语字幕,带说话人归属
- 跨语言客服与语音智能体:实时听懂并译出,语音输出保留原音色
- 会议纪要与访谈整理:一次拿到源文、译文与说话人标注三路结果
- 译员辅助工具:低延迟草稿译文供人工译员校对提速
- 多语言视频内容生产:配音与字幕的初步翻译与对齐
优点亮点
- 官方口径的 LAAL 2.3 秒处于实时同传可用的延迟区间
- 说话人分离与双语对齐内置在会话配置里,省掉自建管线
- 语音输出保留原说话人音色,多人场景观感自然
- 与 Qwen3.8 家族同代际,和 Omni 系列混用切换成本低
- 文本译文覆盖 60 种语言,语向覆盖面在实时同传里算宽的
价格与方案
经阿里云百炼平台实时 API 调用,模型名 qwen3.8-livetranslate-flash-realtime,按音频时长与输出用量计费,官方博客未公布价格明细,具体以百炼平台公示为准。
总结与建议
Qwen3.8-LiveTranslate 是通义千问 2026 年 9 月 18 日发布的实时同声传译模型,用单流交错架构把官方口径的同传延迟做到 LAAL 2.3 秒,60 种语言文本输入、29 种语言语音输出,说话人分离、双语对齐与长上下文消歧都内置在会话配置里。做国际会议同传字幕、跨语言语音智能体或译员辅助的团队,可以在百炼实时 API 上直接接入试跑。
版本演进
- Qwen 发布 Qwen3.8-LiveTranslate 实时同传模型,LAAL 降至 2.3 秒 (2026-09-18):Qwen 发布 Qwen3.8-LiveTranslate,采用 Interleave 架构与 Hybrid-MoE Thinker-Talker 设计重构实时同声传译,平均滞后(LAAL)从上一代的 2.8 秒降至 2.3 秒。