首页 行业资讯 阿里千问发布新一代同传大模型:延迟降至2.3秒,支持60种语言

阿里千问发布新一代同传大模型:延迟降至2.3秒,支持60种语言

9月19日,阿里巴巴旗下千问大模型团队正式发布全新一代同声传译大模型Qwen3.8-LiveTranslate。该模型以Interleave架构重构实时同传技术路线,在翻译准确度、流畅度、简洁度等多个维度实现全面提升,字均延迟(LAAL)从此前的2.8秒进一步降至2.3秒。

官方表示,在原有支持60种语言的基础上,Qwen3.8-LiveTranslate重点新增了三项核心能力,让同传技术能够更广泛地应用于真实业务场景中:

Qwen3.8-LiveTranslate三大新能力

三大核心升级能力

实时说话人分离:能够自动区分不同说话人的发言归属,每句话的音色复刻更加稳定准确,解决了多人对话场景下同传效果差的痛点。

原文译文同帧同出:实现原文与译文双语同屏显示,便于听众随时对照核对,大幅提升了会议、访谈等正式场景的实用性。

长上下文消歧:能够联系前文语境理解当前语句,对于人名、专业术语等容易产生歧义的内容翻译更加精准,前后一致性显著提升。

技术架构深度解析

Qwen3.8-LiveTranslate采用基于Hybrid MoE的Thinker–Talker双模块设计,通过Interleave方式衔接流式理解、文本输出与语音生成三个环节。

Qwen3.8-LiveTranslate技术架构

其中,Thinker模块将视频、音频、原文与译文编排进同一条因果序列,按时序交替排列、端到端产出,让语义理解与翻译生成在单一序列内完成,避免了传统流水线架构中的信息损耗。Talker模块则结合译文内容和源音频特征,将译文合成为能够保留原说话人音色的目标语言语音。

性能表现行业领先

在覆盖14个语向的多说话人长音频评测集Omnilingua-Mspeaker上,Qwen3.8-LiveTranslate在翻译忠实度、流畅度、简洁度以及说话人识别错误率DER四个核心维度上,均优于目前行业主流的实时同传系统。

多维度性能对比评测

官方同时在公开的FLEURS音频测试集上评测了70个语言方向的实时同传表现。测试结果显示,Qwen3.8-LiveTranslate在翻译质量、字均延迟、语音识别准确率以及语音合成质量四个维度上,全面领先于上一代产品以及当前主流的实时同传系统。

作为国内大模型厂商在实时同传领域的最新成果,Qwen3.8-LiveTranslate的发布进一步缩小了AI同传与人工同传之间的效果差距,为跨语言会议、国际交流、在线教育等场景提供了更加成熟的技术选择。

赞助商