阿里巴巴于9月19日发布了新一代即时同步口译模型Qwen3.8-LiveTranslate。根据Qwen团队在官方帐号公布的说明,该版本采用了Interleave架构,在60种语言上将平均延迟从2.8秒降低至2.3秒,同时在以下方面都有所改善:
忠实度
流畅度
简洁度
同步口译要处理的核心矛盾是等待与准确之间的取舍。模型听得越久,掌握的语意越完整,译得越准,但使用者也等得越久。官方采用的衡量指标是平均延迟(LAAL),也就是译文相对于原文平均落后多少时间。
这一版把这个数字从2.8 秒压到2.3 秒,差距约半秒。在口译情境中,半秒是对话节奏会不会断掉的差别。
官方列出的三项新功能,方向一致。第一是即时区分说话人,能在多人同时发言的场合分辨谁在讲话,并透过更稳定的声音复制,让每位说话者的译文保留各自音色。
第二是原文与译文同步显示,两种语言同时出现在画面上。第三是长脉络消歧,模型会利用先前的对话内容来判断人名与专业术语,让同一个词在整场对话中翻译一致。
这三项要解决的都是单向逐句翻译处理不了的状况:会议有多个人讲话、听众需要对照原文、同一个专有名词在一场对话里反复出现。
Qwen3.8-LiveTranslate 透过QwenCloud 提供,官方公告中给的是部落格与云端服务连结。链新闻查询Hugging Face,未见这个模型的权重上架,与Qwen 系列部分版本开源的做法不同。
同属Qwen 3.8 系列的文字模型则可在本地执行,Vitalik 先前实测在笔电上的推论速度约每秒33 个token。