拓冰建站拓冰建站
首页 / 资讯中心 / 正文

Qwen3.5-Live 语音实时同传,60 种语言,超低延迟,且能看到画面?

同声翻译最怕的不是听不懂而是没有看到现场。想象一下当你需要翻译对方的语言时一个模型可以看到现场对方的表情心态肢体动作都能尽收眼底一个模型只能听到声音哪个模型翻译最精确先说一件你可能想不到的事你在泰国餐厅点餐对方说了一串泰文。以前你的选择只有两个拿出手机打字问谷歌翻译或者凭直觉指菜单。现在你戴着Qwen AI眼镜它的摄像头在扫菜单麦克风在听服务员讲话2.8秒后你耳机里响起了中文——不是机器音是用服务员的声线说出来的中文。这是阿里官方演示视频里真实发生的场景。2.8秒。这不是差不多能用的水平这是可以放进真实对话里的速度——人说完一句话你还没开口翻译已经到了。01它做到了哪三件人类译员最怕的事PART 专业词汇语言混用做过翻译的人都知道口译最难的不是词汇是这三个第一难专业词汇。一场医疗会议说到硬膜外血肿翻译官没听过就废了。Qwen3.5-LiveTranslate 内置了热词功能——可以提前输入专有名词、品牌名、产品型号最多支持1000个。开会前提前配置好医学、法律、金融、科技各行各业的黑话它都能认得出来、写得对、翻得准。第二难语言混用。真实会议里没有人只说一种语言。日本客户说着日语突然插一句英文缩写中国代表讲着中文夹着几个术语。这种代码切换是机器翻译的噩梦。Qwen3.5-LiveTranslate 能实时识别语言切换不打断不混乱继续翻。第三难听不清的时候。会议室里有回音视频通话里有延迟户外场景里有噪音。这种情况下纯靠声音的翻译系统会直接出错。但 Qwen3.5-LiveTranslate同时在看画面——口型、手势、屏幕上的文字所有视觉信息都是辅助判断的依据。听不清这个词但看到屏幕上写着它翻译就不会错。02用你的声音说别人的语言PART 最震撼的功能这是整个功能里最让我感到震撼的部分。以往的AI翻译输出的永远是同一个机器声。无论说话的是一位70岁的老教授还是一个20岁的直播主翻出来的声音都一样——冷冰冰毫无人味。Qwen3.5-LiveTranslate 加入了实时声线克隆。只需要一句话的样本模型就能识别说话人的声音特征——音色、语调、节奏——然后用这套特征去合成翻译后的语音。翻译出来的还是你的声音只是换了语言。这意味着什么意味着你在做跨国直播说中文对面的西班牙观众听到的是一个说西班牙语的你。意味着国际会议里A先生用德语发言中方代表听到的是说中文的A先生而不是一个陌生的合成声。身份感、情感、语气——都被保留下来了。0360种语言凭什么PART 60 种输入29 种输出上一个版本的 Qwen3-LiveTranslate支持18种语言的输入10种语言的音频输出。这次一步跨到60种语言输入29种语言的音频输出。中文、英文、法文、德文、俄文、日文、韩文、阿拉伯文、印地文……还有越南语、泰语、斯瓦希里语、冰岛语、世界语甚至粤语。从18到60这是超过3倍的扩展覆盖的人口从主要大国延伸到了几乎所有主流语言区域。对工程师来说这背后是不同语系的发音规律、语法结构和音频模型的全面重构。对用户来说意味着你现在几乎可以在全球任何地方用这个系统实时沟通。04最后说一个让人沉默的细节PART 古代文言文翻译阿里的演示里有一个场景是用 Qwen3.5-LiveTranslate 翻译《三国演义》的文言文。用的是古汉语翻译成现代英文。一个AI同传模型不仅能翻60种现代语言还能处理文言文。语言的壁垒这件事从来不只是国与国之间。它也存在于时代与时代之间存在于专业圈子与普通人之间存在于不同方言的人之间。而现在这道墙开始被一块一块地拆掉了。05技术附录写给想深挖的人PART 核心技术以下内容偏技术模型架构Thinker-Talker 双模块设计Qwen3.5-LiveTranslate 建立在Qwen3.5-Omni的 Thinker-Talker 架构之上分为两个协作模块Thinker理解层接收交错的视觉帧和音频流进行多模态融合理解输出文本翻译。它同时看和听视觉信息口型、手势、屏幕文字与音频信号并行处理用视觉上下文来消解音频层面的歧义。Talker合成层接收 Thinker 的文字翻译结果和原始音频在翻译的同时执行跨语言声线克隆输出像原说话人的目标语言语音。两层之间的信息流是单向的Thinker → Talker但在训练阶段是端到端联合优化的这保证了翻译准确性和声线克隆质量不会互相妥协。Readable Unit 技术延迟优化的核心传统流式翻译面临一个根本性的矛盾语义完整性要求等到一段意思说完再翻低延迟要求越早开始输出越好。等太久延迟高出太早翻到一半语义断了让人听不懂。Qwen3.5-LiveTranslate 引入了Readable Unit可读单元标签机制。模型在生成翻译文本时同步预测当前这段文字是否已经构成一个语义上完整、可以独立朗读的单元。一旦检测到 Readable Unit 边界立刻触发 Talker 合成这段语音不等整句结束。效果与上一代 Qwen3-LiveTranslate-Flash 相比..json{首字延迟下降 3.45 秒每词延迟下降 1.88 秒最终实现平均语音到语音延迟2.8 秒且翻译质量几乎无损失}这是一个典型的不是更快的硬件而是更聪明的调度策略的优化思路。06声线克隆的三种模式PART 核心技术实时声线克隆支持三种工作模式对应不同的场景需求预注册模式pre-registered提前通过 Voice Cloning API 注册一个自定义声线ID调用时直接指定适合固定主播、固定发言人的长期使用场景。API 参数voice: qwen-translate-vc-xxx-yyy-zzzfrequency: never。单次克隆模式clone-once会话开始时用第一句话的音频样本做声线提取之后整场会议保持这个声线。适合临时会议、一次性访谈。实时克隆模式real-time每次说话都做动态声线适配适合多人轮流发言的会议场景每位发言人的声线特征独立提取、实时切换。注意使用预注册模式时voice 参数必须填自定义 ID使用 once 或 always 模式时voice 必须设为 default否则服务端报错。视觉消歧音频降质时的救场机制这是 Qwen3.5-LiveTranslate 在技术设计上最有工程价值的地方。纯音频翻译系统有一个硬伤当音质下降网络延迟、环境噪音、口音偏重翻译准确率会大幅下降且没有任何补救机制。Qwen3.5-LiveTranslate 的 Thinker 模块接受两种输入音频流 可选的视频帧序列。视频帧提供的视觉信息用于以下几类歧义消解唇读辅助当音频不清晰时唇型特征辅助判断发音屏幕文字提取会议PPT、白板上的文字可以直接被识别作为翻译上下文手势和场景理解肢体语言提供语用层面的补充信息比如这个、那边等指示词的指代对象在官方演示视觉消歧场景中说话人提到一个多义词纯靠音频会产生歧义但屏幕上同时显示了相关文字模型据此选择了正确的翻译方向。07热词系统的工程实现逻辑PART 核心技术热词Hotword功能最多支持1000个词条可以在每次会话开始前动态配置无需重新训练模型。热词系统在三个层面发挥作用识别层强制提升热词的 ASR自动语音识别权重降低误识概率。比如DashScope这个品牌名在没有热词配置时可能被识别为近音词配置后直接锁定。规范化层热词确保专有名词按照预定的格式输出简称、全称、大小写、缩写避免翻译结果中同一个名词出现多种写法。翻译层热词携带目标语言的对应译名翻译时直接套用不经过通用翻译逻辑消除创意翻译带来的歧义。更多transformerVITswin tranformer 参考头条号人工智能研究所 v号人工智能研究Suo, 启示AI科技动画详解transformer 在线视频教程
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门