qwen3.5-livetranslate-flash-realtime 是视觉增强型实时翻译模型,支持 60 种语言互译(其中 29 种支持音频+文本输出、31 种仅支持文本输出),可同时处理音频与图像输入,适用于实时视频流或本地视频文件,利用视觉上下文信息提升翻译准确性,并实时输出高质量的翻译文本与音频。
在线体验参见通过函数计算一键部署。
功能特性
- 多语言支持:支持 60 种语言互译,其中 29 种支持音频+文本输出、31 种仅支持文本输出,覆盖中文、英语、法语、德语、俄语、日语、韩语、西班牙语、葡萄牙语、阿拉伯语等主流语种。
- 视觉增强:利用视觉内容提升翻译准确性。模型通过分析画面中的口型、动作和文字,改善在嘈杂环境下或一词多义场景中的翻译效果。
- 2.8 秒延迟:实现低至 2.8 秒的同传延迟。
- 无损同传:通过语义单元预测技术,解决跨语言语序问题。实时翻译质量接近离线翻译结果。
- 音色自然:生成音色自然的拟人语音。模型能根据源语音内容,自适应调节语气和情感。
- 配置热词:通过热词提升特定词汇的翻译准确性。
- 声音复刻:支持复刻发言人音色用于翻译播报,让输出听起来像本人说外语。支持服务端实时复刻和使用预先复刻的固定音色。
- 跳过同语种输出:当源语种与目标语种相同时,可分别跳过文本或音频输出。仅当目标语种为中文(
zh)或英语(en)时生效。
如何使用
1. 配置连接
qwen3.5-livetranslate-flash-realtime 模型通过 WebSocket 协议接入,连接时需要以下配置项:
该模型除 WebSocket 外,还支持通过 AOQ 和 WebRTC 协议接入;如果是客户端对接,且更看重稳定的延迟、弱网下的交互能力、实时双工的降噪与回声消除,可优先考虑 AOQ,协议对比与选型请参见Realtime API 概述。
| 配置项 | 说明 |
|---|---|
| 调用地址 | 华北2(北京)地域:wss://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api-ws/v1/realtime新加坡地域:wss://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api-ws/v1/realtime调用时请将{WorkspaceId}替换为真实的业务空间ID。 |
| 查询参数 | 查询参数为model,需指定为访问的模型名。示例:?model=qwen3.5-livetranslate-flash-realtime |
| 消息头 | 使用 Bearer Token 鉴权:Authorization: Bearer DASHSCOPE_API_KEYDASHSCOPE_API_KEY 是您在百炼上申请的API-KEY。 |
WebSocket 连接 Python示例代码
WebSocket 连接 Python示例代码
2. 配置语种、输出模态与音色
发送客户端事件session.update:
-
语种
-
源语种:通过
session.input_audio_transcription.language参数配置。默认不填写,此时模型会自动识别源语种。
-
目标语种:通过
session.translation.language参数配置。默认值为
en(英语)。
-
源语种:通过
-
输出源语言识别结果
通过
session.input_audio_transcription.model参数配置。设置为qwen3-asr-flash-realtime后,服务端会在翻译的同时返回输入音频的语音识别结果(源语言原文)。 启用后,服务端会返回以下事件:conversation.item.input_audio_transcription.text:流式返回识别结果。conversation.item.input_audio_transcription.completed:识别完成后返回最终结果。conversation.item.input_audio_transcription.failed:识别失败时返回错误信息。
-
输出模态
通过
session.modalities参数配置。支持设置为["text"](仅输出文本)或["text","audio"](输出文本与音频)。 -
语音活动检测(VAD)与 Manual 模式
通过
session.turn_detection参数配置语音起止的检测方式:- VAD 模式(默认):
turn_detection设为配置对象。服务端自动检测语音起止并自动触发翻译,适合客户端持续发送音频流的场景。 - Manual 模式:
turn_detection设为null。由客户端判断语音起止,说完一段话后主动发送input_audio_buffer.commit事件提交音频,适合"按下说话、松开发送"的场景。
- VAD 模式(默认):
-
音色
通过
session.voice参数配置。参见支持的音色。 -
热词
通过
session.translation.corpus.phrases参数配置。热词用于提升特定词汇的翻译准确性,以 key-value 形式指定源语言词汇与目标语言翻译的映射关系。 示例:将"人工智能"指定翻译为"Artificial Intelligence"。 -
声音复刻
通过
session.enable_voice_clone、session.voice_clone_options.frequency与session.voice参数配置。支持三种模式:使用预先复刻的音色(frequency为never)、服务端复刻一次(once)或每次复刻(always)。详见 声音复刻。
3. 输入音频与图片
客户端通过 input_audio_buffer.append 和 input_image_buffer.append 事件发送 Base64 编码的音频和图片数据。音频输入是必需的;图片输入是可选的。
图片可以来自本地文件,或从视频流中实时采集。模型判断一段语音"说完了"的方式,取决于turn_detection参数配置的 VAD 模式或 Manual 模式:
- VAD 模式(默认):客户端持续发送input_audio_buffer.append事件;服务端检测到语音开始/结束时,分别返回input_audio_buffer.speech_started、input_audio_buffer.speech_stopped事件,并自动提交音频缓冲区、触发翻译。翻译响应基于流式语音同步生成,通常在语音输入过程中就已开始,无需等待语音结束。
- Manual 模式:将
session.turn_detection设为null。客户端发送完一段完整的语音后,主动发送input_audio_buffer.commit事件提交音频缓冲区;服务端返回input_audio_buffer.committed事件确认后,自动开始生成翻译响应,客户端无需再发送其他事件触发响应。提交前若需清空未提交的音频,可发送input_audio_buffer.clear事件。
4. 接收模型响应
翻译响应基于流式语音同步生成,通常无需等待语音结束(参见上一节 VAD/Manual 模式说明)。模型的响应格式取决于配置的输出模态。
- 仅输出文本 服务端通过response.text.text事件流式返回增量翻译文本(含已确认文本和待确认的预测文本);翻译完成后,通过response.text.done事件返回完整的翻译文本。
-
输出文本+音频
- 文本 通过response.audio_transcript.text事件流式返回增量翻译文本;翻译完成后,通过response.audio_transcript.done事件返回完整的翻译文本。
- 音频 通过response.audio.delta事件返回 Base64 编码的增量音频数据。
5. 结束会话
音频发送完毕后,客户端必须发送 session.finish 事件通知服务端,然后等待服务端返回 session.finished 事件后再关闭 WebSocket 连接。
支持的模型
推荐模型
| 模型名称 | 版本 | 上下文长度 | 最大输入 | 最大输出 |
|---|---|---|---|---|
| (Token数) | ||||
qwen3.5-livetranslate-flash-realtime当前能力等同 qwen3.5-livetranslate-flash-realtime-2026-05-19 | 稳定版 | 53,248 | 49,152 | 4,096 |
| qwen3.5-livetranslate-flash-realtime-2026-05-19 | 快照版 | |||
旧版模型
以下模型仍在服务中,但不再作为首选推荐。新场景建议使用上方的新一代模型,以获得更优的翻译质量与性价比。
| 模型名称 | 版本 | 上下文长度 | 最大输入 | 最大输出 |
|---|---|---|---|---|
| (Token数) | ||||
qwen3-livetranslate-flash-realtime当前能力等同 qwen3-livetranslate-flash-realtime-2025-09-22 | 稳定版 | 53,248 | 49,152 | 4,096 |
| qwen3-livetranslate-flash-realtime-2025-09-22 | 快照版 | |||
快速开始
-
准备运行环境
您的 Python 版本需要不低于 3.10。
首先安装 pyaudio。
安装完成后,通过 pip 安装 websocket 相关的依赖:macOS
-
创建客户端
在本地新建一个 Python 文件,命名为
livetranslate_client.py,并将以下代码复制进文件中:客户端代码-livetranslate_client.py
-
与模型互动
在
livetranslate_client.py的同级目录下新建另一个 Python 文件,命名为main.py,并将以下代码复制进文件中:运行main.py
main.py,通过麦克风说出要翻译的句子,模型会实时返回翻译完成的音频与文本。系统会检测您的音频起始位置并自动发送到服务端,无需手动发送。
声音复刻
模型支持发言人声音复刻功能,支持使用预先复刻的固定音色,也支持由服务端实时复刻,让翻译播报听起来像本人说外语。适用于跨语言演讲、个人主播、视频翻译等需要保留个人音色的场景。
在 session.update 中设置以下参数启用:
-
session.enable_voice_clone:设置为true,启用声音复刻。 -
session.voice_clone_options.frequency:控制声音复刻时机,取值如下:never:不在服务端复刻,使用用户预先复刻好的音色。此时session.voice需设置为用户自己的复刻音色 ID。once:服务端在会话开始时基于输入音频复刻一次音色,后续翻译输出复用该音色。适合单人演讲场景。此时session.voice需设置为default。always:服务端在每次生成翻译音频前实时复刻,音色跟随输入动态变化。适合双人及以上对话场景。此时session.voice需设置为default。
-
session.voice:指定输出音色,取值取决于frequency的设置。- 设置为
default:搭配frequency为once或always使用,由服务端复刻输入音频的音色,复刻完成前使用默认音色过渡。 - 设置为用户复刻的音色 ID(如
qwen-translate-vc-xxx-yyy-zzz):搭配frequency为never使用。需提前通过声音复刻API准备音色,targetModel需指定为qwen3.5-livetranslate-flash-realtime。
- 设置为
当frequency为once或always时,voice必须设置为default,不可设置为其他预设音色,否则服务端会返回错误。
声音复刻配置示例
使用预先复刻的音色(音质稳定,推荐需要固定音色的场景):
利用图像提升翻译准确率
qwen3.5-livetranslate-flash-realtime 模型可以接收图像输入,辅助音频翻译,适用于同音异义、低频专有名词识别场景。建议每秒发送不超过2张图片。
将以下示例图片下载到本地:口罩.png面具.png
将以下代码下载到livetranslate_client.py同级目录并运行,向麦克风说"What is mask?",在输入口罩图片时,模型会翻译为“什么是口罩?”;输入面具图片时,模型会翻译为“什么是面具?”
通过函数计算一键部署
控制台暂不支持体验。可通过以下方式一键部署:
- 打开我们写好的函数计算模板,填入 API Key, 单击创建并部署默认环境即可在线体验。
-
等待约一分钟,在 环境详情 > 环境信息 中获取访问域名,将访问域名的
http改成https(例如https://qwen-livetranslate-flash-realtime-intl.fcv3.xxx.ap-southeast-1.fc.devsapp.net/),通过该链接与模型交互。
如需开通访问控制权限,请跟随页面指引操作。
通过资源信息-函数资源查看项目源代码。
函数计算与阿里云百炼均为新用户提供免费额度,可以覆盖简单调试所需成本,额度耗尽后按量计费。只有在访问的情况下会产生费用。
交互流程
实时语音翻译的交互流程遵循标准的 WebSocket 事件驱动模型。语音起止的判断方式取决于 VAD 模式或 Manual 模式(参见3. 输入音频与图片),下表以 VAD 模式(默认)为主线,并标注了 Manual 模式下不同的服务端事件。
| 生命周期 | 客户端事件 | 服务端事件 |
|---|---|---|
| 会话初始化 | session.update会话配置 | session.created会话已创建session.updated 会话配置已更新 |
| 用户音频输入 | input_audio_buffer.append添加音频到缓冲区input_image_buffer.append 添加图片到缓冲区input_audio_buffer.commit (仅 Manual 模式)提交音频缓冲区 | VAD 模式:input_audio_buffer.speech_started检测到语音开始input_audio_buffer.speech_stopped 检测到语音结束,服务端自动提交音频缓冲区Manual 模式:input_audio_buffer.committed 客户端发送 input_audio_buffer.commit 后返回,确认音频缓冲区已提交 |
| 服务端音频输出 | 无 | response.created服务端开始生成响应response.output_item.added 响应时有新的输出内容conversation.item.created 对话中创建新的消息项response.content_part.added 新的输出内容添加到assistant messageresponse.text.text 仅文本模态下增量生成的翻译文本response.audio_transcript.text 音频+文本模态下增量生成的转录文字response.audio.delta 模型增量生成的音频response.text.done 仅文本模态下翻译文本完成response.audio_transcript.done 音频+文本模态下文本转录完成response.audio.done 音频生成完成response.content_part.done Assistant message 的文本或音频内容流式输出完成response.output_item.done Assistant message 的整个输出项流式传输完成response.done 响应完成 |
| 会话结束 | session.finish通知服务端音频发送完毕 | session.finished服务端完成处理,会话结束 |
API 参考
- 实时音视频翻译(Qwen-Livetranslate-Realtime)。
- AOQ客户端API
- Realtime API 概述(WebRTC 协议说明)
计费说明
-
Qwen3.5-LiveTranslate-Flash-Realtime
- 音频:输入每秒音频消耗 7 Token,输出每秒音频消耗 12.5 Token。
- 图片:每输入 32*32 像素消耗 0.5 Token。
- 文本:启用源语言语音识别功能后,服务除返回翻译结果外,还会返回输入音频的语音识别文本(即源语言原文),该识别文本将按输出文本的 Token 标准计费。
-
Qwen3-LiveTranslate-Flash-Realtime
- 音频:输入或输出每秒音频均消耗 12.5 Token。
- 图片:每输入 28*28 像素消耗 0.5 Token。
- 文本:启用源语言语音识别功能后,服务除返回翻译结果外,还会返回输入音频的语音识别文本(即源语言原文),该识别文本将按输出文本的 Token 标准计费。
限流说明
模型的限流规则请参见限流。
支持的语种
下表中的语种代码可用于指定源语种与目标语种。
部分目标语种仅支持输出文本,不支持输出音频。老模型 qwen3-livetranslate-flash-realtime 仅支持以下 18 种语种:en、zh、ru、fr、de、pt、es、it、id、ko、ja、vi、th、ar、yue、hi、el、tr。
语种代码 | 语种 | 支持的输出模态 |
|---|---|---|
zh | 中文 | 音频+文本 |
en | 英语 | 音频+文本 |
ar | 阿拉伯语 | 音频+文本 |
de | 德语 | 音频+文本 |
fr | 法语 | 音频+文本 |
es | 西班牙语 | 音频+文本 |
pt | 葡萄牙语 | 音频+文本 |
id | 印度尼西亚语 | 音频+文本 |
it | 意大利语 | 音频+文本 |
ko | 韩语 | 音频+文本 |
ru | 俄语 | 音频+文本 |
th | 泰语 | 音频+文本 |
vi | 越南语 | 音频+文本 |
ja | 日语 | 音频+文本 |
tr | 土耳其语 | 音频+文本 |
hi | 印地语 | 音频+文本 |
ms | 马来语 | 音频+文本 |
nl | 荷兰语 | 音频+文本 |
ur | 乌尔都语 | 音频+文本 |
nb | 挪威语 | 音频+文本 |
sv | 瑞典语 | 音频+文本 |
da | 丹麦语 | 音频+文本 |
he | 希伯来语 | 音频+文本 |
fi | 芬兰语 | 音频+文本 |
pl | 波兰语 | 音频+文本 |
is | 冰岛语 | 音频+文本 |
cs | 捷克语 | 音频+文本 |
fil | 菲律宾语 | 音频+文本 |
fa | 波斯语 | 音频+文本 |
yue | 粤语 | 文本 |
el | 希腊语 | 文本 |
af | 南非荷兰语 | 文本 |
ast | 阿斯图里亚斯语 | 文本 |
be | 白俄罗斯语 | 文本 |
bg | 保加利亚语 | 文本 |
bn | 孟加拉语 | 文本 |
bs | 波斯尼亚语 | 文本 |
ca | 加泰罗尼亚语 | 文本 |
ceb | 宿务语 | 文本 |
et | 爱沙尼亚语 | 文本 |
gl | 加利西亚语 | 文本 |
gu | 古吉拉特语 | 文本 |
hr | 克罗地亚语 | 文本 |
hu | 匈牙利语 | 文本 |
jv | 爪哇语 | 文本 |
kk | 哈萨克语 | 文本 |
kn | 卡纳达语 | 文本 |
ky | 柯尔克孜语 | 文本 |
lv | 拉脱维亚语 | 文本 |
mk | 马其顿语 | 文本 |
ml | 马拉雅拉姆语 | 文本 |
mr | 马拉地语 | 文本 |
pa | 旁遮普语 | 文本 |
ro | 罗马尼亚语 | 文本 |
sk | 斯洛伐克语 | 文本 |
sl | 斯洛文尼亚语 | 文本 |
sw | 斯瓦希里语 | 文本 |
tg | 塔吉克语 | 文本 |
az | 阿塞拜疆语 | 文本 |
uk | 乌克兰语 | 文本 |
支持的音色
实时翻译支持的音色与voice参数取值参见音色列表。