千問3-LiveTranslate-Flash 是音視頻翻譯模型,支援 18 種語言(包括中文、英文、俄文、法文等)互譯,可結合視覺上下文提升翻譯準確性,並輸出文本與語音。
工作方式
-
設定語種:參考支援的語種,在
translation_options參數中設定源語種 (source_lang) 和目標語種 (target_lang)。省略
source_lang將啟用自動檢測,但指定語種能提升翻譯準確率。 -
輸入待翻譯檔案:
messages數組中有且僅有一條role為user的訊息,content欄位需傳入待翻譯音頻/視頻的 URL 或 Base64 資料。 -
控制輸出模態:通過
modalities參數控制輸出模態:-
["text"]:僅輸出文本; -
["text","audio"]:輸出文本和 Base 64 編碼的音頻。若輸出音頻,需在
audio參數中設定音色(voice)。參考支援的音色。
-
- 單輪翻譯:模型專為翻譯任務設計,不支援多輪對話。
- 無 System Message:不支援通過
system角色設定全域行為。 - 調用方式:僅支援相容 OpenAI 協議的流式輸出。
chunk為流式響應對象:
- 文本:讀取
chunk.choices[0].delta.content。 - 音頻:讀取
chunk.choices[0].delta.audio["data"],模型輸出音訊採樣率是 24kHz。
支援的模型
| 模型名稱 | 版本 | 上下文長度 | 最大輸入 | 最大輸出 |
|---|---|---|---|---|
| (Token數) | ||||
qwen3-livetranslate-flash當前能力等同於qwen3-livetranslate-flash-2025-12-01 | 穩定版 | 53,248 | 49,152 | 4,096 |
| qwen3-livetranslate-flash-2025-12-01 | 快照版 | |||
如何使用
qwen3-livetranslate-flash 模型支援音頻或視頻輸入,並輸出文本與音頻。
請確保已擷取API Key並配置API Key到環境變數。若通過OpenAI SDK調用,需安裝SDK。
以下樣本使用音頻輸入。如需輸入視頻,請取消對應代碼的注釋。
解析 Base64 音頻資料
模型以流式 Base 64 編碼格式輸出音頻。可採用以下兩種方式處理資料:
- 拼接解碼:拼接所有返回的 Base64 片段,待產生結束後統一解碼,儲存為音頻檔案。
- 即時播放:即時解碼每個 Base64 片段並直接播放。
計費說明
- 音頻
- 視頻
輸入或輸出每秒音頻均消耗 12.5 Token。
API 參考
qwen3-livetranslate-flash 模型的輸入輸出參數請參見音視頻翻譯-通義千問。
支援的語種
下表中的語種代碼可用於指定源語種與目標語種。
部分目標語種僅支援輸出文本,不支援輸出音頻。
語種代碼 | 語種 | 支援的輸出模態 |
|---|---|---|
en | 英語 | 音頻、文本 |
zh | 中文 | 音頻、文本 |
ru | 俄語 | 音頻、文本 |
fr | 法語 | 音頻、文本 |
de | 德語 | 音頻、文本 |
pt | 葡萄牙語 | 音頻、文本 |
es | 西班牙語 | 音頻、文本 |
it | 意大利語 | 音頻、文本 |
id | 印尼語 | 文本 |
ko | 韓語 | 音頻、文本 |
ja | 日語 | 音頻、文本 |
vi | 越南語 | 文本 |
th | 泰語 | 文本 |
ar | 阿拉伯語 | 文本 |
yue | 粵語 | 音頻、文本 |
hi | 印地語 | 文本 |
el | 希臘語 | 文本 |
tr | 土耳其語 | 文本 |
支援的音色
| 音色名 | voice參數 | 音色效果 | 描述 | 支援的語種 |
|---|---|---|---|---|
| 芊悅 | Cherry | 陽光積極、親切自然小姐姐。 | 中文、英語、法語、德語、俄語、意大利語、西班牙語、葡萄牙語、日語、韓語 | |
| 不吃魚 | Nofish | 不會翹舌音的設計師。 | 中文、英語、法語、德語、俄語、意大利語、西班牙語、葡萄牙語、日語、韓語 | |
| 上海-阿珍 | Jada | 風風火火的滬上阿姐。 | 中文 | |
| 北京-曉東 | Dylan | 北京胡同裡長大的少年。 | 中文 | |
| 四川-晴兒 | Sunny | 甜到你心裡的川妹子。 | 中文 | |
| 天津-李彼得 | Peter | 天津相聲,專業捧人。 | 中文 | |
| 粵語-阿清 | Kiki | 甜美的港妹閨蜜。 | 粵語 | |
| 四川-程川 | Eric | 一個跳脫市井的四川成都男子。 | 中文 |
常見問題
Q:傳入的視訊檔案時,翻譯的是什麼內容?
A:翻譯視頻中的音頻內容,視覺資訊用於輔助上下文理解,以提升準確率。
樣本:
當音頻內容為This is a mask時:
- 若畫面顯示口罩,會翻譯為“這是一個口罩”;
- 若畫面顯示面具,會翻譯為“這是一個面具”。