選擇適合語音合成、聲音複刻和聲音設計情境的模型。
從閉源模型遷移到百鍊?
如果你正在使用 ElevenLabs、OpenAI 或 Google 的語音合成服務,可參考下表選擇對應的百鍊模型。
使用情境 | 閉源模型代表 | 百鍊推薦 |
|---|---|---|
內建音色 / 標準合成 | OpenAI gpt-4o-tts、Google Chirp 3 |
|
自訂音色 / 聲音複刻 | ElevenLabs Multilingual v3 |
|
標準語音合成還是自訂音色?
語音合成模型可將文本轉換為自然語音。首先確定您需要使用內建音色還是自訂音色:
標準語音合成 | 自訂音色 | |
|---|---|---|
音色來源 | 模型內建音色庫,選擇即用 | 從音頻樣本複刻,或用文字描述建立 |
上手成本 | 無需額外配置,選擇模型和音色即可合成 | 需提供音頻樣本或文字描述來建立音色 |
適用情境 | 智能客服、有聲閱讀、內容播報、電商直播 | 品牌專屬音色、虛擬主播、遊戲角色配音 |
推薦模型 |
|
|
- 使用標準語音合成:當內建音色庫能滿足需求,希望快速上手、無需額外配置時。
- 使用自訂音色:當需要品牌專屬聲音、複刻特定人物音色,或建立全新角色音色時。
聲音複刻還是聲音設計?
如果選擇自訂音色,有兩種方式建立:
聲音複刻(Voice Cloning) | 聲音設計(Voice Design) | |
|---|---|---|
輸入方式 | 提供一段音頻樣本 | 用文字描述期望的音色(如“溫暖的低音女聲”) |
效果 | 合成語音與原始說話人高度相似 | 根據描述從零產生全新音色 |
適用情境 | 品牌代言人/主播音色複用、虛擬主播、個人化語音助手 | 品牌音色定製(無錄音素材)、遊戲/動畫角色配音、創意內容製作 |
推薦模型 |
|
|
音色管理服務 |
|
|
- 使用聲音複刻:當已有目標人物的錄音素材,希望在合成中還原該音色時。
- 使用聲音設計:當沒有錄音素材,希望根據文字描述從零建立全新音色時。
WebSocket還是HTTP?
- WebSocket:雙向流式通訊,支援流式輸入和流式輸出,音頻邊合成邊返回,延遲最低。適用於智能客服、語音助手、話務中心等即時互動情境。
- HTTP:發送完整文本,支援流式返迴音頻(逐段輸出)。適用於有聲閱讀、音頻內容製作等情境。
-realtime 尾碼的為 WebSocket 接入,不帶尾碼的為 HTTP 接入。
Qwen-Audio-TTS/CosyVoice 和 Qwen 系列的 WebSocket 模型支援通過 DashScope SDK(Java、Python)接入。其他模型需根據對應的 WebSocket 或 HTTP 協議直接調用。
選擇 WebSocket 接入請參考即時語音合成,選擇 HTTP 接入請參考非即時語音合成。
CosyVoice 系列模型還支援通過 AOQ 協議接入;如果是用戶端對接,且更看重穩定的延遲、弱網下的互動能力、即時雙工的降噪與回聲消除,可優先考慮 AOQ,協議對比與選型請參見Realtime API 概述。
指令控制
用自然語言描述期望的表達方式,可按請求動態控制語速、情緒和風格。例如“用溫柔的語氣,語速稍慢”或“用激動的播報風格”。適用於情感化內容製作、專業播報、有聲讀物等需要豐富表現力的情境。
支援指令控制的模型:Qwen-Audio-TTS 系列(qwen-audio-3.0-tts-plus、qwen-audio-3.0-tts-flash)、CosyVoice 系列(cosyvoice-v3.5-plus、cosyvoice-v3.5-flash、cosyvoice-v3-flash)和 Qwen-TTS 系列(qwen3-tts-instruct-flash-realtime、qwen3-tts-instruct-flash-realtime-2026-01-22、qwen3-tts-instruct-flash、qwen3-tts-instruct-flash-2026-01-26)。詳細使用方式請參見即時語音合成 > 指令控制。
推薦模型
以下為各情境下最推薦的模型,可前往模型廣場查看詳情。
模型ID | 系列 | API | 聲音複刻 | 聲音設計 | 指令控制 |
|---|---|---|---|---|---|
| Qwen-Audio-TTS | WebSocket | 支援 | 不支援 | 支援 |
| CosyVoice | WebSocket | 支援 | 支援 | 支援 |
| CosyVoice | WebSocket | 支援 | 支援 | 不支援 |
所有模型
Qwen-Audio-TTS
模型ID | API | 聲音複刻 | 聲音設計 | 指令控制 |
|---|---|---|---|---|
| WebSocket | 支援 | 不支援 | 支援 |
| WebSocket | 支援 | 不支援 | 支援 |
- 系統音色(因音色而異):中文(普通話)、英文
- 聲音複刻音色(方言通過指令控制功能進行設定):中文(普通話、廣東話、重慶話、東北話、甘肅話、貴州話、浙江話、河北話、河南話、湖北話、湖南話、江西話、寧波話、寧夏話、青島話、陝西話、山西話、山東話、上海話、四川話、雲南話)、英語、日語、韓語、俄語、法語、德語、葡萄牙語、泰語、印尼語、越南語、西班牙語、意大利語、馬來西亞語、菲律賓語、阿拉伯語
CosyVoice
部分 CosyVoice 模型支援 SSML 標記和 LaTeX 方程式朗讀。
模型ID | API | 聲音複刻 | 聲音設計 | 指令控制 |
|---|---|---|---|---|
| WebSocket | 支援 | 支援 | 支援 |
| WebSocket | 支援 | 支援 | 支援 |
| WebSocket | 支援 | 支援 | 不支援 |
| WebSocket | 支援 | 支援 | 支援 |
| WebSocket | 支援 | 不支援 | 不支援 |
-
cosyvoice-v3.5-plus、cosyvoice-v3.5-flash(不支援系統音色):- 聲音複刻音色(方言通過指令控制功能進行設定):中文(普通話、廣東話、東北話、甘肅話、貴州話、河南話、湖北話、江西話、閩南話、寧夏話、山西話、陝西話、山東話、上海話、四川話、天津話、雲南話)、英文、法語、德語、日語、韓語、俄語、葡萄牙語、泰語、印尼語、越南語
- 聲音設計音色:中文(普通話)、英文
-
cosyvoice-v3-plus:- 系統音色(因音色而異):中文(普通話)、英文
- 聲音複刻音色(方言通過指令控制功能進行設定):中文(普通話、廣東話、東北話、甘肅話、貴州話、河南話、湖北話、江西話、閩南話、寧夏話、山西話、陝西話、山東話、上海話、四川話、天津話、雲南話)、英文、法語、德語、日語、韓語、俄語
- 聲音設計音色:中文(普通話)、英文
-
cosyvoice-v3-flash:- 系統音色(因音色而異,部分方言由系統音色直接支援,部分通過指令控制功能設定):中文(普通話、廣東話、東北話、河南話、湖南話、陝西話、山東話、四川話、安徽話、閩南話)、英文
- 聲音複刻音色(方言通過指令控制功能進行設定):中文(普通話、廣東話、東北話、甘肅話、貴州話、河南話、湖北話、江西話、閩南話、寧夏話、山西話、陝西話、山東話、上海話、四川話、天津話、雲南話)、英文、法語、德語、日語、韓語、俄語、葡萄牙語、泰語、印尼語、越南語
- 聲音設計音色:中文(普通話)、英文
-
cosyvoice-v2(不支援聲音設計音色):- 系統音色(因音色而異):中文(普通話、粵語、東北話、閩南話、陝西話)、英文、日語、韓語
- 聲音複刻音色:中文(普通話)、英文
Qwen3-TTS
模型ID | API | 聲音複刻 | 聲音設計 | 指令控制 |
|---|---|---|---|---|
| HTTP | 不支援 | 不支援 | 不支援 |
| HTTP | 不支援 | 不支援 | 不支援 |
| HTTP | 不支援 | 不支援 | 不支援 |
| WebSocket | 不支援 | 不支援 | 不支援 |
| WebSocket | 不支援 | 不支援 | 不支援 |
| WebSocket | 不支援 | 不支援 | 不支援 |
| HTTP | 不支援 | 不支援 | 支援 |
| HTTP | 不支援 | 不支援 | 支援 |
| WebSocket | 不支援 | 不支援 | 支援 |
| WebSocket | 不支援 | 不支援 | 支援 |
| HTTP | 支援 | 不支援 | 不支援 |
| WebSocket | 支援 | 不支援 | 不支援 |
| WebSocket | 支援 | 不支援 | 不支援 |
| HTTP | 不支援 | 支援 | 不支援 |
| WebSocket | 不支援 | 支援 | 不支援 |
| WebSocket | 不支援 | 支援 | 不支援 |
- Qwen3-TTS-Flash 系列(系統音色)(
qwen3-tts-flash、qwen3-tts-flash-2025-11-27、qwen3-tts-flash-2025-09-18、qwen3-tts-flash-realtime、qwen3-tts-flash-realtime-2025-11-27、qwen3-tts-flash-realtime-2025-09-18):中文(普通話、北京話、上海話、四川話、南京話、陝西話、閩南話、天津話、粵語,因音色而異)、英文、德語、意大利語、葡萄牙語、西班牙語、日語、韓語、法語、俄語 - Qwen3-TTS-Instruct-Flash 系列(系統音色)(
qwen3-tts-instruct-flash、qwen3-tts-instruct-flash-2026-01-26、qwen3-tts-instruct-flash-realtime、qwen3-tts-instruct-flash-realtime-2026-01-22):中文(普通話)、英文、德語、意大利語、葡萄牙語、西班牙語、日語、韓語、法語、俄語 - Qwen3-TTS-VC 系列(聲音複刻)(
qwen3-tts-vc-2026-01-22、qwen3-tts-vc-realtime-2026-01-15、qwen3-tts-vc-realtime-2025-11-27):中文(普通話)、英文、德語、意大利語、葡萄牙語、西班牙語、日語、韓語、法語、俄語 - Qwen3-TTS-VD 系列(聲音設計)(
qwen3-tts-vd-2026-01-26、qwen3-tts-vd-realtime-2026-01-15、qwen3-tts-vd-realtime-2025-12-16):中文(普通話)、英文、德語、意大利語、葡萄牙語、西班牙語、日語、韓語、法語、俄語
Qwen-TTS(舊版,按 Token 計費)
以下為按 Token 計費的舊版 Qwen-TTS 模型。若您已遷移到 Qwen3-TTS,可優先使用前文推薦的模型。
模型ID | API | 說明 |
|---|---|---|
| HTTP | 非流式合成,按 Token 計費 |
| HTTP | 非流式合成,按 Token 計費 |
| HTTP | 快照版本,按 Token 計費 |
| HTTP | 快照版本,按 Token 計費 |
| WebSocket | 流式合成,按 Token 計費 |
| WebSocket | 流式合成,按 Token 計費 |
| WebSocket | 快照版本,流式合成,按 Token 計費 |
- Qwen-TTS 系列(系統音色)(
qwen-tts、qwen-tts-latest、qwen-tts-2025-05-22、qwen-tts-2025-04-10):中文(普通話、北京話、上海話、四川話,因音色而異)、英文、德語、意大利語、葡萄牙語、西班牙語、日語、韓語、法語、俄語 - Qwen-TTS-Realtime 系列(系統音色)(
qwen-tts-realtime、qwen-tts-realtime-latest、qwen-tts-realtime-2025-07-15):中文(普通話)、英文、德語、意大利語、葡萄牙語、西班牙語、日語、韓語、法語、俄語