使用者指南:關於模型介紹和選型建議請參見語音合成。
說明:啟動語音合成任務,設定模型、音色、採樣率等參數。
發送時機:建立 WebSocket 串連後立即發送。
響應事件:服務端返回 task-started 事件後才能發送後續指令。
說明:用於發送待合成文本。可一次性發送,也可分段按順序發送。
發送時機:在接收到服務端返回的 task-started 事件後。
數量限制:
說明:通知服務端文本發送完畢,請求結束任務。如需取消當前輪次的語音合成任務,可在
run-task
說明:啟動語音合成任務,設定模型、音色、採樣率等參數。
發送時機:建立 WebSocket 串連後立即發送。
響應事件:服務端返回 task-started 事件後才能發送後續指令。
headerobject(必選)
屬性 action string(必選)指令類型,固定為 run-task。task_idstring(必選)用戶端產生的任務 ID(UUID 格式),用於關聯後續事件。和後續 continue-task、finish-task 中的 task_id 保持一致。streamingstring(必選)固定為 duplexobject(必選)
屬性 task_group string(必選)工作群組,固定為 audio。taskstring(必選)任務類型,固定為 tts。functionstring(必選)功能類型,固定為 SpeechSynthesizer。modelstring(必選)模型名稱。inputobject(必選)輸入資料:固定為空白對象 {},待合成文本通過 continue-task 指令發送。parametersobject(必選)語音合成參數。
屬性 text_type string(必選)固定為 PlainText。voicestring(必選)語音合成所使用的音色。
string(可選)音頻編碼格式。取值範圍:
integer(可選)音頻採樣率(Hz)。取值範圍:8000, 16000, 22050(預設), 24000, 44100, 48000。volumeinteger(可選)音量。預設值:50。取值範圍:[0, 100]。ratefloat(可選)語速。預設值:1.0。取值範圍:[0.5, 2.0]。pitchfloat(可選)音調。預設值:1.0。取值範圍:[0.5, 2.0]。bit_rateinteger(可選)音頻碼率(kbps)。音頻格式為mp3或opus時,支援通過bit_rate參數調整碼率。預設值:32。取值範圍:[6, 510]。enable_ssmlboolean(可選)是否開啟 SSML 功能。預設值:false。設為 true 後,僅允許發送一次 continue-task 指令。SSML 的使用限制(支援的模型、音色和介面),請參見使用限制。word_timestamp_enabledboolean(可選)是否開啟字層級時間戳記。預設值:false。僅在流式輸出模式下可用。支援的音色範圍:cosyvoice-v3.5-plus、cosyvoice-v3.5-flash、cosyvoice-v3-flash、cosyvoice-v3-plus和cosyvoice-v2模型的複刻音色,以及Qwen-Audio-TTS音色列表、CosyVoice音色列表中標記為支援的系統音色。其他模型的複刻音色不支援此功能。seedinteger(可選)產生時使用的隨機數種子,使合成的效果產生變化。在模型版本、文本、音色及其他參數均相同的前提下,使用相同的seed可複現相同的合成結果。預設值0。取值範圍:[0, 65535]。language_hintsarray[string](可選)指定語音合成的目標語言,提升合成效果。當數字、縮寫、符號等朗讀方式或者小語種合成效果不符合預期時使用,例如:
string(可選)設定指令,用於控制方言、情感或角色等合成效果。具體使用說明請參見指令控制。enable_aigc_tagboolean(可選)是否在產生的音頻中添加AIGC隱性標識。設定為true時,會將隱性標識嵌入到支援格式(wav/mp3/opus)的音頻中。預設值:false。僅qwen-audio-3.0-tts-plus、qwen-audio-3.0-tts-flash、cosyvoice-v3-flash、cosyvoice-v3-plus、cosyvoice-v2支援該功能。aigc_propagatorstring(可選)設定AIGC隱性標識中的 ContentPropagator 欄位,用於標識內容的傳播者。僅在 enable_aigc_tag 為 true 時生效。預設值:阿里雲UID。僅qwen-audio-3.0-tts-plus、qwen-audio-3.0-tts-flash、cosyvoice-v3-flash、cosyvoice-v3-plus、cosyvoice-v2支援該功能。aigc_propagate_idstring(可選)設定AIGC隱性標識中的 PropagateID 欄位,用於唯一標識一次具體的傳播行為。僅在 enable_aigc_tag 為 true 時生效。預設值:本次語音合成請求Request ID。僅qwen-audio-3.0-tts-plus、qwen-audio-3.0-tts-flash、cosyvoice-v3-flash、cosyvoice-v3-plus、cosyvoice-v2支援該功能。hot_fixobject(可選)文本熱修複配置,用於自訂指定詞語的發音或對待合成文本進行替換。qwen-audio-3.0-tts-plus、qwen-audio-3.0-tts-flash、cosyvoice-v2不支援該功能。參數介紹:
boolean(可選)是否啟用 Markdown 過濾。啟用該功能後,系統在合成語音前自動過濾輸入文本中的 Markdown 標記符號,避免將其朗讀為文字內容。預設值:false。取值範圍:
|
continue-task
說明:用於發送待合成文本。可一次性發送,也可分段按順序發送。
發送時機:在接收到服務端返回的 task-started 事件後。
數量限制:
- 單次調用最多發送 20000 字元
- 累計最多發送 200000 字元
- 發送間隔不得超過 23 秒,否則連線逾時
headerobject(必選)
屬性 action string(必選)指令類型,固定為 continue-task。task_idstring(必選)任務 ID(UUID 格式),需要和 run-task 中的 task_id 保持一致。streamingstring(必選)固定為 duplex。object(必選)
屬性 input object(必選)包含待合成文本。textstring(必選)待合成文本。單次最多 20000 字元,累計最多 200000 字元。 |
finish-task
說明:通知服務端文本發送完畢,請求結束任務。如需取消當前輪次的語音合成任務,可在 input 中設定 directive 為 cancel。
發送時機:所有文本發送完畢後立即發送。
響應事件:服務端返回 task-finished 事件。
headerobject(必選)
屬性 action string(必選)指令類型,固定為 finish-task。task_idstring(必選)任務 ID(UUID 格式),需要和 run-task 中的 task_id 保持一致。streamingstring(必選)固定為 duplexobject(必選)
屬性 input object(必選)任務輸入。為空白對象 {} 時表示正常結束任務;包含 directive 時可用於取消當前輪次的語音合成任務。directivestring(可選)控制任務結束行為。當前僅支援取值為 cancel,表示取消當前輪次的語音合成任務,服務端會立即返回 task-finished 事件,且不會輸出後續音頻。取消後,可在當前 WebSocket 串連上重新發起語音合成任務(發送新的 run-task 事件),無需重建立立串連。 |