本文介紹聲音複刻的HTTP API介面詳情,包括建立音色、查詢音色列表、查詢音色詳情、更新音色和刪除音色等操作。
使用者指南:聲音複刻。
音色建立後會經過審核流程,以下是各狀態的含義。此狀態體系僅適用於Qwen-Audio-TTS/CosyVoice(model為
介面地址
- 新加坡
- 華北2(北京)
POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/audio/tts/customization調用時請將{WorkspaceId}替換為真實的Workspace ID。要求標頭
參數 | 類型 | 是否必選 | 說明 |
|---|---|---|---|
Authorization | string | 是 | 鑒權令牌,格式為 |
Content-Type | string | 是 | 請求體的媒體類型。Qwen-Audio-TTS/CosyVoice/Qwen-TTS固定為 |
建立音色
請求體modelstring(必選)聲音複刻模型。取值:
object(必選)輸入參數對象。
屬性 action string(必選)操作類型。
string(必選)驅動音色的語音合成模型。必須與後續調用語音合成介面時使用的模型一致,否則合成會失敗。url string(條件必選)用於複刻音色的音頻檔案URL,要求公網可訪問。audio object(條件必選)音頻資料,支援兩種提交方式:
string(可選)音頻對應的常值內容,用於輔助提升複刻效果。prefix string(條件必選)音色名稱首碼,僅允許數字和英文字母,不超過10個字元。產生的音色名格式:{target_model}-{prefix}-{唯一標識}。preferred_name string(條件必選)音色名稱首碼,僅允許數字、英文字母和底線,不超過16個字元。language_hints array[string](可選)輔助模型識別樣本音訊語種,從而更準確地提取音色特徵,提升複刻效果。若設定的語種與實際音頻語種不符(例如為中文音頻設定 en),系統將忽略該設定並自動檢測語種。此參數為數組,但目前的版本僅處理第一個元素。取值範圍(因模型而異):
string(可選)指定 audio.data 音頻對應的語種。若使用該參數,設定的語種須與實際用於複刻的音頻語種一致。取值範圍:
float(可選)音頻預先處理後用於聲音複刻的參考音頻最大時間長度(秒)。取值範圍:[3.0, 30.0]。預設值:10.0。enable_preprocess boolean(可選)是否開啟音頻預先處理(降噪、音頻增強、音量規整)。有背景雜音時建議開啟;安靜環境建議關閉以最大程度還原音色。預設值:false。enable_volume_normalization string(可選)是否對用於聲音複刻的樣本音頻進行音量歸一化。取值:
"false"。 | 以下為新加坡地區的配置,調用時請將"{WorkspaceId}"替換為真實的業務空間ID,各地區的配置不同。 |
返回體request_idstring本次調用的唯一識別碼。outputobject模型返回的資料。
屬性 voice_id / voice string音色ID。Qwen-Audio-TTS/CosyVoice返回voice_id,Qwen返回voice。可直接用於語音合成介面的voice參數。target_modelstring驅動音色的語音合成模型。fallback_modeboolean是否以降級模式建立音色。當音頻品質不佳或與文本不匹配時,該值為true,表示複刻效果可能不理想。fallback_reasonstring降級原因。可能的值包括no_merged_segments(無法合并音頻片段)、no_valid_asr_segments(音頻與文本嚴重不匹配)等。object本次請求用量資訊。
屬性 count integer建立的音色數量,固定為1。 |
查詢音色列表
請求體modelstring(必選)聲音複刻模型。取值:
object(必選)輸入參數對象。
屬性 action string(必選)操作類型。Qwen-Audio-TTS/CosyVoice:list_voice。Qwen:list。prefix string(可選)按首碼篩選音色。page_index integer(可選)頁碼索引。page_size integer(可選)每頁包含資料條數。 | 以下為新加坡地區的配置,調用時請將"{WorkspaceId}"替換為真實的業務空間ID,各地區的配置不同。 |
返回體request_idstring本次調用的唯一識別碼。outputobject模型返回的資料。
屬性 page_index integer當前頁碼索引。page_sizeinteger每頁資料條數。total_countinteger音色總數。voice_listarray[object]查詢到的音色列表。Qwen-Audio-TTS/CosyVoice和Qwen均使用voice_list欄位名。
屬性 voice_id / voice string音色ID。Qwen-Audio-TTS/CosyVoice為voice_id,Qwen為voice。gmt_createstring建立時間。gmt_modifiedstring修改時間。statusstring音色狀態,取值參見"音色狀態說明"。target_modelstring驅動音色的語音合成模型。object本次請求用量資訊。
屬性 count integerQwen-Audio-TTS/CosyVoice固定為1。Qwen固定為0。 |
查詢音色詳情
請求體modelstring(必選)固定為voice-enrollment(Qwen-Audio-TTS/CosyVoice)。inputobject(必選)輸入參數對象。
屬性 action string(必選)固定為query_voice。voice_id string(必選)要查詢的音色ID。 | 以下為新加坡地區的配置,調用時請將"{WorkspaceId}"替換為真實的業務空間ID,各地區的配置不同。
|
返回體request_idstring本次調用的唯一識別碼。outputobject模型返回的資料。
屬性 resource_link string音頻檔案的URL地址。gmt_createstring建立時間。gmt_modifiedstring修改時間。statusstring音色狀態,取值參見"音色狀態說明"。target_modelstring驅動音色的語音合成模型。object本次請求用量資訊。
屬性 count integer固定為1。 |
更新音色
請求體modelstring(必選)固定為voice-enrollment。inputobject(必選)輸入參數對象。
屬性 action string(必選)固定為update_voice。voice_id string(必選)要更新的音色ID。url string(必選)新的音頻檔案URL,要求公網可訪問。 | 以下為新加坡地區的配置,調用時請將"{WorkspaceId}"替換為真實的業務空間ID,各地區的配置不同。 |
返回體request_idstring本次調用的唯一識別碼。outputobject模型返回的資料,更新操作返回Null 物件。usageobject本次請求用量資訊。
屬性 count integer固定為1。 |
刪除音色
請求體modelstring(必選)聲音複刻模型。取值:
object(必選)輸入參數對象。
屬性 action string(必選)操作類型。Qwen-Audio-TTS/CosyVoice:delete_voice。Qwen:delete。voice_id string(條件必選)要刪除的音色ID。voice string(條件必選)要刪除的音色名稱。 | 以下為新加坡地區的配置,調用時請將"{WorkspaceId}"替換為真實的業務空間ID,各地區的配置不同。 |
返回體request_idstring本次調用的唯一識別碼。outputobject模型返回的資料。Qwen-Audio-TTS/CosyVoice返回Null 物件,Qwen返回已刪除的音色名稱。
屬性 voice string已刪除的音色名稱。object本次請求用量資訊。
屬性 count integer固定為1。 |
音色狀態說明
音色建立後會經過審核流程,以下是各狀態的含義。此狀態體系僅適用於Qwen-Audio-TTS/CosyVoice(model為voice-enrollment時),Qwen的查詢和列表返回中不包含status欄位。
狀態 | 說明 |
|---|---|
DEPLOYING | 審核中/處理中。 |
OK | 審核通過,可正常使用。 |
UNDEPLOYED | 審核未通過,不可使用。 |