聲音複刻依託大模型進行特徵提取,無需訓練即可複刻聲音。僅需提供 10~20 秒的音頻,即可產生高度相似且聽感自然的定製音色。聲音複刻與模型調用是前後關聯的兩個步驟。本文檔聚焦於介紹聲音複刻的參數和介面細節,模型調用請參見 即時(Qwen-Omni-Realtime) 或 非即時(Qwen-Omni) 。
音頻要求
高品質的輸入音頻是獲得優質複刻效果的基礎。
專案 | 要求 |
|---|---|
支援格式 | WAV (16bit)、MP3、M4A |
音頻時間長度 | 推薦10~20秒,最長不得超過60秒 |
檔案大小 | < 10 MB |
採樣率 | ≥ 24 kHz |
聲道 | 單聲道 |
內容 | 音頻必須包含至少3秒連續清晰朗讀(無背景音),其餘部分僅允許短暫停頓(≤2秒);整段音頻應避免背景音樂、噪音或其他人聲,確保核心朗讀內容品質;請使用正常說話音頻作為輸入,不要上傳歌曲或唱歌音頻,以確保複刻效果準確和可用 |
語言 | 中文(zh)、英文(en)、德語(de)、意大利語(it)、葡萄牙語(pt)、西班牙語(es)、日語(ja)、韓語(ko)、法語(fr)、俄語(ru)、泰語(th)、印尼語(id)、阿拉伯語(ar)、捷克語(cs)、丹麥語(da)、荷蘭語(nl)、芬蘭語(fi)、希伯來語(he)、印地語(hi)、冰島語(is)、馬來語(ms)、挪威語(no)、波斯語(fa)、波蘭語(pl)、瑞典語(sv)、他加祿語(tl)、土耳其語(tr)、烏爾都語(ur)、越南語(vi) 中文方言:東北話(Dongbei)、陝西話(Shannxi)、四川話(Sichuan)、河南話(Henan)、長沙話(Changsha)、天津話(Tianjin)、杭州話(Hangzhou)、遼寧話(Liaoning)、瀋陽話(Shenyang)、鞍山話(Anshan) |
快速開始:複刻與使用音色
1. 工作流程
聲音複刻與模型調用是緊密關聯的兩個獨立步驟,遵循“先建立,後使用”的流程:
-
建立音色
調用建立音色介面,上傳一段音頻。系統會分析該音頻,建立一個專屬的複刻音色。此步驟必須指定
target_model,聲明建立的音色將由哪個全模態模型驅動。 若已有建立好的音色(調用查詢音色列表介面查看),可跳過這一步直接進行下一步。 -
使用音色進行對話
調用 Omni 介面(即時或非即時),傳入上一步獲得的音色。此步驟指定的全模態模型必須和上一步的
target_model一致。
2. 模型配置與準備工作
選擇合適的模型並完成準備工作。
模型配置
聲音複刻時需要指定以下兩個模型:
- 聲音複刻模型:qwen-voice-enrollment
-
驅動音色的全模態模型:
- qwen3.5-omni-plus-realtime
- qwen3.5-omni-flash-realtime
- qwen3.5-omni-plus
- qwen3.5-omni-flash
準備工作
- 擷取API Key:擷取API Key,為安全起見,推薦將API Key配置到環境變數。
- 安裝SDK:確保已安裝最新版DashScope SDK。
- 準備待覆刻音頻:音頻需符合音頻要求。
3. 端到端樣本
以下樣本示範了如何在對話中使用聲音複刻產生的專屬音色,實現與原音高度相似的輸出效果。
- 關鍵原則:聲音複刻時,
target_model(驅動音色的全模態模型)必須與後續調用 Omni 介面時指定的模型一致,否則會合成失敗。 - 樣本使用本地音頻檔案
voice.mp3進行聲音複刻,運行代碼時,請注意替換。
- 即時
- 非即時
API參考
使用不同 API 時,請確保使用同一帳號進行操作。
建立音色
上傳用於複刻的音頻,建立自訂音色。
- URL 華北2(北京):
-
要求標頭
參數
類型
是否必須
說明
Authorization
string
支援
鑒權令牌,格式為
Bearer <your_api_key>,使用時,將“<your_api_key>”替換為實際的API Key。Content-Type
string
支援
請求體中傳輸的資料的媒體類型。固定為
application/json。 - 訊息體 包含所有請求參數的訊息體如下,對於可選欄位,在實際業務中可根據需求省略。
-
請求參數
參數 類型 預設值 是否必須 說明 model string 支援 聲音複刻模型,固定為 qwen-voice-enrollment。action string 支援 操作類型,固定為 create。target_model string 支援 驅動音色的全模態模型: - qwen3.5-omni-plus-realtime
- qwen3.5-omni-flash-realtime
- qwen3.5-omni-plus
- qwen3.5-omni-flash
preferred_name string 支援 為音色指定一個便於識別的名稱(僅允許數字、大小寫字母和底線,不超過16個字元)。建議選用與角色、情境相關的標識。 該關鍵字會在複刻的音色名中出現,例如關鍵字為“guanyu”,最終音色名為“qwen-omni-vc-guanyu-voice-20250812105009984-838b”
audio.data string 支援 用於複刻的音頻(錄製時需遵循錄音操作指南,音頻需滿足音頻要求)。可通過以下兩種方式提交音頻資料: -
Data URL
格式:
data:<mediatype>;base64,<data>-
<mediatype>:MIME類型- WAV:
audio/wav - MP3:
audio/mpeg - M4A:
audio/mp4
- WAV:
-
<data>:音頻轉成的Base64編碼的字串 Base64編碼會增大體積,請控制原檔案大小,確保編碼後仍小於10MB -
樣本:
data:audio/wav;base64,SUQzBAAAAAAAI1RTU0UAAAAPAAADTGF2ZjU4LjI5LjEwMAAAAAAAAAAAAAAA//PAxABQ/BXRbMPe4IQAhl9點擊查看範例程式碼
-
-
音頻URL(推薦將音頻上傳至OSS)
- 檔案大小不超過10MB
- URL必須公網可訪問且無需鑒權
text string 不支援 與 audio.data音頻內容相匹配的文本。傳入該參數後,服務端會對比音頻與該文本的差異,若差異過大,將返回Audio.PreprocessError。language string 不支援 audio.data音頻對應的語種。支援zh(中文)、en(英文)、de(德語)、it(意大利語)、pt(葡萄牙語)、es(西班牙語)、ja(日語)、ko(韓語)、fr(法語)、ru(俄語)、th(泰語)、id(印尼語)、ar(阿拉伯語)、cs(捷克語)、da(丹麥語)、nl(荷蘭語)、fi(芬蘭語)、he(希伯來語)、hi(印地語)、is(冰島語)、ms(馬來語)、no(挪威語)、fa(波斯語)、pl(波蘭語)、sv(瑞典語)、tl(他加祿語)、tr(土耳其語)、ur(烏爾都語)、vi(越南語)。中文方言:Dongbei(東北話)、Shannxi(陝西話)、Sichuan(四川話)、Henan(河南話)、Changsha(長沙話)、Tianjin(天津話)、Hangzhou(杭州話)、Liaoning(遼寧話)、Shenyang(瀋陽話)、Anshan(鞍山話)。若使用該參數,設定的語種要和實際用於複刻的音訊語種一致。 -
響應參數
需關注的參數如下:
點擊查看響應樣本
參數
類型
說明
voice
string
音色名稱,可直接用於即時多模態介面的
voice參數。target_model
string
驅動音色的全模態模型:
qwen3.5-omni-plus-realtime
qwen3.5-omni-flash-realtime
qwen3.5-omni-plus
qwen3.5-omni-flash
必須與後續調用全模態介面時使用的模型一致,否則合成會失敗。
request_id
string
Request ID。
count
integer
本次請求實際計入費用的“建立音色”次數,本次請求的費用為$ count × 0.01。
建立音色時,count恒為1。
-
範例程式碼
- cURL
- Python
- Java
若未將API Key配置到環境變數,需將樣本中的$DASHSCOPE_API_KEY替換為實際的API Key。
查詢音色列表
分頁查詢已建立的音色列表。
- URL 華北2(北京):
-
要求標頭
參數
類型
是否必須
說明
Authorization
string
支援
鑒權令牌,格式為
Bearer <your_api_key>,使用時,將“<your_api_key>”替換為實際的API Key。Content-Type
string
支援
請求體中傳輸的資料的媒體類型。固定為
application/json。 - 訊息體 包含所有請求參數的訊息體如下,對於可選欄位,在實際業務中可根據需求省略。
-
請求參數
參數
類型
預設值
是否必須
說明
model
string
-
支援
聲音複刻模型,固定為
qwen-voice-enrollment。action
string
-
支援
操作類型,固定為
list。page_index
integer
0
不支援
頁碼索引。取值範圍:[0, 1000000]。
page_size
integer
10
不支援
每頁包含資料條數。取值範圍:[0, 1000000]。
-
響應參數
需關注的參數如下:
點擊查看響應樣本
參數
類型
說明
voice
string
音色名稱,可直接用於即時多模態介面的
voice參數。gmt_create
string
建立音色的時間。
target_model
string
驅動音色的全模態模型:
qwen3.5-omni-plus-realtime
qwen3.5-omni-flash-realtime
qwen3.5-omni-plus
qwen3.5-omni-flash
必須與後續調用全模態介面時使用的模型一致,否則合成會失敗。
request_id
string
Request ID。
count
integer
本次請求實際計入費用的“建立音色”次數,本次請求的費用為$count × 0.01。
查詢音色不計費,因此
count恒為0。 -
範例程式碼
- cURL
- Python
- Java
若未將API Key配置到環境變數,需將樣本中的$DASHSCOPE_API_KEY替換為實際的API Key。
刪除音色
刪除指定音色,釋放對應額度。
- URL 華北2(北京):
-
要求標頭
參數
類型
是否必須
說明
Authorization
string
支援
鑒權令牌,格式為
Bearer <your_api_key>,使用時,將“<your_api_key>”替換為實際的API Key。Content-Type
string
支援
請求體中傳輸的資料的媒體類型。固定為
application/json。 - 訊息體 包含所有請求參數的訊息體如下,對於可選欄位,在實際業務中可根據需求省略:
-
請求參數
參數
類型
預設值
是否必須
說明
model
string
-
支援
聲音複刻模型,固定為
qwen-voice-enrollment。action
string
-
支援
操作類型,固定為
delete。voice
string
-
支援
待刪除的音色。
-
響應參數
需關注的參數如下:
點擊查看響應樣本
參數
類型
說明
request_id
string
Request ID。
count
integer
本次請求實際計入費用的“建立音色”次數,本次請求的費用為$count × 0.01。
刪除音色不計費,因此
count恒為0。 -
範例程式碼
- cURL
- Python
- Java
若未將API Key配置到環境變數,需將樣本中的$DASHSCOPE_API_KEY替換為實際的API Key。
對話使用
如何使用聲音複刻產生的專屬音色進行對話,請參見快速開始:複刻與使用音色。
音色配額與自動清理規則
-
總數限制:1000個音色/帳號
當前介面不提供音色數量查詢功能,可通過調用查詢音色列表介面自行統計音色數目
- 自動清理:若單個音色在過去一年內未被用於任何模型調用請求,系統將自動將其刪除
計費說明
聲音複刻和模型調用分開計費:
-
聲音複刻:建立音色按$0.01/個計費,建立失敗不計費
免費額度說明(僅中國站北京地區和國際站新加坡地區有免費額度):
- 阿里雲百鍊開通後90天內,可享1000次免費音色建立機會。
- 建立失敗不佔用免費次數。
- 刪除音色不會恢複免費次數。
- 免費額度用完或超出 90 天有效期間後,建立音色將按$0.01/個的價格計費。
- 使用複刻產生的專屬音色進行對話:按模型調用的 token 用量計費,詳情請參見模型調用計費
著作權與合法性
您需對所提供聲音的所有權及合法使用權負責,請注意閱讀服務合約。
錄音操作指南
錄音裝置
推薦使用具備降噪功能的麥克風,或在安靜環境下使用手機近距離錄音,以保證音源純淨。
錄音環境
場地
- 建議在 10 平方米以內的小型封閉空間錄音。
- 優先選擇配有吸音材料(如吸音棉、地毯、窗帘)的房間。
- 避免空曠大廳、會議室、教室等高混響場所。
噪音控制
- 室外噪音:關閉門窗,避免交通、施工等幹擾。
- 室內噪音:關閉空調、風扇、日光燈鎮流器等裝置;可通過手機錄製環境音並放大播放,識別潛在噪音源。
混響控制
- 混響會導致聲音模糊、清晰度下降。
- 減少光滑表面反射:拉上窗帘、開啟衣櫃門、鋪放衣物或床單覆蓋案頭/櫃面。
- 利用不規則物體(如書架、軟包傢具)實現聲波漫反射。
錄音文案
- 文案內容靈活,建議與目標應用情境一致(例如,若用於客服情境,文案應為客服對話風格),但必須確保不包含任何敏感或非法詞彙(如政治、色情、暴力相關內容),否則會導致複刻失敗。
- 避免短句(如“你好”、“是的”),應使用完整句子。
- 保持語義連貫,朗讀時避免頻繁停頓(建議至少連續 3 秒無中斷)。
- 可帶入目標情緒(如親切、嚴肅),但需避免過度誇張的戲劇化朗讀,保持語調自然。
操作建議
以普通臥室為例:
- 關閉門窗,隔絕外部噪音。
- 關閉空調、電扇等電器。
- 拉上窗帘,減少玻璃反射。
- 在案頭鋪放衣物或毛毯,降低案頭反射。
- 提前熟悉文案,設定角色語氣,自然演繹。
- 與錄音裝置保持約 10 厘米距離,避免噴麥或訊號過弱。