本文介绍声音复刻的HTTP API接口详情,包括创建音色、查询音色列表、查询音色详情、更新音色和删除音色等操作。
用户指南:声音复刻。
音色创建后会经过审核流程,以下是各状态的含义。此状态体系仅适用于Qwen-Audio-TTS/CosyVoice(model为
接口地址
- 新加坡
- 华北2(北京)
POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/audio/tts/customization调用时请将{WorkspaceId}替换为真实的Workspace ID。请求头
参数 | 类型 | 是否必选 | 说明 |
|---|---|---|---|
Authorization | string | 是 | 鉴权令牌,格式为 |
Content-Type | string | 是 | 请求体的媒体类型。Qwen-Audio-TTS/CosyVoice/Qwen-TTS固定为 |
创建音色
请求体modelstring(必选)声音复刻模型。取值:
object(必选)输入参数对象。
属性 action string(必选)操作类型。
string(必选)驱动音色的语音合成模型。必须与后续调用语音合成接口时使用的模型一致,否则合成会失败。url string(条件必选)用于复刻音色的音频文件URL,要求公网可访问。audio object(条件必选)音频数据,支持两种提交方式:
string(可选)音频对应的文本内容,用于辅助提升复刻效果。prefix string(条件必选)音色名称前缀,仅允许数字和英文字母,不超过10个字符。生成的音色名格式:{target_model}-{prefix}-{唯一标识}。preferred_name string(条件必选)音色名称前缀,仅允许数字、英文字母和下划线,不超过16个字符。language_hints array[string](可选)辅助模型识别样本音频的语种,从而更准确地提取音色特征,提升复刻效果。若设置的语种与实际音频语种不符(例如为中文音频设置 en),系统将忽略该设置并自动检测语种。此参数为数组,但当前版本仅处理第一个元素。取值范围(因模型而异):
string(可选)指定 audio.data 音频对应的语种。若使用该参数,设置的语种须与实际用于复刻的音频语种一致。取值范围:
float(可选)音频预处理后用于声音复刻的参考音频最大时长(秒)。取值范围:[3.0, 30.0]。默认值:10.0。enable_preprocess boolean(可选)是否开启音频预处理(降噪、音频增强、音量规整)。有背景噪音时建议开启;安静环境建议关闭以最大程度还原音色。默认值:false。enable_volume_normalization string(可选)是否对用于声音复刻的样本音频进行音量归一化。取值:
"false"。 | 以下为新加坡地域的配置,调用时请将"{WorkspaceId}"替换为真实的业务空间ID,各地域的配置不同。 |
返回体request_idstring本次调用的唯一标识符。outputobject模型返回的数据。
属性 voice_id / voice string音色ID。Qwen-Audio-TTS/CosyVoice返回voice_id,Qwen返回voice。可直接用于语音合成接口的voice参数。target_modelstring驱动音色的语音合成模型。fallback_modeboolean是否以降级模式创建音色。当音频质量不佳或与文本不匹配时,该值为true,表示复刻效果可能不理想。fallback_reasonstring降级原因。可能的值包括no_merged_segments(无法合并音频片段)、no_valid_asr_segments(音频与文本严重不匹配)等。object本次请求用量信息。
属性 count integer创建的音色数量,固定为1。 |
查询音色列表
请求体modelstring(必选)声音复刻模型。取值:
object(必选)输入参数对象。
属性 action string(必选)操作类型。Qwen-Audio-TTS/CosyVoice:list_voice。Qwen:list。prefix string(可选)按前缀筛选音色。page_index integer(可选)页码索引。page_size integer(可选)每页包含数据条数。 | 以下为新加坡地域的配置,调用时请将"{WorkspaceId}"替换为真实的业务空间ID,各地域的配置不同。 |
返回体request_idstring本次调用的唯一标识符。outputobject模型返回的数据。
属性 page_index integer当前页码索引。page_sizeinteger每页数据条数。total_countinteger音色总数。voice_listarray[object]查询到的音色列表。Qwen-Audio-TTS/CosyVoice和Qwen均使用voice_list字段名。
属性 voice_id / voice string音色ID。Qwen-Audio-TTS/CosyVoice为voice_id,Qwen为voice。gmt_createstring创建时间。gmt_modifiedstring修改时间。statusstring音色状态,取值参见"音色状态说明"。target_modelstring驱动音色的语音合成模型。object本次请求用量信息。
属性 count integerQwen-Audio-TTS/CosyVoice固定为1。Qwen固定为0。 |
查询音色详情
请求体modelstring(必选)固定为voice-enrollment(Qwen-Audio-TTS/CosyVoice)。inputobject(必选)输入参数对象。
属性 action string(必选)固定为query_voice。voice_id string(必选)要查询的音色ID。 | 以下为新加坡地域的配置,调用时请将"{WorkspaceId}"替换为真实的业务空间ID,各地域的配置不同。
|
返回体request_idstring本次调用的唯一标识符。outputobject模型返回的数据。
属性 resource_link string音频文件的URL地址。gmt_createstring创建时间。gmt_modifiedstring修改时间。statusstring音色状态,取值参见"音色状态说明"。target_modelstring驱动音色的语音合成模型。object本次请求用量信息。
属性 count integer固定为1。 |
更新音色
请求体modelstring(必选)固定为voice-enrollment。inputobject(必选)输入参数对象。
属性 action string(必选)固定为update_voice。voice_id string(必选)要更新的音色ID。url string(必选)新的音频文件URL,要求公网可访问。 | 以下为新加坡地域的配置,调用时请将"{WorkspaceId}"替换为真实的业务空间ID,各地域的配置不同。 |
返回体request_idstring本次调用的唯一标识符。outputobject模型返回的数据,更新操作返回空对象。usageobject本次请求用量信息。
属性 count integer固定为1。 |
删除音色
请求体modelstring(必选)声音复刻模型。取值:
object(必选)输入参数对象。
属性 action string(必选)操作类型。Qwen-Audio-TTS/CosyVoice:delete_voice。Qwen:delete。voice_id string(条件必选)要删除的音色ID。voice string(条件必选)要删除的音色名称。 | 以下为新加坡地域的配置,调用时请将"{WorkspaceId}"替换为真实的业务空间ID,各地域的配置不同。 |
返回体request_idstring本次调用的唯一标识符。outputobject模型返回的数据。Qwen-Audio-TTS/CosyVoice返回空对象,Qwen返回已删除的音色名称。
属性 voice string已删除的音色名称。object本次请求用量信息。
属性 count integer固定为1。 |
音色状态说明
音色创建后会经过审核流程,以下是各状态的含义。此状态体系仅适用于Qwen-Audio-TTS/CosyVoice(model为voice-enrollment时),Qwen的查询和列表返回中不包含status字段。
状态 | 说明 |
|---|---|
DEPLOYING | 审核中/处理中。 |
OK | 审核通过,可正常使用。 |
UNDEPLOYED | 审核未通过,不可使用。 |