Utilize a API HTTP para criar, listar, consultar, atualizar e excluir vozes clonadas.
Endpoint do service
- Singapore
- China (Beijing)
POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/audio/tts/customizationSubstitua {WorkspaceId} pelo seu workspace ID real.Cabeçalhos da solicitação
Parâmetro | Tipo | Obrigatório | Descrição |
|---|---|---|---|
Authorization | string | Sim | Token de autenticação no formato |
Content-Type | string | Sim | Tipo de mídia do corpo da solicitação. Defina como |
Crie uma voz
Corpo da solicitação | Este exemplo utiliza o endpoint da região de Singapore. Para a região de Beijing, use: https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/audio/tts/customization.Substitua {WorkspaceId} pelo seu workspace ID real. |
modelstring(obrigatório)Modelo de clonagem de voz. Valores válidos:
| |
inputobject(obrigatório)Parâmetros de entrada.
Propriedades action string(obrigatório)Tipo de ação.
string(obrigatório)Modelo de texto para fala (TTS) que impulsiona a voz clonada. Deve corresponder ao modelo especificado na chamada à API TTS; caso contrário, a síntese falhará.url string(condicionalmente obrigatório)URL do arquivo de áudio para clonagem de voz. A URL deve ser publicamente acessível.audio object(condicionalmente obrigatório)Dados de áudio. Dois métodos de envio são suportados:
string(opcional)Transcrição do áudio, utilizada para melhorar a qualidade da clonagem.prefix string(condicionalmente obrigatório)Prefixo para o nome da voz. Apenas caracteres alfanuméricos são permitidos, com comprimento máximo de 10 caracteres. O nome final da voz segue este formato: {target_model}-{prefix}-{unique_id}.preferred_name string(condicionalmente obrigatório)Prefixo para o nome da voz. Apenas caracteres alfanuméricos e sublinhados são permitidos, com comprimento máximo de 16 caracteres.language_hints array[string](opcional)Auxilia o modelo a identificar o idioma do áudio de amostra para extrair características vocais com mais precisão e melhorar a qualidade da clonagem. Se o idioma especificado não corresponder ao idioma real do áudio (por exemplo, definir en quando o áudio está em chinês), o sistema ignora esse valor e detecta o idioma automaticamente.Este parâmetro é um array, mas a versão atual processa apenas o primeiro elemento.Os valores válidos variam conforme o modelo:
string(opcional)Idioma do áudio fornecido em audio.data. Ao utilizar este parâmetro, certifique-se de que o idioma especificado corresponde ao idioma real do áudio usado para clonagem.Valores válidos:
float(opcional)Duração máxima (em segundos) do áudio de referência após o pré-processamento. Valores válidos: [3,0, 30,0].Padrão: 10,0.enable_preprocess boolean(opcional)Define se o pré-processamento de áudio deve ser ativado (redução de ruído, aprimoramento de áudio e normalização de volume). Ative esta opção para gravações com ruído de fundo. Desative-a para gravações em ambientes silenciosos, preservando as características originais da voz.Padrão: false.enable_volume_normalization string(opcional)Define se o volume do áudio de amostra usado para clonagem de voz deve ser normalizado. Valores válidos:
"false". | |
Corpo da resposta | |
request_idstringIdentificador exclusivo desta solicitação. | |
outputobjectDados retornados pelo modelo.
Propriedades voice_id / voice stringID da voz. O Qwen-Audio-TTS/CosyVoice retorna voice_id, enquanto o Qwen retorna voice. Utilize este valor diretamente no parâmetro de voz da API TTS.target_modelstringModelo TTS que impulsiona a voz clonada.fallback_modebooleanIndica se a voz foi criada em modo de fallback. Um valor true indica que a qualidade do áudio era baixa ou não correspondia ao texto fornecido, podendo reduzir a qualidade da clonagem.fallback_reasonstringMotivo do fallback. Os valores possíveis incluem no_merged_segments (não foi possível mesclar segmentos de áudio) e no_valid_asr_segments (incompatibilidade grave entre áudio e texto). | |
usageobjectInformações de uso desta solicitação.
Propriedades count integerNúmero de vozes criadas. Sempre 1. |
Consultar lista de vozes
Corpo da solicitação | Este exemplo utiliza o endpoint da região de Singapore. Para a região de Beijing, use: https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/audio/tts/customization.Substitua {WorkspaceId} pelo seu workspace ID real. |
modelstring(obrigatório)Modelo de clonagem de voz. Valores válidos:
| |
inputobject(obrigatório)Parâmetros de entrada.
Propriedades action string(obrigatório)Tipo de ação. Qwen-Audio-TTS/CosyVoice: list_voice. Qwen: list.prefix string(opcional)Filtra vozes pelo prefixo do nome.page_index integer(opcional)Índice da página.page_size integer(opcional)Número de entradas por página. |
Corpo da resposta | |
request_idstringIdentificador exclusivo desta solicitação. | |
outputobjectDados retornados pelo modelo.
Propriedades page_index integerÍndice da página atual.page_sizeintegerNúmero de entradas por página.total_countintegerNúmero total de vozes.voice_listarray[object]Lista de vozes consultadas. Tanto o Qwen-Audio-TTS/CosyVoice quanto o Qwen usam o nome de campo voice_list.
Propriedades voice_id / voice stringID da voz. O Qwen-Audio-TTS/CosyVoice usa voice_id, enquanto o Qwen usa voice.gmt_createstringHora de criação.gmt_modifiedstringHora da última modificação.statusstringStatus da voz. Para valores válidos, consulte "Descrições de status de voz".target_modelstringModelo TTS que impulsiona a voz clonada. | |
usageobjectInformações de uso desta solicitação.
Propriedades count integerSempre 1 para Qwen-Audio-TTS/CosyVoice. Sempre 0 para Qwen. |
Consultar detalhes da voz
Corpo da solicitação | Este exemplo utiliza o endpoint da região de Singapore. Para a região de Beijing, use: https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/audio/tts/customization.Substitua {WorkspaceId} pelo seu workspace ID real.
|
modelstring(obrigatório)Defina como voice-enrollment (Qwen-Audio-TTS/CosyVoice). | |
inputobject(obrigatório)Parâmetros de entrada.
Propriedades action string(obrigatório)Defina como query_voice.voice_id string(obrigatório)ID da voz a ser consultada. |
Corpo da resposta | |
request_idstringIdentificador exclusivo desta solicitação. | |
outputobjectDados retornados pelo modelo.
Propriedades resource_link stringURL do arquivo de áudio.gmt_createstringHora de criação.gmt_modifiedstringHora da última modificação.statusstringStatus da voz. Para valores válidos, consulte "Descrições de status de voz".target_modelstringModelo TTS que impulsiona a voz clonada. | |
usageobjectInformações de uso desta solicitação.
Propriedades count integerSempre 1. |
Atualize uma voz
Corpo da solicitação | Este exemplo utiliza o endpoint da região de Singapore. Para a região de Beijing, use: https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/audio/tts/customization. |
modelstring(obrigatório)Defina como voice-enrollment. | |
inputobject(obrigatório)Parâmetros de entrada.
Propriedades action string(obrigatório)Defina como update_voice.voice_id string(obrigatório)ID da voz a ser atualizada.url string(obrigatório)URL do novo arquivo de áudio. A URL deve ser publicamente acessível. |
Corpo da resposta | |
request_idstringIdentificador exclusivo desta solicitação. | |
outputobjectDados retornados pelo modelo. A operação de atualização não retorna dados comerciais. A resposta pode incluir um campo preview_audio, que é um objeto vazio e pode ser ignorado. | |
usageobjectInformações de uso desta solicitação.
Propriedades count integerSempre 1. |
Exclua uma voz
Corpo da solicitação | Este exemplo utiliza o endpoint da região de Singapore. Para a região de Beijing, use: https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/audio/tts/customization.Substitua {WorkspaceId} pelo seu workspace ID real. |
modelstring(obrigatório)Modelo de clonagem de voz. Valores válidos:
| |
inputobject(obrigatório)Parâmetros de entrada.
Propriedades action string(obrigatório)Tipo de ação. Qwen-Audio-TTS/CosyVoice: delete_voice. Qwen: delete.voice_id string(condicionalmente obrigatório)ID da voz a ser excluída.voice string(condicionalmente obrigatório)Nome da voz a ser excluída. |
Corpo da resposta | |
request_idstringIdentificador exclusivo desta solicitação. | |
outputobjectDados retornados pelo modelo. O Qwen-Audio-TTS/CosyVoice retorna um objeto vazio, enquanto o Qwen retorna o nome da voz excluída.
Propriedades voice stringNome da voz excluída. | |
usageobjectInformações de uso desta solicitação.
Propriedades count integerSempre 1 para Qwen-Audio-TTS/CosyVoice. Sempre 0 para Qwen. |
Descrições de status de voz
Após a criação, a voz passa por um processo de revisão. Os status abaixo aplicam-se apenas ao Qwen-Audio-TTS/CosyVoice (quando model é voice-enrollment). As respostas de consulta e listagem do Qwen não incluem um campo de status.
Status | Descrição |
|---|---|
DEPLOYING | Em revisão ou processamento. |
OK | Revisão aprovada. A voz está pronta para uso. |
UNDEPLOYED | Revisão rejeitada. A voz não pode ser usada. |