Use a API HTTP Voice Design para criar, listar, consultar e excluir vozes personalizadas.
Endpoint
- China (Beijing)
- Singapore
POST https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/audio/tts/customizationSubstitua {WorkspaceId} pelo seu ID do workspace real.- Singapore
- China (Beijing)
POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/audio/tts/customizationSubstitua {WorkspaceId} pelo seu ID do workspace real.Cabeçalhos da solicitação
Parâmetro | Tipo | Obrigatório | Descrição |
|---|---|---|---|
Authorization | string | Sim | Token de autorização no formato |
Content-Type | string | Sim | Tipo de mídia do corpo da solicitação. Defina como |
Crie uma voz
Corpo da solicitação | O Voice Design do CosyVoice está disponível apenas na região de Beijing. O Voice Design do Qwen oferece suporte à região de Singapore. Os exemplos do CosyVoice abaixo usam a URL da região China (Beijing). Os exemplos do Qwen abaixo usam a URL da região de Singapore (substitua {WorkspaceId} pelo ID real do seu workspace). |
modelstring(Obrigatório)Modelo de voice design. Valores válidos:
| |
inputobject(Obrigatório)Objeto de parâmetros de entrada.
Propriedades action string(Obrigatório)Tipo de operação.
string(Obrigatório)Modelo de texto para fala (TTS) que gera a voz. Este valor deve corresponder ao modelo usado na chamada à API TTS. Incompatibilidades causam falha na síntese.voice_prompt string(Obrigatório)Descrição das características desejadas para a voz. Há suporte apenas para chinês e inglês.
string(Obrigatório)Texto para o áudio de pré-visualização.
string(Condicionalmente obrigatório)Prefixo do nome da voz. São permitidos apenas dígitos e letras, com máximo de 10 caracteres. O nome da voz gerada segue o formato: {target_model}-vd-{prefix}-{unique_id}preferred_name string(Condicionalmente obrigatório)Prefixo do nome da voz. São permitidos apenas dígitos, letras e sublinhados, com máximo de 16 caracteres.language_hints array[string](Opcional)Dicas de idioma para a voz gerada. Este campo determina as características linguísticas e os padrões de pronúncia da voz. Defina-o com o idioma correspondente ao seu caso de uso. O idioma especificado deve corresponder ao idioma do preview_text.Atualmente, apenas o primeiro elemento é usado.Valores válidos:
string(Opcional)Dicas de idioma para a voz gerada. Este campo determina as características linguísticas e os padrões de pronúncia da voz. Defina-o com o idioma correspondente ao seu caso de uso. O idioma especificado deve corresponder ao idioma do preview_text.Valores válidos:
| |
parametersobject(Opcional)Configuração para voice design.
Propriedades sample_rate int(Opcional)Taxa de amostragem do áudio de pré-visualização, em Hz.
string(Opcional)Formato do áudio de pré-visualização.
|
Corpo da resposta | |
request_idstringIdentificador exclusivo desta solicitação. | |
outputobjectDados retornados pelo modelo.
Propriedades voice_id / voice stringID da voz. O CosyVoice retorna voice_id e o Qwen retorna voice. Use este valor diretamente como parâmetro de voz na API TTS.preview_audioobjectDados do áudio de pré-visualização.
Propriedades data stringDados do áudio de pré-visualização, codificados em Base64.sample_rate intTaxa de amostragem do áudio de pré-visualização, em Hz.response_format stringFormato do áudio de pré-visualização.stringModelo TTS que gera a voz. | |
usageobjectInformações de uso desta solicitação.
Propriedades count integerNúmero de vozes criadas. Sempre 1. |
Listar vozes
Corpo da solicitação | O Voice Design do CosyVoice está disponível apenas na região de Beijing. O Voice Design do Qwen oferece suporte à região de Singapore. Os exemplos do CosyVoice abaixo usam a URL da região China (Beijing). Os exemplos do Qwen abaixo usam a URL da região de Singapore (substitua {WorkspaceId} pelo ID real do seu workspace). |
modelstring(Obrigatório)Modelo de voice design. Valores válidos:
| |
inputobject(Obrigatório)Objeto de parâmetros de entrada.
Propriedades action string(Obrigatório)Tipo de operação. CosyVoice: list_voice. Qwen: list.prefix string(Opcional)Filtrar vozes por prefixo de nome.page_index integer(Opcional)Índice da página.page_size integer(Opcional)Número de entradas por página. |
Corpo da resposta | |
request_idstringIdentificador exclusivo desta solicitação. | |
outputobjectDados retornados pelo modelo.
Propriedades page_index integerÍndice da página atual.page_sizeintegerNúmero de entradas por página.total_countintegerNúmero total de vozes.voice_listarray[object]Lista de vozes retornadas pela consulta.
Propriedades voice_id / voice stringID da voz. O CosyVoice usa voice_id e o Qwen usa voice.gmt_createstringHora de criação.gmt_modifiedstringHora da última modificação.statusstringStatus da voz. Para valores válidos, consulte "Referência de status de voz".target_modelstringModelo TTS que gera a voz.languagestringIdioma da voz.voice_promptstringTexto de descrição da voz.preview_textstringTexto do áudio de pré-visualização. | |
usageobjectInformações de uso desta solicitação.
Propriedades count integerCosyVoice: sempre 1. Qwen: sempre 0. |
Consultar detalhes da voz
Corpo da solicitação | O Voice Design do CosyVoice está disponível apenas na região de Beijing. O Voice Design do Qwen oferece suporte à região de Singapore. Os exemplos do CosyVoice abaixo usam a URL da região China (Beijing). Os exemplos do Qwen abaixo usam a URL da região de Singapore (substitua {WorkspaceId} pelo ID real do seu workspace). |
modelstring(Obrigatório)Modelo de voice design. Valores válidos:
| |
inputobject(Obrigatório)Objeto de parâmetros de entrada.
Propriedades action string(Obrigatório)Tipo de operação. CosyVoice: query_voice. Voice design do Qwen: query.voice_id string(Condicionalmente obrigatório)ID da voz a ser consultada.voice string(Condicionalmente obrigatório)Nome da voz a ser consultada. |
Corpo da resposta | |
request_idstringIdentificador exclusivo desta solicitação. | |
outputobjectDados retornados pelo modelo.
Propriedades voice_id / voice stringID da voz. O CosyVoice retorna voice_id e o Qwen retorna voice.gmt_createstringHora de criação.gmt_modifiedstringHora da última modificação.statusstringStatus da voz. Para valores válidos, consulte "Referência de status de voz".target_modelstringModelo TTS que gera a voz.languagestringIdioma da voz.voice_promptstringTexto de descrição da voz.preview_textstringTexto do áudio de pré-visualização. | |
usageobjectInformações de uso desta solicitação.
Propriedades count integerQwen: sempre 0. Não retornado pelo CosyVoice (o objeto usage está vazio). |
Exclua uma voz
Corpo da solicitação | O Voice Design do CosyVoice está disponível apenas na região de Beijing. O Voice Design do Qwen oferece suporte à região de Singapore. Os exemplos do CosyVoice abaixo usam a URL da região China (Beijing). Os exemplos do Qwen abaixo usam a URL da região de Singapore (substitua {WorkspaceId} pelo ID real do seu workspace). |
modelstring(Obrigatório)Modelo de voice design. Valores válidos:
| |
inputobject(Obrigatório)Objeto de parâmetros de entrada.
Propriedades action string(Obrigatório)Tipo de operação. CosyVoice: delete_voice. Qwen: delete.voice_id string(Condicionalmente obrigatório)ID da voz a ser excluída.voice string(Condicionalmente obrigatório)Nome da voz a ser excluída. |
Corpo da resposta | |
request_idstringIdentificador exclusivo desta solicitação. | |
outputobjectDados retornados pelo modelo. O CosyVoice retorna um objeto vazio. O Qwen retorna o nome da voz excluída.
Propriedades voice stringNome da voz excluída. | |
usageobjectInformações de uso desta solicitação.
Propriedades count integerCosyVoice: sempre 1. Qwen: sempre 0. |
Referência de status de voz
Após a criação, a voz passa por um processo de revisão. A tabela a seguir descreve cada status. Este sistema de status aplica-se apenas ao CosyVoice (quando o modelo é voice-enrollment). As respostas de consulta e lista do Qwen não incluem um campo de status.
Status | Descrição |
|---|---|
DEPLOYING | Em revisão ou processamento. |
OK | Revisão aprovada. A voz está pronta para uso. |
UNDEPLOYED | Revisão rejeitada. Não é possível usar a voz. |