Clone uma voz a partir de 10 a 20 segundos de áudio sem necessidade de treinamento. Este documento aborda os parâmetros e o uso da API de clonagem de voz. Para invocação do modelo, consulte Qwen-Omni-Realtime ou Non-real-time (Qwen-Omni) .
Requisitos de áudio
Áudios de entrada de alta qualidade produzem melhores resultados de clonagem.
Item | Requisito |
|---|---|
Formatos suportados | WAV (16 bits), MP3, M4A |
Duração | Recomendado: 10 a 20 segundos. Máximo: 60 segundos. |
Tamanho do arquivo | < 10 MB |
Taxa de amostragem | >= 24 kHz |
Canais | Mono |
Conteúdo | O áudio deve conter pelo menos 3 segundos de fala contínua e clara, sem sons de fundo. O restante pode incluir pausas breves (<=2 segundos). Evite músicas de fundo, ruídos ou outras vozes em todo o áudio. Utilize áudio de fala natural como entrada. Não envie músicas ou áudios cantados. |
Idiomas | Chinês (zh), Inglês (en), Alemão (de), Italiano (it), Português (pt), Espanhol (es), Japonês (ja), Coreano (ko), Francês (fr), Russo (ru), Tailandês (th), Indonésio (id), Árabe (ar), Tcheco (cs), Dinamarquês (da), Holandês (nl), Finlandês (fi), Hebraico (he), Hindi (hi), Islandês (is), Malaio (ms), Norueguês (no), Persa (fa), Polonês (pl), Sueco (sv), Tagalo (tl), Turco (tr), Urdu (ur), Vietnamita (vi) Dialetos chineses: Dongbei, Shannxi, Sichuan, Henan, Changsha, Tianjin, Hangzhou, Liaoning, Shenyang, Anshan |
Início rápido
1. Fluxo de trabalho
A clonagem de voz segue o fluxo "criar primeiro, usar depois":
- Crie uma voz Chame a API Create a voice e envie um clipe de áudio. O sistema analisa o áudio e cria uma voz clonada personalizada. Especifiquetarget_modelnesta etapa para declarar qual modelo omni conduzirá a voz. Se já possuir uma voz criada (chame a API List voices para verificar), pule esta etapa e prossiga para a próxima.
- Use a voz em uma conversa Chame a API Omni (em tempo real ou não) e passe a voz obtida na etapa anterior. O modelo omni especificado nesta etapa deve corresponder aotarget_modelda etapa anterior.
2. Configuração do modelo e pré-requisitos
Selecione os modelos e cumpra os pré-requisitos antes de começar.
Configuração do modelo
A clonagem de voz requer dois modelos:
- Modelo de clonagem de voz: qwen-voice-enrollment
-
Modelo Omni que conduz a voz:
- qwen3.8-omni-flash-realtime
- qwen3.5-omni-plus-realtime
- qwen3.5-omni-flash-realtime
- qwen3.5-omni-plus
- qwen3.5-omni-flash
Pré-requisitos
- Obtenha uma chave de API: Obtain an API key. Por segurança, configure a chave de API como variável de ambiente.
- Instale o SDK: Certifique-se de ter instalado a versão mais recente do DashScope SDK.
- Prepare o áudio para clonagem: O áudio deve atender aos requisitos de áudio.
3. Exemplo de ponta a ponta
Este exemplo clona uma voz e a utiliza em uma conversa.
Princípio fundamental: O target_model especificado durante a clonagem deve corresponder ao modelo na chamada subsequente da API Omni. Caso contrário, a síntese falhará. Substitua o arquivo de exemplo voice.mp3 pelo seu próprio áudio.
- Realtime
- Non-realtime
Referência da API
Utilize a mesma conta em todas as APIs.
Criar uma voz
Envie o áudio para clonagem e crie uma voz personalizada.
- URL North China 2 (Beijing):
-
Cabeçalhos da solicitação
Parameter
Tipo
Obrigatório
Descrição
Authorization
string
Supported
Token de autenticação no formato
Bearer <your_api_key>. Substitua<your_api_key>pela sua chave de API real.Content-Type
string
Supported
Tipo de mídia do corpo da solicitação. Defina como
application/json. - Corpo da solicitação O corpo da solicitação inclui todos os parâmetros. Omita campos opcionais conforme necessário. Observe a distinção entre:
-
Parâmetros da solicitação
Parâmetro Tipo Padrão Obrigatório Descrição model string Supported O modelo de clonagem de voz. Defina como qwen-voice-enrollment.action string Supported O tipo de ação. Defina como create.target_model string Supported O modelo omni que conduz a voz: - qwen3.8-omni-flash-realtime
- qwen3.5-omni-plus-realtime
- qwen3.5-omni-flash-realtime
- qwen3.5-omni-plus
- qwen3.5-omni-flash
preferred_name string Supported Um nome legível para a voz. Caracteres permitidos: dígitos, letras, sublinhados. Máximo: 16 caracteres. Esta palavra-chave aparece no nome final da voz. Por exemplo, se a palavra-chave for "guanyu", o nome da voz resultante será "qwen-omni-vc-guanyu-voice-20250812105009984-838b".
audio.data string Supported O áudio para clonagem (siga o guia de gravação ao gravar e certifique-se de que o áudio atenda aos requisitos de áudio).Envie os dados de áudio de uma das seguintes formas: -
Data URL
Formato:
data:<mediatype>;base64,<data>-
<mediatype>: O tipo MIME- WAV:
audio/wav - MP3:
audio/mpeg - M4A:
audio/mp4
- WAV:
-
<data>: A string codificada em Base64 do áudio A codificação Base64 aumenta o tamanho do arquivo. Mantenha o resultado codificado abaixo de 10 MB. -
Exemplo:
data:audio/wav;base64,SUQzBAAAAAAAI1RTU0UAAAAPAAADTGF2ZjU4LjI5LjEwMAAAAAAAAAAAAAAA//PAxABQ/BXRbMPe4IQAhl9Ver código de exemplo
-
-
URL do áudio (recomendamos enviar seu áudio para o OSS)
- O tamanho do arquivo não deve exceder 10 MB.
- A URL deve ser publicamente acessível sem autenticação.
text string Unsupported A transcrição correspondente ao áudio em audio.data.Quando fornecida, o servidor valida o áudio em relação ao texto. Se a discrepância for muito grande, um Audio.PreprocessError será retornado.language string Unsupported O idioma do áudio em audio.data.Valores suportados:zh(Chinês),en(Inglês),de(Alemão),it(Italiano),pt(Português),es(Espanhol),ja(Japonês),ko(Coreano),fr(Francês),ru(Russo),th(Tailandês),id(Indonésio),ar(Árabe),cs(Tcheco),da(Dinamarquês),nl(Holandês),fi(Finlandês),he(Hebraico),hi(Hindi),is(Islandês),ms(Malaio),no(Norueguês),fa(Persa),pl(Polonês),sv(Sueco),tl(Tagalo),tr(Turco),ur(Urdu),vi(Vietnamita).Dialetos chineses:Dongbei,Shannxi,Sichuan,Henan,Changsha,Tianjin,Hangzhou,Liaoning,Shenyang,Anshan.Defina este campo como o idioma real do áudio usado para clonagem. -
Parâmetros de resposta
Principais parâmetros de resposta:
Ver exemplo de resposta
Parâmetro
Tipo
Descrição
voice
string
O nome da voz. Use este valor diretamente como o parâmetro
voicena API multimodal em tempo real.target_model
string
O modelo omni que conduz a voz:
qwen3.8-omni-flash-realtime
qwen3.5-omni-plus-realtime
qwen3.5-omni-flash-realtime
Este deve corresponder ao modelo usado na chamada subsequente da API multimodal em tempo real. Caso contrário, a síntese falhará.
request_id
string
ID da solicitação.
count
integer
O número de operações "criar voz" faturadas para esta solicitação. O custo é $ count × 0.01.
Ao criar uma voz, count é sempre 1.
-
Código de exemplo
- curl
- python
- java
Se você não definiu a chave de API como variável de ambiente, substitua$DASHSCOPE_API_KEYno exemplo pela sua chave de API real.
Listar vozes
Consulte suas vozes criadas com paginação.
- URL North China 2 (Beijing):
-
Cabeçalhos da solicitação
Parameter
Tipo
Obrigatório
Descrição
Authorization
string
Supported
Token de autenticação no formato
Bearer <your_api_key>. Substitua<your_api_key>pela sua chave de API real.Content-Type
string
Supported
Tipo de mídia do corpo da solicitação. Defina como
application/json. -
Parâmetros da solicitação
Parâmetro
Tipo
Padrão
Obrigatório
Descrição
model
string
-
Supported
O modelo de clonagem de voz. Defina como
qwen-voice-enrollment.action
string
-
Supported
O tipo de ação. Defina como
list.page_index
integer
0
Unsupported
Índice do número da página. Valores válidos: 0 a 1.000.000.
page_size
integer
10
Unsupported
Número de itens por página. Valores válidos: 0 a 1.000.000.
-
Parâmetros de resposta
Principais parâmetros de resposta:
Ver exemplo de resposta
Parâmetro
Tipo
Descrição
voice
string
O nome da voz. Use este valor diretamente no parâmetro
voiceda API multimodal em tempo real.gmt_create
string
O momento em que a voz foi criada.
target_model
string
O modelo omni que conduz a voz:
qwen3.8-omni-flash-realtime
qwen3.5-omni-plus-realtime
qwen3.5-omni-flash-realtime
qwen3.5-omni-plus
qwen3.5-omni-flash
Este deve corresponder ao modelo omni usado na chamada subsequente da API. Caso contrário, a síntese falhará.
request_id
string
ID da solicitação.
count
integer
Esta solicitação é cobrada com base no número real de operações 'Criar Voz'. O custo para esta solicitação é $ count × 0.01 .
Listar vozes é gratuito.
counté sempre 0. -
Código de exemplo
- cURL
- Python
- Java
Se você não definiu a chave de API como variável de ambiente, substitua$DASHSCOPE_API_KEYno exemplo pela sua chave de API real.
Excluir uma voz
Exclua uma voz específica e libere a cota correspondente.
- URL North China 2 (Beijing):
-
Cabeçalhos da solicitação
Parameter
Tipo
Obrigatório
Descrição
Authorization
string
Supported
Token de autenticação no formato
Bearer <your_api_key>. Substitua<your_api_key>pela sua chave de API real.Content-Type
string
Supported
Tipo de mídia do corpo da solicitação. Defina como
application/json. - Corpo da solicitação Omita campos opcionais conforme necessário.
-
Parâmetros da solicitação
Parâmetro
Tipo
Padrão
Obrigatório
Descrição
model
string
-
Supported
O modelo de clonagem de voz. Defina como
qwen-voice-enrollment.action
string
-
Supported
O tipo de ação. Defina como
delete.voice
string
-
Supported
A voz a ser excluída.
-
Parâmetros de resposta
Principais parâmetros de resposta:
Ver exemplo de resposta
Parâmetro
Tipo
Descrição
request_id
string
ID da solicitação.
count
integer
Esta solicitação é cobrada com base no número real de operações 'Criar Voz'. O custo para esta solicitação é $ count × 0.01 .
Excluir uma voz é gratuito.
counté sempre 0. -
Código de exemplo
- cURL
- Python
- Java
Se você não definiu a chave de API como variável de ambiente, substitua$DASHSCOPE_API_KEYno exemplo pela sua chave de API real.
Usar em conversa
Para usar uma voz clonada em uma conversa, consulte o Início rápido.
Cota de vozes e limpeza automática
Limite total: 1.000 vozes por conta.
Não existe um endpoint dedicado para contagem. Chame a API Listar vozes para contar suas vozes.Limpeza automática: Vozes não utilizadas por um ano são excluídas automaticamente.
Faturamento
A clonagem de voz e a invocação do modelo são faturadas separadamente:
-
Clonagem de voz: faturada a $0,01/voz. Criações com falha não são faturadas.
Cota gratuita (apenas região de Beijing do site China e região de Singapore do site Internacional):
- 1.000 criações de voz gratuitas dentro de 90 dias após a ativação do Model Studio.
- Criações com falha não consomem a cota gratuita.
- Excluir uma voz não restaura a cota gratuita.
- Após o esgotamento da cota gratuita ou o término do período de 90 dias, a criação de voz é faturada a $0,01/voz.
- Conversa com uma voz clonada: Faturada pelo uso de tokens na invocação do modelo. Para detalhes, consulte Model inference pricing.
Direitos autorais e conformidade legal
Você é responsável pela propriedade e pelo uso legal da voz fornecida. Leia o Contrato de Serviço.
Guia de gravação
Equipamento de gravação
Utilize um microfone com cancelamento de ruído ou grave com um telefone a curta distância em um ambiente silencioso.
Ambiente de gravação
Local
- Grave em um espaço pequeno e fechado, com 10 metros quadrados ou menos.
- Escolha uma sala com materiais de absorção sonora, como espuma acústica, carpetes ou cortinas.
- Evite grandes salões abertos, salas de conferência ou salas de aula onde a reverberação seja alta.
Controle de ruído
- Ruído externo: Feche portas e janelas para bloquear trânsito, obras e outros sons externos.
- Ruído interno: Desligue ar-condicionados, ventiladores e reatores de lâmpadas fluorescentes.
- Grave o som ambiente com seu telefone e reproduza-o em volume alto para identificar fontes de ruído ocultas.
Controle de reverberação
- A reverberação faz o áudio soar abafado e reduz a clareza.
- Reduza reflexões de superfícies lisas: feche cortinas, abra portas de armários e cubra mesas e prateleiras com roupas ou cobertores.
- Use objetos irregulares, como estantes e móveis estofados, para criar reflexões difusas.
Preparação do roteiro
- Adapte o roteiro ao caso de uso alvo. Por exemplo, use o estilo de diálogo de atendimento ao cliente para um cenário de suporte.
- Certifique-se de que o roteiro não contenha conteúdo sensível ou ilegal (como material político, pornográfico ou violento), pois isso causa falha na clonagem.
- Evite frases curtas (como "olá" ou "sim"). Use sentenças completas.
- Mantenha a coerência semântica e evite pausas frequentes durante a leitura. Recomenda-se pelo menos 3 segundos consecutivos sem interrupção.
- Você pode transmitir a emoção desejada (como amigável ou séria), mas evite uma entrega excessivamente dramática ou teatral. Mantenha o tom natural.
Passos recomendados
Tomando um quarto típico como exemplo:
- Feche portas e janelas para bloquear ruídos externos.
- Desligue ar-condicionados, ventiladores e outros aparelhos.
- Feche cortinas para reduzir reflexões do vidro.
- Cubra a superfície da mesa com roupas ou um cobertor para reduzir reflexões da mesa.
- Familiarize-se com o roteiro, defina o tom do personagem e faça uma entrega natural.
- Mantenha cerca de 10 cm de distância do dispositivo de gravação para evitar distorção por plosivas ou sinal fraco.