O Voice Design permite criar vozes personalizadas apenas com descrições em linguagem natural, sem necessidade de amostras de áudio.
O Voice Design é ideal para prototipagem rápida, produção de conteúdo criativo e dublagem de personagens de jogos. O Alibaba Cloud Model Studio oferece o Voice Design por meio das seguintes famílias de modelos:
O fluxo de trabalho do Voice Design consiste em três etapas: descrever, criar e usar.
O exemplo a seguir demonstra como criar uma voz CosyVoice a partir de uma descrição textual e usá-la para síntese de fala.
Etapa 1: Criar uma voz a partir de uma descrição
Chame a API com dois parâmetros:
Etapa 2: Sintetizar fala com a voz projetada
Na solicitação a seguir, use o valor de
Os exemplos abaixo mostram como criar uma voz e aplicá-la na síntese de fala.
A descrição da voz (
Combine as dimensões a seguir para descrever uma voz. Quanto mais dimensões você incluir, mais preciso será o resultado.
O Voice Design permite listar vozes, visualizar detalhes e excluir vozes. Para endpoints da API e detalhes dos parâmetros, consulte a Referência da API.
Limite total de vozes: Cada conta do Alibaba Cloud Model Studio tem limite separado de 1.000 vozes personalizadas para CosyVoice e 1.000 para Qwen-TTS. As duas cotas são contabilizadas independentemente.
Limpeza automática: Se uma voz não for usada em nenhuma solicitação de síntese de fala durante um ano, o sistema a exclui automaticamente.
Referência da API do Voice Design
Não necessariamente. O Voice Design envolve aleatoriedade, portanto a mesma descrição pode gerar vozes ligeiramente diferentes a cada vez. Gere várias opções, ouça-as e escolha a melhor.
Atualmente, as descrições de voz (
O Voice Design cria uma voz do zero usando descrições textuais, sem exigir amostras de áudio. É adequado para desenvolver identidades vocais totalmente novas. Já a Clonagem de Voz replica uma voz com base em amostras de áudio reais, sendo indicada para reproduzir a voz de uma pessoa específica. Para mais detalhes, consulte Clonagem de voz.
Visão geral
O Voice Design é ideal para prototipagem rápida, produção de conteúdo criativo e dublagem de personagens de jogos. O Alibaba Cloud Model Studio oferece o Voice Design por meio das seguintes famílias de modelos:
- CosyVoice: Suporta síntese de fala em tempo real . Disponível na região de Pequim (séries v3.5 e v3).
- Qwen-TTS: Oferece suporte à síntese de fala em tempo real e não em tempo real, com limite maior de caracteres para descrição de voz (2.048 caracteres). Disponível nas regiões de Pequim e Singapura.
Pré-requisitos
- Configure uma chave de API e defina-a como variável de ambiente.
- Para chamar a API pelo DashScope SDK, instale o SDK mais recente.
Início rápido
O fluxo de trabalho do Voice Design consiste em três etapas: descrever, criar e usar.
- Escreva uma descrição de voz: Descreva as características desejadas da voz em linguagem natural. Para orientações detalhadas, consulte Escrever descrições de voz.
- Crie uma voz: Chame a API do Voice Design. O sistema gera uma voz com base na sua descrição e retorna um clipe de áudio de pré-visualização. Ouça a pré-visualização antes de usar a voz em produção.
- Sintetize a fala com a voz criada: Chame a API de síntese de fala com o ID da voz para gerar o áudio.
Voice Design com CosyVoice
O exemplo a seguir demonstra como criar uma voz CosyVoice a partir de uma descrição textual e usá-la para síntese de fala.
Etapa 1: Criar uma voz a partir de uma descrição
Chame a API com dois parâmetros: voice_prompt para a descrição da voz e preview_text para o texto lido no áudio de pré-visualização.
voice_id retornado na etapa anterior.
Voice Design com Qwen-TTS
Os exemplos abaixo mostram como criar uma voz e aplicá-la na síntese de fala.
Ouça o áudio de pré-visualização antes de usar a voz para síntese. Isso confirma o resultado e evita custos desnecessários com a API.
- Python
- cURL
Escrever descrições de voz
A descrição da voz (voice_prompt) determina a qualidade da voz gerada. Quanto mais específica e detalhada for a descrição, mais próximo o resultado estará das suas expectativas.
Requisitos e limitações
- Limite de comprimento: O tamanho máximo de
voice_promptvaria conforme o modelo: até 500 caracteres para CosyVoice e até 2.048 caracteres para Qwen-TTS. - Idiomas suportados: As descrições de voz aceitam apenas chinês e inglês.
Princípios fundamentais
- Seja específico, não vago: Use termos que descrevam qualidades vocais, como "grave", "nítida" ou "rápida". Evite palavras subjetivas ou ambíguas como "bonita" ou "normal".
- Aborde múltiplas dimensões: Uma boa descrição abrange diversos aspectos (como gênero, idade e emoção). Descrever apenas "voz feminina" é genérico demais para produzir um resultado distinto.
- Mantenha a objetividade: Concentre-se nas características físicas e perceptivas da voz. Por exemplo, prefira "aguda com tom enérgico" em vez de "minha voz favorita".
- Priorize a originalidade: Descreva as qualidades da voz em vez de solicitar a imitação de pessoas específicas (como celebridades ou atores). O modelo não suporta imitações, e tais solicitações podem levantar questões de direitos autorais.
- Seja conciso: Evite repetir sinônimos ou adicionar modificadores sem significado. Garanta que cada palavra tenha um propósito claro.
Dimensões da descrição
Combine as dimensões a seguir para descrever uma voz. Quanto mais dimensões você incluir, mais preciso será o resultado.
Dimensão | Exemplos |
|---|---|
Gênero | Masculino, feminino, neutro |
Idade | Criança (5-12), adolescente (13-18), jovem adulto (19-35), meia-idade (36-55), idoso (55+) |
Tom | Agudo, médio, grave, levemente agudo, levemente grave |
Velocidade | Rápida, média, lenta, levemente rápida, levemente lenta |
Emoção | Alegre, calma, gentil, séria, animada, serena, suave |
Características | Ressonante, nítida, rouca, aveludada, doce, profunda, poderosa |
Caso de uso | Telejornal, publicidade, audiolivro, personagem de animação, assistente de voz, narração de documentário |
Exemplos
- Estilo padrão de locução: articulação clara e precisa, com dicção perfeita
- Voz feminina jovem e animada, ritmo acelerado com entonação ascendente marcante, adequada para apresentações de produtos de moda
- Voz masculina de meia-idade, calma e pausada, profunda e ressonante, ideal para leitura de notícias ou narração de documentários
- Voz feminina gentil e ponderada, cerca de 30 anos, tom uniforme, apropriada para narração de audiolivros
- Voz infantil fofa, menina de aproximadamente 8 anos, fala levemente infantilizada, perfeita para dublagem de personagens de animação
Gerencie vozes personalizadas
O Voice Design permite listar vozes, visualizar detalhes e excluir vozes. Para endpoints da API e detalhes dos parâmetros, consulte a Referência da API.
Cota e faturamento
Cota de vozes e limpeza automática
Limite total de vozes: Cada conta do Alibaba Cloud Model Studio tem limite separado de 1.000 vozes personalizadas para CosyVoice e 1.000 para Qwen-TTS. As duas cotas são contabilizadas independentemente.
Limpeza automática: Se uma voz não for usada em nenhuma solicitação de síntese de fala durante um ano, o sistema a exclui automaticamente.
Regras de faturamento
- CosyVoice: A criação de vozes é gratuita.
-
Qwen-TTS: Cada criação de voz custa USD 0,2. Criações malsucedidas não são cobradas.
Cota gratuita (apenas na região de Singapura):
- Você recebe 10 criações gratuitas de voz nos primeiros 90 dias após ativar o Alibaba Cloud Model Studio.
- Criações com falha não consomem a cota gratuita.
- Excluir uma voz não restaura a cota gratuita.
- Após o esgotamento da cota gratuita ou o término do período de 90 dias, a criação de vozes é cobrada a USD 0,2 por voz.
Modelos e regiões suportados
- China (Beijing)
- Singapore
Para chamar os modelos a seguir, selecione uma chave de API da região de Pequim:
- CosyVoice: cosyvoice-v3.5-plus, cosyvoice-v3.5-flash, cosyvoice-v3-plus, cosyvoice-v3-flash
-
Qwen-TTS:
- Qwen3-TTS-VD-Realtime: qwen3-tts-vd-realtime-2026-01-15 (snapshot mais recente), qwen3-tts-vd-realtime-2025-12-16 (snapshot)
- Qwen3-TTS-VD: qwen3-tts-vd-2026-01-26 (snapshot mais recente)
- Singapore
- China (Beijing)
Para chamar os modelos a seguir, selecione uma chave de API da região de Singapura:
-
Qwen-TTS:
- Qwen3-TTS-VD-Realtime: qwen3-tts-vd-realtime-2026-01-15 (snapshot mais recente), qwen3-tts-vd-realtime-2025-12-16 (snapshot)
- Qwen3-TTS-VD: qwen3-tts-vd-2026-01-26 (snapshot mais recente)
- O Voice Design com CosyVoice usa o modelo FunAudioGen-VD.
- O mesmo texto de descrição (prompt) pode gerar vozes ligeiramente diferentes a cada execução. Gere múltiplas vozes e selecione a melhor opção.
Referência da API
Referência da API do Voice Design
Perguntas frequentes
A mesma descrição de voz sempre produz a mesma voz?
Não necessariamente. O Voice Design envolve aleatoriedade, portanto a mesma descrição pode gerar vozes ligeiramente diferentes a cada vez. Gere várias opções, ouça-as e escolha a melhor.
Quais idiomas são suportados nas descrições de voz?
Atualmente, as descrições de voz (voice_prompt) aceitam apenas chinês e inglês. No entanto, a voz gerada pode sintetizar fala em vários idiomas.