Escolha o modelo ideal para síntese de fala, clonagem de voz e design de voz.
Migrando de modelos proprietários?
Se você utiliza atualmente ElevenLabs, OpenAI ou Google para síntese de fala, consulte a tabela abaixo para encontrar o modelo equivalente no Model Studio.
Caso de uso | Modelo proprietário | Equivalente no Model Studio |
|---|---|---|
Vozes integradas / síntese padrão | OpenAI gpt-4o-tts, Google Chirp 3 |
|
Voz personalizada / clonagem de voz | ElevenLabs Multilingual v3 |
|
TTS padrão ou voz personalizada?
Os modelos de síntese de fala convertem texto em fala com sonoridade natural. Comece definindo se as vozes integradas ou personalizadas atendem melhor às suas necessidades:
TTS padrão | Voz personalizada | |
|---|---|---|
Origem da voz | Biblioteca de vozes predefinidas — selecione e use imediatamente | Clone a partir de uma amostra de áudio ou crie com uma descrição textual |
Esforço de configuração | Nenhuma configuração extra necessária — basta escolha um modelo e uma voz para começar | Requer uma amostra de áudio ou descrição textual para criar a voz |
Casos de uso | Bots de atendimento ao cliente, audiolivros, noticiários, transmissões ao vivo de e-commerce | Vozes exclusivas de marca, âncoras virtuais, dublagem de personagens de jogos |
Modelos recomendados |
|
|
- Opte pelo TTS padrão quando a biblioteca de vozes predefinidas atender às suas necessidades e você desejar uma configuração rápida, sem ajustes adicionais.
- Prefira uma voz personalizada caso precise de uma identidade vocal exclusiva para sua marca, queira replicar a voz de uma pessoa específica ou necessite criar uma voz totalmente nova para um personagem.
Clonagem de voz ou design de voz?
Ao optar por uma voz personalizada, dois métodos de criação estão disponíveis:
Clonagem de voz | Design de voz | |
|---|---|---|
Entrada | Uma amostra de áudio do falante alvo | Uma descrição textual da voz desejada (ex.: "voz feminina grave e acolhedora") |
Resultado | A fala sintetizada reproduz fielmente as características do falante original | Geração de uma voz inédita, criada do zero com base na descrição fornecida |
Casos de uso | Reutilização da voz de porta-vozes ou âncoras de marca, âncoras virtuais, assistentes de voz personalizados | Criação de identidade vocal para marcas (sem gravações prévias), dublagem de personagens em jogos e animações, produção de conteúdo criativo |
Modelos recomendados |
|
|
service de gerenciamento de vozes |
|
|
- Utilize a clonagem de voz se você já possui uma gravação do falante alvo e deseja reproduzir essa identidade vocal na fala sintetizada.
- Recorra ao design de voz quando não houver gravações disponíveis e for necessário gerar uma nova voz exclusivamente a partir de uma descrição textual.
WebSocket ou HTTP?
- WebSocket: Streaming bidirecional — aceita entrada e saída contínuas, entregando o áudio à medida que é sintetizado para minimizar a latência. Ideal para bots de atendimento, assistentes de voz e centrais de chamadas.
- HTTP: Envio do texto completo com recebimento do áudio em resposta via streaming (saída fragmentada). Mais indicado para audiolivros, produção de conteúdo sonoro e outros cenários de processamento em lote de alto volume.
-realtime operam via WebSocket, enquanto os demais utilizam HTTP.
Acesse os modelos Qwen-Audio-TTS/CosyVoice e Qwen WebSocket por meio do DashScope SDK (Java, Python). Demais modelos exigem chamadas diretas via WebSocket ou HTTP.
Para acesso via WebSocket, consulte Síntese de fala em tempo real. Para acesso via HTTP, consulte Síntese de fala não em tempo real.
Os modelos da série CosyVoice também suportam o protocolo AOQ. Recomenda-se o uso do AOQ para integrações no lado do cliente que priorizam latência estável, resiliência em redes instáveis e supressão de ruído full-duplex integrada com cancelamento de eco. Para uma comparação detalhada dos protocolos, consulte Realtime API overview.
Controle por instruções
Descreva o estilo de expressão desejado em linguagem natural para ajustar a velocidade, a emoção e o estilo a cada requisição. Exemplos incluem "fale suavemente em um ritmo mais lento" ou "use um tom empolgado de locutor". Aplique o controle por instruções na produção de conteúdo emocional, transmissões profissionais, audiolivros e outros cenários que demandam alta expressividade.
Modelos compatíveis com controle por instruções: Série Qwen-Audio-TTS (qwen-audio-3.0-tts-plus, qwen-audio-3.0-tts-flash), Série CosyVoice (cosyvoice-v3.5-plus, cosyvoice-v3.5-flash, cosyvoice-v3-flash) e Série Qwen-TTS (qwen3-tts-instruct-flash-realtime, qwen3-tts-instruct-flash). Para mais detalhes, consulte Real-time speech synthesis > Instruction control.
Modelos recomendados
A tabela a seguir apresenta o modelo mais adequado para cada cenário. Para informações completas, visite a Model Gallery.
ID do modelo | Série | API | Clonagem de voz | Design de voz | Controle por instruções |
|---|---|---|---|---|---|
| Qwen-Audio-TTS | WebSocket | Supported | Unsupported | Supported |
| CosyVoice | WebSocket | Supported | Supported | Supported |
| CosyVoice | WebSocket | Supported | Supported | Unsupported |
Todos os modelos
Qwen-Audio-TTS
ID do modelo | API | Clonagem de voz | Design de voz | Controle por instruções |
|---|---|---|---|---|
| WebSocket | Supported | Unsupported | Supported |
| WebSocket | Supported | Unsupported | Supported |
- Vozes do sistema (varia conforme a voz): Chinês (Mandarim), Inglês
- Vozes clonadas (dialetos configuráveis via controle por instruções): Chinês (Mandarim, Cantonês, Chongqing, Nordeste, Gansu, Guizhou, Zhejiang, Hebei, Henan, Hubei, Hunan, Jiangxi, Ningbo, Ningxia, Qingdao, Shaanxi, Shanxi, Shandong, Xangai, Sichuan, Yunnan), Inglês, Japonês, Coreano, Russo, Francês, Alemão, Português, Tailandês, Indonésio, Vietnamita, Espanhol, Italiano, Malaio, Filipino e Árabe
CosyVoice
Determinados modelos CosyVoice aceitam marcação SSML (Speech Synthesis Markup Language) e leitura de fórmulas LaTeX.
ID do modelo | API | Clonagem de voz | Design de voz | Controle por instruções |
|---|---|---|---|---|
| WebSocket | Supported | Supported | Supported |
| WebSocket | Supported | Supported | Supported |
| WebSocket | Supported | Supported | Unsupported |
| WebSocket | Supported | Supported | Supported |
| WebSocket | Supported | Unsupported | Unsupported |
-
cosyvoice-v3.5-plus e cosyvoice-v3.5-flash (sem vozes do sistema):
- Vozes clonadas (dialetos configuráveis via controle por instruções): Chinês (Mandarim, Cantonês, Nordeste, Gansu, Guizhou, Henan, Hubei, Jiangxi, Hokkien, Ningxia, Shanxi, Shaanxi, Shandong, Xangai, Sichuan, Tianjin, Yunnan), Inglês, Francês, Alemão, Japonês, Coreano, Russo, Português, Tailandês, Indonésio e Vietnamita
- Vozes projetadas: Chinês (Mandarim), Inglês
-
cosyvoice-v3-plus:
- Vozes do sistema (varia conforme a voz): Chinês (Mandarim), Inglês
- Vozes clonadas (dialetos configuráveis via controle por instruções): Chinês (Mandarim, Cantonês, Nordeste, Gansu, Guizhou, Henan, Hubei, Jiangxi, Hokkien, Ningxia, Shanxi, Shaanxi, Shandong, Xangai, Sichuan, Tianjin, Yunnan), Inglês, Francês, Alemão, Japonês, Coreano e Russo
- Vozes projetadas: Chinês (Mandarim), Inglês
-
cosyvoice-v3-flash:
- Vozes do sistema (varia conforme a voz; alguns dialetos têm suporte nativo pelas vozes do sistema, outros via controle por instruções): Chinês (Mandarim, Cantonês, Nordeste, Henan, Hunan, Shaanxi, Shandong, Sichuan, Anhui, Hokkien), Inglês
- Vozes clonadas (dialetos configuráveis via controle por instruções): Chinês (Mandarim, Cantonês, Nordeste, Gansu, Guizhou, Henan, Hubei, Jiangxi, Hokkien, Ningxia, Shanxi, Shaanxi, Shandong, Xangai, Sichuan, Tianjin, Yunnan), Inglês, Francês, Alemão, Japonês, Coreano, Russo, Português, Tailandês, Indonésio e Vietnamita
- Vozes projetadas: Chinês (Mandarim), Inglês
-
cosyvoice-v2 (design de voz não suportado):
- Vozes do sistema (varia conforme a voz): Chinês (Mandarim, Cantonês, Nordeste, Hokkien, Shaanxi), Inglês, Japonês e Coreano
- Vozes clonadas: Chinês (Mandarim), Inglês
Qwen3-TTS
ID do modelo | API | Clonagem de voz | Design de voz | Controle por instruções |
|---|---|---|---|---|
| HTTP | Unsupported | Unsupported | Unsupported |
| HTTP | Unsupported | Unsupported | Unsupported |
| HTTP | Unsupported | Unsupported | Unsupported |
| WebSocket | Unsupported | Unsupported | Unsupported |
| WebSocket | Unsupported | Unsupported | Unsupported |
| WebSocket | Unsupported | Unsupported | Unsupported |
| HTTP | Unsupported | Unsupported | Supported |
| HTTP | Unsupported | Unsupported | Supported |
| WebSocket | Unsupported | Unsupported | Supported |
| WebSocket | Unsupported | Unsupported | Supported |
| HTTP | Supported | Unsupported | Unsupported |
| WebSocket | Supported | Unsupported | Unsupported |
| WebSocket | Supported | Unsupported | Unsupported |
| HTTP | Unsupported | Supported | Unsupported |
| WebSocket | Unsupported | Supported | Unsupported |
| WebSocket | Unsupported | Supported | Unsupported |
- Série Qwen3-TTS-Flash (vozes do sistema) (
qwen3-tts-flash,qwen3-tts-flash-2025-11-27,qwen3-tts-flash-2025-09-18,qwen3-tts-flash-realtime,qwen3-tts-flash-realtime-2025-11-27,qwen3-tts-flash-realtime-2025-09-18): Chinês (Mandarim, Pequim, Xangai, Sichuan, Nanjing, Shaanxi, Hokkien, Tianjin, Cantonês — varia conforme a voz), Inglês, Alemão, Italiano, Português, Espanhol, Japonês, Coreano, Francês e Russo - Série Qwen3-TTS-Instruct-Flash (vozes do sistema) (
qwen3-tts-instruct-flash,qwen3-tts-instruct-flash-2026-01-26,qwen3-tts-instruct-flash-realtime,qwen3-tts-instruct-flash-realtime-2026-01-22): Chinês (Mandarim), Inglês, Alemão, Italiano, Português, Espanhol, Japonês, Coreano, Francês e Russo - Série Qwen3-TTS-VC (clonagem de voz) (
qwen3-tts-vc-2026-01-22,qwen3-tts-vc-realtime-2026-01-15,qwen3-tts-vc-realtime-2025-11-27): Chinês (Mandarim), Inglês, Alemão, Italiano, Português, Espanhol, Japonês, Coreano, Francês e Russo - Série Qwen3-TTS-VD (design de voz) (
qwen3-tts-vd-2026-01-26,qwen3-tts-vd-realtime-2026-01-15,qwen3-tts-vd-realtime-2025-12-16): Chinês (Mandarim), Inglês, Alemão, Italiano, Português, Espanhol, Japonês, Coreano, Francês e Russo
Qwen-TTS (legado, faturamento baseado em tokens)
Os modelos legados do Qwen-TTS listados abaixo utilizam faturamento baseado em tokens. Caso tenha migrado para o Qwen3-TTS, utilize os modelos recomendados anteriormente neste tópico.
ID do modelo | API | Descrição |
|---|---|---|
| HTTP | Síntese sem streaming, faturamento baseado em tokens |
| HTTP | Síntese sem streaming, faturamento baseado em tokens |
| HTTP | Versão snapshot, faturamento baseado em tokens |
| HTTP | Versão snapshot, faturamento baseado em tokens |
| WebSocket | Síntese com streaming, faturamento baseado em tokens |
| WebSocket | Síntese com streaming, faturamento baseado em tokens |
| WebSocket | Versão snapshot, síntese com streaming, faturamento baseado em tokens |
- Série Qwen-TTS (vozes do sistema) (
qwen-tts,qwen-tts-latest,qwen-tts-2025-05-22,qwen-tts-2025-04-10): Chinês (Mandarim, Pequim, Xangai, Sichuan — varia conforme a voz), Inglês, Alemão, Italiano, Português, Espanhol, Japonês, Coreano, Francês e Russo - Série Qwen-TTS-Realtime (vozes do sistema) (
qwen-tts-realtime,qwen-tts-realtime-latest,qwen-tts-realtime-2025-07-15): Chinês (Mandarim), Inglês, Alemão, Italiano, Português, Espanhol, Japonês, Coreano, Francês e Russo