Skip to main content
Speech synthesis

Visão geral da síntese de fala

Escolha o modelo ideal para síntese de fala, clonagem de voz e design de voz.

Migrando de modelos proprietários?

Se você utiliza atualmente ElevenLabs, OpenAI ou Google para síntese de fala, consulte a tabela abaixo para encontrar o modelo equivalente no Model Studio.

Caso de uso

Modelo proprietário

Equivalente no Model Studio

Vozes integradas / síntese padrão

OpenAI gpt-4o-tts, Google Chirp 3

qwen-audio-3.0-tts-plus

Voz personalizada / clonagem de voz

ElevenLabs Multilingual v3

qwen-audio-3.0-tts-flash (clonagem de voz), cosyvoice-v3.5-plus (design de voz)

TTS padrão ou voz personalizada?

Os modelos de síntese de fala convertem texto em fala com sonoridade natural. Comece definindo se as vozes integradas ou personalizadas atendem melhor às suas necessidades:

TTS padrão

Voz personalizada

Origem da voz

Biblioteca de vozes predefinidas — selecione e use imediatamente

Clone a partir de uma amostra de áudio ou crie com uma descrição textual

Esforço de configuração

Nenhuma configuração extra necessária — basta escolha um modelo e uma voz para começar

Requer uma amostra de áudio ou descrição textual para criar a voz

Casos de uso

Bots de atendimento ao cliente, audiolivros, noticiários, transmissões ao vivo de e-commerce

Vozes exclusivas de marca, âncoras virtuais, dublagem de personagens de jogos

Modelos recomendados

qwen-audio-3.0-tts-plus

qwen-audio-3.0-tts-plus (clonagem de voz), cosyvoice-v3.5-plus (design de voz)

  • Opte pelo TTS padrão quando a biblioteca de vozes predefinidas atender às suas necessidades e você desejar uma configuração rápida, sem ajustes adicionais.
  • Prefira uma voz personalizada caso precise de uma identidade vocal exclusiva para sua marca, queira replicar a voz de uma pessoa específica ou necessite criar uma voz totalmente nova para um personagem.

Clonagem de voz ou design de voz?

Ao optar por uma voz personalizada, dois métodos de criação estão disponíveis:

Clonagem de voz

Design de voz

Entrada

Uma amostra de áudio do falante alvo

Uma descrição textual da voz desejada (ex.: "voz feminina grave e acolhedora")

Resultado

A fala sintetizada reproduz fielmente as características do falante original

Geração de uma voz inédita, criada do zero com base na descrição fornecida

Casos de uso

Reutilização da voz de porta-vozes ou âncoras de marca, âncoras virtuais, assistentes de voz personalizados

Criação de identidade vocal para marcas (sem gravações prévias), dublagem de personagens em jogos e animações, produção de conteúdo criativo

Modelos recomendados

qwen-audio-3.0-tts-plus, qwen-audio-3.0-tts-flash

cosyvoice-v3.5-plus, cosyvoice-v3.5-flash

service de gerenciamento de vozes

voice-enrollment (registre e gerencie vozes)

voice-enrollment (registre e gerencie vozes)

  • Utilize a clonagem de voz se você já possui uma gravação do falante alvo e deseja reproduzir essa identidade vocal na fala sintetizada.
  • Recorra ao design de voz quando não houver gravações disponíveis e for necessário gerar uma nova voz exclusivamente a partir de uma descrição textual.

WebSocket ou HTTP?

  • WebSocket: Streaming bidirecional — aceita entrada e saída contínuas, entregando o áudio à medida que é sintetizado para minimizar a latência. Ideal para bots de atendimento, assistentes de voz e centrais de chamadas.
  • HTTP: Envio do texto completo com recebimento do áudio em resposta via streaming (saída fragmentada). Mais indicado para audiolivros, produção de conteúdo sonoro e outros cenários de processamento em lote de alto volume.
Os modelos Qwen-Audio-TTS/CosyVoice utilizam o mesmo nome de modelo tanto para acesso via WebSocket quanto HTTP. Nos modelos Qwen, o sufixo indica a API: modelos com o sufixo -realtime operam via WebSocket, enquanto os demais utilizam HTTP. Acesse os modelos Qwen-Audio-TTS/CosyVoice e Qwen WebSocket por meio do DashScope SDK (Java, Python). Demais modelos exigem chamadas diretas via WebSocket ou HTTP. Para acesso via WebSocket, consulte Síntese de fala em tempo real. Para acesso via HTTP, consulte Síntese de fala não em tempo real. Os modelos da série CosyVoice também suportam o protocolo AOQ. Recomenda-se o uso do AOQ para integrações no lado do cliente que priorizam latência estável, resiliência em redes instáveis e supressão de ruído full-duplex integrada com cancelamento de eco. Para uma comparação detalhada dos protocolos, consulte Realtime API overview.

Controle por instruções

Descreva o estilo de expressão desejado em linguagem natural para ajustar a velocidade, a emoção e o estilo a cada requisição. Exemplos incluem "fale suavemente em um ritmo mais lento" ou "use um tom empolgado de locutor". Aplique o controle por instruções na produção de conteúdo emocional, transmissões profissionais, audiolivros e outros cenários que demandam alta expressividade. Modelos compatíveis com controle por instruções: Série Qwen-Audio-TTS (qwen-audio-3.0-tts-plus, qwen-audio-3.0-tts-flash), Série CosyVoice (cosyvoice-v3.5-plus, cosyvoice-v3.5-flash, cosyvoice-v3-flash) e Série Qwen-TTS (qwen3-tts-instruct-flash-realtime, qwen3-tts-instruct-flash). Para mais detalhes, consulte Real-time speech synthesis > Instruction control.

Modelos recomendados

A tabela a seguir apresenta o modelo mais adequado para cada cenário. Para informações completas, visite a Model Gallery.

ID do modelo

Série

API

Clonagem de voz

Design de voz

Controle por instruções

qwen-audio-3.0-tts-plus

Qwen-Audio-TTS

WebSocket

Supported

Unsupported

Supported

cosyvoice-v3.5-plus

CosyVoice

WebSocket

Supported

Supported

Supported

cosyvoice-v3-plus

CosyVoice

WebSocket

Supported

Supported

Unsupported

Todos os modelos

Qwen-Audio-TTS

ID do modelo

API

Clonagem de voz

Design de voz

Controle por instruções

qwen-audio-3.0-tts-plus

WebSocket

Supported

Unsupported

Supported

qwen-audio-3.0-tts-flash

WebSocket

Supported

Unsupported

Supported

Idiomas suportados:
  • Vozes do sistema (varia conforme a voz): Chinês (Mandarim), Inglês
  • Vozes clonadas (dialetos configuráveis via controle por instruções): Chinês (Mandarim, Cantonês, Chongqing, Nordeste, Gansu, Guizhou, Zhejiang, Hebei, Henan, Hubei, Hunan, Jiangxi, Ningbo, Ningxia, Qingdao, Shaanxi, Shanxi, Shandong, Xangai, Sichuan, Yunnan), Inglês, Japonês, Coreano, Russo, Francês, Alemão, Português, Tailandês, Indonésio, Vietnamita, Espanhol, Italiano, Malaio, Filipino e Árabe

CosyVoice

Determinados modelos CosyVoice aceitam marcação SSML (Speech Synthesis Markup Language) e leitura de fórmulas LaTeX.

ID do modelo

API

Clonagem de voz

Design de voz

Controle por instruções

cosyvoice-v3.5-plus

WebSocket

Supported

Supported

Supported

cosyvoice-v3.5-flash

WebSocket

Supported

Supported

Supported

cosyvoice-v3-plus

WebSocket

Supported

Supported

Unsupported

cosyvoice-v3-flash

WebSocket

Supported

Supported

Supported

cosyvoice-v2

WebSocket

Supported

Unsupported

Unsupported

Idiomas suportados (por versão):
  • cosyvoice-v3.5-plus e cosyvoice-v3.5-flash (sem vozes do sistema):
    • Vozes clonadas (dialetos configuráveis via controle por instruções): Chinês (Mandarim, Cantonês, Nordeste, Gansu, Guizhou, Henan, Hubei, Jiangxi, Hokkien, Ningxia, Shanxi, Shaanxi, Shandong, Xangai, Sichuan, Tianjin, Yunnan), Inglês, Francês, Alemão, Japonês, Coreano, Russo, Português, Tailandês, Indonésio e Vietnamita
    • Vozes projetadas: Chinês (Mandarim), Inglês
  • cosyvoice-v3-plus:
    • Vozes do sistema (varia conforme a voz): Chinês (Mandarim), Inglês
    • Vozes clonadas (dialetos configuráveis via controle por instruções): Chinês (Mandarim, Cantonês, Nordeste, Gansu, Guizhou, Henan, Hubei, Jiangxi, Hokkien, Ningxia, Shanxi, Shaanxi, Shandong, Xangai, Sichuan, Tianjin, Yunnan), Inglês, Francês, Alemão, Japonês, Coreano e Russo
    • Vozes projetadas: Chinês (Mandarim), Inglês
  • cosyvoice-v3-flash:
    • Vozes do sistema (varia conforme a voz; alguns dialetos têm suporte nativo pelas vozes do sistema, outros via controle por instruções): Chinês (Mandarim, Cantonês, Nordeste, Henan, Hunan, Shaanxi, Shandong, Sichuan, Anhui, Hokkien), Inglês
    • Vozes clonadas (dialetos configuráveis via controle por instruções): Chinês (Mandarim, Cantonês, Nordeste, Gansu, Guizhou, Henan, Hubei, Jiangxi, Hokkien, Ningxia, Shanxi, Shaanxi, Shandong, Xangai, Sichuan, Tianjin, Yunnan), Inglês, Francês, Alemão, Japonês, Coreano, Russo, Português, Tailandês, Indonésio e Vietnamita
    • Vozes projetadas: Chinês (Mandarim), Inglês
  • cosyvoice-v2 (design de voz não suportado):
    • Vozes do sistema (varia conforme a voz): Chinês (Mandarim, Cantonês, Nordeste, Hokkien, Shaanxi), Inglês, Japonês e Coreano
    • Vozes clonadas: Chinês (Mandarim), Inglês

Qwen3-TTS

ID do modelo

API

Clonagem de voz

Design de voz

Controle por instruções

qwen3-tts-flash

HTTP

Unsupported

Unsupported

Unsupported

qwen3-tts-flash-2025-11-27

HTTP

Unsupported

Unsupported

Unsupported

qwen3-tts-flash-2025-09-18

HTTP

Unsupported

Unsupported

Unsupported

qwen3-tts-flash-realtime

WebSocket

Unsupported

Unsupported

Unsupported

qwen3-tts-flash-realtime-2025-11-27

WebSocket

Unsupported

Unsupported

Unsupported

qwen3-tts-flash-realtime-2025-09-18

WebSocket

Unsupported

Unsupported

Unsupported

qwen3-tts-instruct-flash

HTTP

Unsupported

Unsupported

Supported

qwen3-tts-instruct-flash-2026-01-26

HTTP

Unsupported

Unsupported

Supported

qwen3-tts-instruct-flash-realtime

WebSocket

Unsupported

Unsupported

Supported

qwen3-tts-instruct-flash-realtime-2026-01-22

WebSocket

Unsupported

Unsupported

Supported

qwen3-tts-vc-2026-01-22

HTTP

Supported

Unsupported

Unsupported

qwen3-tts-vc-realtime-2026-01-15

WebSocket

Supported

Unsupported

Unsupported

qwen3-tts-vc-realtime-2025-11-27

WebSocket

Supported

Unsupported

Unsupported

qwen3-tts-vd-2026-01-26

HTTP

Unsupported

Supported

Unsupported

qwen3-tts-vd-realtime-2026-01-15

WebSocket

Unsupported

Supported

Unsupported

qwen3-tts-vd-realtime-2025-12-16

WebSocket

Unsupported

Supported

Unsupported

Idiomas suportados (por versão):
  • Série Qwen3-TTS-Flash (vozes do sistema) (qwen3-tts-flash, qwen3-tts-flash-2025-11-27, qwen3-tts-flash-2025-09-18, qwen3-tts-flash-realtime, qwen3-tts-flash-realtime-2025-11-27, qwen3-tts-flash-realtime-2025-09-18): Chinês (Mandarim, Pequim, Xangai, Sichuan, Nanjing, Shaanxi, Hokkien, Tianjin, Cantonês — varia conforme a voz), Inglês, Alemão, Italiano, Português, Espanhol, Japonês, Coreano, Francês e Russo
  • Série Qwen3-TTS-Instruct-Flash (vozes do sistema) (qwen3-tts-instruct-flash, qwen3-tts-instruct-flash-2026-01-26, qwen3-tts-instruct-flash-realtime, qwen3-tts-instruct-flash-realtime-2026-01-22): Chinês (Mandarim), Inglês, Alemão, Italiano, Português, Espanhol, Japonês, Coreano, Francês e Russo
  • Série Qwen3-TTS-VC (clonagem de voz) (qwen3-tts-vc-2026-01-22, qwen3-tts-vc-realtime-2026-01-15, qwen3-tts-vc-realtime-2025-11-27): Chinês (Mandarim), Inglês, Alemão, Italiano, Português, Espanhol, Japonês, Coreano, Francês e Russo
  • Série Qwen3-TTS-VD (design de voz) (qwen3-tts-vd-2026-01-26, qwen3-tts-vd-realtime-2026-01-15, qwen3-tts-vd-realtime-2025-12-16): Chinês (Mandarim), Inglês, Alemão, Italiano, Português, Espanhol, Japonês, Coreano, Francês e Russo

Qwen-TTS (legado, faturamento baseado em tokens)

Os modelos legados do Qwen-TTS listados abaixo utilizam faturamento baseado em tokens. Caso tenha migrado para o Qwen3-TTS, utilize os modelos recomendados anteriormente neste tópico.

ID do modelo

API

Descrição

qwen-tts

HTTP

Síntese sem streaming, faturamento baseado em tokens

qwen-tts-latest

HTTP

Síntese sem streaming, faturamento baseado em tokens

qwen-tts-2025-05-22

HTTP

Versão snapshot, faturamento baseado em tokens

qwen-tts-2025-04-10

HTTP

Versão snapshot, faturamento baseado em tokens

qwen-tts-realtime

WebSocket

Síntese com streaming, faturamento baseado em tokens

qwen-tts-realtime-latest

WebSocket

Síntese com streaming, faturamento baseado em tokens

qwen-tts-realtime-2025-07-15

WebSocket

Versão snapshot, síntese com streaming, faturamento baseado em tokens

Idiomas suportados (por versão):
  • Série Qwen-TTS (vozes do sistema) (qwen-tts, qwen-tts-latest, qwen-tts-2025-05-22, qwen-tts-2025-04-10): Chinês (Mandarim, Pequim, Xangai, Sichuan — varia conforme a voz), Inglês, Alemão, Italiano, Português, Espanhol, Japonês, Coreano, Francês e Russo
  • Série Qwen-TTS-Realtime (vozes do sistema) (qwen-tts-realtime, qwen-tts-realtime-latest, qwen-tts-realtime-2025-07-15): Chinês (Mandarim), Inglês, Alemão, Italiano, Português, Espanhol, Japonês, Coreano, Francês e Russo
Plano de Tokens
Playground de Modelos
Inferência do Modelo
Avaliação
Compressão de Modelos
Estatísticas e Monitoramento
Suporte