A síntese de fala não em tempo real converte texto em áudio por meio da API HTTP. Esse recurso atende a cenários que toleram maior latência, como produção de audiolivros, narração para educação online e criação de conteúdo. Ele oferece suporte a uma ampla variedade de vozes, múltiplos idiomas, clonagem de voz e design de voz.
Converta textos completos em arquivos de áudio pela API HTTP. Dois modos de saída estão disponíveis: sem streaming e com streaming.
Antes de começar, conclua as seguintes preparações:
As abas a seguir demonstram a síntese de fala para cada série de modelos. Para mais exemplos de código em diferentes linguagens e descrições detalhadas dos parâmetros, consulte API reference.
Especificações de instruções por modelo:
Esta seção explica como gerar fala em dialetos chineses (como o dialeto de Henan e o de Sichuan). O método de configuração depende do modelo e do tipo de voz.
Cada modelo oferece suporte a um conjunto diferente de vozes. Defina o parâmetro de requisição
R: A URL do arquivo de áudio é válida por 24 horas após a geração. Quando a URL expirar, chame a API novamente para obter uma nova URL.
Visão geral
Converta textos completos em arquivos de áudio pela API HTTP. Dois modos de saída estão disponíveis: sem streaming e com streaming.
- O modo sem streaming retorna uma URL de arquivo de áudio válida por 24 horas; o modo com streaming retorna dados de áudio em blocos.
- Há suporte para vários idiomas, incluindo dialetos do chinês.
- Compatível com Voice cloning e Voice Design para criação de vozes personalizadas.
- Permite o uso de Instruction control para controlar a expressividade da fala por meio de instruções em linguagem natural.
Pré-requisitos
Antes de começar, conclua as seguintes preparações:
- Configure an API key e set it as an environment variable
- (Opcional) Se você for chamar a API pelo DashScope SDK, install the latest SDK
Início rápido
As abas a seguir demonstram a síntese de fala para cada série de modelos. Para mais exemplos de código em diferentes linguagens e descrições detalhadas dos parâmetros, consulte API reference.
- Qwen-TTS
Todos os exemplos nesta seção utilizam system voices.
- Saída sem streaming
- Saída com streaming
No modo sem streaming, a resposta inclui um campo
url que aponta para o arquivo de áudio sintetizado. A URL tem validade de 24 horas.- Python
- Java
- cURL
Recursos avançados
Controle por instruções
Especificações de instruções por modelo:
- Qwen-TTS
Modelos suportados: Apenas a série Qwen3-TTS-Instruct-Flash.Uso: Passe o conteúdo da instrução através do parâmetro
instructions.Idiomas suportados para texto de instrução: Somente Chinês e Inglês.Limite de comprimento do texto de instrução: Até 1.600 tokens.Dialetos
Esta seção explica como gerar fala em dialetos chineses (como o dialeto de Henan e o de Sichuan). O método de configuração depende do modelo e do tipo de voz.
- Qwen-TTS
- Vozes do sistema: Utilize vozes do sistema com suporte a dialetos. Consulte Qwen-TTS voice list.
- Vozes clonadas: Sem suporte para dialetos.
- Vozes desenhadas: Sem suporte para dialetos.
Modelos e regiões suportados
- Singapore
- China (Beijing)
Utilize uma chave de API da região de Singapore para chamar os seguintes modelos:
-
Qwen-TTS:
- Qwen3-TTS-Instruct-Flash: qwen3-tts-instruct-flash (versão estável, atualmente equivalente a qwen3-tts-instruct-flash-2026-01-26), qwen3-tts-instruct-flash-2026-01-26 (snapshot mais recente)
- Qwen3-TTS-VD: qwen3-tts-vd-2026-01-26 (snapshot mais recente)
- Qwen3-TTS-VC: qwen3-tts-vc-2026-01-22 (snapshot mais recente)
- Qwen3-TTS-Flash: qwen3-tts-flash (versão estável, atualmente equivalente a qwen3-tts-flash-2025-11-27), qwen3-tts-flash-2025-11-27, qwen3-tts-flash-2025-09-18
Vozes do sistema suportadas
Cada modelo oferece suporte a um conjunto diferente de vozes. Defina o parâmetro de requisição voice com um valor da coluna parâmetro de voz nas tabelas a seguir.