Skip to main content
Speech synthesis

Síntese de fala não em tempo real

A síntese de fala não em tempo real converte texto em áudio por meio da API HTTP. Esse recurso atende a cenários que toleram maior latência, como produção de audiolivros, narração para educação online e criação de conteúdo. Ele oferece suporte a uma ampla variedade de vozes, múltiplos idiomas, clonagem de voz e design de voz.

Visão geral

Converta textos completos em arquivos de áudio pela API HTTP. Dois modos de saída estão disponíveis: sem streaming e com streaming.
  • O modo sem streaming retorna uma URL de arquivo de áudio válida por 24 horas; o modo com streaming retorna dados de áudio em blocos.
  • Há suporte para vários idiomas, incluindo dialetos do chinês.
  • Compatível com Voice cloning e Voice Design para criação de vozes personalizadas.
  • Permite o uso de Instruction control para controlar a expressividade da fala por meio de instruções em linguagem natural.
Para cenários de streaming com baixa latência, consulte Real-time speech synthesis. Para recomendações sobre a escolha de modelos, veja Speech synthesis. O áudio sintetizado na página de design de voz no console do Model Studio serve apenas para pré-visualização online e não pode ser baixado diretamente como arquivo. Para obter o arquivo de áudio, chame a API ou utilize o SDK. No modo sem streaming, a resposta inclui uma URL de arquivo de áudio válida por 24 horas.

Pré-requisitos

Antes de começar, conclua as seguintes preparações:

Início rápido

As abas a seguir demonstram a síntese de fala para cada série de modelos. Para mais exemplos de código em diferentes linguagens e descrições detalhadas dos parâmetros, consulte API reference.
  • Qwen-TTS
Todos os exemplos nesta seção utilizam system voices.
  • Saída sem streaming
  • Saída com streaming
No modo sem streaming, a resposta inclui um campo url que aponta para o arquivo de áudio sintetizado. A URL tem validade de 24 horas.
  • Python
  • Java
  • cURL
import os
import dashscope

# The following is the configuration for the Singapore region.
dashscope.base_http_api_url = 'https://dashscope-intl.aliyuncs.com/api/v1'

text = "Today is a wonderful day to build something people love!"
# Interface usage: dashscope.MultiModalConversation.call(...)
response = dashscope.MultiModalConversation.call(
    # To use the instruction control feature, replace model with qwen3-tts-instruct-flash
    model="qwen3-tts-flash",
    # The API Keys for the Singapore and Beijing regions are different. Get an API Key: https://www.alibabacloud.com/help/zh/model-studio/get-api-key
    # If you have not configured the environment variable, replace the following line with your Model Studio API Key: api_key = "sk-xxx"
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    text=text,
    voice="Cherry",
    language_type="English", # We recommend matching this with the language of the text for correct pronunciation and natural intonation.
    # To use the instruction control feature, uncomment the lines below and replace model with qwen3-tts-instruct-flash
    # instructions='Fast-paced speech with noticeable upward intonation, ideal for presenting fashion products.',
    # optimize_instructions=True,
    stream=False
)
print(response)

Recursos avançados

Controle por instruções

Especificações de instruções por modelo:
  • Qwen-TTS
Modelos suportados: Apenas a série Qwen3-TTS-Instruct-Flash.Uso: Passe o conteúdo da instrução através do parâmetro instructions.Idiomas suportados para texto de instrução: Somente Chinês e Inglês.Limite de comprimento do texto de instrução: Até 1.600 tokens.

Dialetos

Esta seção explica como gerar fala em dialetos chineses (como o dialeto de Henan e o de Sichuan). O método de configuração depende do modelo e do tipo de voz.
  • Qwen-TTS
  • Vozes do sistema: Utilize vozes do sistema com suporte a dialetos. Consulte Qwen-TTS voice list.
  • Vozes clonadas: Sem suporte para dialetos.
  • Vozes desenhadas: Sem suporte para dialetos.
Dialetos suportados: Confira a seção "Idiomas suportados" de cada modelo em Qwen3-TTS.

Modelos e regiões suportados

  • Singapore
  • China (Beijing)
Utilize uma chave de API da região de Singapore para chamar os seguintes modelos:
  • Qwen-TTS:
    • Qwen3-TTS-Instruct-Flash: qwen3-tts-instruct-flash (versão estável, atualmente equivalente a qwen3-tts-instruct-flash-2026-01-26), qwen3-tts-instruct-flash-2026-01-26 (snapshot mais recente)
    • Qwen3-TTS-VD: qwen3-tts-vd-2026-01-26 (snapshot mais recente)
    • Qwen3-TTS-VC: qwen3-tts-vc-2026-01-22 (snapshot mais recente)
    • Qwen3-TTS-Flash: qwen3-tts-flash (versão estável, atualmente equivalente a qwen3-tts-flash-2025-11-27), qwen3-tts-flash-2025-11-27, qwen3-tts-flash-2025-09-18

Vozes do sistema suportadas

Cada modelo oferece suporte a um conjunto diferente de vozes. Defina o parâmetro de requisição voice com um valor da coluna parâmetro de voz nas tabelas a seguir.

Referência da API

Perguntas frequentes

P: Qual é a validade da URL do arquivo de áudio?

R: A URL do arquivo de áudio é válida por 24 horas após a geração. Quando a URL expirar, chame a API novamente para obter uma nova URL.
Plano de Tokens
Playground de Modelos
Inferência do Modelo
Avaliação
Compressão de Modelos
Estatísticas e Monitoramento
Suporte