Pré-requisitos
Requer o DashScope Python SDK 1.25.11 ou posterior.
Primeiros passos
Parâmetros de solicitação
Defina estes parâmetros no construtor QwenTtsRealtime:
Parâmetro | Tipo | Obrigatório | Descrição |
|---|---|---|---|
model | str | Sim | Nome do modelo (consulte Modelos compatíveis). |
url | str | Sim | China (Pequim): Singapura: |
Parâmetro | Tipo | Obrigatório | Descrição |
|---|---|---|---|
voice | str | Sim | Voz usada na síntese de fala. Para mais informações, consulte Vozes compatíveis. Há suporte a vozes do sistema e personalizadas:
|
language_type | str | Não | Define o idioma do áudio sintetizado. O valor padrão é
|
mode | str | Não | Modo de interação. Valores válidos:
|
format | str | Não | Formato da saída de áudio do modelo. Formatos compatíveis:
Qwen-TTS-Realtime (consulte Modelos compatíveis) aceita apenas |
sample_rate | int | Não | Taxa de amostragem da saída de áudio do modelo, em Hz. Taxas de amostragem compatíveis:
Qwen-TTS-Realtime (consulte Modelos compatíveis) aceita apenas 24000. |
speech_rate | float | Não | Velocidade da fala do áudio. O valor 1,0 representa a velocidade normal. Valores menores que 1,0 tornam a fala mais lenta; valores maiores que 1,0 a tornam mais rápida. Valor padrão: 1,0. Intervalo válido: [0,5, 2,0]. Qwen-TTS-Realtime (consulte Modelos compatíveis) não aceita este parâmetro. |
volume | int | Não | Volume do áudio. Valor padrão: 50. Intervalo válido: [0, 100]. Qwen-TTS-Realtime (consulte Modelos compatíveis) não aceita este parâmetro. |
pitch_rate | float | Não | Tom do áudio sintetizado. Valor padrão: 1,0. Intervalo válido: [0,5, 2,0]. Qwen-TTS-Realtime (consulte Modelos compatíveis) não aceita este parâmetro. |
bit_rate | int | Não | Define a taxa de bits do áudio em kbps. Uma taxa de bits maior resulta em melhor qualidade de áudio e tamanho de arquivo maior. Este parâmetro está disponível apenas quando o formato de áudio ( Valor padrão: 128. Intervalo válido: [6, 510]. Qwen-TTS-Realtime (consulte Modelos compatíveis) não aceita este parâmetro. |
instructions | str | Não | Define as instruções. Para mais informações, consulte Síntese de fala em tempo real - Qwen. Valor padrão: None. O parâmetro permanece inativo se não for definido. Limite de comprimento: Não pode exceder 1600 tokens. Idiomas aceitos: Apenas chinês e inglês. Escopo: Disponível apenas para a série de modelos Qwen3-TTS-Instruct-Flash-Realtime. |
optimize_instructions | bool | Não | Define se as Valor padrão: False Comportamento: Quando definido como True, o sistema aprimora e reescreve semanticamente as Cenários: Recomendado para cenários que exigem expressão vocal de alta qualidade e granularidade fina. Dependência: Depende da definição do parâmetro Escopo: Disponível apenas para a série de modelos Qwen3-TTS-Instruct-Flash-Realtime. |
Principais interfaces
Classe QwenTtsRealtime
Importação: from dashscope.audio.qwen_tts_realtime import QwenTtsRealtime
| Assinatura do método | Eventos de resposta do servidor (entregues via callback) | Descrição |
|---|---|---|
session.createdSessão criadasession.updated Configuração da sessão atualizada | Conecta ao servidor. | |
session.updatedConfiguração da sessão atualizada | Atualiza as configurações padrão da sessão. Para detalhes dos parâmetros, consulte Parâmetros de solicitação.Após a conexão, o servidor retorna configurações padrão de entrada e saída. Chame este método imediatamente após conectar para atualizar esses padrões.O servidor valida os parâmetros ao receber um evento session.update. Se a validação falhar, ele retorna um erro; caso contrário, atualiza a configuração da sessão. | |
| None | Adiciona um trecho de texto ao buffer de entrada na nuvem (armazenamento temporário para texto antes do envio).
| |
input_text_buffer.clearedLimpa o texto recebido pelo servidor | Exclui todo o texto no buffer da nuvem. | |
input_text_buffer.committedEnvia o texto e aciona a síntese de falaresponse.output_item.added Novo conteúdo de saída adicionadoresponse.content_part.added Novo conteúdo adicionado à mensagem do assistenteresponse.audio.delta Áudio incremental gerado pelo modeloresponse.audio.done Geração de áudio concluídaresponse.content_part.done Streaming de conteúdo de áudio para mensagem do assistente concluídoresponse.output_item.done Streaming de todo o item de saída para mensagem do assistente concluídoresponse.done Resposta concluída | Envia todo o texto no buffer da nuvem e sintetiza imediatamente. Retorna um erro se o buffer estiver vazio.
| |
session.finishedResposta concluída | Encerra a tarefa. | |
| None | Fecha a conexão. | |
| None | Obtém o ID da sessão da tarefa atual. | |
| None | Obtém o ID da resposta mais recente. | |
| None | Obtém o atraso até a chegada do primeiro pacote de áudio. |
Interface de callback (QwenTtsRealtimeCallback)
O servidor envia respostas e dados por meio de callbacks. Implemente métodos de callback para lidar com eles.
Importação: from dashscope.audio.qwen_tts_realtime import QwenTtsRealtimeCallback
| Método | Parâmetros | Valor de retorno | Descrição |
|---|---|---|---|
| None | None | Chamado quando a conexão com o servidor é estabelecida. | |
| message: Evento de resposta do servidor. | None | Inclui respostas de chamadas de API, texto gerado pelo modelo e áudio. Consulte Eventos do servidor. | |
| close_status_code: Código de status de fechamento do WebSocket.close_msg: Mensagem de fechamento do WebSocket. | None | Chamado após o servidor fechar a conexão. |