Skip to main content
Tradução de áudio e vídeo em tempo real - Qwen-Livetranslate-Realtime

Eventos do cliente

Este tópico descreve os eventos do cliente para a API qwen3.5-livetranslate-flash-realtime.

Referência: Real-time audio and video translation - Qwen .

session.update

Envie este evento após estabelecer uma conexão WebSocket para atualizar a configuração padrão da sessão. O servidor valida os parâmetros e retorna um erro (se inválidos) ou a configuração atualizada (se válidos).
typestring(Obrigatório)Tipo de evento. Deve ser definido como session.update.
{
  "event_id": "event_ToPZqeobitzUJnt3QqtWg",
  "type": "session.update",
  "session": {
    "modalities": [
      "text",
      "audio"
    ],
    "voice": "Cherry",
    "sample_rate": 16000,
    "input_audio_format": "pcm",
    "output_audio_format": "pcm",
    "input_audio_transcription": {
      "model": "qwen3-asr-flash-realtime",
      "language": "zh"
    },
    "translation": {
      "language": "en",
      "corpus": {
        "phrases": {
          "人工智能": "Artificial Intelligence",
          "机器学习": "Machine Learning"
        }
      }
    }
  }
}
Exemplo com clonagem de voz ativada (frequency=once):
{
  "event_id": "event_ToPZqeobitzUJnt3QqtWg",
  "type": "session.update",
  "session": {
    "modalities": [
      "text",
      "audio"
    ],
    "voice": "default",
    "enable_voice_clone": true,
    "voice_clone_options": {
      "frequency": "once"
    },
    "sample_rate": 16000,
    "input_audio_format": "pcm",
    "output_audio_format": "pcm",
    "translation": {
      "language": "en"
    }
  }
}
sessionobject(Opcional)A configuração da sessão.

Propriedades

modalitiesarray(Opcional)Modalidades de saída. Valores válidos:
  • ["text"] Gera saída apenas em texto.
  • ["text","audio"] (Padrão) Gera saída em texto e áudio.
voicestring(Opcional)Voz para o áudio gerado. Quando a clonagem de voz está desativada, defina este campo como uma voz predefinida do sistema. Valores válidos: Supported voices. Valor padrão: Tina para Qwen3.5-LiveTranslate-Flash-Realtime ou Cherry para Qwen3-LiveTranslate-Flash-Realtime.
Quando enable_voice_clone é true, o valor de voice depende da configuração de frequency. Se frequency for once ou always, defina-o como default. Se frequency for never, defina-o como o ID da voz que você clonou anteriormente. O uso de uma voz predefinida do sistema neste caso causa um erro no servidor.
enable_voice_cloneboolean(Opcional)Indica se a clonagem de voz deve ser ativada. Valor padrão: false. Quando ativado, o modelo clona a voz do falante a partir do áudio de entrada para a saída traduzida. Nesse cenário, voice não aceita mais vozes predefinidas do sistema e deve ser definido como default ou como um ID de voz criado anteriormente por meio de Voice Clone API.voice_clone_optionsobject(Opcional)Opções de controle da clonagem de voz. Têm efeito somente quando enable_voice_clone é true.

Propriedades

voice_clone_options.frequencystring(Opcional)Frequência da clonagem de voz. Valores válidos:
  • never Desativa a clonagem de voz no servidor e utiliza uma voz que você clonou previamente. Defina voice com o ID da sua voz clonada.
  • once Clona a voz uma única vez no início da sessão e a reutiliza para todas as saídas subsequentes. Ideal para cenários com um único falante. Defina voice como default.
  • always Reclona a voz em tempo real antes de cada saída, adaptando-se dinamicamente ao áudio de entrada. Recomendado para cenários com múltiplos falantes. Defina voice como default.
sample_rateinteger(Opcional)Taxa de amostragem do áudio de entrada, em Hz. Valores válidos:
  • 8000
  • 16000 (Padrão)
input_audio_transcriptionobject(Opcional)Configuração para o áudio de entrada.

Propriedades

modelstring(Opcional)Modelo de reconhecimento de fala. Se configurado, o servidor retorna tanto o resultado do reconhecimento (texto original no idioma de origem) quanto a tradução por meio dos eventos conversation.item.input_audio_transcription.text e conversation.item.input_audio_transcription.completed.Valor válido: qwen3-asr-flash-realtime.languagestring(Opcional)Idioma de origem para tradução. Valores válidos: Supported languages. Caso não seja especificado, o modelo detecta automaticamente o idioma de origem.
input_audio_formatstring(Opcional)Formato do áudio de entrada. Valores válidos:
  • pcm (Padrão) Dados de áudio brutos não compactados.
  • opus Codec de áudio com perdas e suporte a baixa latência, adequado para cenários de VoIP.
output_audio_formatstring(Opcional)Formato do áudio de saída. Atualmente, este parâmetro só pode ser definido como pcm.turn_detectionobject(Opcional)Configuração de Detecção de Atividade de Voz (VAD), usada para controlar como o início e o fim da fala são detectados:
  • Definido como um objeto de configuração (padrão): Ativa o modo VAD. O servidor detecta automaticamente o início e o fim da fala, confirma o buffer de áudio e aciona as respostas de tradução. O cliente não precisa enviar eventos input_audio_buffer.commit.
  • Definido como null: Ativa o modo Manual. O cliente confirma manualmente o buffer de áudio enviando eventos input_audio_buffer.commit. O servidor começa a gerar respostas de tradução automaticamente ao receber a confirmação.

Propriedades

typestring(Opcional)Tipo de VAD. Deve ser definido como server_vad.thresholdfloat(Opcional)Sensibilidade da detecção de VAD. Um valor menor facilita o reconhecimento de sons fracos (incluindo ruído de fundo) como fala; um valor maior exige uma fala mais clara e alta para acionar a detecção.Intervalo de valores: [-1,0, 1,0]. Valor padrão: 0,2.silence_duration_msinteger(Opcional)Duração mínima de silêncio (em milissegundos) necessária após o término da fala. Ao ultrapassar essa duração, o servidor determina que a fala terminou, confirma automaticamente o buffer de áudio e aciona uma resposta de tradução.Intervalo de valores: [200, 6000]. Valor padrão: 1000.
translationobject(Opcional)Configuração de tradução.

Propriedades

languagestring(Opcional)Idioma de destino para tradução. Valores válidos: Supported languages. Valor padrão: en.corpusobject(Opcional)Configuração de palavras-chave para melhorar a precisão da tradução de termos específicos.

Propriedades

phrasesobject(Opcional)Mapeamento de palavras-chave. A chave é o termo no idioma de origem e o valor é sua tradução no idioma de destino.Exemplo: {"AI": "Artificial Intelligence"}

input_audio_buffer.append

Adiciona bytes de áudio ao buffer de áudio de entrada. O service utiliza esse buffer para detectar fala e determinar quando submetê-la.
typestring(Obrigatório)Tipo de evento. Deve ser definido como input_audio_buffer.append.
{
    "event_id": "event_xxx",
    "type": "input_audio_buffer.append",
    "audio": "xxx"
}
audiostring(Obrigatório)Dados de áudio codificados em Base64.

input_audio_buffer.commit

Confirma o buffer de áudio de entrada. Este evento só precisa ser enviado no modo Manual (turn_detection definido como null). No modo VAD, o servidor faz a confirmação automaticamente e o cliente não precisa enviar este evento. Ao receber este evento, o servidor retorna um evento input_audio_buffer.committed como confirmação e começa automaticamente a gerar uma resposta de tradução (nenhum evento adicional é necessário para acionar a resposta). Se o buffer de áudio estiver vazio, o servidor retorna um evento de erro.
typestring(Obrigatório)Tipo de evento. Deve ser definido como input_audio_buffer.commit.
{
    "event_id": "event_xxx",
    "type": "input_audio_buffer.commit"
}

input_audio_buffer.clear

Limpa os dados de áudio não confirmados do buffer de áudio de entrada.
typestring(Obrigatório)Tipo de evento. Deve ser definido como input_audio_buffer.clear.
{
    "event_id": "event_xxx",
    "type": "input_audio_buffer.clear"
}

input_image_buffer.append

Adiciona dados de imagem ao buffer de imagens a partir de um arquivo local ou fluxo de vídeo em tempo real. Limites para entrada de imagem:
  • Formato da imagem: JPG ou JPEG. Resolução recomendada para melhor desempenho: 480p ou 720p (máximo: 1080p).
  • Tamanho máximo da imagem: 500 KB (antes da codificação Base64).
  • Os dados da imagem devem estar codificados em Base64.
  • Frequência máxima: 2 imagens por segundo.
  • Envie pelo menos um evento input_audio_buffer.append antes de enviar input_image_buffer.append.
typestring(Obrigatório)Tipo de evento. Deve ser definido como input_image_buffer.append.
{
    "event_id": "event_xxx",
    "type": "input_image_buffer.append",
    "image": "xxx"
}
imagestring(Obrigatório)Dados de imagem codificados em Base64.

session.finish

Envie este evento para encerrar a sessão atual. Respostas do servidor: O cliente deve desconectar após receber session.finished.
typestring(Obrigatório)Tipo de evento. Deve ser definido como session.finish.
{
    "event_id": "event_xxx",
    "type": "session.finish"
}
Referência da API de Geração de Texto
Geração de Imagens
  • FAQ
Geração de Vídeo
Áudio
API em tempo real
Incorporação de Texto
Produção de Modelos