Este tópico descreve os eventos do cliente para a API qwen3.5-livetranslate-flash-realtime.
Referência: Real-time audio and video translation - Qwen .
session.update
Envie este evento após estabelecer uma conexão WebSocket para atualizar a configuração padrão da sessão. O servidor valida os parâmetros e retorna um erro (se inválidos) ou a configuração atualizada (se válidos).
typestring(Obrigatório)Tipo de evento. Deve ser definido como session.update. | frequency=once): |
sessionobject(Opcional)A configuração da sessão.
Propriedades modalities array(Opcional)Modalidades de saída. Valores válidos:
string(Opcional)Voz para o áudio gerado. Quando a clonagem de voz está desativada, defina este campo como uma voz predefinida do sistema. Valores válidos: Supported voices. Valor padrão: Tina para Qwen3.5-LiveTranslate-Flash-Realtime ou Cherry para Qwen3-LiveTranslate-Flash-Realtime.Quandoenable_voice_clone boolean(Opcional)Indica se a clonagem de voz deve ser ativada. Valor padrão: false. Quando ativado, o modelo clona a voz do falante a partir do áudio de entrada para a saída traduzida. Nesse cenário, voice não aceita mais vozes predefinidas do sistema e deve ser definido como default ou como um ID de voz criado anteriormente por meio de Voice Clone API.voice_clone_optionsobject(Opcional)Opções de controle da clonagem de voz. Têm efeito somente quando enable_voice_clone é true.
Propriedades voice_clone_options.frequency string(Opcional)Frequência da clonagem de voz. Valores válidos:
integer(Opcional)Taxa de amostragem do áudio de entrada, em Hz. Valores válidos:
object(Opcional)Configuração para o áudio de entrada.
Propriedades model string(Opcional)Modelo de reconhecimento de fala. Se configurado, o servidor retorna tanto o resultado do reconhecimento (texto original no idioma de origem) quanto a tradução por meio dos eventos conversation.item.input_audio_transcription.text e conversation.item.input_audio_transcription.completed.Valor válido: qwen3-asr-flash-realtime.languagestring(Opcional)Idioma de origem para tradução. Valores válidos: Supported languages. Caso não seja especificado, o modelo detecta automaticamente o idioma de origem.string(Opcional)Formato do áudio de entrada. Valores válidos:
string(Opcional)Formato do áudio de saída. Atualmente, este parâmetro só pode ser definido como pcm.turn_detectionobject(Opcional)Configuração de Detecção de Atividade de Voz (VAD), usada para controlar como o início e o fim da fala são detectados:
Propriedades type string(Opcional)Tipo de VAD. Deve ser definido como server_vad.thresholdfloat(Opcional)Sensibilidade da detecção de VAD. Um valor menor facilita o reconhecimento de sons fracos (incluindo ruído de fundo) como fala; um valor maior exige uma fala mais clara e alta para acionar a detecção.Intervalo de valores: [-1,0, 1,0]. Valor padrão: 0,2.silence_duration_msinteger(Opcional)Duração mínima de silêncio (em milissegundos) necessária após o término da fala. Ao ultrapassar essa duração, o servidor determina que a fala terminou, confirma automaticamente o buffer de áudio e aciona uma resposta de tradução.Intervalo de valores: [200, 6000]. Valor padrão: 1000.object(Opcional)Configuração de tradução.
Propriedades language string(Opcional)Idioma de destino para tradução. Valores válidos: Supported languages. Valor padrão: en.corpusobject(Opcional)Configuração de palavras-chave para melhorar a precisão da tradução de termos específicos.
Propriedades phrases object(Opcional)Mapeamento de palavras-chave. A chave é o termo no idioma de origem e o valor é sua tradução no idioma de destino.Exemplo: {"AI": "Artificial Intelligence"} |
input_audio_buffer.append
Adiciona bytes de áudio ao buffer de áudio de entrada. O service utiliza esse buffer para detectar fala e determinar quando submetê-la.
typestring(Obrigatório)Tipo de evento. Deve ser definido como input_audio_buffer.append. | |
audiostring(Obrigatório)Dados de áudio codificados em Base64. |
input_audio_buffer.commit
Confirma o buffer de áudio de entrada. Este evento só precisa ser enviado no modo Manual (turn_detection definido como null). No modo VAD, o servidor faz a confirmação automaticamente e o cliente não precisa enviar este evento.
Ao receber este evento, o servidor retorna um evento input_audio_buffer.committed como confirmação e começa automaticamente a gerar uma resposta de tradução (nenhum evento adicional é necessário para acionar a resposta). Se o buffer de áudio estiver vazio, o servidor retorna um evento de erro.
typestring(Obrigatório)Tipo de evento. Deve ser definido como input_audio_buffer.commit. |
input_audio_buffer.clear
Limpa os dados de áudio não confirmados do buffer de áudio de entrada.
typestring(Obrigatório)Tipo de evento. Deve ser definido como input_audio_buffer.clear. |
input_image_buffer.append
Adiciona dados de imagem ao buffer de imagens a partir de um arquivo local ou fluxo de vídeo em tempo real.
Limites para entrada de imagem:
- Formato da imagem: JPG ou JPEG. Resolução recomendada para melhor desempenho: 480p ou 720p (máximo: 1080p).
- Tamanho máximo da imagem: 500 KB (antes da codificação Base64).
- Os dados da imagem devem estar codificados em Base64.
- Frequência máxima: 2 imagens por segundo.
- Envie pelo menos um evento input_audio_buffer.append antes de enviar input_image_buffer.append.
typestring(Obrigatório)Tipo de evento. Deve ser definido como input_image_buffer.append. | |
imagestring(Obrigatório)Dados de imagem codificados em Base64. |
session.finish
Envie este evento para encerrar a sessão atual. Respostas do servidor:
- Se fala for detectada: O servidor conclui o reconhecimento de fala, envia conversation.item.input_audio_transcription.completed com o resultado do reconhecimento e, em seguida, envia session.finished para indicar o fim da sessão.
- Se nenhuma fala for detectada: O servidor envia session.finished diretamente.
typestring(Obrigatório)Tipo de evento. Deve ser definido como session.finish. |