O qwen3-livetranslate-flash traduz arquivos de áudio e vídeo em 18 idiomas. Ele aceita entrada de áudio ou vídeo e retorna texto traduzido, áudio sintetizado ou ambos por meio de uma API de streaming. Para entradas de vídeo, o contexto visual melhora a precisão da tradução (por exemplo, distingue "máscara cirúrgica" de "máscara de baile" com base nos quadros do vídeo).
Antes de começar
- Crie uma chave de API.
- Configure a chave de API como variável de ambiente.
- (Opcional) Caso utilize o SDK da OpenAI, instale o SDK.
Início rápido
Todos os exemplos usam a API de streaming compatível com a OpenAI. Defina os idiomas de origem e destino por meio de translation_options. A entrada padrão é áudio; descomente o bloco de entrada de vídeo em cada exemplo para traduzir arquivos de vídeo.
Especifique source_lang aumenta a precisão. Omita esse parâmetro para ativar a detecção automática de idioma.
Parâmetros da solicitação
Entrada
O array messages deve conter exatamente uma mensagem com role definido como user. O campo content armazena o áudio ou vídeo a traduzir:
- Áudio: Defina
typecomoinput_audio. Forneça a URL do arquivo ou os dados codificados em Base64 eminput_audio.datae especifique o formato (por exemplo,wav) eminput_audio.format. - Vídeo: Configure
typecomovideo_url. Informe a URL do arquivo emvideo_url.url.
Opções de tradução
Especifique os idiomas de origem e destino no parâmetro translation_options:
translation_options não é um parâmetro padrão da OpenAI. Passe-o por meio de extra_body:
Modalidade de saída
Controle o formato de saída com o parâmetro modalities:
**Valor de | Saída |
|---|---|
| Apenas texto traduzido |
| Texto traduzido e áudio sintetizado codificado em Base64 |
audio. Consulte Vozes compatíveis para ver as opções disponíveis.
Restrições
- Apenas turno único: O modelo processa uma tradução por solicitação. Não há suporte para conversas com múltiplos turnos.
- Sem mensagem de sistema: Não há suporte para a função
system. - Apenas streaming: Somente a saída de streaming compatível com a OpenAI tem suporte.
Analisar a resposta
Cada objeto chunk do streaming contém:
- Texto:
chunk.choices[0].delta.content - Áudio:
chunk.choices[0].delta.audio["data"](codificado em Base64, taxa de amostragem de 24 kHz)
Salvar áudio em um arquivo
Concatene todos os fragmentos de áudio em Base64 do fluxo e, após a conclusão do streaming, decodifique e salve o resultado.
Python
Node.js
Reprodução em tempo real
Decodifique cada fragmento Base64 ao recebê-lo e reproduza-o diretamente. Essa abordagem requer bibliotecas de áudio específicas para cada plataforma.
Python
Instale pyaudio primeiro:
Plataforma | Instalação |
|---|---|
macOS |
|
Ubuntu / Debian |
|
CentOS |
|
Windows |
|
Node.js
Instale as dependências primeiro:
Plataforma | Instalação |
|---|---|
macOS |
|
Ubuntu / Debian |
|
Windows |
|
Faturamento
- Áudio
- Vídeo
Detalhes do modelo
Modelo | Versão | Janela de contexto | Entrada máxima | Saída máxima |
|---|---|---|---|---|
qwen3-livetranslate-flash | Estável | 53.248 tokens | 49.152 tokens | 4.096 tokens |
qwen3-livetranslate-flash-2025-12-01 | Snapshot | 53.248 tokens | 49.152 tokens | 4.096 tokens |
Atualmente, o qwen3-livetranslate-flash tem as mesmas capacidades do qwen3-livetranslate-flash-2025-12-01.
Idiomas compatíveis
Use estes códigos de idioma para source_lang e target_lang. Alguns idiomas de destino aceitam apenas saída de texto.
Código do idioma | Idioma | Saída compatível |
|---|---|---|
en | Inglês | Áudio, texto |
zh | Chinês | Áudio, texto |
ru | Russo | Áudio, texto |
fr | Francês | Áudio, texto |
de | Alemão | Áudio, texto |
pt | Português | Áudio, texto |
es | Espanhol | Áudio, texto |
it | Italiano | Áudio, texto |
id | Indonésio | Texto |
ko | Coreano | Áudio, texto |
ja | Japonês | Áudio, texto |
vi | Vietnamita | Texto |
th | Tailandês | Texto |
ar | Árabe | Texto |
yue | Cantonês | Áudio, texto |
hi | Hindi | Texto |
el | Grego | Texto |
tr | Turco | Texto |
Vozes compatíveis
Defina o parâmetro voice em audio quando a saída incluir áudio sintetizado.
Nome da voz | **Parâmetro | Descrição | Idiomas compatíveis |
|---|---|---|---|
Cherry | Cherry | Uma jovem alegre, amigável e autêntica. | Chinês, inglês, francês, alemão, russo, italiano, espanhol, português, japonês, coreano |
Nofish | Nofish | Um designer que tem dificuldade em pronunciar consoantes retroflexas. | Chinês, inglês, francês, alemão, russo, italiano, espanhol, português, japonês, coreano |
Shanghai-Jada | Jada | Uma senhora de Xangai agitada e enérgica. | Chinês |
Beijing-Dylan | Dylan | Um jovem que cresceu nos hutongs de Pequim. | Chinês |
Sichuan-Sunny | Sunny | Uma doce garota de Sichuan. | Chinês |
Tianjin-Peter | Peter | Uma voz no estilo de um artista de crosstalk de Tianjin (o papel coadjuvante). | Chinês |
Cantonese-Kiki | Kiki | Uma doce melhor amiga de Hong Kong. | Cantonês |
Sichuan-Eric | Eric | Um homem de Chengdu, Sichuan, não convencional e que se destaca da multidão. | Chinês |
Perguntas frequentes
Quando insiro um arquivo de vídeo, qual conteúdo é traduzido?
O modelo traduz a faixa de áudio do vídeo. As informações visuais melhoram a precisão da tradução.
Por exemplo, se o áudio disser "Isso é uma máscara":
- Se o vídeo mostrar uma máscara cirúrgica, o modelo traduzirá como "Isso é uma máscara cirúrgica".
- Caso o vídeo exiba uma máscara de baile, a tradução será "Isso é uma máscara de baile".