O modelo qwen3-livetranslate-flash traduz áudio e vídeo pelo endpoint de chat completions compatível com OpenAI. Todas as requisições usam streaming.
Nota: A interface DashScope não tem suporte.
Modelos compatíveis
qwen3-livetranslate-flashqwen3-livetranslate-flash-2025-12-01
Pré-requisitos
Antes de começar, conclua as etapas a seguir:
- Crie uma chave de API
- Configure a chave de API como variável de ambiente
- Instale o SDK da OpenAI (para Python ou Node.js)
Endpoints
Região | SDKbase_url | Endpoint HTTP |
|---|---|---|
Singapura |
|
|
Pequim |
|
|
{WorkspaceId} pelo seu ID do workspace real.
Início rápido
Os exemplos a seguir traduzem um arquivo de áudio e retornam texto traduzido e áudio via streaming. Substitua o base_url se usar a região de Pequim.
Python
Node.js
curl
Entrada de vídeo
Para traduzir vídeo em vez de áudio, defina o tipo de conteúdo como video_url:
Corpo da requisição
Parâmetros obrigatórios
Parâmetro | Tipo | Descrição |
|---|---|---|
| string | Nome do modelo. Valores válidos: |
| array | Array de mensagens. Apenas uma mensagem de usuário tem suporte. |
| boolean | Deve ser |
| object | Configuração de tradução. Consulte Opções de tradução. Este é um parâmetro fora do padrão OpenAI. No SDK Python, passe-o dentro de |
Parâmetros opcionais
Parâmetro | Tipo | Padrão | Descrição |
|---|---|---|---|
| array |
| Modalidade de saída. Defina como |
| object | - | Configuração do áudio de saída. Obrigatório quando |
| object | - | Configuração de streaming. Consulte Opções de streaming. |
| integer | Máximo do modelo | Número máximo de tokens a gerar. A geração para neste limite ou ao concluir. |
| integer | - | Semente aleatória para reprodutibilidade. A mesma semente produz saída idêntica para requisições idênticas. Intervalo: |
| float | 1.0 | Controla a velocidade do áudio de saída. 1.0 é a velocidade normal; valores menores que 1.0 tornam o áudio mais lento e maiores que 1.0, mais rápido. Intervalo: [0.5, 2.0]. |
Parâmetros de amostragem
Para garantir a precisão da tradução, mantenha estes parâmetros com os valores padrão.
Parâmetro | Tipo | Padrão | Intervalo | Observações |
|---|---|---|---|---|
| float | 0.000001 | [0, 2) | Controla a diversidade da saída. |
| float | 0.8 | (0, 1.0] | Limiar de amostragem de núcleo. |
| float | 0 | [-2.0, 2.0] | Reduz repetições quando positivo. |
| integer | 1 | >= 0 | Tamanho do conjunto de candidatos. Se o valor for |
| float | 1.05 | > 0 | Penaliza sequências repetidas. Parâmetro fora do padrão OpenAI. SDK Python: use |
Objeto de mensagem
O array messages deve conter exatamente um objeto com role definido como user.
Propriedades dos itens do arraycontent:
Campo | Tipo | Obrigatório | Descrição |
|---|---|---|---|
| string | Sim |
|
| object | Quando | Entrada de áudio. Veja abaixo. |
| object | Quando | Entrada de vídeo. Veja abaixo. |
Campo | Tipo | Obrigatório | Descrição |
|---|---|---|---|
| string | Sim | URL do arquivo de áudio ou URL de dados Base64. Para arquivos locais, consulte Inserir um arquivo local codificado em Base64. |
| string | Sim | Formato de áudio, como |
Campo | Tipo | Obrigatório | Descrição |
|---|---|---|---|
| string | Sim | URL pública do arquivo de vídeo ou URL de dados Base64. Para arquivos locais, consulte Inserir um arquivo local codificado em Base64. |
Opções de tradução
Campo | Tipo | Obrigatório | Descrição |
|---|---|---|---|
| string | Não | Nome completo em inglês do idioma de origem. Consulte Idiomas compatíveis. Se omitido, o sistema detecta o idioma automaticamente. |
| string | Sim | Nome completo em inglês do idioma de destino. Consulte Idiomas compatíveis. |
Nota:translation_optionsé um parâmetro fora do padrão OpenAI. No SDK Python, passe-o dentro deextra_body. Em Node.js ou HTTP, passe-o no nível superior do corpo da requisição.
Opções de saída de áudio
Obrigatório quando modalities é ["text", "audio"].
Campo | Tipo | Obrigatório | Descrição |
|---|---|---|---|
| string | Sim | Voz para o áudio de saída. Consulte Vozes compatíveis. |
| string | Sim | Formato do áudio de saída. Apenas |
Opções de streaming
Campo | Tipo | Padrão | Descrição |
|---|---|---|---|
| boolean |
| Quando |
Resposta
A API retorna uma série de chunks em streaming, cada um como um objeto chat.completion.chunk. Os chunks dividem-se em três categorias: texto, áudio e uso de tokens.
Chunk de texto
Contém texto traduzido incremental em choices[0].delta.content:
Chunk de áudio
Contém áudio incremental codificado em Base64 em choices[0].delta.audio.data:
Chunk de uso de tokens
Retornado como o último chunk quando include_usage é true. O array choices está vazio e usage contém o detalhamento dos tokens:
Nota: Para entrada de vídeo,prompt_tokens_details.audio_tokensinclui os tokens de áudio extraídos do vídeo.video_tokensinforma a contagem de tokens específicos do vídeo.
Campos da resposta
Campo | Tipo | Descrição |
|---|---|---|
| string | Identificador da requisição. Idêntico em todos os chunks. |
| array | Conteúdo gerado. Vazio no chunk final de uso. |
| string | Texto traduzido incremental. |
| object | Dados de áudio incrementais. |
| string | Segmento de áudio codificado em Base64. |
| string | Identificador único do áudio de saída. |
| integer | Timestamp de criação da requisição. |
| string | Função da mensagem. Presente apenas no primeiro chunk. |
| string |
|
| integer | Sempre |
| integer | Timestamp Unix da requisição. Idêntico em todos os chunks. |
| string | Nome do modelo. |
| string | Sempre |
| object | Consumo de tokens. Presente apenas no último chunk quando |
| integer | Total de tokens de entrada. |
| integer | Total de tokens de saída. |
| integer | Soma de |
| integer | Tokens de áudio de saída. |
| integer | Tokens de texto de saída. |
| integer | Tokens de áudio de entrada. Para entrada de vídeo, inclui o áudio extraído do vídeo. |
| integer | Tokens de texto de entrada. Sempre |
| integer | Tokens de vídeo de entrada. Presente apenas para entrada de vídeo. |
Campos fixos como null
Os campos a seguir estão presentes na resposta para compatibilidade com OpenAI, mas sempre retornam null:
reasoning_content, function_call, refusal, tool_calls, logprobs, service_tier, system_fingerprint
Notas de uso
- Apenas streaming. Defina
streamcomotrue. Chamadas sem streaming não têm suporte. - Mensagem única. O array
messagesaceita apenas uma mensagem de usuário. - Parâmetros fora do padrão.
translation_options,top_kerepetition_penaltynão fazem parte da API padrão da OpenAI. SDK Python: passe emextra_body. Node.js/HTTP: inclua no nível superior. - Padrões de amostragem. Os valores padrão para
temperature,top_p,top_k,presence_penaltyerepetition_penaltysão otimizados para precisão na tradução. Alterá-los pode reduzir a qualidade. - Formato do áudio de saída. Apenas
wavtem suporte. - Detecção automática de idioma. Se você omitir
source_lang, o sistema detectará o idioma de entrada automaticamente.
Referências
- Visão geral da tradução de áudio e vídeo
- Vozes compatíveis
- Idiomas compatíveis
- Seleção de modelo
- Crie uma chave de API
- Configure a chave de API como variável de ambiente
- Instale o SDK
- Inserir um arquivo local codificado em Base64