Skip to main content
Toolkit/Framework

Compatível com OpenAI - Batch Chat

Para cenários sem exigência de tempo real, como anotação de dados e geração de conteúdo, a API Batch Chat oferece uma alternativa de baixo custo e alta concorrência que utiliza o mesmo método de chamada síncrona. Desconto de 50% disponível por tempo limitado.

Esta API aceita apenas o envio de requisições individuais. Para enviar múltiplas requisições simultaneamente, agrupe-as em um arquivo. Consulte OpenAI-compatible - Batch (file input) .

Como funciona

  1. Envio da requisição: O cliente envia uma requisição e estabelece uma conexão.
  2. Fila e espera: A requisição entra em fila enquanto o cliente mantém a conexão ativa.
  3. Retorno do resultado: Após o processamento, o servidor retorna o resultado completo pela conexão estabelecida.
    A conexão é encerrada com erro de timeout caso o tempo máximo de espera seja excedido.

Disponibilidade

  • China (Beijing)
  • Text generation models: qwen3.8-max, qwen3.8-flash, qwen3.7-max, qwen3.7-plus, qwen3.6-plus, qwen3.7-flash, qwen3.6-flash, qwen3.5-plus, qwen3.5-flash, qwen3-max, qwen-plus, qwen-flash, deepseek-v3.2
  • Image and video understanding models: qwen3.8-max, qwen3.8-flash, qwen3.7-plus, qwen3.6-plus, qwen3.7-flash, qwen3.6-flash, qwen3.5-plus, qwen3.5-flash, qwen3.5-omni-plus, qwen3-vl-plus, qwen3-vl-flash
  • No cenário de processamento em lote, o limite de tokens de contexto por requisição é de 256 K para os modelos qwen3.8-max, qwen3.8-flash, qwen3.7-max, qwen3.7-plus, qwen3.6-plus, qwen3.7-flash, qwen3.6-flash, qwen3.5-plus, qwen3.5-flash e qwen3.5-omni-plus.
  • Alguns modelos suportam o modo de raciocínio. Ative esse modo gera tokens de raciocínio e aumenta os custos.
  • Os modelos das séries qwen3.8, qwen3.7, qwen3.6 e qwen3.5 têm o modo de raciocínio ativado por padrão. Ao usar um modelo de raciocínio híbrido, defina explicitamente o parâmetro enable_thinking. Defina este parâmetro como true para ativar o modo ou false para desativá-lo.
  • No corpo da requisição JSONL, enable_thinking é um parâmetro de nível superior de body e deve estar no mesmo nível de model. Não o coloque dentro de extra_body.

Uso

Pré-requisitos

  • Ative o Alibaba Cloud Model Studio e obtenha uma API key.
    Configure the API key as an environment variable para reduzir o risco de vazamento.
  • Para usar o SDK da OpenAI, instale-o:
pip3 install -U openai

Etapa 1: Configure o endpoint da API

Mude da inferência em tempo real para a inferência em lote modificando o endpoint da API (base_url) conforme o método de chamada: SDK: Defina base_url como https://batch.dashscope.aliyuncs.com/compatible-mode/v1 HTTP: POST https://batch.dashscope.aliyuncs.com/compatible-mode/v1/chat/completions

Etapa 2: Fazer uma chamada

Os exemplos a seguir mostram como chamar a API Batch Chat. O timeout padrão é de 3600 segundos (1 hora); nenhuma configuração extra é necessária na maioria dos casos.
Intervalo de timeout personalizado: 60–3600 segundos.
  • Python
  • Java
  • Node.js
  • Go
  • C# (HTTP)
  • PHP (HTTP)
  • curl
Exemplo de requisição
import os
from openai import OpenAI

client = OpenAI(
   # If environment variable not set, replace with api_key="sk-xxx".
   # Avoid hard-coding API keys in production to reduce leak risk.
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    base_url="https://batch.dashscope.aliyuncs.com/compatible-mode/v1",  # Batch Chat API endpoint
).with_options(timeout=1800.0) # Timeout: 1800s (30 min). Max: 3600s.

completion = client.chat.completions.create(
    model="qwen-plus",
    messages=[
        {"role": "system", "content": "You are a helpful assistant."},
        {"role": "user", "content": "Who are you?"},
    ]
)
print(completion.choices[0].message.content)
Exemplo de resposta
I am Qwen, a large-scale language model from Alibaba Group. I can answer questions, create text such as stories, official documents, emails, and scripts, perform logical reasoning, write code, and more. I can also express opinions and play games. If you have any questions or need help, feel free to let me know!

Limitações

  • Tempo de espera: Espera síncrona máxima de 3600 segundos (1 hora). Timeout personalizado: 60–3600 segundos.
  • Limites de concorrência: Máximo de 10.000 requisições pendentes por modelo e por conta. Requisições excedentes são rejeitadas com código de erro. Novas requisições só são aceitas após a conclusão das pendentes.
  • Taxa de chamadas: Máximo de 1.000 QPS por conta ou 10.000 chamadas a cada 10 segundos.
    Apenas máximo teórico. A disponibilidade real depende da carga do sistema. Implemente lógica de nova tentativa.

Faturamento

  • Preço unitário: Faturamento baseado em tokens de entrada/saída em requisições bem-sucedidas. O preço de tabela corresponde ao preço da chamada em tempo real. Desconto de 50% disponível por tempo limitado no site oficial. Consulte Model list.
  • Escopo de faturamento: Apenas requisições bem-sucedidas são faturadas. Requisições com falha (erros de sistema ou timeouts) não geram cobrança.
  • A inferência em lote é um item de faturamento separado. Ela suporta AI general-purpose savings plan, mas não aceita descontos, como subscription (outros planos de economia) ou free quotas for new users. Também não suporta recursos como context cache.
  • Alguns modelos, como qwen3.5-plus e qwen3.5-flash, têm o modo de raciocínio ativado por padrão. Esse modo gera tokens adicionais de raciocínio, cobrados pelo preço de tokens de saída, o que aumenta os custos. Para controlar despesas, defina o parâmetro enable_thinking conforme a complexidade da tarefa. Para mais informações, consulte Deep thinking.

Códigos de erro

Se a chamada do modelo falhar e retornar uma mensagem de erro, consulte Error codes para resolução.

FAQ

  1. Existe diferença no tempo de requisição entre o Batch Chat e a API em tempo real? Sim. As requisições entram em fila para agendamento, portanto o tempo total geralmente é maior que na API em tempo real. Espera máxima: 1 hora. A conexão é encerrada com erro se o timeout for excedido.
  2. Como escolher entre Batch Chat e Batch File? Escolha o Batch Chat para muitas requisições de diálogo independentes com alta concorrência via chamadas síncronas. Opte pelo Batch File para processar um único arquivo grande com muitas requisições via recuperação assíncrona.
  3. O Batch Chat garante que todas as requisições serão concluídas? Não. A conclusão depende da alocação de recursos compartilhados. As requisições podem entrar em fila se os recursos estiverem ocupados. A conexão atinge timeout se não for executada dentro do tempo máximo de espera. Requisições com timeout não são faturadas; tente novamente mais tarde.

Referências

Referência da API de Geração de Texto
Geração de Imagens
  • FAQ
Geração de Vídeo
Áudio
API em tempo real
Incorporação de Texto
Produção de Modelos