Para cenários sem exigência de tempo real, como anotação de dados e geração de conteúdo, a API Batch Chat oferece uma alternativa de baixo custo e alta concorrência que utiliza o mesmo método de chamada síncrona. Desconto de 50% disponível por tempo limitado.
Esta API aceita apenas o envio de requisições individuais. Para enviar múltiplas requisições simultaneamente, agrupe-as em um arquivo. Consulte OpenAI-compatible - Batch (file input) .
Como funciona
- Envio da requisição: O cliente envia uma requisição e estabelece uma conexão.
- Fila e espera: A requisição entra em fila enquanto o cliente mantém a conexão ativa.
-
Retorno do resultado: Após o processamento, o servidor retorna o resultado completo pela conexão estabelecida.
A conexão é encerrada com erro de timeout caso o tempo máximo de espera seja excedido.
Disponibilidade
- China (Beijing)
- Text generation models: qwen3.8-max, qwen3.8-flash, qwen3.7-max, qwen3.7-plus, qwen3.6-plus, qwen3.7-flash, qwen3.6-flash, qwen3.5-plus, qwen3.5-flash, qwen3-max, qwen-plus, qwen-flash, deepseek-v3.2
- Image and video understanding models: qwen3.8-max, qwen3.8-flash, qwen3.7-plus, qwen3.6-plus, qwen3.7-flash, qwen3.6-flash, qwen3.5-plus, qwen3.5-flash, qwen3.5-omni-plus, qwen3-vl-plus, qwen3-vl-flash
Uso
Pré-requisitos
-
Ative o Alibaba Cloud Model Studio e obtenha uma API key.
Configure the API key as an environment variable para reduzir o risco de vazamento.
- Para usar o SDK da OpenAI, instale-o:
Etapa 1: Configure o endpoint da API
Mude da inferência em tempo real para a inferência em lote modificando o endpoint da API (base_url) conforme o método de chamada:
SDK: Defina base_url como https://batch.dashscope.aliyuncs.com/compatible-mode/v1
HTTP: POST https://batch.dashscope.aliyuncs.com/compatible-mode/v1/chat/completions
Etapa 2: Fazer uma chamada
Os exemplos a seguir mostram como chamar a API Batch Chat. O timeout padrão é de 3600 segundos (1 hora); nenhuma configuração extra é necessária na maioria dos casos.
Intervalo de timeout personalizado: 60–3600 segundos.
- Python
- Java
- Node.js
- Go
- C# (HTTP)
- PHP (HTTP)
- curl
Exemplo de requisiçãoExemplo de resposta
Limitações
- Tempo de espera: Espera síncrona máxima de 3600 segundos (1 hora). Timeout personalizado: 60–3600 segundos.
- Limites de concorrência: Máximo de 10.000 requisições pendentes por modelo e por conta. Requisições excedentes são rejeitadas com código de erro. Novas requisições só são aceitas após a conclusão das pendentes.
-
Taxa de chamadas: Máximo de 1.000 QPS por conta ou 10.000 chamadas a cada 10 segundos.
Apenas máximo teórico. A disponibilidade real depende da carga do sistema. Implemente lógica de nova tentativa.
Faturamento
- Preço unitário: Faturamento baseado em tokens de entrada/saída em requisições bem-sucedidas. O preço de tabela corresponde ao preço da chamada em tempo real. Desconto de 50% disponível por tempo limitado no site oficial. Consulte Model list.
- Escopo de faturamento: Apenas requisições bem-sucedidas são faturadas. Requisições com falha (erros de sistema ou timeouts) não geram cobrança.
- A inferência em lote é um item de faturamento separado. Ela suporta AI general-purpose savings plan, mas não aceita descontos, como subscription (outros planos de economia) ou free quotas for new users. Também não suporta recursos como context cache.
- Alguns modelos, como qwen3.5-plus e qwen3.5-flash, têm o modo de raciocínio ativado por padrão. Esse modo gera tokens adicionais de raciocínio, cobrados pelo preço de tokens de saída, o que aumenta os custos. Para controlar despesas, defina o parâmetro
enable_thinkingconforme a complexidade da tarefa. Para mais informações, consulte Deep thinking.
Códigos de erro
Se a chamada do modelo falhar e retornar uma mensagem de erro, consulte Error codes para resolução.
FAQ
- Existe diferença no tempo de requisição entre o Batch Chat e a API em tempo real? Sim. As requisições entram em fila para agendamento, portanto o tempo total geralmente é maior que na API em tempo real. Espera máxima: 1 hora. A conexão é encerrada com erro se o timeout for excedido.
- Como escolher entre Batch Chat e Batch File? Escolha o Batch Chat para muitas requisições de diálogo independentes com alta concorrência via chamadas síncronas. Opte pelo Batch File para processar um único arquivo grande com muitas requisições via recuperação assíncrona.
- O Batch Chat garante que todas as requisições serão concluídas? Não. A conclusão depende da alocação de recursos compartilhados. As requisições podem entrar em fila se os recursos estiverem ocupados. A conexão atinge timeout se não for executada dentro do tempo máximo de espera. Requisições com timeout não são faturadas; tente novamente mais tarde.
Referências
- Lista completa de parâmetros para chamadas de modelo em tempo real: OpenAI compatible - Chat.
- Processamento em lote via envio de arquivo com resultados assíncronos: OpenAI-compatible - Batch (file input).