O Alibaba Cloud Model Studio aplica limitação de taxa às chamadas de modelo no nível da conta Alibaba Cloud, agregando o uso de todos os usuários RAM, workspaces e chaves de API vinculados à conta. As solicitações são rejeitadas quando o limite é excedido e a recuperação geralmente ocorre de forma automática em até um minuto.
Regras de limitação de taxa
- Limitação de taxa no nível da conta: Os limites de taxa são aplicados no nível da conta raiz. O uso de todos os usuários RAM, workspaces e chaves de API associados à conta é consolidado.
- Limitação de taxa específica por modelo: Cada modelo possui seu próprio limite de taxa. Para mais informações, consulte as tabelas abaixo.
Limites de tamanho do corpo da requisição
O gateway da API aplica os seguintes limites ao tamanho do corpo da requisição:
| Tipo de requisição | Limite |
|---|---|
| Requisições sem conteúdo Base64 | Tamanho máximo do corpo da requisição: 16 MiB |
| Requisições com conteúdo Base64 (protocolo Anthropic) | Conteúdo Base64 individual máximo: 32 MiB |
| Requisições com conteúdo Base64 (outros protocolos) | Conteúdo Base64 individual máximo: 20 MiB |
| Requisições com conteúdo Base64 (corpo da requisição total) | Máximo: 64 MiB |
Perguntas frequentes
Por que a limitação de taxa é acionada?
Identifique o tipo de limite de taxa acionado com base na mensagem de erro:
Requests rate limit exceededouYou exceeded your current requests list: Indica que o limite de solicitações por minuto (RPM) foi atingido.Allocated quota exceededouYou exceeded your current quota: Sinaliza que o limite de tokens por minuto (TPM) foi ultrapassado.Request rate increased too quickly: A frequência de solicitações aumentou abruptamente em um curto período, ativando a proteção de estabilidade do sistema. Isso pode ocorrer mesmo que o número total de chamadas não tenha atingido os limites de RPM ou TPM.- Para outros erros, consulte Error codes para confirmar a causa.
Como visualizar o uso do modelo
Uma hora após chamar um modelo, acesse a página Monitoring (Singapore ou Beijing). Defina as condições de consulta, como intervalo de tempo e workspace. Em seguida, na área Models, localize o modelo desejado e clique em Monitor na coluna Actions para visualizar as estatísticas de chamadas do modelo. Para mais informações, consulte o documento Monitoring.
Os dados são atualizados a cada hora. Durante períodos de pico, pode haver uma latência de até uma hora.

Quanto tempo leva para recuperar da limitação de taxa?
A recuperação normalmente ocorre em até um minuto. Caso outros erros surjam, consulte Error codes para solução de problemas.
A velocidade de resposta do modelo está relacionada ao status de pagamento?
A velocidade de resposta do modelo não depende do uso de cota gratuita ou de chamadas pagas. Ambas utilizam a mesma infraestrutura de service de modelo, portanto a velocidade de geração para um determinado modelo é idêntica. A cota gratuita controla apenas se uma solicitação é aceita: uma vez esgotada, a solicitação é rejeitada com um erro 403 (caso você tenha ativado stop when the free quota is used up). Isso não reduz a velocidade de geração de nenhuma solicitação já aceita.
Quais fatores afetam a velocidade de resposta do modelo?
- Tipo de modelo: Modelos leves (como qwen-flash) geram respostas mais rapidamente do que modelos maiores (como qwen-max).
- Comprimento da saída: Quanto mais tokens uma resposta contém, maior será o tempo total de geração.
- Carga do servidor: A velocidade de resposta pode apresentar pequenas flutuações durante períodos de pico.
A limitação de taxa reduz a velocidade de geração das solicitações aceitas?
Não. A limitação de taxa (RPM/TPM) apenas rejeita solicitações que excedem o limite, retornando um erro 429. Quando a cota gratuita se esgota (se você tiver ativado stop when the free quota is used up), as solicitações são rejeitadas com um erro 403. Nenhum dos casos afeta a velocidade de geração das solicitações já aceitas: 429 indica limitação de taxa e 403 indica esgotamento de cota — ambos são mecanismos de rejeição, não de redução de velocidade.
Como evitar a limitação de taxa
- Escolha modelos com limites de taxa mais altos: Versões estáveis ou mais recentes oferecem limites de taxa superiores aos das versões snapshot datadas.
-
Otimize sua estratégia de chamadas
- Reduza a frequência de chamadas: Se receber um erro
Requests rate limit exceededouYou exceeded your current requests list, diminua a frequência de chamadas à API. - Diminua o consumo de tokens: Ao receber um erro
Allocated quota exceededouYou exceeded your current quota, encurte a entrada ou limite o tamanho da saída. - Suavize a taxa de solicitações: Caso receba um erro
Request rate increased too quickly, utilize agendamento uniforme, backoff exponencial ou uma fila de solicitações para distribuir as requisições de maneira equilibrada e evitar picos repentinos.
- Reduza a frequência de chamadas: Se receber um erro
-
Adicione um modelo de backup
Se a limitação de taxa for acionada, alterne para um modelo de backup para continuar a geração. Essa prática reduz a probabilidade de falhas e aumenta o throughput. O código abaixo tenta automaticamente com
qwen-plus-2025-07-14após a limitação de taxa ser acionada paraqwen-plus-2025-07-28. Você também pode escolher um modelo de uma série diferente (como qwen-flash) como backup para reduzir ainda mais o risco de ambos os modelos serem limitados simultaneamente.Código de exemplo
- Divida as tarefas: Conversas longas ou documentos extensos podem consumir muitos tokens rapidamente. Divida grandes tarefas em lotes menores e envie-as em momentos diferentes.
- Utilize inferência em lote: Para tarefas que não exigem respostas em tempo real, use o Batch API. Solicitações em lote não estão sujeitas aos limites de taxa em tempo real, mas considere o tempo de fila e processamento.
- Aumente os limites de taxa: Se os limites padrão forem insuficientes, aumente a cota temporária de TPM para um modelo na página Increase Rate Limits no console do Model Studio. O aumento entra em vigor imediatamente. Para mais informações, consulte Aumentar limites temporários de taxa.
Como controlar o uso de tokens ou custos
A limitação de taxa restringe apenas a taxa de solicitações por unidade de tempo; ela não limita o uso acumulado. Para controlar o uso de tokens ou custos, utilize os seguintes métodos:
- Defina um limite de gastos e alertas de custo: No cartão Billing, configure Cost alerts para ativar um limite mensal de gastos e notificações de limiar. Você será notificado ao atingir o limiar, o que ajuda a evitar gastos excessivos. Para mais informações, consulte Query bills and manage costs.
- Ative a parada ao esgotar a cota gratuita: Para modelos que oferecem cota gratuita, ative stop when the free quota is used up para que as chamadas parem automaticamente assim que a cota gratuita acabar, evitando cobranças adicionais. Para mais informações, consulte Free quota.
- Monitore o uso do modelo: Verifique regularmente o consumo de tokens de cada modelo para detectar crescimentos anômalos a tempo. Consulte Como visualizar o uso do modelo acima.
Ainda serei limitado após recarregar minha conta?
Recarregar sua conta não altera os limites padrão de RPM e TPM de um modelo. Os limites de taxa são configurados no nível da conta Alibaba Cloud e independem do faturamento. A recarga (pagamento conforme o uso) garante apenas que sua conta não seja suspensa por pagamentos atrasados; ela não aumenta seus limites de taxa.
Para obter limites de taxa mais altos, consulte a seção Como evitar a limitação de taxa neste tópico ou solicite um aumento na página Increase Rate Limits no console do Model Studio. Para mais informações, consulte Aumentar limites temporários de taxa.
Aumentar limites temporários de taxa
Se os limites padrão forem insuficientes, aumente a cota temporária de TPM de um modelo no console do Model Studio. O aumento entra em vigor imediatamente e é válido por 30 dias. Após a expiração, a cota retorna automaticamente ao padrão do sistema.
Este recurso está disponível atualmente nas regiões China (Beijing) e Singapore.
- Faça login no console do Model Studio e acesse a página Increase Rate Limits.
- Clique em Increase Temporary Rate Limit no canto superior direito.
- Na caixa de diálogo exibida, selecione um Model e insira o valor desejado para Token Account Limit (Token/60 seconds). A caixa de diálogo mostra a cota atual e o limite máximo configurável.
- Clique em Confirm. A cota aumentada entra em vigor imediatamente.
- Na página Increase Rate Limits, visualize na lista os modelos com cotas aumentadas e seus respectivos dados de limite de taxa.
- No Model List, acesse a página de detalhes do modelo correspondente para visualizar os dados atualizados do limite de taxa.
- Os modelos para os quais é possível aumentar temporariamente as cotas estão listados na caixa de diálogo da página Increase Rate Limits.
- Enviar outra solicitação para um modelo que já possui cota aumentada é considerado uma nova aplicação, e o período de validade é reiniciado para 30 dias.
- Solicite uma cota baseada em suas necessidades reais. Se a capacidade provisionada exceder significativamente o uso real por um longo período, o sistema poderá restaurá-la ao valor padrão mediante notificação prévia.
- Caso a cota de limite de taxa disponível ainda não atenda às suas necessidades, entre em contato com seu gerente de conta para solicitar um aumento adicional.
Geração de texto - Qwen
Modelo de linguagem Qwen
- Singapore
- US (Virginia)
- China (Beijing)
- Germany (Frankfurt)
- Hong Kong (China)
- Japan (Tokyo)
| Nome do modelo | Escopo de implantação do service | Condições de limitação de taxa (acionadas se qualquer valor for excedido)Os limites a seguir são por minuto. O service também pode aplicar limites com base em requisições por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60). | |
|---|---|---|---|
| Requisições por minuto (RPM) | Tokens por minuto (TPM)Inclui tokens de entrada e saída. | ||
| qwen3.8-max | International | 15.000 | 2.000.000 |
| qwen3.8-max-0902 | International | 15.000 | 150.000 |
| qwen3.8-flash | International | 15.000 | 2.000.000 |
| qwen3.7-max | International | 600 | 1.000.000 |
| qwen3.7-max-2026-06-08 | International | 60 | 1.000.000 |
| qwen3.7-max-2026-05-20 | International | 60 | 1.000.000 |
| qwen3.7-max-preview | International | 600 | 1.000.000 |
| qwen3.7-max-2026-05-17 | International | 600 | 1.000.000 |
| qwen3.6-max-preview | International | 600 | 1.000.000 |
| qwen3-max | International | 600 | 1.000.000 |
| qwen3-max-2026-01-23 | International | 600 | 1.000.000 |
| qwen3-max-2025-09-23 | International | 60 | 100.000 |
| qwen3-max-preview | International | 600 | 1.000.000 |
qwen-maxA limitação de taxa não se aplica a chamadas de service feitas usando o Batch API. | International | 600 | 1.000.000 |
| qwen3.7-plus | International | 15.000 | 5.000.000 |
| qwen3.7-plus-2026-05-26 | International | 60 | 1.000.000 |
| qwen3.6-plus | International | 15.000 | 5.000.000 |
| qwen3.6-plus-2026-04-02 | International | 60 | 1.000.000 |
| qwen3.7-flash | International | 15.000 | 5.000.000 |
| qwen3.7-flash-2026-07-15 | International | 15.000 | 5.000.000 |
| qwen3.6-flash | International | 15.000 | 5.000.000 |
| qwen3.6-flash-2026-04-16 | International | 60 | 1.000.000 |
| qwen3.5-plus | International | 15.000 | 5.000.000 |
| qwen3.5-plus-2026-04-20 | International | 600 | 1.000.000 |
| qwen3.5-plus-2026-02-15 | International | 60 | 1.000.000 |
qwen-plusA limitação de taxa não se aplica a chamadas de service feitas usando o Batch API. | International | 600 | 1.000.000 |
| qwen-plus-latest | International | 600 | 1.000.000 |
| qwen-plus-2025-12-01 | International | 120 | 1.000.000 |
| qwen-plus-2025-09-11 | International | 120 | 1.000.000 |
| qwen-plus-2025-07-28 | International | 60 | 100.000 |
| qwen-plus-2025-07-14(qwen-plus-0714) | International | 60 | 100.000 |
| qwen-plus-2025-04-28(qwen-plus-0428) | International | 60 | 1.000.000 |
| qwen-plus-2025-01-25(qwen-plus-0125) | International | 60 | 100.000 |
| qwen3.5-flash | International | 15.000 | 5.000.000 |
| qwen3.5-flash-2026-02-23 | International | 60 | 1.000.000 |
qwen-flashA limitação de taxa não se aplica a chamadas de service feitas usando o Batch API. | International | 600 | 5.000.000 |
| qwen-flash-2025-07-28 | International | 600 | 5.000.000 |
| qwq-plus | International | 60 | 100.000 |
qwen-turboA limitação de taxa não se aplica a chamadas de service feitas usando o Batch API. | International | 600 | 5.000.000 |
Qwen-VL (compreensão visual/imagem para texto)
- Singapore
- US (Virginia)
- China (Beijing)
- Germany (Frankfurt)
- Hong Kong (China)
| Model name | Service deployment scope | Rate limiting conditions (triggered if any value is exceeded)The following limits are per minute. The service may also enforce limits based on requests per second (RPS = RPM/60) and tokens per second (TPS = TPM/60). | |
|---|---|---|---|
| Requests per minute (RPM) | Tokens per minute (TPM)Includes input and output tokens. | ||
| qwen3-vl-plus | International | 1,200 | 1,000,000 |
| qwen3-vl-plus-2025-12-19 | International | 60 | 100,000 |
| qwen3-vl-plus-2025-09-23 | International | 120 | 1,000,000 |
| qwen3-vl-flash | International | 1,200 | 1,000,000 |
| qwen3-vl-flash-2026-01-22 | International | 60 | 100,000 |
| qwen3-vl-flash-2025-10-15 | International | 120 | 1,000,000 |
| qwen-vl-max | International | 1,200 | 1,000,000 |
| qwen-vl-plus | International | 1,200 | 1,000,000 |
| qvq-max | International | 60 | 100,000 |
Qwen-Omni (omnimodal)
- Singapore
- China (Beijing)
| Model name | Service deployment scope | Rate limiting conditions (triggered if any value is exceeded)The following limits are per minute. The service may also enforce limits based on requests per second (RPS = RPM/60) and tokens per second (TPS = TPM/60). | |
|---|---|---|---|
| Requests per minute (RPM) | Tokens per minute (TPM)Includes input and output tokens. | ||
| qwen3.5-omni-flash | International | 60 | 100,000 |
| qwen3.5-omni-flash-2026-03-15 | International | 60 | 100,000 |
| qwen3.5-omni-plus | International | 60 | 100,000 |
| qwen3.5-omni-plus-2026-03-15 | International | 60 | 100,000 |
| qwen3-omni-flash | International | 60 | 100,000 |
| qwen3-omni-flash-2025-12-01 | International | 60 | 100,000 |
| qwen3-omni-flash-2025-09-15 | International | 60 | 100,000 |
| qwen-omni-turbo | International | 60 | 100,000 |
| qwen-omni-turbo-latest | International | 60 | 100,000 |
| qwen-omni-turbo-2025-03-26 | International | 60 | 100,000 |
Qwen-Omni-Realtime (multimodal em tempo real)
- Singapore
- China (Beijing)
| Nome do modelo | Escopo de implantação do service | Condições de limitação de taxa (acionadas se qualquer valor for excedido)Os limites a seguir são por minuto. O service também pode impor limites com base em requisições por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60). | |
|---|---|---|---|
| Requisições por minuto (RPM) | Tokens por minuto (TPM)Inclui tokens de entrada e saída. | ||
| qwen3.5-omni-plus-realtime | Internacional | 60 | 100.000 |
| qwen3.5-omni-plus-realtime-2026-03-15 | Internacional | 60 | 100.000 |
| qwen3.5-omni-flash-realtime | Internacional | 60 | 100.000 |
| qwen3.5-omni-flash-realtime-2026-03-15 | Internacional | 60 | 100.000 |
| qwen3-omni-flash-realtime | Internacional | 60 | 100.000 |
| qwen3-omni-flash-realtime-2025-12-01 | Internacional | 60 | 100.000 |
| qwen3-omni-flash-realtime-2025-09-15 | Internacional | 60 | 100.000 |
| qwen-omni-turbo-realtime | Internacional | 60 | 10.000 |
| qwen-omni-turbo-realtime-latest | Internacional | 60 | 10.000 |
| qwen-omni-turbo-realtime-2025-05-08 | Internacional | 60 | 10.000 |
Qwen-OCR (extração de texto)
- Singapore
- US (Virginia)
- China (Beijing)
- Germany (Frankfurt)
| Nome do modelo | Escopo de implantação do service | Condições de limitação de taxa (acionadas se qualquer valor for excedido)Os limites a seguir são por minuto. O service também pode impor limites com base em requisições por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60). | |
|---|---|---|---|
| Requisições por minuto (RPM) | Tokens por minuto (TPM)Inclui tokens de entrada e saída. | ||
| qwen-vl-ocr | Internacional | 600 | 6.000.000 |
| qwen-vl-ocr-2025-11-20 | Internacional | 1.200 | 6.000.000 |
Modelo matemático Qwen
- China (Beijing)
| Nome do modelo | Condições de limitação de taxa (acionadas se qualquer valor for excedido)Os limites a seguir são por minuto. O service também pode impor limites com base em requisições por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60). | |
|---|---|---|
| Requisições por minuto (RPM) | Tokens por minuto (TPM)Inclui tokens de entrada e saída | |
| qwen-math-plus | 1.200 | 1.000.000 |
| qwen-math-plus-latest | 1.200 | 1.000.000 |
| qwen-math-plus-2024-09-19(qwen-math-plus-0919) | 60 | 100.000 |
| qwen-math-plus-2024-08-16(qwen-math-plus-0816) | 10 | 20.000 |
| qwen-math-turbo | 1200 | 1.000.000 |
Qwen-Coder
- Singapore
- US (Virginia)
- China (Beijing)
- Germany (Frankfurt)
| Nome do modelo | Escopo de implantação do service | Condições de limitação de taxa (acionadas se qualquer valor for excedido)Os limites a seguir são por minuto. O service também pode impor limites com base em solicitações por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60). | |
|---|---|---|---|
| Solicitações por minuto (RPM) | Tokens por minuto (TPM)Inclui tokens de entrada e saída. | ||
| qwen3-coder-plus | International | 2.400 | 2.000.000 |
| qwen3-coder-plus-2025-09-23 | International | 600 | 1.000.000 |
| qwen3-coder-plus-2025-07-22 | International | 60 | 1.000.000 |
| qwen3-coder-flash | International | 600 | 5.000.000 |
| qwen3-coder-flash-2025-07-28 | International | 600 | 5.000.000 |
Modelo de tradução Qwen
- Singapore
- US (Virginia)
- China (Beijing)
- Germany (Frankfurt)
| Nome do modelo | Escopo de implantação do service | Condições de limitação de taxa (acionadas se qualquer valor for excedido)Os limites a seguir são por minuto. O service também pode impor limites com base em solicitações por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60). | |
|---|---|---|---|
| Solicitações por minuto (RPM) | Tokens por minuto (TPM)Inclui tokens de entrada e saída. | ||
| qwen-mt-plus | International | 60 | 100.000 |
| qwen-mt-flash | International | 60 | 100.000 |
| qwen-mt-lite | International | 60 | 100.000 |
| qwen-mt-turbo | International | 60 | 100.000 |
Modelo de mineração de dados Qwen
- China (Beijing)
| Nome do modelo | Condições de limitação de taxa (acionadas se qualquer valor for excedido)Os limites a seguir são por minuto. O service também pode impor limites com base em solicitações por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60). | |
|---|---|---|
| Solicitações por minuto (RPM) | Tokens por minuto (TPM)Inclui tokens de entrada e saída | |
| qwen-doc-turbo | 600 | 3.000.000 |
Modelo de pesquisa profunda Qwen
- China (Beijing)
| Nome do modelo | Condições de limitação de taxa (acionadas se qualquer valor for excedido)Os limites a seguir são por minuto. O service também pode impor limites com base em solicitações por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60). | |
|---|---|---|
| Solicitações por minuto (RPM) | Tokens por minuto (TPM)Inclui tokens de entrada e saída | |
| qwen-deep-research | 120 | 1.200.000 |
Geração de texto - Qwen - Código aberto
Modelo de linguagem Qwen open source
- Singapore
- US (Virginia)
- China (Beijing)
- Germany (Frankfurt)
| Nome do modelo | Escopo de implantação do service | Condições de limitação de taxa (acionadas se qualquer valor for excedido)Os limites a seguir são por minuto. O service também pode aplicar limites com base em requisições por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60). | |
|---|---|---|---|
| Requisições por minuto (RPM) | Tokens por minuto (TPM)Inclui tokens de entrada e saída. | ||
| qwen3.8-2.4t-a95b | International | 5.000 | 5.000.000 |
| qwen3.8-27b | International | 5.000 | 5.000.000 |
| qwen3.6-35b-a3b | International | 600 | 1.000.000 |
| qwen3.6-27b | International | 600 | 1.000.000 |
| qwen3.5-397b-a17b | International | 600 | 1.000.000 |
| qwen3.5-122b-a10b | International | 600 | 1.000.000 |
| qwen3.5-27b | International | 600 | 1.000.000 |
| qwen3.5-35b-a3b | International | 600 | 5.000.000 |
| qwen3-next-80b-a3b-thinking | International | 600 | 1.000.000 |
| qwen3-next-80b-a3b-instruct | International | 600 | 1.000.000 |
| qwen3-235b-a22b-thinking-2507 | International | 600 | 1.000.000 |
| qwen3-235b-a22b-instruct-2507 | International | 600 | 1.000.000 |
| qwen3-30b-a3b-thinking-2507 | International | 600 | 5.000.000 |
| qwen3-30b-a3b-instruct-2507 | International | 600 | 5.000.000 |
| qwen3-235b-a22b | International | 600 | 1.000.000 |
| qwen3-32b | International | 600 | 1.000.000 |
| qwen3-30b-a3b | International | 600 | 1.000.000 |
| qwen3-14b | International | 600 | 1.000.000 |
| qwen3-8b | International | 600 | 1.000.000 |
Qwen-VL (compreensão visual/imagem para texto)
- Singapore
- US (Virginia)
- China (Beijing)
- Germany (Frankfurt)
| Nome do modelo | Escopo de implantação do service | Condições de limitação de taxa (acionadas se qualquer valor for excedido)Os limites a seguir são por minuto. O service também pode impor limites com base em requisições por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60). | |
|---|---|---|---|
| Requisições por minuto (RPM) | Tokens por minuto (TPM)Inclui tokens de entrada e saída. | ||
| qwen3-vl-32b-thinking | Internacional | 60 | 100.000 |
| qwen3-vl-32b-instruct | Internacional | 60 | 100.000 |
| qwen3-vl-30b-a3b-thinking | Internacional | 60 | 100.000 |
| qwen3-vl-30b-a3b-instruct | Internacional | 60 | 100.000 |
| qwen3-vl-8b-thinking | Internacional | 60 | 100.000 |
| qwen3-vl-8b-instruct | Internacional | 60 | 100.000 |
| qwen3-vl-235b-a22b-thinking | Internacional | 60 | 100.000 |
| qwen3-vl-235b-a22b-instruct | Internacional | 60 | 100.000 |
Qwen3-Omni
- Singapore
- China (Beijing)
| Nome do modelo | Escopo de implantação do service | Condições de limitação de taxa (acionadas se qualquer valor for excedido)Os limites a seguir são por minuto. O service também pode impor limites com base em requisições por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60). | |
|---|---|---|---|
| Requisições por minuto (RPM) | Tokens por minuto (TPM)Inclui tokens de entrada e saída. | ||
| qwen2.5-omni-7b | Internacional | 60 | 100.000 |
Qwen3-Omni-Captioner
- Singapore
- China (Beijing)
| Nome do modelo | Escopo de implantação do service | Condições de limitação de taxa (acionadas se qualquer valor for excedido)Os limites a seguir são por minuto. O service também pode impor limites com base em requisições por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60). | |
|---|---|---|---|
| Requisições por minuto (RPM) | Tokens por minuto (TPM)Inclui tokens de entrada e saída. | ||
| qwen3-omni-30b-a3b-captioner | Internacional | 60 | 100.000 |
Qwen-Coder
- Singapore
- US (Virginia)
- China (Beijing)
- Germany (Frankfurt)
| Nome do modelo | Escopo de implantação do service | Condições de limitação de taxa (acionadas se qualquer valor for excedido)Os limites a seguir são por minuto. O service também pode impor limites com base em requisições por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60). | |
|---|---|---|---|
| Requisições por minuto (RPM) | Tokens por minuto (TPM)Inclui tokens de entrada e saída. | ||
| qwen3-coder-next | Internacional | 600 | 1.000.000 |
| qwen3-coder-480b-a35b-instruct | Internacional | 600 | 1.000.000 |
| qwen3-coder-30b-a3b-instruct | Internacional | 600 | 1.000.000 |
Geração de texto - Modelos de terceiros
DeepSeek
- Singapore
- US (Virginia)
- China (Beijing)
- Germany (Frankfurt)
- Japan (Tokyo)
- Hong Kong (China)
| Nome do modelo | Escopo de implantação do service | Condições de limitação de taxa (acionadas se qualquer valor for excedido)Os limites a seguir são por minuto. O service também pode impor limites com base em requisições por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60). | |
|---|---|---|---|
| Requisições por minuto (RPM) | Tokens por minuto (TPM)Inclui tokens de entrada e saída. | ||
| deepseek-v4-pro | Internacional | 10.000 | 1.200.000 |
| deepseek-v4-pro-0813 | Internacional | 10.000 | 1.200.000 |
| deepseek-v4-flash-0731 | Internacional | 15.000 | 1.200.000 |
| deepseek-v4-flash | Internacional | 10.000 | 1.200.000 |
| deepseek-v3.2 | Internacional | 10.000 | 1.200.000 |
Kimi
- China (Beijing)
- US (Virginia)
- Germany (Frankfurt)
- Hong Kong (China)
- Japan (Tokyo)
- Singapore
| Nome do modelo | Condições de limitação de taxa (acionadas se qualquer valor for excedido)Os limites a seguir são por minuto. O service também pode impor limites com base em requisições por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60). | |
|---|---|---|
| Requisições por minuto (RPM) | Tokens por minuto (TPM)Inclui tokens de entrada e saída | |
| kimi-k3 | 15.000 | 1.200.000 |
| kimi-k2.7-code | 500 | 1.000.000 |
| kimi-k2.6 | 500 | 1.000.000 |
| kimi-k2.5 | 500 | 1.000.000 |
| kimi-k2-thinking | 500 | 1.000.000 |
| Moonshot-Kimi-K2-Instruct | 500 | 1.000.000 |
MiniMax
- China (Beijing)
| Nome do modelo | Condições de limitação de taxa (acionadas se qualquer valor for excedido)Os limites a seguir são por minuto. O service também pode impor limites com base em requisições por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60). | |
|---|---|---|
| Requisições por minuto (RPM) | Tokens por minuto (TPM)Inclui tokens de entrada e saída | |
| MiniMax-M2.5 | 500 | 1.000.000 |
GLM
- US (Virginia)
- China (Beijing)
- Germany (Frankfurt)
- Singapore
- Hong Kong (China)
- Japan (Tokyo)
| Nome do modelo | Escopo de implantação do service | Condições de limitação de taxa (acionadas se qualquer valor for excedido)Os limites a seguir são por minuto. O service também pode impor limites com base em requisições por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60). | |
|---|---|---|---|
| Requisições por minuto (RPM) | Tokens por minuto (TPM)Inclui tokens de entrada e saída. | ||
| glm-5.2 | Global | 500 | 1.000.000 |
| glm-5.2-us | EUA | 500 | 1.000.000 |
| glm-5.1 | Global | 500 | 1.000.000 |
Fornecimento direto GLM-Z.AI
- Singapore
| Nome do modelo | Limites de taxa (acionados se qualquer valor for excedido)Os limites a seguir são por minuto. O service também pode impor limites com base em requisições por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60). | |
|---|---|---|
| Requisições por minuto (RPM) | Tokens por minuto (TPM)Incluindo tokens de entrada e saída | |
| ZHIPU/GLM-5.3 | 200 | 3.000.000 |
| ZHIPU/GLM-5.2 | 200 | 3.000.000 |
Geração de imagens
Qwen-Image
- Singapore
- China (Beijing)
- Hong Kong (China)
- Germany (Frankfurt)
- Japan (Tokyo)
Model name | Service deployment scope | Condições de limitação de taxa (acionadas se qualquer valor for excedido) | |
|---|---|---|---|
Limite de chamadas de API para envio de tarefas | Número de tarefas simultâneas (concorrência) | ||
qwen-image-3.0-pro | Internacional | 5 requisições/minuto | Sem limite para APIs síncronas / 10 para APIs assíncronas |
qwen-image-3.0 | Internacional | 20 requisições/minuto | Sem limite para APIs síncronas / 10 para APIs assíncronas |
qwen-image-2.0-pro | Internacional | 2 vezes/minuto | Sem limite para APIs síncronas |
qwen-image-2.0-pro-2026-06-22 | Internacional | 2 vezes/minuto | Sem limite para APIs síncronas |
qwen-image-2.0-pro-2026-04-22 | Internacional | 2 vezes/minuto | Sem limite para APIs síncronas |
qwen-image-2.0-pro-2026-03-03 | Internacional | 2 vezes/minuto | Sem limite para APIs síncronas |
qwen-image-2.0 | Internacional | 2 vezes/segundo | Sem limite para APIs síncronas |
qwen-image-2.0-2026-03-03 | Internacional | 2 vezes/segundo | Sem limite para APIs síncronas |
qwen-image-max | Internacional | 2 vezes/minuto | Sem limite para APIs síncronas |
qwen-image-max-2025-12-30 | Internacional | 2 vezes/minuto | Sem limite para APIs síncronas |
qwen-image-plus | Internacional | 2 vezes/segundo | Sem limite para APIs síncronas / 2 para APIs assíncronas |
qwen-image-plus-2026-01-09 | Internacional | 2 vezes/segundo | Sem limite para APIs síncronas |
qwen-image | Internacional | 2 vezes/segundo | Sem limite para APIs síncronas / 2 para APIs assíncronas |
qwen-image-edit-max | Internacional | 2 vezes/minuto | Sem limite para APIs síncronas |
qwen-image-edit-max-2026-01-16 | Internacional | 2 vezes/minuto | Sem limite para APIs síncronas |
qwen-image-edit-plus | Internacional | 2 vezes/segundo | Sem limite para APIs síncronas |
qwen-image-edit-plus-2025-12-15 | Internacional | 2 vezes/segundo | Sem limite para APIs síncronas |
qwen-image-edit-plus-2025-10-30 | Internacional | 2 vezes/segundo | Sem limite para APIs síncronas |
qwen-image-edit | Internacional | 2 vezes/segundo | Sem limite para APIs síncronas |
Texto para imagem - Z-Image
- Singapore
- China (Beijing)
Model name | Service deployment scope | Condições de limitação de taxa (acionadas se qualquer valor for excedido) | |
|---|---|---|---|
Solicitações por segundo (RPS) | Número de tarefas simultâneas (concorrência) | ||
z-image-turbo | Internacional | 2 | Sem limite para APIs síncronas |
Wanxiang
- Singapore
- US (Virginia)
- China (Beijing)
- Germany (Frankfurt)
Model name | Service deployment scope | Condições de limitação de taxa (acionadas se qualquer valor for excedido) | |
|---|---|---|---|
Solicitações por segundo (RPS) | Número de tarefas simultâneas (concorrência) | ||
wan2.7-image-pro | Internacional | 5 | 5 |
wan2.7-image | Internacional | 5 | 5 |
wan2.6-image | Internacional | 5 | 5 |
wan2.6-t2i | Internacional | 5 | 5 |
wan2.5-t2i-preview | Internacional | 5 | 5 |
wan2.2-t2i-flash | Internacional | 2 | 2 |
wan2.2-t2i-plus | Internacional | 2 | 2 |
wan2.1-t2i-turbo | Internacional | 2 | 2 |
wan2.1-t2i-plus | Internacional | 2 | 2 |
wan2.5-i2i-preview | Internacional | 5 | 5 |
OutfitAnyone
- China (Beijing)
Nome do modelo | Condições de limitação de taxa (acionadas se qualquer valor for excedido) | |
|---|---|---|
Solicitações por segundo (RPS) | Número de tarefas simultâneas | |
aitryon-plus | 10 | 5 |
aitryon-parsing-v1 | 10 | Sem limite para APIs síncronas |
Geração de vídeo
Série HappyHorse
- Singapore
- US (Virginia)
- China (Beijing)
- Germany (Frankfurt)
- Japan (Tokyo)
Nome do modelo | Escopo de implantação do service | Condições de limitação de taxa (acionadas se qualquer valor for excedido) | |
|---|---|---|---|
Solicitações por segundo (RPS) | Número de tarefas simultâneas (concorrência) | ||
happyhorse-1.1-t2v | Internacional | 5 | 5 |
happyhorse-1.1-i2v | Internacional | 5 | 5 |
happyhorse-1.1-r2v | Internacional | 5 | 5 |
happyhorse-1.0-t2v | Internacional | 5 | 5 |
happyhorse-1.0-i2v | Internacional | 5 | 5 |
happyhorse-1.0-r2v | Internacional | 5 | 5 |
happyhorse-1.0-video-edit | Internacional | 5 | 5 |
Série Wanxiang
- Singapore
- US (Virginia)
- China (Beijing)
- Germany (Frankfurt)
Nome do modelo | Escopo de implantação do service | Condições de limitação de taxa (acionadas se qualquer valor for excedido) | |
|---|---|---|---|
Solicitações por segundo (RPS) | Número de tarefas simultâneas (concorrência) | ||
wan2.7-r2v-2026-06-12 | Internacional | 5 | 5 |
wan2.7-t2v-2026-06-12 | Internacional | 5 | 5 |
wan2.7-t2v-2026-04-25 | Internacional | 5 | 5 |
wan2.7-t2v | Internacional | 5 | 5 |
wan2.6-t2v | Internacional | 5 | 5 |
wan2.5-t2v-preview | Internacional | 5 | 5 |
wan2.2-t2v-plus | Internacional | 2 | 2 |
wan2.1-t2v-turbo | Internacional | 2 | 2 |
wan2.1-t2v-plus | Internacional | 2 | 2 |
wan2.7-i2v-2026-04-25 | Internacional | 5 | 5 |
wan2.7-i2v | Internacional | 5 | 5 |
wan2.6-i2v-flash | Internacional | 5 | 5 |
wan2.6-i2v | Internacional | 5 | 5 |
wan2.5-i2v-preview | Internacional | 5 | 5 |
wan2.2-i2v-flash | Internacional | 2 | 2 |
wan2.1-i2v-plus | Internacional | 2 | 2 |
wan2.1-i2v-turbo | Internacional | 2 | 2 |
wan2.2-i2v-plus | Internacional | 2 | 2 |
wan2.2-kf2v-flash | Internacional | 2 | 2 |
wan2.1-kf2v-plus | Internacional | 1 | 2 |
wan2.1-vace-plus | Internacional | 2 | 2 |
wan2.7-videoedit | Internacional | 5 | 5 |
wan2.7-r2v | Internacional | 5 | 5 |
wan2.6-r2v-flash | Internacional | 5 | 5 |
wan2.6-r2v | Internacional | 5 | 5 |
wan2.2-animate-move | Internacional | 5 | 1 |
wan2.2-animate-mix | Internacional | 5 | 1 |
AnimateAnyone
- China (Beijing)
Nome do modelo | Solicitações por segundo (RPS) | Número de tarefas simultâneas |
|---|---|---|
animate-anyone-detect-gen2 | 5 | Sem limite para APIs síncronas |
animate-anyone-template-gen2 | 5 | 1 Apenas uma tarefa é executada por vez. As demais tarefas na fila permanecem em estado de espera. |
animate-anyone-gen2 | 5 | 1 Apenas uma tarefa é executada por vez. As demais tarefas na fila permanecem em estado de espera. |
EMO
- China (Beijing)
Nome do modelo | Solicitações por segundo (RPS) | Número de tarefas simultâneas |
|---|---|---|
emo-detect-v1 | 5 | Sem limite para APIs síncronas |
emo-v1 | 5 | 1 Apenas uma tarefa é executada por vez. As demais tarefas na fila permanecem em estado de espera. |
LivePortrait
- China (Beijing)
Nome do modelo | Solicitações por segundo (RPS) | Número de tarefas simultâneas |
|---|---|---|
liveportrait-detect | 5 | Sem limite para APIs síncronas |
liveportrait | 5 | 1 Apenas uma tarefa é executada por vez. As demais tarefas na fila permanecem em estado de espera. |
VideoRetalk
- China (Beijing)
Nome do modelo | Solicitações por segundo (RPS) | Número de tarefas simultâneas |
|---|---|---|
videoretalk | 1 | 1 Apenas uma tarefa é executada por vez. As demais tarefas na fila permanecem em estado de espera. |
Emoji
- China (Beijing)
Nome do modelo | Solicitações por segundo (RPS) | Número de tarefas simultâneas |
|---|---|---|
emoji-detect-v1 | 1 | Sem limite para APIs síncronas |
emoji-v1 | 1 | 1 Apenas uma tarefa é executada por vez. As demais tarefas na fila permanecem em estado de espera. |
Transformação de estilo de vídeo
- China (Beijing)
Nome do modelo | Solicitações por segundo (RPS) | Número de tarefas simultâneas |
|---|---|---|
video-style-transform | 20 | 2 Apenas uma tarefa é executada por vez. As demais tarefas na fila permanecem em estado de espera. |
Geração de música
- China (Beijing)
Nome do modelo | Solicitações por minuto (RPM) |
|---|---|
fun-music-preview | 180 |
fun-music-v1 | 180 |
Chat de voz
Chat de voz em tempo real
- Singapore
- China (Beijing)
| Nome do modelo | Escopo de implantação do service | Condições de limitação de taxa (acionadas se qualquer valor for excedido)Os limites a seguir são por minuto. O service também pode aplicar limites com base em solicitações por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60). | |
|---|---|---|---|
| Solicitações por minuto (RPM) | Tokens por minuto (TPM)Inclui tokens de entrada e saída | ||
| qwen-audio-3.0-realtime-plus | Internacional | 60 | 100.000 |
| qwen-audio-3.0-realtime-flash | Internacional | 60 | 100.000 |
Síntese de fala (texto para fala)
Qwen-Audio-TTS
- Singapore
- China (Beijing)
Nome do modelo | Escopo de implantação do service | Solicitações por segundo (RPS) |
|---|---|---|
qwen-audio-3.0-tts-plus | Internacional | 3 |
qwen-audio-3.0-tts-flash | Internacional | 3 |
Qwen-TTS
- Singapore
- China (Beijing)
- Qwen3-TTS-Instruct-Flash
- Qwen3-TTS-VD
- Qwen3-TTS-VC
- Qwen3-TTS-Flash
Nome do modelo | Escopo de implantação do service | Solicitações por minuto (RPM) |
|---|---|---|
qwen3-tts-instruct-flash | Internacional | 180 |
qwen3-tts-instruct-flash-2026-01-26 | Internacional | 180 |
Qwen-TTS-Realtime
- Singapore
- China (Beijing)
- Qwen3-TTS-Instruct-Flash-Realtime
- Qwen3-TTS-VD-Realtime
- Qwen3-TTS-VC-Realtime
- Qwen3-TTS-Flash-Realtime
Nome do modelo | Escopo de implantação do service | Solicitações por minuto (RPM) |
|---|---|---|
qwen3-tts-instruct-flash-realtime | Internacional | 180 |
qwen3-tts-instruct-flash-realtime-2026-01-22 | Internacional | 180 |
Clonagem de voz do Qwen-TTS
- Singapore
- China (Beijing)
Nome do modelo | Escopo de implantação do service | Solicitações por minuto (RPM) |
|---|---|---|
qwen-voice-enrollment | Internacional | 180 |
Design de voz do Qwen-TTS
- Singapore
- China (Beijing)
Nome do modelo | Escopo de implantação do service | Solicitações por minuto (RPM) |
|---|---|---|
qwen-voice-design | Internacional | 180 |
CosyVoice
- Singapore
- China (Beijing)
Nome do modelo | Escopo de implantação do service | Solicitações por segundo (RPS) |
|---|---|---|
cosyvoice-v3-plus | Internacional | 3 |
cosyvoice-v3-flash | Internacional |
Clonagem e design de voz do Qwen-Audio-TTS/CosyVoice
Os modelos de clonagem e design de voz do Qwen-Audio-TTS/CosyVoice compartilham um único modelo e uma única cota de limite de taxa.
- Singapore
- China (Beijing)
Nome do modelo | Escopo de implantação do service | Solicitações por segundo (RPS) |
|---|---|---|
voice-enrollment | Internacional | 10 |
Reconhecimento de fala (fala para texto) e tradução (fala para texto em um idioma especificado)
Qwen3-LiveTranslate-Flash
- Singapore
- China (Beijing)
| Nome do modelo | Escopo de implantação do service | Condições de limitação de taxa (a limitação é acionada quando qualquer valor é excedido)As condições abaixo referem-se à limitação por minuto. O service também pode impor limites de RPS (RPM/60) e TPS (TPM/60) | |
|---|---|---|---|
| Solicitações por minuto (RPM) | Tokens por minuto (TPM)Inclui tokens de entrada e saída | ||
| qwen3-livetranslate-flash | Internacional | 100 | 100.000 |
| qwen3-livetranslate-flash-2025-12-01 | Internacional | 100 | 100.000 |
Qwen-LiveTranslate-Flash-Realtime
- Singapore
- China (Beijing)
| Nome do modelo | Escopo de implantação do service | Condições de limitação de taxa (a limitação é acionada quando qualquer valor é excedido)As condições abaixo referem-se à limitação por minuto. O service também pode impor limites de RPS (RPM/60) e TPS (TPM/60) | |
|---|---|---|---|
| Solicitações por minuto (RPM) | Tokens por minuto (TPM)Inclui tokens de entrada e saída | ||
| qwen3.5-livetranslate-flash-realtime | Internacional | 10 | 100.000 |
| qwen3.5-livetranslate-flash-realtime-2026-05-19 | Internacional | ||
| qwen3-livetranslate-flash-realtime | Internacional | ||
| qwen3-livetranslate-flash-realtime-2025-09-22 | Internacional | ||
Qwen-Audio-3.0-ASR-Flash-Streaming
- Singapore
- China (Beijing)
Nome do modelo | Escopo de implantação do service | Solicitações por segundo (RPS) |
|---|---|---|
qwen-audio-3.0-asr-flash-streaming | Internacional | 20 |
Qwen-Audio-3.0-ASR-Flash-Filetrans
- Singapore
- China (Beijing)
Nome do modelo | Escopo de implantação do service | Solicitações por minuto (RPM) |
|---|---|---|
qwen-audio-3.0-asr-flash-filetrans | Internacional | 600 |
Qwen-Audio-3.0-ASR-Flash
- Singapore
- China (Beijing)
Nome do modelo | Escopo de implantação do service | Solicitações por minuto (RPM) |
|---|---|---|
qwen-audio-3.0-asr-flash | Internacional | 600 |
Qwen-ASR
- Singapore
- US (Virginia)
- China (Beijing)
- Qwen3-ASR-Flash-Filetrans
- Qwen3-ASR-Flash
Nome do modelo | Escopo de implantação do service | Solicitações por minuto (RPM) |
|---|---|---|
qwen3-asr-flash-filetrans | Internacional | 100 |
qwen3-asr-flash-filetrans-2025-11-17 | Internacional |
Qwen-ASR-Realtime
- Singapore
- China (Beijing)
Nome do modelo | Escopo de implantação do service | Solicitações por segundo (RPS) |
|---|---|---|
qwen3-asr-flash-realtime | Internacional | 20 |
qwen3-asr-flash-realtime-2026-02-10 | Internacional | |
qwen3-asr-flash-realtime-2025-10-27 | Internacional |
Paraformer
- China (Beijing)
Nome do modelo | Solicitações por segundo (RPS) |
|---|---|
paraformer-realtime-v2 | 20 |
paraformer-realtime-8k-v2 |
Nome do modelo | Solicitações por minuto (RPM) |
|---|---|
paraformer-v2 | 1.200 |
Nome do modelo | Solicitações por segundo (RPS) | Tarefas simultâneas (concorrência) |
|---|---|---|
paraformer-8k-v2 | 20 | 100 |
Fun-ASR
- Singapore
- China (Beijing)
Nome do modelo | Escopo de implantação do service | Solicitações por minuto (RPM) |
|---|---|---|
fun-asr | Internacional | 600 |
fun-asr-2025-11-07 | Internacional | 600 |
fun-asr-2025-08-25 | Internacional | 600 |
fun-asr-mtl | Internacional | 100 |
fun-asr-mtl-2025-08-25 | Internacional | 100 |
fun-asr-flash-2026-06-15 | Internacional | 600 |
Fun-ASR-Realtime
- Singapore
- China (Beijing)
Nome do modelo | Escopo de implantação do service | Solicitações por segundo (RPS) |
|---|---|---|
fun-asr-realtime | Internacional | 20 |
fun-asr-realtime-2025-11-07 | Internacional |
Embedding de texto
- Singapore
- China (Beijing)
- Hong Kong (China)
| Nome do modelo | Escopo de implantação do service | Condições de limitação de taxa (acionadas se qualquer valor for excedido)Os limites abaixo são por minuto. O service também pode impor limites baseados em solicitações por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60). | |
|---|---|---|---|
| Solicitações por minuto (RPM) | Tokens por minuto (TPM)Inclui tokens de entrada e saída. | ||
| text-embedding-v4 | Internacional | 1.800 | 1.000.000 |
| text-embedding-v3 | Internacional | 6.000 | 24.000.000 |
Embedding multimodal
- Singapore
- China (Beijing)
| Nome do modelo | Escopo de implantação do service | Condições de limitação de taxaOs limites a seguir são por minuto. O service também pode impor limites com base em solicitações por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60). | |
|---|---|---|---|
| Solicitações por minuto (RPM) | Tokens por minuto (TPM)Apenas tokens de entrada. | ||
| tongyi-embedding-vision-plus | Internacional | 600 | 200.000 |
| tongyi-embedding-vision-flash | Internacional | 600 | 200.000 |
Modelo de ordenação
- Singapore
- China (Beijing)
| Nome do modelo | Escopo de implantação do service | Condições de limitação de taxaOs limites a seguir são por minuto. O service também pode impor limites com base em solicitações por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60). | |
|---|---|---|---|
| Solicitações por minuto (RPM) | Tokens por minuto (TPM)Apenas tokens de entrada. | ||
| qwen3-rerank | Internacional | 5.400 | 5.000.000.000 |
Indústria
Reconhecimento de intenção
- China (Beijing)
| Nome do modelo | Condições de limitação de taxa (acionadas se qualquer valor for excedido)Os limites a seguir são por minuto. O service também pode impor limites com base em solicitações por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60). | |
|---|---|---|
| Solicitações por minuto (RPM) | Tokens por minuto (TPM)Inclui tokens de entrada e saída | |
| tongyi-intent-detect-v3 | 1.200 | 1.000.000 |
Assunção de papel
- Singapore
- US (Virginia)
- China (Beijing)
| Nome do modelo | Escopo de implantação do service | Condições de limitação de taxa (acionadas se qualquer valor for excedido)Os limites a seguir são por minuto. O service também pode impor limites com base em solicitações por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60). | |
|---|---|---|---|
| Solicitações por minuto (RPM) | Tokens por minuto (TPM)Inclui tokens de entrada e saída. | ||
| qwen-plus-character | Internacional | 120 | 500.000 |
| qwen-flash-character | Internacional | 120 | 500.000 |
| qwen-plus-character-ja | Internacional | 120 | 500.000 |
Modelos offline
Para mais informações, consulte Model unpublishing policy .
- Offline on January 30, 2026
- Offline on August 20, 2025
| Categoria | Nome do modelo | Condições de limitação de taxa (acionadas se qualquer valor for excedido) | |
|---|---|---|---|
| Solicitações por minuto (RPM) | Tokens por minuto (TPM)Inclui tokens de entrada e saída. | ||
| Qwen-Plus | qwen-plus-2024-11-27 | 0 | 0 |
| qwen-plus-2024-11-25 | |||
| qwen-plus-2024-09-19 | |||
| qwen-plus-2024-08-06 | |||
| Qwen-Turbo | qwen-turbo-2024-09-19 | ||
| Qwen-VL | qwen-vl-max-2024-10-30 | ||
| qwen-vl-max-2024-08-09 | |||
| qwen-vl-plus-2024-08-09 | |||