Skip to main content
Começar

Rate limiting

O Alibaba Cloud Model Studio aplica limitação de taxa às chamadas de modelo no nível da conta Alibaba Cloud, agregando o uso de todos os usuários RAM, workspaces e chaves de API vinculados à conta. As solicitações são rejeitadas quando o limite é excedido e a recuperação geralmente ocorre de forma automática em até um minuto.

Regras de limitação de taxa

  • Limitação de taxa no nível da conta: Os limites de taxa são aplicados no nível da conta raiz. O uso de todos os usuários RAM, workspaces e chaves de API associados à conta é consolidado.
  • Limitação de taxa específica por modelo: Cada modelo possui seu próprio limite de taxa. Para mais informações, consulte as tabelas abaixo.

Limites de tamanho do corpo da requisição

O gateway da API aplica os seguintes limites ao tamanho do corpo da requisição:
Tipo de requisiçãoLimite
Requisições sem conteúdo Base64Tamanho máximo do corpo da requisição: 16 MiB
Requisições com conteúdo Base64 (protocolo Anthropic)Conteúdo Base64 individual máximo: 32 MiB
Requisições com conteúdo Base64 (outros protocolos)Conteúdo Base64 individual máximo: 20 MiB
Requisições com conteúdo Base64 (corpo da requisição total)Máximo: 64 MiB
Após a decodificação Base64 no lado do servidor, o tamanho total do corpo da requisição ainda não deve exceder 16 MiB. Requisições que excedam esses limites serão rejeitadas pelo gateway com um erro HTTP 413.

Perguntas frequentes

Por que a limitação de taxa é acionada?

Identifique o tipo de limite de taxa acionado com base na mensagem de erro:
  • Requests rate limit exceeded ou You exceeded your current requests list: Indica que o limite de solicitações por minuto (RPM) foi atingido.
  • Allocated quota exceeded ou You exceeded your current quota: Sinaliza que o limite de tokens por minuto (TPM) foi ultrapassado.
  • Request rate increased too quickly: A frequência de solicitações aumentou abruptamente em um curto período, ativando a proteção de estabilidade do sistema. Isso pode ocorrer mesmo que o número total de chamadas não tenha atingido os limites de RPM ou TPM.
  • Para outros erros, consulte Error codes para confirmar a causa.
Além de RPM e TPM, a limitação de taxa pode ser aplicada no nível de segundos para solicitações por segundo (RPS), que corresponde a RPM/60, e tokens por segundo (TPS), equivalente a TPM/60. Mesmo que o total de chamadas por minuto não exceda o limite, um pico repentino de solicitações em um curto intervalo ainda pode acionar a limitação.

Como visualizar o uso do modelo

Uma hora após chamar um modelo, acesse a página Monitoring (Singapore ou Beijing). Defina as condições de consulta, como intervalo de tempo e workspace. Em seguida, na área Models, localize o modelo desejado e clique em Monitor na coluna Actions para visualizar as estatísticas de chamadas do modelo. Para mais informações, consulte o documento Monitoring.
Os dados são atualizados a cada hora. Durante períodos de pico, pode haver uma latência de até uma hora.
image

Quanto tempo leva para recuperar da limitação de taxa?

A recuperação normalmente ocorre em até um minuto. Caso outros erros surjam, consulte Error codes para solução de problemas.

A velocidade de resposta do modelo está relacionada ao status de pagamento?

A velocidade de resposta do modelo não depende do uso de cota gratuita ou de chamadas pagas. Ambas utilizam a mesma infraestrutura de service de modelo, portanto a velocidade de geração para um determinado modelo é idêntica. A cota gratuita controla apenas se uma solicitação é aceita: uma vez esgotada, a solicitação é rejeitada com um erro 403 (caso você tenha ativado stop when the free quota is used up). Isso não reduz a velocidade de geração de nenhuma solicitação já aceita.

Quais fatores afetam a velocidade de resposta do modelo?

  • Tipo de modelo: Modelos leves (como qwen-flash) geram respostas mais rapidamente do que modelos maiores (como qwen-max).
  • Comprimento da saída: Quanto mais tokens uma resposta contém, maior será o tempo total de geração.
  • Carga do servidor: A velocidade de resposta pode apresentar pequenas flutuações durante períodos de pico.

A limitação de taxa reduz a velocidade de geração das solicitações aceitas?

Não. A limitação de taxa (RPM/TPM) apenas rejeita solicitações que excedem o limite, retornando um erro 429. Quando a cota gratuita se esgota (se você tiver ativado stop when the free quota is used up), as solicitações são rejeitadas com um erro 403. Nenhum dos casos afeta a velocidade de geração das solicitações já aceitas: 429 indica limitação de taxa e 403 indica esgotamento de cota — ambos são mecanismos de rejeição, não de redução de velocidade.

Como evitar a limitação de taxa

  1. Escolha modelos com limites de taxa mais altos: Versões estáveis ou mais recentes oferecem limites de taxa superiores aos das versões snapshot datadas.
  2. Otimize sua estratégia de chamadas
    • Reduza a frequência de chamadas: Se receber um erro Requests rate limit exceeded ou You exceeded your current requests list, diminua a frequência de chamadas à API.
    • Diminua o consumo de tokens: Ao receber um erro Allocated quota exceeded ou You exceeded your current quota, encurte a entrada ou limite o tamanho da saída.
    • Suavize a taxa de solicitações: Caso receba um erro Request rate increased too quickly, utilize agendamento uniforme, backoff exponencial ou uma fila de solicitações para distribuir as requisições de maneira equilibrada e evitar picos repentinos.
  3. Adicione um modelo de backup Se a limitação de taxa for acionada, alterne para um modelo de backup para continuar a geração. Essa prática reduz a probabilidade de falhas e aumenta o throughput. O código abaixo tenta automaticamente com qwen-plus-2025-07-14 após a limitação de taxa ser acionada para qwen-plus-2025-07-28. Você também pode escolher um modelo de uma série diferente (como qwen-flash) como backup para reduzir ainda mais o risco de ambos os modelos serem limitados simultaneamente.
    import os
    import asyncio
    from openai import AsyncOpenAI, APIStatusError
    
    # Configuration
    API_KEY = os.getenv("DASHSCOPE_API_KEY")
    # Primary model
    MODEL = "qwen-plus-2025-07-28"
    # Backup model
    BACKUP_MODEL = "qwen-plus-2025-07-14"
    # Test question
    QUESTION = "Who are you?"
    # Concurrency setting
    NUM_REQUESTS = 10
    
    client = AsyncOpenAI(
        api_key=API_KEY,
        # When calling, replace {WorkspaceId} with your actual workspace ID.
        base_url="https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/compatible-mode/v1"
    )
    
    async def send_request(model):
        """Sends a single request."""
        try:
            await client.chat.completions.create(
                model=model,
                messages=[{"role": "user", "content": QUESTION}]
            )
            return True
        except APIStatusError as e:
            if e.status_code == 429:
                print(f"[Rate limit triggered] Model {model}")
                return False
            raise
        except Exception as e:
            print(f"[Request failed] Model {model}, Error: {e}")
            return False
    
    async def task(i):
        # Try the primary model.
        if await send_request(MODEL):
            return True
        # If rate limited, try the backup model.
        return await send_request(BACKUP_MODEL)
    
    async def main():
        results = await asyncio.gather(*(task(i) for i in range(NUM_REQUESTS)))
        print(f"Successful requests: {sum(results)}, Failed requests: {len(results) - sum(results)}")
    
    if __name__ == "__main__":
        asyncio.run(main())
    
  4. Divida as tarefas: Conversas longas ou documentos extensos podem consumir muitos tokens rapidamente. Divida grandes tarefas em lotes menores e envie-as em momentos diferentes.
  5. Utilize inferência em lote: Para tarefas que não exigem respostas em tempo real, use o Batch API. Solicitações em lote não estão sujeitas aos limites de taxa em tempo real, mas considere o tempo de fila e processamento.
  6. Aumente os limites de taxa: Se os limites padrão forem insuficientes, aumente a cota temporária de TPM para um modelo na página Increase Rate Limits no console do Model Studio. O aumento entra em vigor imediatamente. Para mais informações, consulte Aumentar limites temporários de taxa.

Como controlar o uso de tokens ou custos

A limitação de taxa restringe apenas a taxa de solicitações por unidade de tempo; ela não limita o uso acumulado. Para controlar o uso de tokens ou custos, utilize os seguintes métodos:
  • Defina um limite de gastos e alertas de custo: No cartão Billing, configure Cost alerts para ativar um limite mensal de gastos e notificações de limiar. Você será notificado ao atingir o limiar, o que ajuda a evitar gastos excessivos. Para mais informações, consulte Query bills and manage costs.
  • Ative a parada ao esgotar a cota gratuita: Para modelos que oferecem cota gratuita, ative stop when the free quota is used up para que as chamadas parem automaticamente assim que a cota gratuita acabar, evitando cobranças adicionais. Para mais informações, consulte Free quota.
  • Monitore o uso do modelo: Verifique regularmente o consumo de tokens de cada modelo para detectar crescimentos anômalos a tempo. Consulte Como visualizar o uso do modelo acima.

Ainda serei limitado após recarregar minha conta?

Recarregar sua conta não altera os limites padrão de RPM e TPM de um modelo. Os limites de taxa são configurados no nível da conta Alibaba Cloud e independem do faturamento. A recarga (pagamento conforme o uso) garante apenas que sua conta não seja suspensa por pagamentos atrasados; ela não aumenta seus limites de taxa. Para obter limites de taxa mais altos, consulte a seção Como evitar a limitação de taxa neste tópico ou solicite um aumento na página Increase Rate Limits no console do Model Studio. Para mais informações, consulte Aumentar limites temporários de taxa.

Aumentar limites temporários de taxa

Se os limites padrão forem insuficientes, aumente a cota temporária de TPM de um modelo no console do Model Studio. O aumento entra em vigor imediatamente e é válido por 30 dias. Após a expiração, a cota retorna automaticamente ao padrão do sistema. Este recurso está disponível atualmente nas regiões China (Beijing) e Singapore.
  1. Faça login no console do Model Studio e acesse a página Increase Rate Limits.
  2. Clique em Increase Temporary Rate Limit no canto superior direito.
  3. Na caixa de diálogo exibida, selecione um Model e insira o valor desejado para Token Account Limit (Token/60 seconds). A caixa de diálogo mostra a cota atual e o limite máximo configurável.
  4. Clique em Confirm. A cota aumentada entra em vigor imediatamente.
Após a entrada em vigor do aumento de cota, confirme-o das seguintes formas:
  • Na página Increase Rate Limits, visualize na lista os modelos com cotas aumentadas e seus respectivos dados de limite de taxa.
  • No Model List, acesse a página de detalhes do modelo correspondente para visualizar os dados atualizados do limite de taxa.
  • Os modelos para os quais é possível aumentar temporariamente as cotas estão listados na caixa de diálogo da página Increase Rate Limits.
  • Enviar outra solicitação para um modelo que já possui cota aumentada é considerado uma nova aplicação, e o período de validade é reiniciado para 30 dias.
  • Solicite uma cota baseada em suas necessidades reais. Se a capacidade provisionada exceder significativamente o uso real por um longo período, o sistema poderá restaurá-la ao valor padrão mediante notificação prévia.
  • Caso a cota de limite de taxa disponível ainda não atenda às suas necessidades, entre em contato com seu gerente de conta para solicitar um aumento adicional.

Geração de texto - Qwen

Modelo de linguagem Qwen

  • Singapore
  • US (Virginia)
  • China (Beijing)
  • Germany (Frankfurt)
  • Hong Kong (China)
  • Japan (Tokyo)
Nome do modeloEscopo de implantação do serviceCondições de limitação de taxa (acionadas se qualquer valor for excedido)
Os limites a seguir são por minuto. O service também pode aplicar limites com base em requisições por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60).
Requisições por minuto (RPM)Tokens por minuto (TPM)
Inclui tokens de entrada e saída.
qwen3.8-maxInternational15.0002.000.000
qwen3.8-max-0902International15.000150.000
qwen3.8-flashInternational15.0002.000.000
qwen3.7-maxInternational6001.000.000
qwen3.7-max-2026-06-08International601.000.000
qwen3.7-max-2026-05-20International601.000.000
qwen3.7-max-previewInternational6001.000.000
qwen3.7-max-2026-05-17International6001.000.000
qwen3.6-max-previewInternational6001.000.000
qwen3-maxInternational6001.000.000
qwen3-max-2026-01-23International6001.000.000
qwen3-max-2025-09-23International60100.000
qwen3-max-previewInternational6001.000.000
qwen-max
A limitação de taxa não se aplica a chamadas de service feitas usando o Batch API.
International6001.000.000
qwen3.7-plusInternational15.0005.000.000
qwen3.7-plus-2026-05-26International601.000.000
qwen3.6-plusInternational15.0005.000.000
qwen3.6-plus-2026-04-02International601.000.000
qwen3.7-flashInternational15.0005.000.000
qwen3.7-flash-2026-07-15International15.0005.000.000
qwen3.6-flashInternational15.0005.000.000
qwen3.6-flash-2026-04-16International601.000.000
qwen3.5-plusInternational15.0005.000.000
qwen3.5-plus-2026-04-20International6001.000.000
qwen3.5-plus-2026-02-15International601.000.000
qwen-plus
A limitação de taxa não se aplica a chamadas de service feitas usando o Batch API.
International6001.000.000
qwen-plus-latestInternational6001.000.000
qwen-plus-2025-12-01International1201.000.000
qwen-plus-2025-09-11International1201.000.000
qwen-plus-2025-07-28International60100.000
qwen-plus-2025-07-14(qwen-plus-0714)International60100.000
qwen-plus-2025-04-28(qwen-plus-0428)International601.000.000
qwen-plus-2025-01-25(qwen-plus-0125)International60100.000
qwen3.5-flashInternational15.0005.000.000
qwen3.5-flash-2026-02-23International601.000.000
qwen-flash
A limitação de taxa não se aplica a chamadas de service feitas usando o Batch API.
International6005.000.000
qwen-flash-2025-07-28International6005.000.000
qwq-plusInternational60100.000
qwen-turbo
A limitação de taxa não se aplica a chamadas de service feitas usando o Batch API.
International6005.000.000

Qwen-VL (compreensão visual/imagem para texto)

  • Singapore
  • US (Virginia)
  • China (Beijing)
  • Germany (Frankfurt)
  • Hong Kong (China)
Model nameService deployment scopeRate limiting conditions (triggered if any value is exceeded)
The following limits are per minute. The service may also enforce limits based on requests per second (RPS = RPM/60) and tokens per second (TPS = TPM/60).
Requests per minute (RPM)Tokens per minute (TPM)
Includes input and output tokens.
qwen3-vl-plusInternational1,2001,000,000
qwen3-vl-plus-2025-12-19International60100,000
qwen3-vl-plus-2025-09-23International1201,000,000
qwen3-vl-flashInternational1,2001,000,000
qwen3-vl-flash-2026-01-22International60100,000
qwen3-vl-flash-2025-10-15International1201,000,000
qwen-vl-maxInternational1,2001,000,000
qwen-vl-plusInternational1,2001,000,000
qvq-maxInternational60100,000

Qwen-Omni (omnimodal)

  • Singapore
  • China (Beijing)
Model nameService deployment scopeRate limiting conditions (triggered if any value is exceeded)
The following limits are per minute. The service may also enforce limits based on requests per second (RPS = RPM/60) and tokens per second (TPS = TPM/60).
Requests per minute (RPM)Tokens per minute (TPM)
Includes input and output tokens.
qwen3.5-omni-flashInternational60100,000
qwen3.5-omni-flash-2026-03-15International60100,000
qwen3.5-omni-plusInternational60100,000
qwen3.5-omni-plus-2026-03-15International60100,000
qwen3-omni-flashInternational60100,000
qwen3-omni-flash-2025-12-01International60100,000
qwen3-omni-flash-2025-09-15International60100,000
qwen-omni-turboInternational60100,000
qwen-omni-turbo-latestInternational60100,000
qwen-omni-turbo-2025-03-26International60100,000

Qwen-Omni-Realtime (multimodal em tempo real)

  • Singapore
  • China (Beijing)
Nome do modeloEscopo de implantação do serviceCondições de limitação de taxa (acionadas se qualquer valor for excedido)
Os limites a seguir são por minuto. O service também pode impor limites com base em requisições por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60).
Requisições por minuto (RPM)Tokens por minuto (TPM)
Inclui tokens de entrada e saída.
qwen3.5-omni-plus-realtimeInternacional60100.000
qwen3.5-omni-plus-realtime-2026-03-15Internacional60100.000
qwen3.5-omni-flash-realtimeInternacional60100.000
qwen3.5-omni-flash-realtime-2026-03-15Internacional60100.000
qwen3-omni-flash-realtimeInternacional60100.000
qwen3-omni-flash-realtime-2025-12-01Internacional60100.000
qwen3-omni-flash-realtime-2025-09-15Internacional60100.000
qwen-omni-turbo-realtimeInternacional6010.000
qwen-omni-turbo-realtime-latestInternacional6010.000
qwen-omni-turbo-realtime-2025-05-08Internacional6010.000

Qwen-OCR (extração de texto)

  • Singapore
  • US (Virginia)
  • China (Beijing)
  • Germany (Frankfurt)
Nome do modeloEscopo de implantação do serviceCondições de limitação de taxa (acionadas se qualquer valor for excedido)
Os limites a seguir são por minuto. O service também pode impor limites com base em requisições por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60).
Requisições por minuto (RPM)Tokens por minuto (TPM)
Inclui tokens de entrada e saída.
qwen-vl-ocrInternacional6006.000.000
qwen-vl-ocr-2025-11-20Internacional1.2006.000.000

Modelo matemático Qwen

  • China (Beijing)
Nome do modeloCondições de limitação de taxa (acionadas se qualquer valor for excedido)
Os limites a seguir são por minuto. O service também pode impor limites com base em requisições por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60).
Requisições por minuto (RPM)Tokens por minuto (TPM)
Inclui tokens de entrada e saída
qwen-math-plus1.2001.000.000
qwen-math-plus-latest1.2001.000.000
qwen-math-plus-2024-09-19(qwen-math-plus-0919)60100.000
qwen-math-plus-2024-08-16(qwen-math-plus-0816)1020.000
qwen-math-turbo12001.000.000

Qwen-Coder

  • Singapore
  • US (Virginia)
  • China (Beijing)
  • Germany (Frankfurt)
Nome do modeloEscopo de implantação do serviceCondições de limitação de taxa (acionadas se qualquer valor for excedido)
Os limites a seguir são por minuto. O service também pode impor limites com base em solicitações por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60).
Solicitações por minuto (RPM)Tokens por minuto (TPM)
Inclui tokens de entrada e saída.
qwen3-coder-plusInternational2.4002.000.000
qwen3-coder-plus-2025-09-23International6001.000.000
qwen3-coder-plus-2025-07-22International601.000.000
qwen3-coder-flashInternational6005.000.000
qwen3-coder-flash-2025-07-28International6005.000.000

Modelo de tradução Qwen

  • Singapore
  • US (Virginia)
  • China (Beijing)
  • Germany (Frankfurt)
Nome do modeloEscopo de implantação do serviceCondições de limitação de taxa (acionadas se qualquer valor for excedido)
Os limites a seguir são por minuto. O service também pode impor limites com base em solicitações por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60).
Solicitações por minuto (RPM)Tokens por minuto (TPM)
Inclui tokens de entrada e saída.
qwen-mt-plusInternational60100.000
qwen-mt-flashInternational60100.000
qwen-mt-liteInternational60100.000
qwen-mt-turboInternational60100.000

Modelo de mineração de dados Qwen

  • China (Beijing)
Nome do modeloCondições de limitação de taxa (acionadas se qualquer valor for excedido)
Os limites a seguir são por minuto. O service também pode impor limites com base em solicitações por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60).
Solicitações por minuto (RPM)Tokens por minuto (TPM)
Inclui tokens de entrada e saída
qwen-doc-turbo6003.000.000

Modelo de pesquisa profunda Qwen

  • China (Beijing)
Nome do modeloCondições de limitação de taxa (acionadas se qualquer valor for excedido)
Os limites a seguir são por minuto. O service também pode impor limites com base em solicitações por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60).
Solicitações por minuto (RPM)Tokens por minuto (TPM)
Inclui tokens de entrada e saída
qwen-deep-research1201.200.000

Geração de texto - Qwen - Código aberto

Modelo de linguagem Qwen open source

  • Singapore
  • US (Virginia)
  • China (Beijing)
  • Germany (Frankfurt)
Nome do modeloEscopo de implantação do serviceCondições de limitação de taxa (acionadas se qualquer valor for excedido)
Os limites a seguir são por minuto. O service também pode aplicar limites com base em requisições por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60).
Requisições por minuto (RPM)Tokens por minuto (TPM)
Inclui tokens de entrada e saída.
qwen3.8-2.4t-a95bInternational5.0005.000.000
qwen3.8-27bInternational5.0005.000.000
qwen3.6-35b-a3bInternational6001.000.000
qwen3.6-27bInternational6001.000.000
qwen3.5-397b-a17bInternational6001.000.000
qwen3.5-122b-a10bInternational6001.000.000
qwen3.5-27bInternational6001.000.000
qwen3.5-35b-a3bInternational6005.000.000
qwen3-next-80b-a3b-thinkingInternational6001.000.000
qwen3-next-80b-a3b-instructInternational6001.000.000
qwen3-235b-a22b-thinking-2507International6001.000.000
qwen3-235b-a22b-instruct-2507International6001.000.000
qwen3-30b-a3b-thinking-2507International6005.000.000
qwen3-30b-a3b-instruct-2507International6005.000.000
qwen3-235b-a22bInternational6001.000.000
qwen3-32bInternational6001.000.000
qwen3-30b-a3bInternational6001.000.000
qwen3-14bInternational6001.000.000
qwen3-8bInternational6001.000.000

Qwen-VL (compreensão visual/imagem para texto)

  • Singapore
  • US (Virginia)
  • China (Beijing)
  • Germany (Frankfurt)
Nome do modeloEscopo de implantação do serviceCondições de limitação de taxa (acionadas se qualquer valor for excedido)
Os limites a seguir são por minuto. O service também pode impor limites com base em requisições por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60).
Requisições por minuto (RPM)Tokens por minuto (TPM)
Inclui tokens de entrada e saída.
qwen3-vl-32b-thinkingInternacional60100.000
qwen3-vl-32b-instructInternacional60100.000
qwen3-vl-30b-a3b-thinkingInternacional60100.000
qwen3-vl-30b-a3b-instructInternacional60100.000
qwen3-vl-8b-thinkingInternacional60100.000
qwen3-vl-8b-instructInternacional60100.000
qwen3-vl-235b-a22b-thinkingInternacional60100.000
qwen3-vl-235b-a22b-instructInternacional60100.000

Qwen3-Omni

  • Singapore
  • China (Beijing)
Nome do modeloEscopo de implantação do serviceCondições de limitação de taxa (acionadas se qualquer valor for excedido)
Os limites a seguir são por minuto. O service também pode impor limites com base em requisições por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60).
Requisições por minuto (RPM)Tokens por minuto (TPM)
Inclui tokens de entrada e saída.
qwen2.5-omni-7bInternacional60100.000

Qwen3-Omni-Captioner

  • Singapore
  • China (Beijing)
Nome do modeloEscopo de implantação do serviceCondições de limitação de taxa (acionadas se qualquer valor for excedido)
Os limites a seguir são por minuto. O service também pode impor limites com base em requisições por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60).
Requisições por minuto (RPM)Tokens por minuto (TPM)
Inclui tokens de entrada e saída.
qwen3-omni-30b-a3b-captionerInternacional60100.000

Qwen-Coder

  • Singapore
  • US (Virginia)
  • China (Beijing)
  • Germany (Frankfurt)
Nome do modeloEscopo de implantação do serviceCondições de limitação de taxa (acionadas se qualquer valor for excedido)
Os limites a seguir são por minuto. O service também pode impor limites com base em requisições por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60).
Requisições por minuto (RPM)Tokens por minuto (TPM)
Inclui tokens de entrada e saída.
qwen3-coder-nextInternacional6001.000.000
qwen3-coder-480b-a35b-instructInternacional6001.000.000
qwen3-coder-30b-a3b-instructInternacional6001.000.000

Geração de texto - Modelos de terceiros

DeepSeek

  • Singapore
  • US (Virginia)
  • China (Beijing)
  • Germany (Frankfurt)
  • Japan (Tokyo)
  • Hong Kong (China)
Nome do modeloEscopo de implantação do serviceCondições de limitação de taxa (acionadas se qualquer valor for excedido)
Os limites a seguir são por minuto. O service também pode impor limites com base em requisições por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60).
Requisições por minuto (RPM)Tokens por minuto (TPM)
Inclui tokens de entrada e saída.
deepseek-v4-proInternacional10.0001.200.000
deepseek-v4-pro-0813Internacional10.0001.200.000
deepseek-v4-flash-0731Internacional15.0001.200.000
deepseek-v4-flashInternacional10.0001.200.000
deepseek-v3.2Internacional10.0001.200.000

Kimi

  • China (Beijing)
  • US (Virginia)
  • Germany (Frankfurt)
  • Hong Kong (China)
  • Japan (Tokyo)
  • Singapore
Nome do modeloCondições de limitação de taxa (acionadas se qualquer valor for excedido)
Os limites a seguir são por minuto. O service também pode impor limites com base em requisições por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60).
Requisições por minuto (RPM)Tokens por minuto (TPM)
Inclui tokens de entrada e saída
kimi-k315.0001.200.000
kimi-k2.7-code5001.000.000
kimi-k2.65001.000.000
kimi-k2.55001.000.000
kimi-k2-thinking5001.000.000
Moonshot-Kimi-K2-Instruct5001.000.000

MiniMax

  • China (Beijing)
Nome do modeloCondições de limitação de taxa (acionadas se qualquer valor for excedido)
Os limites a seguir são por minuto. O service também pode impor limites com base em requisições por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60).
Requisições por minuto (RPM)Tokens por minuto (TPM)
Inclui tokens de entrada e saída
MiniMax-M2.55001.000.000

GLM

  • US (Virginia)
  • China (Beijing)
  • Germany (Frankfurt)
  • Singapore
  • Hong Kong (China)
  • Japan (Tokyo)
Nome do modeloEscopo de implantação do serviceCondições de limitação de taxa (acionadas se qualquer valor for excedido)
Os limites a seguir são por minuto. O service também pode impor limites com base em requisições por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60).
Requisições por minuto (RPM)Tokens por minuto (TPM)
Inclui tokens de entrada e saída.
glm-5.2Global5001.000.000
glm-5.2-usEUA5001.000.000
glm-5.1Global5001.000.000

Fornecimento direto GLM-Z.AI

  • Singapore
Nome do modeloLimites de taxa (acionados se qualquer valor for excedido)
Os limites a seguir são por minuto. O service também pode impor limites com base em requisições por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60).
Requisições por minuto (RPM)Tokens por minuto (TPM)
Incluindo tokens de entrada e saída
ZHIPU/GLM-5.32003.000.000
ZHIPU/GLM-5.22003.000.000

Geração de imagens

Qwen-Image

  • Singapore
  • China (Beijing)
  • Hong Kong (China)
  • Germany (Frankfurt)
  • Japan (Tokyo)

Model name

Service deployment scope

Condições de limitação de taxa (acionadas se qualquer valor for excedido)

Limite de chamadas de API para envio de tarefas

Número de tarefas simultâneas (concorrência)

qwen-image-3.0-pro

Internacional

5 requisições/minuto

Sem limite para APIs síncronas / 10 para APIs assíncronas

qwen-image-3.0

Internacional

20 requisições/minuto

Sem limite para APIs síncronas / 10 para APIs assíncronas

qwen-image-2.0-pro

Internacional

2 vezes/minuto

Sem limite para APIs síncronas

qwen-image-2.0-pro-2026-06-22

Internacional

2 vezes/minuto

Sem limite para APIs síncronas

qwen-image-2.0-pro-2026-04-22

Internacional

2 vezes/minuto

Sem limite para APIs síncronas

qwen-image-2.0-pro-2026-03-03

Internacional

2 vezes/minuto

Sem limite para APIs síncronas

qwen-image-2.0

Internacional

2 vezes/segundo

Sem limite para APIs síncronas

qwen-image-2.0-2026-03-03

Internacional

2 vezes/segundo

Sem limite para APIs síncronas

qwen-image-max

Internacional

2 vezes/minuto

Sem limite para APIs síncronas

qwen-image-max-2025-12-30

Internacional

2 vezes/minuto

Sem limite para APIs síncronas

qwen-image-plus

Internacional

2 vezes/segundo

Sem limite para APIs síncronas / 2 para APIs assíncronas

qwen-image-plus-2026-01-09

Internacional

2 vezes/segundo

Sem limite para APIs síncronas

qwen-image

Internacional

2 vezes/segundo

Sem limite para APIs síncronas / 2 para APIs assíncronas

qwen-image-edit-max

Internacional

2 vezes/minuto

Sem limite para APIs síncronas

qwen-image-edit-max-2026-01-16

Internacional

2 vezes/minuto

Sem limite para APIs síncronas

qwen-image-edit-plus

Internacional

2 vezes/segundo

Sem limite para APIs síncronas

qwen-image-edit-plus-2025-12-15

Internacional

2 vezes/segundo

Sem limite para APIs síncronas

qwen-image-edit-plus-2025-10-30

Internacional

2 vezes/segundo

Sem limite para APIs síncronas

qwen-image-edit

Internacional

2 vezes/segundo

Sem limite para APIs síncronas

Texto para imagem - Z-Image

  • Singapore
  • China (Beijing)

Model name

Service deployment scope

Condições de limitação de taxa (acionadas se qualquer valor for excedido)

Solicitações por segundo (RPS)

Número de tarefas simultâneas (concorrência)

z-image-turbo

Internacional

2

Sem limite para APIs síncronas

Wanxiang

  • Singapore
  • US (Virginia)
  • China (Beijing)
  • Germany (Frankfurt)

Model name

Service deployment scope

Condições de limitação de taxa (acionadas se qualquer valor for excedido)

Solicitações por segundo (RPS)

Número de tarefas simultâneas (concorrência)

wan2.7-image-pro

Internacional

5

5

wan2.7-image

Internacional

5

5

wan2.6-image

Internacional

5

5

wan2.6-t2i

Internacional

5

5

wan2.5-t2i-preview

Internacional

5

5

wan2.2-t2i-flash

Internacional

2

2

wan2.2-t2i-plus

Internacional

2

2

wan2.1-t2i-turbo

Internacional

2

2

wan2.1-t2i-plus

Internacional

2

2

wan2.5-i2i-preview

Internacional

5

5

OutfitAnyone

  • China (Beijing)

Nome do modelo

Condições de limitação de taxa (acionadas se qualquer valor for excedido)

Solicitações por segundo (RPS)

Número de tarefas simultâneas

aitryon-plus

10

5

aitryon-parsing-v1

10

Sem limite para APIs síncronas

Geração de vídeo

Série HappyHorse

  • Singapore
  • US (Virginia)
  • China (Beijing)
  • Germany (Frankfurt)
  • Japan (Tokyo)

Nome do modelo

Escopo de implantação do service

Condições de limitação de taxa (acionadas se qualquer valor for excedido)

Solicitações por segundo (RPS)

Número de tarefas simultâneas (concorrência)

happyhorse-1.1-t2v

Internacional

5

5

happyhorse-1.1-i2v

Internacional

5

5

happyhorse-1.1-r2v

Internacional

5

5

happyhorse-1.0-t2v

Internacional

5

5

happyhorse-1.0-i2v

Internacional

5

5

happyhorse-1.0-r2v

Internacional

5

5

happyhorse-1.0-video-edit

Internacional

5

5

Série Wanxiang

  • Singapore
  • US (Virginia)
  • China (Beijing)
  • Germany (Frankfurt)

Nome do modelo

Escopo de implantação do service

Condições de limitação de taxa (acionadas se qualquer valor for excedido)

Solicitações por segundo (RPS)

Número de tarefas simultâneas (concorrência)

wan2.7-r2v-2026-06-12

Internacional

5

5

wan2.7-t2v-2026-06-12

Internacional

5

5

wan2.7-t2v-2026-04-25

Internacional

5

5

wan2.7-t2v

Internacional

5

5

wan2.6-t2v

Internacional

5

5

wan2.5-t2v-preview

Internacional

5

5

wan2.2-t2v-plus

Internacional

2

2

wan2.1-t2v-turbo

Internacional

2

2

wan2.1-t2v-plus

Internacional

2

2

wan2.7-i2v-2026-04-25

Internacional

5

5

wan2.7-i2v

Internacional

5

5

wan2.6-i2v-flash

Internacional

5

5

wan2.6-i2v

Internacional

5

5

wan2.5-i2v-preview

Internacional

5

5

wan2.2-i2v-flash

Internacional

2

2

wan2.1-i2v-plus

Internacional

2

2

wan2.1-i2v-turbo

Internacional

2

2

wan2.2-i2v-plus

Internacional

2

2

wan2.2-kf2v-flash

Internacional

2

2

wan2.1-kf2v-plus

Internacional

1

2

wan2.1-vace-plus

Internacional

2

2

wan2.7-videoedit

Internacional

5

5

wan2.7-r2v

Internacional

5

5

wan2.6-r2v-flash

Internacional

5

5

wan2.6-r2v

Internacional

5

5

wan2.2-animate-move

Internacional

5

1

wan2.2-animate-mix

Internacional

5

1

AnimateAnyone

  • China (Beijing)

Nome do modelo

Solicitações por segundo (RPS)

Número de tarefas simultâneas

animate-anyone-detect-gen2

5

Sem limite para APIs síncronas

animate-anyone-template-gen2

5

1

Apenas uma tarefa é executada por vez. As demais tarefas na fila permanecem em estado de espera.

animate-anyone-gen2

5

1

Apenas uma tarefa é executada por vez. As demais tarefas na fila permanecem em estado de espera.

EMO

  • China (Beijing)

Nome do modelo

Solicitações por segundo (RPS)

Número de tarefas simultâneas

emo-detect-v1

5

Sem limite para APIs síncronas

emo-v1

5

1

Apenas uma tarefa é executada por vez. As demais tarefas na fila permanecem em estado de espera.

LivePortrait

  • China (Beijing)

Nome do modelo

Solicitações por segundo (RPS)

Número de tarefas simultâneas

liveportrait-detect

5

Sem limite para APIs síncronas

liveportrait

5

1

Apenas uma tarefa é executada por vez. As demais tarefas na fila permanecem em estado de espera.

VideoRetalk

  • China (Beijing)

Nome do modelo

Solicitações por segundo (RPS)

Número de tarefas simultâneas

videoretalk

1

1

Apenas uma tarefa é executada por vez. As demais tarefas na fila permanecem em estado de espera.

Emoji

  • China (Beijing)

Nome do modelo

Solicitações por segundo (RPS)

Número de tarefas simultâneas

emoji-detect-v1

1

Sem limite para APIs síncronas

emoji-v1

1

1

Apenas uma tarefa é executada por vez. As demais tarefas na fila permanecem em estado de espera.

Transformação de estilo de vídeo

  • China (Beijing)

Nome do modelo

Solicitações por segundo (RPS)

Número de tarefas simultâneas

video-style-transform

20

2

Apenas uma tarefa é executada por vez. As demais tarefas na fila permanecem em estado de espera.

Geração de música

  • China (Beijing)

Nome do modelo

Solicitações por minuto (RPM)

fun-music-preview

180

fun-music-v1

180

Chat de voz

Chat de voz em tempo real

  • Singapore
  • China (Beijing)
Nome do modeloEscopo de implantação do serviceCondições de limitação de taxa (acionadas se qualquer valor for excedido)
Os limites a seguir são por minuto. O service também pode aplicar limites com base em solicitações por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60).
Solicitações por minuto (RPM)Tokens por minuto (TPM)
Inclui tokens de entrada e saída
qwen-audio-3.0-realtime-plusInternacional60100.000
qwen-audio-3.0-realtime-flashInternacional60100.000

Síntese de fala (texto para fala)

Qwen-Audio-TTS

  • Singapore
  • China (Beijing)

Nome do modelo

Escopo de implantação do service

Solicitações por segundo (RPS)

qwen-audio-3.0-tts-plus

Internacional

3

qwen-audio-3.0-tts-flash

Internacional

3

Qwen-TTS

  • Singapore
  • China (Beijing)
  • Qwen3-TTS-Instruct-Flash
  • Qwen3-TTS-VD
  • Qwen3-TTS-VC
  • Qwen3-TTS-Flash

Nome do modelo

Escopo de implantação do service

Solicitações por minuto (RPM)

qwen3-tts-instruct-flash

Internacional

180

qwen3-tts-instruct-flash-2026-01-26

Internacional

180

Qwen-TTS-Realtime

  • Singapore
  • China (Beijing)
  • Qwen3-TTS-Instruct-Flash-Realtime
  • Qwen3-TTS-VD-Realtime
  • Qwen3-TTS-VC-Realtime
  • Qwen3-TTS-Flash-Realtime

Nome do modelo

Escopo de implantação do service

Solicitações por minuto (RPM)

qwen3-tts-instruct-flash-realtime

Internacional

180

qwen3-tts-instruct-flash-realtime-2026-01-22

Internacional

180

Clonagem de voz do Qwen-TTS

  • Singapore
  • China (Beijing)

Nome do modelo

Escopo de implantação do service

Solicitações por minuto (RPM)

qwen-voice-enrollment

Internacional

180

Design de voz do Qwen-TTS

  • Singapore
  • China (Beijing)

Nome do modelo

Escopo de implantação do service

Solicitações por minuto (RPM)

qwen-voice-design

Internacional

180

CosyVoice

  • Singapore
  • China (Beijing)

Nome do modelo

Escopo de implantação do service

Solicitações por segundo (RPS)

cosyvoice-v3-plus

Internacional

3

cosyvoice-v3-flash

Internacional

Clonagem e design de voz do Qwen-Audio-TTS/CosyVoice

Os modelos de clonagem e design de voz do Qwen-Audio-TTS/CosyVoice compartilham um único modelo e uma única cota de limite de taxa.
  • Singapore
  • China (Beijing)

Nome do modelo

Escopo de implantação do service

Solicitações por segundo (RPS)

voice-enrollment

Internacional

10

Reconhecimento de fala (fala para texto) e tradução (fala para texto em um idioma especificado)

Qwen3-LiveTranslate-Flash

  • Singapore
  • China (Beijing)
Nome do modeloEscopo de implantação do serviceCondições de limitação de taxa (a limitação é acionada quando qualquer valor é excedido)
As condições abaixo referem-se à limitação por minuto. O service também pode impor limites de RPS (RPM/60) e TPS (TPM/60)
Solicitações por minuto (RPM)Tokens por minuto (TPM)
Inclui tokens de entrada e saída
qwen3-livetranslate-flashInternacional100100.000
qwen3-livetranslate-flash-2025-12-01Internacional100100.000

Qwen-LiveTranslate-Flash-Realtime

  • Singapore
  • China (Beijing)
Nome do modeloEscopo de implantação do serviceCondições de limitação de taxa (a limitação é acionada quando qualquer valor é excedido)
As condições abaixo referem-se à limitação por minuto. O service também pode impor limites de RPS (RPM/60) e TPS (TPM/60)
Solicitações por minuto (RPM)Tokens por minuto (TPM)
Inclui tokens de entrada e saída
qwen3.5-livetranslate-flash-realtimeInternacional10100.000
qwen3.5-livetranslate-flash-realtime-2026-05-19Internacional
qwen3-livetranslate-flash-realtimeInternacional
qwen3-livetranslate-flash-realtime-2025-09-22Internacional

Qwen-Audio-3.0-ASR-Flash-Streaming

  • Singapore
  • China (Beijing)

Nome do modelo

Escopo de implantação do service

Solicitações por segundo (RPS)

qwen-audio-3.0-asr-flash-streaming

Internacional

20

Qwen-Audio-3.0-ASR-Flash-Filetrans

  • Singapore
  • China (Beijing)

Nome do modelo

Escopo de implantação do service

Solicitações por minuto (RPM)

qwen-audio-3.0-asr-flash-filetrans

Internacional

600

Qwen-Audio-3.0-ASR-Flash

  • Singapore
  • China (Beijing)

Nome do modelo

Escopo de implantação do service

Solicitações por minuto (RPM)

qwen-audio-3.0-asr-flash

Internacional

600

Qwen-ASR

  • Singapore
  • US (Virginia)
  • China (Beijing)
  • Qwen3-ASR-Flash-Filetrans
  • Qwen3-ASR-Flash

Nome do modelo

Escopo de implantação do service

Solicitações por minuto (RPM)

qwen3-asr-flash-filetrans

Internacional

100

qwen3-asr-flash-filetrans-2025-11-17

Internacional

Qwen-ASR-Realtime

  • Singapore
  • China (Beijing)

Nome do modelo

Escopo de implantação do service

Solicitações por segundo (RPS)

qwen3-asr-flash-realtime

Internacional

20

qwen3-asr-flash-realtime-2026-02-10

Internacional

qwen3-asr-flash-realtime-2025-10-27

Internacional

Paraformer

  • China (Beijing)

Nome do modelo

Solicitações por segundo (RPS)

paraformer-realtime-v2

20

paraformer-realtime-8k-v2

Nome do modelo

Solicitações por minuto (RPM)

paraformer-v2

1.200

Nome do modelo

Solicitações por segundo (RPS)

Tarefas simultâneas (concorrência)

paraformer-8k-v2

20

100

Fun-ASR

  • Singapore
  • China (Beijing)

Nome do modelo

Escopo de implantação do service

Solicitações por minuto (RPM)

fun-asr

Internacional

600

fun-asr-2025-11-07

Internacional

600

fun-asr-2025-08-25

Internacional

600

fun-asr-mtl

Internacional

100

fun-asr-mtl-2025-08-25

Internacional

100

fun-asr-flash-2026-06-15

Internacional

600

Fun-ASR-Realtime

  • Singapore
  • China (Beijing)

Nome do modelo

Escopo de implantação do service

Solicitações por segundo (RPS)

fun-asr-realtime

Internacional

20

fun-asr-realtime-2025-11-07

Internacional

Embedding de texto

  • Singapore
  • China (Beijing)
  • Hong Kong (China)
Nome do modeloEscopo de implantação do serviceCondições de limitação de taxa (acionadas se qualquer valor for excedido)
Os limites abaixo são por minuto. O service também pode impor limites baseados em solicitações por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60).
Solicitações por minuto (RPM)Tokens por minuto (TPM)
Inclui tokens de entrada e saída.
text-embedding-v4Internacional1.8001.000.000
text-embedding-v3Internacional6.00024.000.000

Embedding multimodal

  • Singapore
  • China (Beijing)
Nome do modeloEscopo de implantação do serviceCondições de limitação de taxa
Os limites a seguir são por minuto. O service também pode impor limites com base em solicitações por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60).
Solicitações por minuto (RPM)Tokens por minuto (TPM)
Apenas tokens de entrada.
tongyi-embedding-vision-plusInternacional600200.000
tongyi-embedding-vision-flashInternacional600200.000

Modelo de ordenação

  • Singapore
  • China (Beijing)
Nome do modeloEscopo de implantação do serviceCondições de limitação de taxa
Os limites a seguir são por minuto. O service também pode impor limites com base em solicitações por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60).
Solicitações por minuto (RPM)Tokens por minuto (TPM)
Apenas tokens de entrada.
qwen3-rerankInternacional5.4005.000.000.000

Indústria

Reconhecimento de intenção

  • China (Beijing)
Nome do modeloCondições de limitação de taxa (acionadas se qualquer valor for excedido)
Os limites a seguir são por minuto. O service também pode impor limites com base em solicitações por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60).
Solicitações por minuto (RPM)Tokens por minuto (TPM)
Inclui tokens de entrada e saída
tongyi-intent-detect-v31.2001.000.000

Assunção de papel

  • Singapore
  • US (Virginia)
  • China (Beijing)
Nome do modeloEscopo de implantação do serviceCondições de limitação de taxa (acionadas se qualquer valor for excedido)
Os limites a seguir são por minuto. O service também pode impor limites com base em solicitações por segundo (RPS = RPM/60) e tokens por segundo (TPS = TPM/60).
Solicitações por minuto (RPM)Tokens por minuto (TPM)
Inclui tokens de entrada e saída.
qwen-plus-characterInternacional120500.000
qwen-flash-characterInternacional120500.000
qwen-plus-character-jaInternacional120500.000

Modelos offline

Para mais informações, consulte Model unpublishing policy .
  • Offline on January 30, 2026
  • Offline on August 20, 2025
CategoriaNome do modeloCondições de limitação de taxa (acionadas se qualquer valor for excedido)
Solicitações por minuto (RPM)Tokens por minuto (TPM)
Inclui tokens de entrada e saída.
Qwen-Plusqwen-plus-2024-11-2700
qwen-plus-2024-11-25
qwen-plus-2024-09-19
qwen-plus-2024-08-06
Qwen-Turboqwen-turbo-2024-09-19
Qwen-VLqwen-vl-max-2024-10-30
qwen-vl-max-2024-08-09
qwen-vl-plus-2024-08-09
Plano de Tokens
Playground de Modelos
  • Music generation
Inferência do Modelo
Avaliação
Compressão de Modelos
Estatísticas e Monitoramento
Suporte