Este tópico descreve os recursos de entrada longa e cache de prefixo das implantações PTU (Provisioned Throughput), incluindo regras de consumo de cota, uso da Provisioned Throughput Quota Calculator e descrições dos campos de resposta da API.
Visão geral
As implantações PTU suportam solicitações de entrada longa (até 200 mil tokens para alguns modelos) e cache de prefixo. Coeficientes de capacidade em camadas e descontos de cache permitem gerenciar o consumo de cota com flexibilidade.
Principais recursos:
- Suporte a entrada longa: Alguns modelos aceitam entradas superiores a 32 mil tokens. Na conversão para TPM (tokens por minuto), os tokens que ultrapassam o limiar consomem coeficientes em camadas mais altos. Para obter detalhes, consulte Regras de consumo de cota.
- Desconto de cache de prefixo: Alguns modelos oferecem suporte ao cache de prefixo. Tokens de entrada com acerto de cache consomem cota com um coeficiente de desconto (o valor específico varia conforme o modelo), reduzindo o consumo em conversas de múltiplas turnos e cenários com prefixos repetidos.
- Fallback automático para pagamento conforme o uso: Se a cota PTU for excedida ou a entrada ultrapassar o limite do modelo (128K para Qwen / 64K para DeepSeek), a solicitação retornará automaticamente ao faturamento de pagamento conforme o uso. Não é necessário alterar o código de chamada.
Regras de consumo de cota
Os coeficientes em camadas para entradas longas e os descontos de cache variam conforme o modelo. A tabela a seguir lista os parâmetros dos modelos compatíveis atualmente:
Modelo | Comprimento máximo de entrada | Desconto de cache | Coeficientes em camadas para entrada longa |
|---|---|---|---|
qwen3.8-Max | 1 milhão | 0,125 (tokens com acerto de cache consomem 12,5% da capacidade) | Sem camadas (1,0) |
qwen3.7-plus-2026-05-26 | 1 milhão | 0,2 (tokens com acerto de cache consomem 20% da capacidade) | Sem camadas (1,0) |
qwen3.7-flash-2026-07-15 | 1 milhão | 0,2 (tokens com acerto de cache consomem 20% da capacidade) | [0, 32K): entrada 1,0 / saída 1,0(32K, 256K]: entrada 3,0 / saída 3,0 (256K, 1 milhão]: entrada 6,0 / saída 6,0 |
glm-5.2 | 1 milhão | 0,25 (tokens com acerto de cache consomem 25% da capacidade) | Sem camadas (1,0) |
glm-5.1 | 200K | 0,2 (tokens com acerto de cache consomem 20% da capacidade) | [0, 32K): entrada 1,0 / saída 1,0(32K, 200K]: entrada 1,33 / saída 1,17 |
deepseek-v4-pro | 256K | 0,08 (tokens com acerto de cache consomem 8% da capacidade) | Sem camadas (1,0) |
deepseek-v4-flash-0731 | 1 milhão | 0,2 (tokens com acerto de cache consomem 20% da capacidade) | Sem camadas (1,0) |
Outros modelos | Consulte o console | Consulte o console | Sem camadas (1,0) |
Exemplos de cálculo (glm-5.1)
Estimativa de cota com a Provisioned Throughput Quota Calculator

Parâmetro | Descrição | Impacto nos resultados |
|---|---|---|
Solicitações por minuto (RPM) | Quantidade de solicitações por minuto durante o pico de negócios. | Quanto maior o RPM, maior será o aumento proporcional dos valores recomendados de KTPM de entrada e saída. |
Comprimento médio de entrada (tokens) | Média de tokens de entrada por solicitação. | Entradas mais longas elevam a camada e o coeficiente, aumentando o KTPM de entrada recomendado. Os limites das camadas variam conforme o modelo; consulte o console para os valores reais. |
Comprimento médio de saída (tokens) | Média de tokens de saída por solicitação. | Saídas mais extensas podem aumentar o coeficiente aplicável, resultando em um KTPM de saída recomendado mais alto. |
Taxa de acerto de cache (%) | Percentual de tokens de prefixo da solicitação que atingem o cache. A taxa real depende da repetição do conteúdo das solicitações; consulte os resultados reais em tempo de execução. | Uma taxa de acerto maior desacelera o consumo da cota de entrada, reduzindo o KTPM de entrada recomendado. Afeta apenas o KTPM de entrada, não o de saída. |
Descrições dos campos de resposta da API
As respostas da API para implantações PTU incluem os seguintes campos relacionados à cota, que identificam o método de faturamento e o consumo:
Campo | Tipo | Descrição |
|---|---|---|
| String | Campo de resposta de nível superior (consistente em todos os formatos de API). O valor |
| Integer | Tokens reais de cota PTU consumidos após a conversão (inclui coeficientes em camadas e descontos de cache). |
| Integer | Quantidade de tokens que atingiram o cache de prefixo. Para obter detalhes, consulte Context Cache. |
- Compatível com OpenAI Chat
- OpenAI Responses
- Compatível com Anthropic
- DashScope
Campo | Caminho JSON | Descrição |
|---|---|---|
|
| Contagem de tokens em cache no lado da entrada |
|
| Consumo de cota PTU no lado da entrada |
|
| Consumo de cota PTU no lado da saída |
Monitoramento e verificação
Monitore as implantações PTU por meio do recurso de monitoramento de modelos na plataforma Model Studio. As métricas a seguir são relevantes para entradas longas e cache:
- Utilização de PTU: Três curvas independentes para entrada, saída e saída do modo de raciocínio. Em cenários de entrada longa, os coeficientes em camadas podem fazer a utilização ultrapassar 100%. Esse comportamento é esperado.
- Uso de tokens e acertos de cache: Inclui a série de dados
cached_tokenspara mostrar a proporção de acertos de cache em relação ao total de entrada. - Contagem de chamadas dentro e fora da cota: Exibe a proporção de solicitações que retornaram ao faturamento de pagamento conforme o uso após exceder a cota PTU.
Perguntas frequentes
P: O que acontece quando a cota PTU é excedida?
P: O que acontece quando a cota PTU é excedida?
service_tier está ausente ou retorna default, e o cabeçalho da resposta inclui x-dashscope-ptu-overflow:true. O service não sofre interrupção.P: O que acontece quando uma única entrada excede o limite do modelo?
P: O que acontece quando uma única entrada excede o limite do modelo?
P: Como verifico se o cache está funcionando?
P: Como verifico se o cache está funcionando?
cached_tokens na resposta da API. Um valor maior que 0 indica acerto no cache de prefixo. Tokens com acerto de cache consomem cota pelo coeficiente de desconto do modelo (para taxas específicas, consulte Regras de consumo de cota). Também é possível visualizar tendências no gráfico de uso de tokens na página de monitoramento do console.P: E se cached_tokens for sempre 0 e o cache não estiver funcionando?
P: E se cached_tokens for sempre 0 e o cache não estiver funcionando?
P: Por que a utilização excede 100%?
P: Por que a utilização excede 100%?