Skip to main content
Implantação

Provisioned Throughput Long Input and Cache

Este tópico descreve os recursos de entrada longa e cache de prefixo das implantações PTU (Provisioned Throughput), incluindo regras de consumo de cota, uso da Provisioned Throughput Quota Calculator e descrições dos campos de resposta da API.

Visão geral

As implantações PTU suportam solicitações de entrada longa (até 200 mil tokens para alguns modelos) e cache de prefixo. Coeficientes de capacidade em camadas e descontos de cache permitem gerenciar o consumo de cota com flexibilidade. Principais recursos:
  • Suporte a entrada longa: Alguns modelos aceitam entradas superiores a 32 mil tokens. Na conversão para TPM (tokens por minuto), os tokens que ultrapassam o limiar consomem coeficientes em camadas mais altos. Para obter detalhes, consulte Regras de consumo de cota.
  • Desconto de cache de prefixo: Alguns modelos oferecem suporte ao cache de prefixo. Tokens de entrada com acerto de cache consomem cota com um coeficiente de desconto (o valor específico varia conforme o modelo), reduzindo o consumo em conversas de múltiplas turnos e cenários com prefixos repetidos.
  • Fallback automático para pagamento conforme o uso: Se a cota PTU for excedida ou a entrada ultrapassar o limite do modelo (128K para Qwen / 64K para DeepSeek), a solicitação retornará automaticamente ao faturamento de pagamento conforme o uso. Não é necessário alterar o código de chamada.
Após o fallback automático para pagamento conforme o uso, as cobranças são calculadas pelo preço unitário do modelo. Use a Provisioned Throughput Quota Calculator para planejar adequadamente sua cota PTU e evitar cobranças inesperadas.
Esse recurso é comum em análises de documentos longos (contratos, resumos de relatórios de pesquisa) e conversas de múltiplas turnos (atendimento ao cliente, assistentes de codificação) nas quais a entrada excede 32 mil tokens. Para conceitos básicos e métodos de compra de implantações PTU, consulte Introduction to model deployment. Para entender o funcionamento do cache de prefixo, consulte Context Cache.

Regras de consumo de cota

Os coeficientes em camadas para entradas longas e os descontos de cache variam conforme o modelo. A tabela a seguir lista os parâmetros dos modelos compatíveis atualmente:

Modelo

Comprimento máximo de entrada

Desconto de cache

Coeficientes em camadas para entrada longa

qwen3.8-Max

1 milhão

0,125 (tokens com acerto de cache consomem 12,5% da capacidade)

Sem camadas (1,0)

qwen3.7-plus-2026-05-26

1 milhão

0,2 (tokens com acerto de cache consomem 20% da capacidade)

Sem camadas (1,0)

qwen3.7-flash-2026-07-15

1 milhão

0,2 (tokens com acerto de cache consomem 20% da capacidade)

[0, 32K): entrada 1,0 / saída 1,0(32K, 256K]: entrada 3,0 / saída 3,0

(256K, 1 milhão]: entrada 6,0 / saída 6,0

glm-5.2

1 milhão

0,25 (tokens com acerto de cache consomem 25% da capacidade)

Sem camadas (1,0)

glm-5.1

200K

0,2 (tokens com acerto de cache consomem 20% da capacidade)

[0, 32K): entrada 1,0 / saída 1,0(32K, 200K]: entrada 1,33 / saída 1,17

deepseek-v4-pro

256K

0,08 (tokens com acerto de cache consomem 8% da capacidade)

Sem camadas (1,0)

deepseek-v4-flash-0731

1 milhão

0,2 (tokens com acerto de cache consomem 20% da capacidade)

Sem camadas (1,0)

Outros modelos

Consulte o console

Consulte o console

Sem camadas (1,0)

Exemplos de cálculo (glm-5.1)

Scenario 1: Short input (10K tokens, no cache)
  Input consumption: 10K × 1.0 = 10 KTPM

Scenario 2: Long input (50K tokens, no cache)
  Input consumption: 32K × 1.0 + 18K × 1.33 = 55.94 KTPM
  Output consumption (assuming 1K tokens): 1K × 1.17 = 1.17 KTPM

Scenario 3: Long input + cache hit (50K tokens, first 30K hit cache)
  Cached input (first 30K, within [0,32K) tier):
    30K × 1.0 × 0.2 = 6 KTPM
  Non-cached input (last 20K):
    2K × 1.0 + 18K × 1.33 = 25.94 KTPM
  Total input = 31.940 KTPM (43% savings compared to no cache)

Estimativa de cota com a Provisioned Throughput Quota Calculator

Use a calculadora antes de criar ou dimensionar uma implantação para avaliar os requisitos de cota em cenários de entrada longa. Isso ajuda a evitar que solicitações retornem ao faturamento de pagamento conforme o uso devido à cota insuficiente. Consulte o console para verificar os limites reais de compra.
Pré-requisitos: Ative o Model Studio e possua permissões de implantação PTU. Acesse o console do Model Studio, navegue até a página Model Deployment > Create Deployment (ou clique em Scale Up na página do product de uma implantação existente), selecione um modelo PTU (Provisioned Throughput) implantável e expanda a Provisioned Throughput Quota Calculator.
image
A Provisioned Throughput Quota Calculator recomenda automaticamente a cota KTPM com base na sua carga de trabalho. Preencha os parâmetros abaixo e a calculadora fornecerá os valores recomendados de KTPM de entrada e KTPM de saída.

Parâmetro

Descrição

Impacto nos resultados

Solicitações por minuto (RPM)

Quantidade de solicitações por minuto durante o pico de negócios.

Quanto maior o RPM, maior será o aumento proporcional dos valores recomendados de KTPM de entrada e saída.

Comprimento médio de entrada (tokens)

Média de tokens de entrada por solicitação.

Entradas mais longas elevam a camada e o coeficiente, aumentando o KTPM de entrada recomendado. Os limites das camadas variam conforme o modelo; consulte o console para os valores reais.

Comprimento médio de saída (tokens)

Média de tokens de saída por solicitação.

Saídas mais extensas podem aumentar o coeficiente aplicável, resultando em um KTPM de saída recomendado mais alto.

Taxa de acerto de cache (%)

Percentual de tokens de prefixo da solicitação que atingem o cache. A taxa real depende da repetição do conteúdo das solicitações; consulte os resultados reais em tempo de execução.

Uma taxa de acerto maior desacelera o consumo da cota de entrada, reduzindo o KTPM de entrada recomendado. Afeta apenas o KTPM de entrada, não o de saída.

Descrições dos campos de resposta da API

As respostas da API para implantações PTU incluem os seguintes campos relacionados à cota, que identificam o método de faturamento e o consumo:

Campo

Tipo

Descrição

service_tier

String

Campo de resposta de nível superior (consistente em todos os formatos de API). O valor ptu-standard indica uso de cota PTU. O valor default ou a ausência desse campo indica faturamento de pagamento conforme o uso.

provisioned_tokens

Integer

Tokens reais de cota PTU consumidos após a conversão (inclui coeficientes em camadas e descontos de cache).

cached_tokens

Integer

Quantidade de tokens que atingiram o cache de prefixo. Para obter detalhes, consulte Context Cache.

Os caminhos JSON desses campos variam conforme o formato da API:
  • Compatível com OpenAI Chat
  • OpenAI Responses
  • Compatível com Anthropic
  • DashScope

Campo

Caminho JSON

Descrição

cached_tokens

usage.prompt_tokens_details.cached_tokens

Contagem de tokens em cache no lado da entrada

provisioned_tokens

usage.prompt_tokens_details.provisioned_tokens

Consumo de cota PTU no lado da entrada

provisioned_tokens

usage.completion_tokens_details.provisioned_tokens

Consumo de cota PTU no lado da saída

Para definições completas dos campos e intervalos de valores, consulte API reference.

Monitoramento e verificação

Monitore as implantações PTU por meio do recurso de monitoramento de modelos na plataforma Model Studio. As métricas a seguir são relevantes para entradas longas e cache:
  • Utilização de PTU: Três curvas independentes para entrada, saída e saída do modo de raciocínio. Em cenários de entrada longa, os coeficientes em camadas podem fazer a utilização ultrapassar 100%. Esse comportamento é esperado.
  • Uso de tokens e acertos de cache: Inclui a série de dados cached_tokens para mostrar a proporção de acertos de cache em relação ao total de entrada.
  • Contagem de chamadas dentro e fora da cota: Exibe a proporção de solicitações que retornaram ao faturamento de pagamento conforme o uso após exceder a cota PTU.
Para mais métricas de monitoramento e instruções, consulte Model monitoring.

Perguntas frequentes

A solicitação retorna automaticamente ao faturamento de pagamento conforme o uso. Na resposta da API, o campo service_tier está ausente ou retorna default, e o cabeçalho da resposta inclui x-dashscope-ptu-overflow:true. O service não sofre interrupção.
Os modelos da série Qwen têm limite de entrada de 128 mil tokens, enquanto os da série DeepSeek possuem limite de 64 mil tokens. Solicitações que ultrapassam esse limite também retornam automaticamente ao faturamento de pagamento conforme o uso.
Verifique o campo cached_tokens na resposta da API. Um valor maior que 0 indica acerto no cache de prefixo. Tokens com acerto de cache consomem cota pelo coeficiente de desconto do modelo (para taxas específicas, consulte Regras de consumo de cota). Também é possível visualizar tendências no gráfico de uso de tokens na página de monitoramento do console.
Causas comuns: O prefixo de entrada é inconsistente entre as solicitações (por exemplo, a System Message muda), o intervalo entre duas solicitações excede o período de validade do cache ou a contagem de tokens de entrada é muito baixa para acionar o cache. Para métodos de solução de problemas e limites de cache, consulte Context Cache.
Alguns modelos (como o glm-5.1) possuem coeficientes em camadas para entradas longas que fazem o consumo real de cota superar a contagem bruta de tokens. Utilização = consumo convertido ÷ cota adquirida. Ultrapassar 100% significa que a taxa de consumo excede a cota comprada. O excedente retorna automaticamente ao faturamento de pagamento conforme o uso, sem afetar a disponibilidade do service.
Plano de Tokens
Playground de Modelos
  • Music generation
Inferência do Modelo
Avaliação
Compressão de Modelos
Estatísticas e Monitoramento
Suporte