Skip to main content
Inferência do Modelo

Reserva de TPM

A reserva de TPM garante uma capacidade de inferência dedicada para um modelo específico, assegurando que seus services não sejam afetados pelos limites de taxa do pool público durante os horários de pico. Este tópico descreve como criar, integrar e gerenciar reservas de TPM.

Visão geral

Com uma reserva de TPM (Tokens Por Minuto), você bloqueia um throughput de inferência dedicado para um modelo determinado. As chamadas dentro da capacidade reservada não estão sujeitas aos limites de taxa do pool de recursos público.
  • Garantia de capacidade: A capacidade de TPM reservada é exclusiva para sua carga de trabalho e não é compartilhada com outros usuários.
  • Código de modelo dedicado: Após criar uma reserva de TPM, o sistema gera automaticamente um código de modelo dedicado. Substitua o parâmetro model nas suas requisições de API por este código.
  • Estratégia de overflow: Ao criar uma reserva, escolha como lidar com o tráfego excedente — redirecionamento automático para pagamento conforme o uso (padrão, sem interrupção do service) ou uso exclusivo da capacidade reservada (requisições excedentes retornam 429, sem custos adicionais).

Compare e selecione um plano

O Model Studio oferece diversos planos de capacidade e faturamento para chamadas de inferência, incluindo pagamento conforme o uso, planos de recursos e planos de economia, reservas de TPM e implantações dedicadas PTU. Cada plano possui características distintas quanto à unidade de faturamento, nível de garantia de capacidade, tratamento de overflow e alterações de integração. Esta seção ajuda você a escolher o plano adequado com base nas necessidades do seu negócio.

Plano

Unidade de faturamento

Garantia de capacidade

Casos de uso

Tratamento de overflow

Alterações de código

Pagamento conforme o uso

Por token

Nenhuma (pool público compartilhado)

Tráfego altamente variável/de curto prazo

Atendido automaticamente, sujeito aos limites de taxa públicos

Nenhuma alteração necessária

Plano de recursos/Plano de economia

Cota pré-paga

Desconto por uso comprometido (não é capacidade dedicada)

Otimização de custos

Tráfego excedente muda para pagamento conforme o uso

Nenhuma alteração necessária

Reserva de TPM

Pré-pago por kTPM

Capacidade dedicada com garantia firme

Tráfego previsível, sem tolerância a limitação de taxa

Opcional: overflow automático para pagamento conforme o uso (padrão) / apenas capacidade reservada retorna 429

Substituir o parâmetro model

PTU (Model deployment)

Pré-pago por kTPM

Instância de implantação dedicada

Alto throughput e alto desempenho

Opcional: overflow automático para pagamento conforme o uso (padrão) / apenas capacidade PTU retorna 429

Substituir o parâmetro model

Modelos suportados

Os preços estão sujeitos ao console; as tabelas servem apenas como referência.
  • China (Beijing)
  • Singapore

Nome do modelo

Pré-pago - diário

Entrada (por 10.000 TPM)

Saída (por 1.000 TPM)

Qwen3.8-Max

$16,63

$4,99

Qwen3.7-Flash-2026-07-15 Entre em contato com seu gerente de conta para ativar

$0,28

$0,11

Qwen3.7-Max-2026-05-20

$16,63

$4,99

Qwen3.7-Plus-2026-05-26

$2,77

$1,11

Qwen3.6-Flash-2026-04-16

$1,66

$1,00

GLM-5.2

$11,09

$3,88

GLM-5.1

$8,32

$3,33

DeepSeek-v4-Pro-0813

$12,82

$3,85

DeepSeek-v4-Flash

$1,39

$0,28

DeepSeek-v4-Pro

$16,63

$3,33

DeepSeek-v4-Flash-0731

$4,27

$1,28

Kimi-K2.6

$9,01

$3,74

Notas de faturamento e uso

  • O faturamento inicia assim que a implantação for bem-sucedida. Chamadas dentro da capacidade reservada não geram cobranças adicionais.
  • As taxas pré-pagas são quitadas em um pagamento único antecipado e permanecem válidas a partir do momento da compra. Consulte o console Bailian para verificar as cobranças reais.
  • O ciclo de faturamento "diário" é calculado por dia natural: do momento em que a instância entra em vigor até às 00:00:00 do dia seguinte, em vez de 24 horas contínuas a partir da hora da compra. Por exemplo, uma reserva de 1 dia comprada às 16:00 expira à meia-noite (válida por cerca de 8 horas). Recomendamos comprar no início do dia ou ativar a opção Auto-renewal on expiry para evitar interrupção do service.
  • Reembolso por downgrade e cancelamento de assinatura: a parte utilizada é liquidada com um coeficiente de 1,2x. Fórmula: Refund = prepaid fee of the reduced portion - (prepaid fee of the reduced portion × used duration / purchased duration × 1.2)
  • Quando a política de overflow é "Overflow automático": requisições que excedem a cota garantida degradam automaticamente para o faturamento padrão de pagamento conforme o uso, sem interrupção do service. Visualize a contagem de degradações na página de detalhes em Overflow degradation statistics. Quando definido como "Apenas capacidade reservada": requisições acima da cota retornam 429 e não geram cobranças adicionais.
  • Até 2 horas após a expiração do service: a instância continua em execução, pode ser chamada e renovada; entre 2 e 14 horas após a expiração: a instância é parada, não pode ser chamada, mas ainda pode ser renovada; após 14 horas da expiração: a instância é excluída e não pode ser recuperada.
Alguns modelos suportam coeficientes de faixa para entradas longas e descontos de cache. A calculadora de capacidade aplica esses parâmetros automaticamente. Os detalhes são os seguintes:

Modelo

Comprimento máximo de entrada

Desconto de cache

Coeficiente de faixa para entrada longa

Qwen3.8-max

1 Milhão

0,125

Sem faixas (1,0)

Qwen3.6-flash-2026-04-16

256K

Cache não suportado

Sem faixas (1,0)

Outros da série Qwen

256K

0,2 (acertos de cache consomem capacidade a 20% da taxa normal)

Sem faixas (1,0)

glm-5.2

1 Milhão

0,25 (acertos de cache consomem capacidade a 25% da taxa normal)

Sem faixas (1,0)

glm-5.1

200K

0,2 (acertos de cache consomem capacidade a 20% da taxa normal)

[0, 32K): entrada 1,0 / saída 1,0[32K, 200K]: entrada 1,33 / saída 1,17

DeepSeek-v4-Pro-0813

1 Milhão

0,1 (acertos de cache consomem capacidade a 10% da taxa normal)

Sem faixas (1,0)

DeepSeek-v4-Pro

256K

0,08 (acertos de cache consomem capacidade a 8% da taxa normal)

Sem faixas (1,0)

DeepSeek-v4-Flash-0731

1 Milhão

0,1 (acertos de cache consomem capacidade a 10% da taxa normal)

Sem faixas (1,0)

DeepSeek-v4-Flash

256K

0,2 (acertos de cache consomem capacidade a 20% da taxa normal)

Sem faixas (1,0)

Kimi-K2.6

256K

0,2 (acertos de cache consomem capacidade a 20% da taxa normal)

Sem faixas (1,0)

Criar uma reserva de TPM

Pré-requisitos: O service de modelos Bailian deve estar ativado e um workspace criado. Faça login no console Bailian e clique em Create TPM reservation.
image
Criar uma reserva de TPM exige um pagamento único antecipado. Recomendamos usar a calculadora de capacidade de TPM para estimar a quantidade necessária e confirmar o custo antes de enviar.
  1. Preencha os seguintes parâmetros:

    Parâmetro

    Descrição

    Obrigatório

    Descrição do valor

    Nome da reserva

    Nome personalizado para identificação.

    Sim

    ≤ 50 caracteres

    Selecionar modelo

    Escolha o modelo para o qual reservar capacidade. Um código de modelo dedicado é gerado automaticamente após o envio.

    Sim

    Apenas modelos que suportam reserva de TPM estão disponíveis; consulte a exibição no console.

    Ciclo de faturamento

    Período de cobrança.

    Sim

    Diário

    TPM de entrada

    Throughput de entrada reservado, em kTPM (1 kTPM = 1.000 tokens/minuto).

    Sim

    O valor inicial e o incremento variam conforme o modelo; consulte a exibição no console.

    TPM de saída

    Throughput de saída reservado, em kTPM.

    Sim

    O valor inicial e o incremento variam conforme o modelo; consulte a exibição no console.

    Duração da compra

    Validade da reserva.

    Sim

    Insira o número de dias na caixa de entrada. Valores suportados: 1-30, 60, 90, 120, 365 dias.

    Renovação automática na expiração

    Deduz o pagamento e renova automaticamente às 08:00, um dia antes da expiração. Ativado por padrão.

    Não

    On / Off

    Duração única de renovação

    Duração de cada renovação automática.

    Não

    Insira o número de dias na caixa de entrada. O intervalo de valores é o mesmo da duração da compra.

    Política de overflow

    Define como lidar com requisições que excedem a capacidade reservada quando esta se esgota.

    Sim

    Overflow automático para pagamento conforme o uso por token (padrão; o overflow muda para pagamento conforme o uso, sem interrupção do service) / Apenas capacidade reservada (o overflow retorna 429, sem cobranças adicionais)

  2. Após confirmar os parâmetros, clique em Buy now. Na caixa de diálogo de confirmação de taxa, verifique as cobranças e clique em Confirm payment.
  3. Na aba Overview da página de detalhes da reserva de TPM, localize o Dedicated model code e clique para copiar.
  4. Substitua o parâmetro model na sua requisição de API pelo código de modelo dedicado copiado:
    Pré-requisito: uma instância de reserva de TPM foi criada e seu status é Running .
    O parâmetro thinking_budget do GLM-5.2 (que limita o comprimento do raciocínio) não tem efeito quando chamado.
# When the request volume surges within a short period, the system needs a brief warm-up to match the required compute.
# During warm-up, some requests may experience latency fluctuations. Stability recovers after warm-up completes.
# Ensure you have request queuing or retry mechanisms in place.

import dashscope

response = dashscope.Generation.call(
    api_key="your-api-key",
    model="your-dedicated-model-code",   # Replace with your dedicated model code
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.output.text)
# When the request volume surges within a short period, the system needs a brief warm-up to match the required compute.
# During warm-up, some requests may experience latency fluctuations. Stability recovers after warm-up completes.
# Ensure you have request queuing or retry mechanisms in place.
curl -X POST https://dashscope.aliyuncs.com/compatible-mode/v1/chat/completions \
  -H "Authorization: Bearer $DASHSCOPE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"your-dedicated-model-code","messages":[{"role":"user","content":"Hello"}]}'

Calculadora de capacidade de TPM

A calculadora de capacidade de TPM, localizada no lado direito da página de criação, ajuda a estimar a cota de TPM a ser comprada com base na sua carga de negócios. Após preencher os parâmetros abaixo, a calculadora fornece automaticamente o TPM de entrada e saída recomendados.

Parâmetro

Descrição

Impacto no resultado

Requisições por minuto (RPM)

Número de requisições enviadas por minuto durante o horário de pico.

Quanto maior o RPM, maiores serão os TPMs de entrada e saída recomendados, proporcionalmente.

Comprimento médio de entrada (tokens)

Média de tokens de entrada por requisição.

Entradas mais longas elevam a faixa e aumentam o coeficiente, resultando em um TPM de entrada recomendado maior. Os limites das faixas variam por modelo; consulte a exibição real no console.

Comprimento médio de saída (tokens)

Média de tokens de saída por requisição.

Saídas mais longas podem aumentar o coeficiente, elevando o TPM de saída recomendado.

Taxa de acerto de cache

Proporção de requisições cujos prefixos repetidos resultam em acerto de cache. A taxa real depende da repetição do conteúdo das requisições; consulte o resultado em tempo de execução.

Uma taxa de acerto maior desacelera o consumo da capacidade de entrada, reduzindo o TPM de entrada recomendado. Afeta apenas o TPM de entrada, não o de saída.

image

Visualizar e gerenciar

Acesse o console Bailian e abra a página da lista de reservas. A lista exibe todas as instâncias de reserva como cartões de modelo e permite filtrar por modelo, horário e status.
image

Detalhes da reserva

Clique no cartão do modelo desejado para abrir a página de detalhes, que contém as seguintes 3 abas:
  • Overview
  • Monitoring
  • API access
image
  • Informações básicas: nome da reserva, código do modelo dedicado (copiável), modelo base, capacidade de entrada/saída.
  • Cartões de estatísticas (últimos 7 dias): contagem de reservas ativas, uso total e de pico de TPM, utilização média.
  • Tendência de utilização: alterne entre as direções de entrada/saída; exibe a linha de capacidade reservada e o uso real.
  • Estatísticas de degradação por overflow: mostra o número de requisições degradadas após exceder a capacidade reservada (a degradação ocorre apenas sob a política "Overflow automático").

Operações de gerenciamento

Na lista de reservas da aba Overview da página de detalhes, localize a instância alvo e utilize a coluna Operation para executar as seguintes ações:
  • Scaling
  • Renewal
  • Unsubscribe
image
Clique em Scaling e ajuste o TPM de entrada e o TPM de saída na caixa de diálogo.
O TPM de entrada e o TPM de saída podem ser definidos como 0: após zerar, não há acúmulo de cobranças de capacidade e o código do modelo dedicado é mantido, evitando a invalidação do código causada por expiração ou cancelamento de assinatura. No entanto, zerar é considerado um downgrade, e a parte utilizada é liquidada com um coeficiente de penalidade de 1,5x (consulte as Notas de faturamento e uso acima).
Até 2 horas após a expiração do service, o status é Running; de 2 a 14 horas após a expiração, torna-se Stopped; após 14 horas, torna-se Expired e é eventualmente excluído.

Status

Descrição

Running

Em execução normal; pode ser chamado usando o código do modelo dedicado.

Pending

Criado; aguardando entrar em vigor.

Modifying

Dimensionamento em andamento; o service não é interrompido durante este período.

Stopped

Parado devido a motivos como pagamento atrasado; pode ser restaurado após a renovação.

Expired

Expirado sem renovação; os recursos foram liberados.

Canceled

Cancelamento de assinatura concluído; irreversível.

Perguntas frequentes

Depende da política de overflow selecionada na criação: sob "Overflow automático", as requisições que excedem a capacidade reservada degradam automaticamente para o faturamento de pagamento conforme o uso, sem interrupção do service. Visualize a contagem e o horário das degradações na aba Overview da página de detalhes, em Overflow degradation statistics; se as degradações forem frequentes, recomendamos aumentar o dimensionamento. Sob "Apenas capacidade reservada", as requisições que excedem a cota retornam um erro 429 e não geram cobranças adicionais; se os erros 429 forem frequentes, recomendamos aumentar o dimensionamento.
Após a criação de uma reserva de TPM, o sistema gera automaticamente um código de modelo dedicado. Copie o código na aba Overview da página de detalhes da reserva de TPM. Substitua o parâmetro model na sua requisição de API por este código para utilizar a capacidade reservada.
Após a expiração de uma reserva, o código do modelo dedicado torna-se inválido, e as requisições subsequentes retornam automaticamente ao processamento por recursos públicos (pagamento conforme o uso). Recomendamos ativar a opção Auto-renewal on expiry antecipadamente para evitar impactos no service.
Na aba Overview da página de detalhes, visualize o gráfico de tendência de uso de TPM e as estatísticas de degradação por overflow. Se a utilização permanecer próxima de 100% ou se as degradações ocorrerem frequentemente, recomendamos aumentar o TPM de entrada/saída.
O ciclo "Diário" é calculado por dia natural: o período de validade vai do momento em que a instância entra em vigor até às 00:00:00 do dia seguinte, em vez de 24 horas contínuas a partir da hora da compra. Por exemplo, uma reserva comprada às 16:00 expira à meia-noite, com uma duração efetiva de cerca de 8 horas. Para obter um dia completo de capacidade, recomendamos comprar no início do dia ou ativar a opção Auto-renewal on expiry para garantir a continuidade do service.
Plano de Tokens
Playground de Modelos
  • Music generation
Inferência do Modelo
Avaliação
Compressão de Modelos
Estatísticas e Monitoramento
Suporte