Skip to main content
Estatísticas e Monitoramento

Model usage

Visualize o uso dos modelos do Alibaba Cloud Model Studio.

Para obter mais informações sobre cotas gratuitas, consulte New user free quota . Gerencie o uso da cota gratuita na página Free Quota .

Disponibilidade

Visualizar uso da cota gratuita

No console

  1. Acesse a página Free Quota e selecione uma aba de tipo de modelo para visualizar o uso da cota gratuita de cada modelo.
  2. Na tabela de modelos, localize modelos específicos usando busca, ordenação ou filtros. Ative ou desative o Free Quota Only individualmente ou em lote para gerenciar as configurações de cota gratuita.
Free Quota Only: Quando ativado, o service interrompe automaticamente ao esgotar a cota gratuita (retorna um erro 403: AllocationQuota.FreeTierOnly). Isso evita cobranças além da cota gratuita. Para continuar usando e pagando pelo uso real, mantenha este recurso desligado. Este recurso está disponível apenas quando sua conta possui cota gratuita não consumida. Uma vez ativado, não pode ser desligado até que a cota gratuita se esgote totalmente. As cotas gratuitas são faturadas com granularidade de minutos, e os dados exibidos no console podem apresentar atraso. Consulte o valor da cota gratuita mostrado no console.

Visualizar uso do modelo

Atualmente, o console suporta apenas o uso de cota gratuita. Para visualizar estatísticas detalhadas de uso, acesse a página Bill Details e exporte a fatura para ver o uso de tokens.

Visualizar visão geral de faturamento

Na página Billing Overview, visualize o resumo de custos dos services do Model Studio, incluindo:
  • Cartões de custo: Visualize despesas totais, custos de assinatura e custos de fatura para o período de faturamento atual, com links para detalhamentos.
  • Tendências de fatura: Visualize tendências de custos em formato de gráfico ou lista. Filtre por estatísticas mensais ou diárias, categoria de product, ID da chave de API ou modelo.
  • Alertas de custo: Configure alertas de custo para receber notificações sobre despesas anormais.

Unidades de uso

No Model Studio, as estatísticas de uso para diferentes modelos são:

Tipo

Subcategoria

Unidade

Faturamento (invocação)

Modelo de linguagem grande

Text generation

Token

Faturado pelo número de tokens de entrada e saída.

Deep thinking

Visual understanding

Modelo visual

Image generation

Imagens

Faturado pelo número de imagens geradas com sucesso.

Video generation

Segundos

Faturado pelo número de segundos de vídeo gerados com sucesso.

Modelo de fala

Speech synthesis

Segundo, caractere ou token

Pode ser faturado por duração de áudio (segundos), caracteres de texto correspondentes ou tokens, dependendo do modelo.

Real-time speech synthesis

Audio file recognition

Real-time speech recognition

Audio and video translation

Modelo omni-modal

Omni-modal

Token

O texto é faturado pela contagem de tokens. Outras modalidades (áudio, imagem, vídeo) são faturadas pelas respectivas contagens de tokens.

Real-time multimodal

Modelo de embedding

Multimodal embedding

Token

Faturado pelo número de tokens no texto de entrada.

Embedding de texto

Entrando em produção

Recomendações para gerenciar o uso de modelos:
  • Controle o comprimento da saída do modelo: Limite o comprimento máximo do conteúdo gerado por invocação e, consequentemente, controle os custos definindo adequadamente limiting the thinking length e configurando o parâmetro max_tokens.
  • Selecione modelos com base no tipo de tarefa: Para tarefas simples, como categorização e resumo, priorize modelos leves e de menor custo em vez de modelos poderosos, porém mais caros.
  • Monitoramento e alertas: Monitor usage trends. Configure alertas de uso para receber notificações oportunas sobre usos anormais.
  • Otimize os prompts: Prompts concisos e claros melhoram a qualidade da saída do modelo e reduzem tokens de entrada desnecessários.
  • Utilize inferência em lote: Para tarefas de processamento em grandes lotes e sem necessidade de tempo real, batch inference costuma ser mais econômico do que a invocação em tempo real.

Glossário

Termo

Explicação

Token

Os modelos de linguagem grande processam entrada e saída em tokens. Um token pode ser:

  • Caractere único: como A, I

  • Palavra completa: como large, Model

  • Parte de uma palavra longa: Uma palavra longa geralmente é dividida em vários tokens. Esse processo de divisão é chamado de tokenização.

Com base na experiência, em média, 1 Token corresponde a aproximadamente 1,5-2 caracteres chineses; 1 letra inglesa corresponde a aproximadamente 0,25 Tokens; 1 palavra inglesa corresponde a aproximadamente 1,3 Tokens:

  • Alibaba Cloud Model Studio: aproximadamente 4-5 Tokens

  • Hello World: aproximadamente 2 Tokens

Cada modelo possui uma contagem máxima de tokens de entrada e saída (consulte Model list). Exceder esse limite causa falha.

Billing Overview

Refere-se a todas as invocações diretas e indiretas de um modelo, cobrindo principalmente os seguintes cenários:

  • Invocação de API

  • Experiência do modelo

  • Model Studio applications (aplicações de orquestração de agente/workflow/agente e nós que envolvem invocação de modelo, como nós LLM, nós de categorização de intenção e nós de grupo de agentes) em estados de teste e publicação

  • Invocação de Assistant API (Deprecated)

  • Application Invocation

Billing Overview

Processamento de dados em larga escala realizado offline para cenários que não exigem respostas em tempo real, usando a API OpenAI-compatible - Batch (file input).

Perguntas frequentes

P: Como visualizo o uso total de tokens da minha conta Alibaba Cloud? R: Use sua conta Alibaba Cloud para acessar a página Bill Details e exporte a fatura. @props:china Na página Real-time, filtre e exporte a fatura:
  1. Defina o Batches para o mês desejado (como 2025-05).
  2. Em Bill Details, selecione Billing Month.
  3. Clique em no ícone de download no canto superior direito da tabela para exportar os dados de faturamento.
@/props
Plano de Tokens
Playground de Modelos
  • Music generation
Inferência do Modelo
Avaliação
Compressão de Modelos
Estatísticas e Monitoramento
Suporte