Skip to main content
Estatísticas e Monitoramento

Model monitoring

O Model Studio oferece monitoramento de modelos, alertas e logs para acompanhamento de chamadas em tempo real, detecção rápida de anomalias e solução de problemas.

Visão geral do monitoramento de modelos

O Model Studio fornece monitoramento unificado de modelos. Uma chamada aparece nos gráficos de monitoramento cerca de 1 a 2 minutos (até 5 minutos) após a ocorrência, facilitando o rastreamento em tempo real. Os dados de monitoramento são isolados por workspace: é possível visualizar apenas os dados do workspace selecionado no momento. Esses dados servem apenas como referência e não constituem base para faturamento. Para conciliação, consulte sua fatura em Expenses and Costs.
O suporte a monitoramento e alertas varia conforme o modelo: alguns modelos — como os de geração de fala, imagem e vídeo, além de modelos de terceiros acessados diretamente — não têm suporte. Verifique no console para confirmar.
Este tópico está organizado por recurso: para solucionar problemas de chamadas de modelo, comece pelo audit log; para configurar alertas, consulte a seção Alerting; para ativar a entrega de dados, consulte a seção Data delivery.

Filtrar dados de monitoramento por dimensão

Filtre os dados de monitoramento por Time (predefinições rápidas e personalizadas), Inference Type e API key (todos por padrão; exibe o ID e a descrição, listando apenas as API keys existentes no workspace atual). A filtragem por granularidade de tempo está disponível somente na página de detalhes do monitoramento de modelos.

Visualizar escala geral de chamadas e integridade

A página de visão geral exibe cartões de dados como total de modelos, total de chamadas, total de falhas, duração média das chamadas e tempo médio até o primeiro token (latência do primeiro token), permitindo avaliar rapidamente a escala geral das chamadas e a integridade do sistema.

Visualizar detalhes de monitoramento ou logs de um modelo

A lista de modelos apresenta os dados de monitoramento de cada modelo no workspace atual. Clique em View details para abrir a página de detalhes do monitoramento do modelo ou em View Logs para abrir a aba Audit Log na página de logs. Acesse o console do Model Studio e, no painel de navegação à esquerda, escolha Model Monitoring & Alerting para abrir a página de visão geral do monitoramento.

Detalhes do monitoramento de modelos

Na página de visão geral do monitoramento, localize o modelo desejado na lista e clique em View details para abrir a página de detalhes do monitoramento desse modelo. O caminho de navegação no topo da página é: Model monitoring > nome do modelo. A página de detalhes exibe estatísticas de chamadas e gráficos de desempenho para um único modelo, além de oferecer uma entrada para configurar alertas: o ícone de sino em um gráfico de métrica permite configurar rapidamente um alerta para o modelo ou métrica atual (para gerenciamento completo de regras entre modelos, consulte a seção Alerting). Os filtros são os mesmos da página de visão geral (tempo, granularidade de tempo, tipo de inferência e API key), e as configurações da página de visão geral são mantidas ao acessá-la a partir dela. Para visualizar logs, retorne à lista de modelos na página de visão geral e clique na entrada View logs (consulte a seção Logging).

Métricas de monitoramento

Na página de detalhes, as métricas aparecem em dois grupos: estatísticas de chamadas e desempenho. O significado, as notas de referência e o suporte a alertas de cada métrica estão listados na tabela a seguir.

Metric

Description

Reference

Alerting support

Calls

Número total de chamadas do modelo

Varia conforme o negócio

Configurável

Usage

Total de tokens

Varia conforme o negócio

Configurável

Failures

Número de chamadas com falha

Varia conforme o negócio

Configurável

Failure rate

Falhas divididas pelo total de chamadas

Varia conforme o negócio

Configurável

Call duration

Tempo total da solicitação até a resposta

Varia conforme o modelo e o cenário

Configurável

Time to first token

Latência da solicitação até o primeiro token retornado

Varia conforme o modelo e o cenário

Configurável

Subsequent token latency

Tempo médio para gerar cada token após o primeiro

Varia conforme o modelo e o cenário

Sem suporte

Model TotalToken consumption

Total de tokens consumidos, agregados por modelo (métrica dedicada a modelos de alerta predefinidos)

Varia conforme o negócio

Configurável

Average usage per request

Média de tokens por solicitação

Varia conforme o negócio

Sem suporte

Content moderation error count

Número de bloqueios por moderação de conteúdo

Varia conforme o negócio

Sem suporte

Rate limiting error count

Número de acionamentos de limite de taxa 429

Varia conforme o negócio

Configurável

RPM

Solicitações por minuto

Varia conforme o negócio

Sem suporte

TPM

Tokens por minuto

Varia conforme o negócio

Sem suporte

Output tokens per second (TPS)

Tokens de saída por segundo

Varia conforme o modelo e o cenário

Sem suporte

O suporte a alertas de uma métrica depende de sua inclusão em um modelo de alerta predefinido (para modelos predefinidos, consulte Alerting > Alert templates). Métricas fora de um modelo predefinido (como contagem de erros de moderação de conteúdo e RPM) não exibem o ícone de sino e não permitem configuração de alertas.
Para obter detalhes sobre códigos de erro e limitação de taxa, consulte Error codes.
Recomendação: Para solucionar um aumento repentino de chamadas com falha, concentre-se nas métricas de falhas, contagem de erros de limitação de taxa e taxa de falhas. Para diagnosticar degradação de desempenho, observe uma tendência sustentada de alta no tempo até o primeiro token e na duração média das chamadas, e configure alertas para as métricas principais.

Configuração do sino de alerta

Métricas com suporte a alertas exibem um ícone de sino no gráfico. Clique no sino para abrir o painel lateral de configuração de regras de alerta (para detalhes dos campos, consulte a seção Alert rule management). O ícone de sino e os rótulos de status no painel lateral têm os seguintes significados:

Type

Status

Color

Meaning

Bell icon

No alert configured

Gray

Nenhuma regra de alerta configurada; clique para abrir o painel lateral de configuração

Bell icon

Alert configured, normal

Blue

Regra configurada e não acionada no momento; clique para visualizar os detalhes da regra

Bell icon

Alerting

Red

Alerta em acionamento; clique para visualizar os detalhes do acionamento

Side-panel label

Normal

Green

Regra configurada com status normal

Side-panel label

Alerting

Red

Alerta em acionamento

Side-panel label

Disabled

Gray

Regra desativada; não gera mais alertas

Ao clicar no sino, o painel lateral de alerta exibe campos diferentes dependendo do status do alerta (Normal = não acionado, Alerting = acionado atualmente, Recovered = acionado e depois recuperado):

Field

Normal

Recovered

Alerting

Alert rule name

Shown

Shown

Shown

Alert rule ID

Shown

Shown

Shown

Alert content

Shown

Shown

Shown

Alert metric

Shown

Shown

Shown

Notification recipients

Shown

Shown

Shown

Alert target

Shown

Shown

Shown

Start time

Hidden

Shown

Shown

Duration

Hidden

Shown

Shown

Alert count

Hidden

Shown

Shown

Status

Hidden

Shown

Shown

Recovery time

Hidden

Shown

Hidden

Alerting

O Model Studio oferece três recursos de alerta: regras de alerta, modelos de alerta e histórico de alertas. Todos estão localizados nas abas Alert rules, Alert templates e Alert history na página Model Monitoring & Alerting.

Gerenciamento de regras de alerta

Na página Model Monitoring & Alerting, clique na aba Alerting para abrir a página de gerenciamento de regras de alerta. A lista de regras de alerta mostra as regras atualmente efetivas e permite criar, editar, parar e excluir regras. A lista exibe os destinatários das notificações (contatos ou grupos de contatos) e suporta múltiplos canais, como e-mail. Caminho completo para configurar alertas pela primeira vez: primeiro, conclua a autorização da função vinculada ao service CloudMonitor em Data delivery > Monitoring data delivery; em seguida, crie uma regra de alerta nesta seção (selecione um modelo de alerta e preencha os campos); por fim, configure as notificações de alerta (contatos ou grupos de contatos, intervalo de tempo de notificação e política de repetição).
Recomendações: Para controlar custos de tokens, configure um alerta de pico (comparado ao período anterior) para Model TotalToken consumption. Para garantir disponibilidade, configure um alerta para a taxa de falhas de chamadas. Ambos podem usar diretamente um modelo de alerta predefinido.
Antes de criar uma regra de alerta, autorize a função vinculada ao service CloudMonitor na entrega de monitoramento de modelos (para saber como configurar, consulte Data delivery > Monitoring data delivery). Sem autorização, o botão Create alert rule fica inativo e, ao passar o mouse sobre ele, a seguinte dica é exibida: "The CloudMonitor service-linked role is not authorized, so you cannot create an alert rule. Click to authorize." Após a autorização, o service CloudMonitor é ativado automaticamente em segundo plano.
  1. Clique em Create Alert Rule para abrir uma nova página.
  2. Preencha o nome do alerta, modelo de alerta, modelo, duração, período de verificação do alerta, conteúdo do alerta e nível do alerta conforme descrito nas descrições de campo abaixo.
  3. Configure as notificações de alerta (contatos ou grupos de contatos de alerta, intervalo de tempo de notificação e política de repetição) e clique em Create para concluir.
Os campos do formulário são descritos na tabela a seguir.

Field

Required

Description

Alert name

Required

Até 50 caracteres.

Alert template

Required

Selecione um modelo predefinido ou personalizado na lista suspensa ou crie um salvando com base em um modelo existente.

Model

Required

Até 50 modelos.

Duration

Required

Especificado em minutos.

Alert check period

Required

Padrão de 60 segundos, em segundos; deve ser um número inteiro maior ou igual a 0 (0 significa alertar imediatamente quando acionado).

Alert content

Required

Até 200 caracteres; suporta variáveis (é possível inserir placeholders como workspace, modelo e valor atual).

Alert level

Optional

INFO / WARNING / ERROR / CRITICAL. Padrão INFO.

Alert contacts / contact groups

Multiple allowed

Originados de contatos ou grupos de contatos do CloudMonitor.

Notification time range

Required

Qualquer intervalo dentro de 24 horas, podendo abranger dias (por exemplo, 23:00 a 01:00 do dia seguinte).

Repeat policy

Required

Sem escalonamento significa que o alerta é enviado apenas uma vez enquanto não resolvido; alternativamente, especifique um intervalo de horas e minutos para repetir as notificações.

Usuários existentes que já ativaram a entrega de monitoramento e configuraram regras de alerta podem migrar as regras de alerta da instância Prometheus do CloudMonitor para o Model Studio com um clique. Atualmente, apenas regras de alerta criadas pela plataforma podem ser migradas; regras criadas no lado do CloudMonitor não podem ser migradas.
  1. Acima da lista de regras de alerta, clique em Migrate now ou Migrate alert rules.
  2. Confirm the migration source. Visualize o nome e o status da instância Prometheus e clique em Start detection.
  3. Check alert rules. O sistema detecta quais regras de alerta podem ser migradas e quais são incompatíveis. Selecione-as, confirme e clique em Start migration.
  4. Migrate alert rules. Durante a migração, o status "Migrating" é exibido. Ao término da migração, o resultado de sucesso ou falha é mostrado. Se a migração falhar, tente novamente. Após uma migração bem-sucedida, feche a caixa de diálogo.
Após a migração, as regras de alerta na instância Prometheus são desativadas (não excluídas); você pode excluí-las manualmente no lado do Prometheus. A tarefa de migração permanece registrada por 6 horas, e atualizar a página durante a migração não interrompe a tarefa. Após uma migração bem-sucedida, não é necessária uma segunda migração, a entrada de migração fica oculta e apenas uma mensagem de sucesso em linha é exibida. As regras de alerta suportam as operações de parar, editar e excluir. Escopo de alerta: atualmente, apenas métricas específicas suportam alertas. Os itens configuráveis estão marcados por linha na tabela de métricas na seção Detalhes do monitoramento de modelos.

Modelos de alerta

Um modelo de alerta é uma configuração de alerta com condições de acionamento predefinidas. Crie regras de alerta rapidamente com base em um modelo, sem precisar configurar do zero. O sistema fornece 12 modelos predefinidos, e você também pode criar os seus próprios. A aba Alert templates está na página Model Monitoring & Alerting, no mesmo nível das abas Alert rules e Alert history. Clique em Create alert template para abrir o painel lateral de criação de modelo de alerta e preencha as seguintes informações:
  • Template name: Obrigatório, até 20 caracteres.
  • Parameter: Até 10 parâmetros. Escolha acionar o alerta quando todas as regras atenderem às condições (AND) ou quando qualquer uma atender à condição (OR).
  • Metric: Obrigatório. Seleciona a métrica a ser monitorada para alerta. As opções suspensas incluem chamadas, falhas, taxa de falhas, duração da chamada e tempo até o primeiro token.
  • Alert Threshold: Obrigatório. Selecione um operador de comparação (>, >=, <, <=, ==, !=) e um valor.
  • Cycle: Em minutos. Intervalo válido de 1 a 10080 minutos.
Os modelos de alerta predefinidos são marcados com uma tag Preset após o nome e permitem visualizar detalhes e copiar, mas não editar ou excluir. Modelos de alerta personalizados permitem visualizar detalhes, editar, excluir e copiar. Recomendações: use primeiro os modelos predefinidos para cobrir cenários comuns de alerta (a métrica e o limiar são predefinidos para cargas típicas); basta preencher os parâmetros para usá-los. Utilize modelos personalizados para condições compostas complexas e regras específicas do negócio. As métricas suportadas pelos modelos de alerta predefinidos estão listadas na tabela a seguir.

Preset alert template name

Metric

Model call failures: 1-minute sum > 10

Falhas de chamadas de modelo

Model call failure ratio: 1-minute sum > 1%

Proporção de falhas de chamadas de modelo

Model 4xx calls: 1-minute sum > 10

Chamadas 4xx de modelo

Model 4xx ratio: 1-minute sum > 1%

Proporção de 4xx de modelo

Model 429 calls: 1-minute sum > 10

Chamadas 429 de modelo

Model 429 ratio: 1-minute sum > 1%

Proporção de 429 de modelo

Model 5xx calls: 1-minute sum > 10

Chamadas 5xx de modelo

Model 5xx ratio: 1-minute sum > 1%

Proporção de 5xx de modelo

Model calls: 1-minute sum > 500

Chamadas de modelo

Model call duration: 1-minute average > 60 seconds

Duração de chamadas de modelo

Model time to first token: 1-minute average > 10 seconds

Tempo até o primeiro token do modelo (latência do primeiro token)

Model TotalToken consumption: 1-minute sum > 10000

Consumo total de tokens do modelo

Histórico de alertas

Na página Model Monitoring & Alerting, clique na aba History para visualizar registros de acionamento de alertas. Na lista de histórico de alertas, o destinatário da notificação mostra apenas as informações de contato, não os canais de notificação relacionados. O histórico de alertas pode ser filtrado por quatro condições: hora do alerta (predefinições rápidas e calendário), regra de alerta, nível de alerta e status (Recovered ou Alerting). A lista de histórico de alertas exibe as seguintes colunas.

Column

Description

Alert instance

Identificador da instância de alerta

Alert level

INFO / WARNING / ERROR / CRITICAL

Alert time

Quando o alerta foi acionado

Alert count

Número de vezes que este alerta foi acionado

Alert rule

Nome e ID da regra de alerta

Status

Recovered ou Alerting

Notification recipient

Contatos ou grupos de contatos de alerta

Actions

Visualizar detalhes (abre o painel lateral de detalhes do alerta)

Clique em View details na lista para abrir o painel lateral de detalhes do alerta. O status no painel lateral de detalhes possui apenas dois valores: Recovered e Alerting.

Logging

O Model Studio registra audit logs por padrão (armazenados na plataforma, sem necessidade de configuração), capturando as informações de solicitação de cada chamada de modelo, mas não o Prompt ou Response. Os inference logs registram o Prompt e Response completos e as etapas intermediárias; devem ser ativados manualmente e dependem da entrega de logs para gravar logs em seu próprio Logstore do Simple Log Service (SLS) (para entrega de logs, consulte a seção Data delivery).

Audit Log

Os audit logs são ativados por padrão para todos os usuários, não exigem configuração e são armazenados na plataforma Model Studio. Eles registram as informações de solicitação de cada chamada de modelo, incluindo métricas principais como Request ID, horário, modelo, uso de tokens, latência e status, mas não incluem o conteúdo de Prompt e Response. Para visualizar o conteúdo completo de Prompt e Response, ative os inference logs (para saber como ativá-los, consulte a seção Inference Log).

Condições de filtro

Os audit logs suportam as seguintes condições de filtro:
  • Time range: Últimos 7 dias por padrão; suporta consulta de logs de até 30 dias.
  • Model: Seleção suspensa; todos os modelos por padrão.
  • API key ID: Seleção suspensa. As API keys exibem o ID e a descrição; se uma API key for excluída, a descrição ficará vazia.
  • Status: Seleção múltipla, incluindo 0 (solicitação bem-sucedida, mas interrompida ativamente pelo usuário), 200 (sucesso), 4XX (exceções causadas pelo comportamento do usuário) e 5XX (service indisponível).
  • Inference Type: Inferência em tempo real por padrão.
  • Search Request ID: Correspondência exata.

Lista de logs

A lista de audit logs exibe os seguintes campos: Request ID, horário da chamada, modelo, uso, tempo até o primeiro token, duração da chamada, status e código de erro. A coluna Actions fornece View details, que abre o painel lateral de detalhes do audit log.

Painel lateral de detalhes

O painel lateral de detalhes do audit log permite alternar entre a visualização em lista e a visualização JSON:
  • Informações básicas: Request ID, horário da chamada, modelo, API key.
  • Uso: total de tokens, tokens de saída, tokens de entrada.
  • Desempenho: tempo até o primeiro token, duração da chamada, código de status, código de erro e mensagem de erro (se houver).
Para criar e gerenciar API keys, acesse System Management no console do Model Studio.

Inference Log

Os inference logs devem ser ativados manualmente. Além dos audit logs, os inference logs registram o Prompt e Response completos e as etapas intermediárias, auxiliando na depuração, otimização e solução de problemas. Os inference logs são armazenados em seu próprio Logstore do Simple Log Service.

Ativar inference logs

Os inference logs são desativados por padrão; você deve primeiro ativar a entrega de audit logs. Na página de logs, alterne para a aba Inference Log (quando não estiver configurada, esta aba mostra uma página de guia para ativá-la) e clique em Start configuration para abrir a caixa de diálogo de configuração de entrega de logs. Você também pode acessá-la clicando no botão Log delivery configuration no canto superior direito da página de logs. Após concluir a autorização e a configuração do Logstore, visualize a lista de inference logs.

Lista de logs e detalhes

As condições de filtro para inference logs são as mesmas dos audit logs, exceto pela remoção do filtro de tipo de inferência (inferência em tempo real/inferência em lote). Para modelos sem suporte a inference logs, a mensagem "The current model is not supported" é exibida. Além dos audit logs, a lista de inference logs adiciona dados de Prompt e Response, com limite de 128 KB. Conteúdos acima de 128 KB são truncados; para o conteúdo completo, consulte os logs reais de chamadas.
Ativar inference logs e entregar logs em seu próprio Logstore SLS gera cobranças do Simple Log Service. Para as regras de faturamento, consulte Visão geral do faturamento do Simple Log Service.
As regras de exibição após a exclusão de uma API key são as mesmas dos audit logs (a lista não mostra a descrição, e os detalhes mostram apenas o ID). Os inference logs podem ser reciclados em conjuntos de dados de treinamento. Para mais informações, consulte Log backflow.
Recomendação: Os inference logs registram o Prompt e Response completos, sendo adequados para reproduzir solicitações anômalas, depurar saídas de modelo e solucionar problemas intermitentes.

Data delivery

Por padrão, o Model Studio armazena métricas de monitoramento e audit logs na plataforma, permitindo visualizá-los no console sem nenhuma entrega. Para entregar métricas de monitoramento ou logs em seus próprios services Alibaba Cloud (para retenção de longo prazo ou integração com seus próprios sistemas de O&M, o que gera cobranças de services cloud), ative a entrega de dados correspondente: dados de monitoramento são entregues em uma instância Prometheus do CloudMonitor, e logs são entregues em um Logstore do Simple Log Service (SLS). A entrega de logs também é pré-requisito para inference logs.

Entrega de dados de monitoramento

A entrada de entrega de monitoramento de modelos está no canto superior esquerdo da página de visão geral do monitoramento. A entrega de monitoramento de modelos envia automaticamente os dados de monitoramento dos modelos do Model Studio para uma instância Prometheus do Alibaba Cloud CloudMonitor, permitindo o gerenciamento unificado dos dados de monitoramento. O Model Studio fornece métricas de service de modelo por padrão, que podem ser visualizadas na plataforma sem configuração extra. Para entregar as métricas ao service CloudMonitor sob sua conta, ative a entrega de dados e configure o recurso de destino.

Etapas de configuração

Para novos usuários, configurar a entrega de monitoramento de modelos requer as seguintes etapas:
  1. Autorize a função vinculada ao service CloudMonitor.
  2. Ative o service CloudMonitor.
  3. Crie uma instância de monitoramento Prometheus do CloudMonitor.
A entrega de monitoramento de modelos atualmente suporta apenas instâncias Prometheus do CloudMonitor, não Prometheus autogerenciado. Para usuários existentes que já ativaram a entrega de monitoramento, a configuração existente é migrada automaticamente, os dados de monitoramento da plataforma são entregues automaticamente à instância Prometheus ativada anteriormente e a instância Prometheus não pode ser alterada. Após a ativação da entrega, os dados de monitoramento são armazenados tanto no lado da plataforma quanto no lado do usuário.
Usuários existentes que ativaram o monitoramento avançado têm a entrega de dados de monitoramento ativada por padrão; se não precisar dela, desative-a na entrada de entrega de monitoramento de modelos.

Status da entrega

Após configurar a entrega de dados, um indicador de status é exibido ao lado da entrega de monitoramento de modelos:
  • Delivering (verde)
  • Delivery failed (vermelho)
  • Delivery not configured (cinza)
O botão de alternância de entrega é Call statistics and performance metrics delivery. Os detalhes de autorização são expandidos por padrão.

Entrega de logs

A entrada de configuração de entrega de logs está no canto superior direito da página de logs. Na página de visão geral do monitoramento, selecione um modelo para entrar em sua página de detalhes e, em seguida, alterne para a página de logs para ver esta entrada. A entrega de logs envia automaticamente os audit logs e inference logs dos modelos do Model Studio para um Logstore do Alibaba Cloud Simple Log Service, permitindo o gerenciamento unificado dos dados. Para entregar logs ao Simple Log Service sob sua conta, ative a entrega de logs e conclua a configuração.

Etapas de configuração

Configurar a entrega de logs pela primeira vez requer as três etapas seguintes:
  1. Autorize a função do Simple Log Service.
  2. Ative o Simple Log Service.
  3. Crie um Logstore.
Usuários existentes que já ativaram a entrega de logs não precisam reconfigurar; a configuração original é retida automaticamente e o Logstore não pode ser alterado.

Entrega de audit logs

Ao ativar ou desativar a entrega de audit logs, uma mensagem de resultado aparece brevemente no topo da página. O processo de autorização e configuração é o mesmo das etapas de configuração acima.

Entrega de inference logs

Antes de ativar a entrega de inference logs, você deve primeiro ativar a entrega de audit logs (a entrega de inference logs não pode ser ativada quando a entrega de audit logs não estiver configurada). O processo de autorização e configuração para entrega de inference logs é o mesmo descrito acima.
Ao desativar a entrega de audit logs, a entrega de inference logs também é desativada.
Após a conclusão da configuração, um indicador de status é exibido ao lado da configuração de entrega de logs; os três estados têm os mesmos significados da entrega de dados de monitoramento.
Ao desativar a entrega de logs, os logs gerados durante o período de desativação não são sincronizados com o Logstore SLS e não podem ser preenchidos retroativamente ou restaurados posteriormente. Desative com cautela.
Plano de Tokens
Playground de Modelos
  • Music generation
Inferência do Modelo
Avaliação
Compressão de Modelos
Estatísticas e Monitoramento
Suporte