O Model Studio oferece monitoramento de modelos, alertas e logs para acompanhamento de chamadas em tempo real, detecção rápida de anomalias e solução de problemas.
Visão geral do monitoramento de modelos
O Model Studio fornece monitoramento unificado de modelos. Uma chamada aparece nos gráficos de monitoramento cerca de 1 a 2 minutos (até 5 minutos) após a ocorrência, facilitando o rastreamento em tempo real. Os dados de monitoramento são isolados por workspace: é possível visualizar apenas os dados do workspace selecionado no momento. Esses dados servem apenas como referência e não constituem base para faturamento. Para conciliação, consulte sua fatura em Expenses and Costs.
Filtrar dados de monitoramento por dimensão
Filtre os dados de monitoramento por Time (predefinições rápidas e personalizadas), Inference Type e API key (todos por padrão; exibe o ID e a descrição, listando apenas as API keys existentes no workspace atual). A filtragem por granularidade de tempo está disponível somente na página de detalhes do monitoramento de modelos.
Visualizar escala geral de chamadas e integridade
A página de visão geral exibe cartões de dados como total de modelos, total de chamadas, total de falhas, duração média das chamadas e tempo médio até o primeiro token (latência do primeiro token), permitindo avaliar rapidamente a escala geral das chamadas e a integridade do sistema.
Visualizar detalhes de monitoramento ou logs de um modelo
A lista de modelos apresenta os dados de monitoramento de cada modelo no workspace atual. Clique em View details para abrir a página de detalhes do monitoramento do modelo ou em View Logs para abrir a aba Audit Log na página de logs. Acesse o console do Model Studio e, no painel de navegação à esquerda, escolha Model Monitoring & Alerting para abrir a página de visão geral do monitoramento.
Detalhes do monitoramento de modelos
Na página de visão geral do monitoramento, localize o modelo desejado na lista e clique em View details para abrir a página de detalhes do monitoramento desse modelo. O caminho de navegação no topo da página é: Model monitoring > nome do modelo.
A página de detalhes exibe estatísticas de chamadas e gráficos de desempenho para um único modelo, além de oferecer uma entrada para configurar alertas: o ícone de sino em um gráfico de métrica permite configurar rapidamente um alerta para o modelo ou métrica atual (para gerenciamento completo de regras entre modelos, consulte a seção Alerting). Os filtros são os mesmos da página de visão geral (tempo, granularidade de tempo, tipo de inferência e API key), e as configurações da página de visão geral são mantidas ao acessá-la a partir dela. Para visualizar logs, retorne à lista de modelos na página de visão geral e clique na entrada View logs (consulte a seção Logging).
Métricas de monitoramento
Na página de detalhes, as métricas aparecem em dois grupos: estatísticas de chamadas e desempenho. O significado, as notas de referência e o suporte a alertas de cada métrica estão listados na tabela a seguir.
Metric | Description | Reference | Alerting support |
|---|---|---|---|
Calls | Número total de chamadas do modelo | Varia conforme o negócio | Configurável |
Usage | Total de tokens | Varia conforme o negócio | Configurável |
Failures | Número de chamadas com falha | Varia conforme o negócio | Configurável |
Failure rate | Falhas divididas pelo total de chamadas | Varia conforme o negócio | Configurável |
Call duration | Tempo total da solicitação até a resposta | Varia conforme o modelo e o cenário | Configurável |
Time to first token | Latência da solicitação até o primeiro token retornado | Varia conforme o modelo e o cenário | Configurável |
Subsequent token latency | Tempo médio para gerar cada token após o primeiro | Varia conforme o modelo e o cenário | Sem suporte |
Model TotalToken consumption | Total de tokens consumidos, agregados por modelo (métrica dedicada a modelos de alerta predefinidos) | Varia conforme o negócio | Configurável |
Average usage per request | Média de tokens por solicitação | Varia conforme o negócio | Sem suporte |
Content moderation error count | Número de bloqueios por moderação de conteúdo | Varia conforme o negócio | Sem suporte |
Rate limiting error count | Número de acionamentos de limite de taxa 429 | Varia conforme o negócio | Configurável |
RPM | Solicitações por minuto | Varia conforme o negócio | Sem suporte |
TPM | Tokens por minuto | Varia conforme o negócio | Sem suporte |
Output tokens per second (TPS) | Tokens de saída por segundo | Varia conforme o modelo e o cenário | Sem suporte |
Configuração do sino de alerta
Métricas com suporte a alertas exibem um ícone de sino no gráfico. Clique no sino para abrir o painel lateral de configuração de regras de alerta (para detalhes dos campos, consulte a seção Alert rule management). O ícone de sino e os rótulos de status no painel lateral têm os seguintes significados:
Type | Status | Color | Meaning |
|---|---|---|---|
Bell icon | No alert configured | Gray | Nenhuma regra de alerta configurada; clique para abrir o painel lateral de configuração |
Bell icon | Alert configured, normal | Blue | Regra configurada e não acionada no momento; clique para visualizar os detalhes da regra |
Bell icon | Alerting | Red | Alerta em acionamento; clique para visualizar os detalhes do acionamento |
Side-panel label | Normal | Green | Regra configurada com status normal |
Side-panel label | Alerting | Red | Alerta em acionamento |
Side-panel label | Disabled | Gray | Regra desativada; não gera mais alertas |
Field | Normal | Recovered | Alerting |
|---|---|---|---|
Alert rule name | Shown | Shown | Shown |
Alert rule ID | Shown | Shown | Shown |
Alert content | Shown | Shown | Shown |
Alert metric | Shown | Shown | Shown |
Notification recipients | Shown | Shown | Shown |
Alert target | Shown | Shown | Shown |
Start time | Hidden | Shown | Shown |
Duration | Hidden | Shown | Shown |
Alert count | Hidden | Shown | Shown |
Status | Hidden | Shown | Shown |
Recovery time | Hidden | Shown | Hidden |
Alerting
O Model Studio oferece três recursos de alerta: regras de alerta, modelos de alerta e histórico de alertas. Todos estão localizados nas abas Alert rules, Alert templates e Alert history na página Model Monitoring & Alerting.
Gerenciamento de regras de alerta
Na página Model Monitoring & Alerting, clique na aba Alerting para abrir a página de gerenciamento de regras de alerta. A lista de regras de alerta mostra as regras atualmente efetivas e permite criar, editar, parar e excluir regras. A lista exibe os destinatários das notificações (contatos ou grupos de contatos) e suporta múltiplos canais, como e-mail.
Caminho completo para configurar alertas pela primeira vez: primeiro, conclua a autorização da função vinculada ao service CloudMonitor em Data delivery > Monitoring data delivery; em seguida, crie uma regra de alerta nesta seção (selecione um modelo de alerta e preencha os campos); por fim, configure as notificações de alerta (contatos ou grupos de contatos, intervalo de tempo de notificação e política de repetição).
- Clique em Create Alert Rule para abrir uma nova página.
- Preencha o nome do alerta, modelo de alerta, modelo, duração, período de verificação do alerta, conteúdo do alerta e nível do alerta conforme descrito nas descrições de campo abaixo.
- Configure as notificações de alerta (contatos ou grupos de contatos de alerta, intervalo de tempo de notificação e política de repetição) e clique em Create para concluir.
Field | Required | Description |
|---|---|---|
Alert name | Required | Até 50 caracteres. |
Alert template | Required | Selecione um modelo predefinido ou personalizado na lista suspensa ou crie um salvando com base em um modelo existente. |
Model | Required | Até 50 modelos. |
Duration | Required | Especificado em minutos. |
Alert check period | Required | Padrão de 60 segundos, em segundos; deve ser um número inteiro maior ou igual a 0 (0 significa alertar imediatamente quando acionado). |
Alert content | Required | Até 200 caracteres; suporta variáveis (é possível inserir placeholders como workspace, modelo e valor atual). |
Alert level | Optional | INFO / WARNING / ERROR / CRITICAL. Padrão INFO. |
Alert contacts / contact groups | Multiple allowed | Originados de contatos ou grupos de contatos do CloudMonitor. |
Notification time range | Required | Qualquer intervalo dentro de 24 horas, podendo abranger dias (por exemplo, 23:00 a 01:00 do dia seguinte). |
Repeat policy | Required | Sem escalonamento significa que o alerta é enviado apenas uma vez enquanto não resolvido; alternativamente, especifique um intervalo de horas e minutos para repetir as notificações. |
- Acima da lista de regras de alerta, clique em Migrate now ou Migrate alert rules.
- Confirm the migration source. Visualize o nome e o status da instância Prometheus e clique em Start detection.
- Check alert rules. O sistema detecta quais regras de alerta podem ser migradas e quais são incompatíveis. Selecione-as, confirme e clique em Start migration.
- Migrate alert rules. Durante a migração, o status "Migrating" é exibido. Ao término da migração, o resultado de sucesso ou falha é mostrado. Se a migração falhar, tente novamente. Após uma migração bem-sucedida, feche a caixa de diálogo.
Modelos de alerta
Um modelo de alerta é uma configuração de alerta com condições de acionamento predefinidas. Crie regras de alerta rapidamente com base em um modelo, sem precisar configurar do zero. O sistema fornece 12 modelos predefinidos, e você também pode criar os seus próprios. A aba Alert templates está na página Model Monitoring & Alerting, no mesmo nível das abas Alert rules e Alert history.
Clique em Create alert template para abrir o painel lateral de criação de modelo de alerta e preencha as seguintes informações:
- Template name: Obrigatório, até 20 caracteres.
- Parameter: Até 10 parâmetros. Escolha acionar o alerta quando todas as regras atenderem às condições (AND) ou quando qualquer uma atender à condição (OR).
- Metric: Obrigatório. Seleciona a métrica a ser monitorada para alerta. As opções suspensas incluem chamadas, falhas, taxa de falhas, duração da chamada e tempo até o primeiro token.
- Alert Threshold: Obrigatório. Selecione um operador de comparação (>, >=, <, <=, ==, !=) e um valor.
- Cycle: Em minutos. Intervalo válido de 1 a 10080 minutos.
Preset alert template name | Metric |
|---|---|
Model call failures: 1-minute sum > 10 | Falhas de chamadas de modelo |
Model call failure ratio: 1-minute sum > 1% | Proporção de falhas de chamadas de modelo |
Model 4xx calls: 1-minute sum > 10 | Chamadas 4xx de modelo |
Model 4xx ratio: 1-minute sum > 1% | Proporção de 4xx de modelo |
Model 429 calls: 1-minute sum > 10 | Chamadas 429 de modelo |
Model 429 ratio: 1-minute sum > 1% | Proporção de 429 de modelo |
Model 5xx calls: 1-minute sum > 10 | Chamadas 5xx de modelo |
Model 5xx ratio: 1-minute sum > 1% | Proporção de 5xx de modelo |
Model calls: 1-minute sum > 500 | Chamadas de modelo |
Model call duration: 1-minute average > 60 seconds | Duração de chamadas de modelo |
Model time to first token: 1-minute average > 10 seconds | Tempo até o primeiro token do modelo (latência do primeiro token) |
Model TotalToken consumption: 1-minute sum > 10000 | Consumo total de tokens do modelo |
Histórico de alertas
Na página Model Monitoring & Alerting, clique na aba History para visualizar registros de acionamento de alertas. Na lista de histórico de alertas, o destinatário da notificação mostra apenas as informações de contato, não os canais de notificação relacionados.
O histórico de alertas pode ser filtrado por quatro condições: hora do alerta (predefinições rápidas e calendário), regra de alerta, nível de alerta e status (Recovered ou Alerting).
A lista de histórico de alertas exibe as seguintes colunas.
Column | Description |
|---|---|
Alert instance | Identificador da instância de alerta |
Alert level | INFO / WARNING / ERROR / CRITICAL |
Alert time | Quando o alerta foi acionado |
Alert count | Número de vezes que este alerta foi acionado |
Alert rule | Nome e ID da regra de alerta |
Status | Recovered ou Alerting |
Notification recipient | Contatos ou grupos de contatos de alerta |
Actions | Visualizar detalhes (abre o painel lateral de detalhes do alerta) |
Logging
O Model Studio registra audit logs por padrão (armazenados na plataforma, sem necessidade de configuração), capturando as informações de solicitação de cada chamada de modelo, mas não o Prompt ou Response. Os inference logs registram o Prompt e Response completos e as etapas intermediárias; devem ser ativados manualmente e dependem da entrega de logs para gravar logs em seu próprio Logstore do Simple Log Service (SLS) (para entrega de logs, consulte a seção Data delivery).
Audit Log
Os audit logs são ativados por padrão para todos os usuários, não exigem configuração e são armazenados na plataforma Model Studio. Eles registram as informações de solicitação de cada chamada de modelo, incluindo métricas principais como Request ID, horário, modelo, uso de tokens, latência e status, mas não incluem o conteúdo de Prompt e Response. Para visualizar o conteúdo completo de Prompt e Response, ative os inference logs (para saber como ativá-los, consulte a seção Inference Log).
Condições de filtro
Os audit logs suportam as seguintes condições de filtro:
- Time range: Últimos 7 dias por padrão; suporta consulta de logs de até 30 dias.
- Model: Seleção suspensa; todos os modelos por padrão.
- API key ID: Seleção suspensa. As API keys exibem o ID e a descrição; se uma API key for excluída, a descrição ficará vazia.
- Status: Seleção múltipla, incluindo 0 (solicitação bem-sucedida, mas interrompida ativamente pelo usuário), 200 (sucesso), 4XX (exceções causadas pelo comportamento do usuário) e 5XX (service indisponível).
- Inference Type: Inferência em tempo real por padrão.
- Search Request ID: Correspondência exata.
Lista de logs
A lista de audit logs exibe os seguintes campos: Request ID, horário da chamada, modelo, uso, tempo até o primeiro token, duração da chamada, status e código de erro. A coluna Actions fornece View details, que abre o painel lateral de detalhes do audit log.
Painel lateral de detalhes
O painel lateral de detalhes do audit log permite alternar entre a visualização em lista e a visualização JSON:
- Informações básicas: Request ID, horário da chamada, modelo, API key.
- Uso: total de tokens, tokens de saída, tokens de entrada.
- Desempenho: tempo até o primeiro token, duração da chamada, código de status, código de erro e mensagem de erro (se houver).
Inference Log
Os inference logs devem ser ativados manualmente. Além dos audit logs, os inference logs registram o Prompt e Response completos e as etapas intermediárias, auxiliando na depuração, otimização e solução de problemas. Os inference logs são armazenados em seu próprio Logstore do Simple Log Service.
Ativar inference logs
Os inference logs são desativados por padrão; você deve primeiro ativar a entrega de audit logs. Na página de logs, alterne para a aba Inference Log (quando não estiver configurada, esta aba mostra uma página de guia para ativá-la) e clique em Start configuration para abrir a caixa de diálogo de configuração de entrega de logs. Você também pode acessá-la clicando no botão Log delivery configuration no canto superior direito da página de logs. Após concluir a autorização e a configuração do Logstore, visualize a lista de inference logs.
Lista de logs e detalhes
As condições de filtro para inference logs são as mesmas dos audit logs, exceto pela remoção do filtro de tipo de inferência (inferência em tempo real/inferência em lote). Para modelos sem suporte a inference logs, a mensagem "The current model is not supported" é exibida.
Além dos audit logs, a lista de inference logs adiciona dados de Prompt e Response, com limite de 128 KB. Conteúdos acima de 128 KB são truncados; para o conteúdo completo, consulte os logs reais de chamadas.
Data delivery
Por padrão, o Model Studio armazena métricas de monitoramento e audit logs na plataforma, permitindo visualizá-los no console sem nenhuma entrega. Para entregar métricas de monitoramento ou logs em seus próprios services Alibaba Cloud (para retenção de longo prazo ou integração com seus próprios sistemas de O&M, o que gera cobranças de services cloud), ative a entrega de dados correspondente: dados de monitoramento são entregues em uma instância Prometheus do CloudMonitor, e logs são entregues em um Logstore do Simple Log Service (SLS). A entrega de logs também é pré-requisito para inference logs.
Entrega de dados de monitoramento
A entrada de entrega de monitoramento de modelos está no canto superior esquerdo da página de visão geral do monitoramento. A entrega de monitoramento de modelos envia automaticamente os dados de monitoramento dos modelos do Model Studio para uma instância Prometheus do Alibaba Cloud CloudMonitor, permitindo o gerenciamento unificado dos dados de monitoramento. O Model Studio fornece métricas de service de modelo por padrão, que podem ser visualizadas na plataforma sem configuração extra. Para entregar as métricas ao service CloudMonitor sob sua conta, ative a entrega de dados e configure o recurso de destino.
Etapas de configuração
Para novos usuários, configurar a entrega de monitoramento de modelos requer as seguintes etapas:
- Autorize a função vinculada ao service CloudMonitor.
- Ative o service CloudMonitor.
- Crie uma instância de monitoramento Prometheus do CloudMonitor.
Status da entrega
Após configurar a entrega de dados, um indicador de status é exibido ao lado da entrega de monitoramento de modelos:
- Delivering (verde)
- Delivery failed (vermelho)
- Delivery not configured (cinza)
Entrega de logs
A entrada de configuração de entrega de logs está no canto superior direito da página de logs. Na página de visão geral do monitoramento, selecione um modelo para entrar em sua página de detalhes e, em seguida, alterne para a página de logs para ver esta entrada. A entrega de logs envia automaticamente os audit logs e inference logs dos modelos do Model Studio para um Logstore do Alibaba Cloud Simple Log Service, permitindo o gerenciamento unificado dos dados. Para entregar logs ao Simple Log Service sob sua conta, ative a entrega de logs e conclua a configuração.
Etapas de configuração
Configurar a entrega de logs pela primeira vez requer as três etapas seguintes:
- Autorize a função do Simple Log Service.
- Ative o Simple Log Service.
- Crie um Logstore.