Skip to main content
Avaliação

Model Evaluation

O Model Evaluation é uma ferramenta de avaliação da qualidade de modelos fornecida pela plataforma Alibaba Cloud Model Studio. Ela permite avaliar quantitativamente o desempenho de grandes modelos de linguagem por meio de dimensões de avaliação personalizadas, ajudando você a concluir a seleção de modelos, a verificação de ajustes e a comparação de capacidades.

O que é o Model Evaluation

O Model Evaluation é uma ferramenta de verificação da qualidade de modelos disponibilizada pela plataforma Alibaba Cloud Model Studio. Por meio de dimensões de avaliação e métodos de pontuação personalizados, você pode avaliar quantitativamente o desempenho de grandes modelos de linguagem em cenários de negócios específicos e obter resultados de avaliação comparáveis.
image

Casos de uso

O Model Evaluation aplica-se aos seguintes cenários:
  • Seleção de modelos: compare as pontuações entre vários modelos candidatos para escolher aquele que melhor atende às suas necessidades de negócios.
  • Verificação de ajuste: após Prompt tuning or fine-tuning um modelo, utilize a avaliação para verificar se o desempenho melhorou.
  • Avaliação quantitativa: converta a qualidade da saída do modelo em métricas de pontuação mensuráveis para substituir o julgamento subjetivo.
  • Monitoramento contínuo: execute tarefas de avaliação periodicamente para acompanhar a tendência das capacidades do modelo ao longo das iterações de versão.

Métodos de pontuação

O Model Evaluation oferece suporte a 5 métodos de pontuação, abrangendo tanto a pontuação automática quanto a manual:
  • Pontuação Numérica LLM: o modelo juiz atribui uma pontuação numérica (como 0-5 pontos) de acordo com o Scorer Prompt, adequado para cenários que exigem quantificação granular.
  • Pontuação por Classificação LLM: o modelo juiz classifica a saída em categorias predefinidas (como Aprovado/Reprovado) conforme o Scorer Prompt, ideal para julgamentos binários ou de múltiplos rótulos.
  • Correspondência de Strings: realiza uma comparação exata (igual, contém, começa com, termina com, etc.) entre a saída do modelo e a resposta de referência, indicado para cenários com uma única resposta padrão.
  • Similaridade de Texto: utiliza algoritmos (ROUGE-L, BLEU, Cosseno, Fuzzy, Precisão) para calcular a similaridade entre a saída do modelo e a resposta de referência, apropriado para avaliação da qualidade de geração de texto.
  • Pontuação por Classificação Manual: anotadores humanos classificam e julgam a saída do modelo, recomendado para cenários de avaliação subjetiva que a pontuação automática não consegue cobrir.
Os modelos passíveis de avaliação incluem os modelos comerciais da série Qwen, modelos open-source Qwen, Tongyi Farui, entre outros. Os modelos disponíveis estão sujeitos à lista suspensa Model to Be Evaluated no console. Veja a seguir uma visão geral comparativa dos 5 métodos de pontuação:

Método de Pontuação

Origem da Pontuação

Cenários Aplicáveis

Custo

Pontuação Numérica LLM

Modelo juiz

Compreensão semântica, avaliação aberta

Médio

Pontuação por Classificação LLM

Modelo juiz

Julgamento binário (segurança/correção)

Médio

Correspondência de Strings

Regra

Cenários com resposta padrão única

Muito baixo

Similaridade de Texto

Algoritmo

Avaliação de qualidade de tradução e resumo

Baixo

Pontuação por Classificação Manual

Anotador humano

Avaliação de criatividade, julgamento subjetivo

Alto

Pré-requisitos e limites

O fluxo completo de avaliação é: Create an Evaluation DimensionPrepare Evaluation DataCreate an Evaluation TaskView Evaluation Results. Antes de usar o Model Evaluation, confirme as seguintes condições:
  • Você registrou uma conta Alibaba Cloud e concluiu a verificação de nome real.
  • Você ativou o service Alibaba Cloud Model Studio. URL de ativação: https://modelstudio.console.alibabacloud.com.
  • Se você operar como usuário RAM, a conta principal deve conceder as permissões correspondentes.
O Model Evaluation está acessível apenas pelo console; não há invocação via API ou SDK.
Os modelos da série Qwen3 ainda não suportam avaliação no Thinking Mode. Para avaliar um modelo Qwen3, desative o Thinking Mode antes de criar a tarefa de avaliação.

Preparar dados de avaliação

Os dados de avaliação são a entrada de uma tarefa de avaliação e determinam sobre quais questões o modelo será avaliado. O Alibaba Cloud Model Studio oferece suporte a duas fontes de dados: conjuntos de dados de avaliação (perguntas de teste preparadas antecipadamente) e conjuntos de resultados de inferência (resultados de inferência já gerados pelo modelo).

Descrição do formato de dados

Um conjunto de dados de avaliação contém os seguintes campos:
  • Prompt (obrigatório): a pergunta de entrada enviada ao modelo a ser avaliado. Cada entrada deve incluir este campo.
  • Completion (opcional): a resposta de referência, usada por métodos de pontuação (como Correspondência de Strings e Similaridade de Texto) para comparação com a saída do modelo.
  • Output (apenas conjunto de resultados de inferência): o conteúdo de saída já gerado pelo modelo. Ao usar um conjunto de resultados de inferência, a tarefa de avaliação pontua o Output diretamente e não chama o modelo a ser avaliado novamente.
O tipo de conjunto de dados deve ser Evaluation Set. Um conjunto de dados do tipo training set não pode ser usado em tarefas de avaliação. Ao criar um conjunto de dados, selecione Dataset Type e escolha Evaluation Set.
Ao criar um conjunto de dados, você deve selecionar o evaluation set como o tipo de conjunto de dados. Se você selecionar incorretamente o training set, o conjunto de dados não poderá ser usado em tarefas de avaliação. O tipo de conjunto de dados não pode ser alterado após a criação, sendo necessário criar um novo conjunto de dados.
As descrições dos campos dos dados de avaliação são as seguintes:

Campo

Obrigatório

Descrição

Cenários Aplicáveis

Prompt

Obrigatório

Pergunta de entrada enviada ao modelo a ser avaliado

Todos os métodos de avaliação

Completion

Opcional

Resposta de referência, usada para comparação com a saída do modelo

Correspondência de Strings, Similaridade de Texto

Output

Apenas conjunto de resultados de inferência

Conteúdo de saída já gerado pelo modelo

Ao reutilizar resultados de inferência existentes

Recomendações de volume de dados

O volume de dados afeta diretamente a confiabilidade dos resultados da avaliação. Escolha uma escala de dados adequada com base no seu objetivo de avaliação:
  • Validação rápida (50-100 entradas): indicada para confirmação rápida de resultados após o ajuste de Prompt, permitindo concluir a avaliação em pouco tempo.
  • Avaliação padrão (200-500 entradas): recomendada para seleção de modelos e avaliação formal, cobre mais cenários e gera resultados mais representativos.
  • Avaliação aprofundada (500 entradas ou mais): projetada para cenários que exigem alta precisão na avaliação, capaz de cobrir totalmente a distribuição de perguntas de negócios.
Ao escrever Prompts, cubra cenários típicos e casos extremos do seu negócio e evite concentrar-se em um único tipo de pergunta. Cada Prompt deve ser claro e específico para que o desempenho do modelo em uso real possa ser avaliado.

Criar um conjunto de dados

Siga estas etapas para criar um conjunto de dados de avaliação no console:
  1. Faça login no console do Alibaba Cloud Model Studio.
  2. No painel de navegação à esquerda, escolha Data Management > Dataset Management.
  3. Clique em Create Dataset.
  4. Preencha o Dataset Name e, em Dataset Type, selecione Evaluation Set.
  5. Carregue um arquivo de dados ou adicione entradas de dados manualmente, garantindo que cada entrada contenha pelo menos o campo Prompt.
  6. Clique em OK para concluir a criação.
image

Criar uma dimensão de avaliação

Uma dimensão de avaliação define os critérios de pontuação para a saída do modelo. Cada dimensão está vinculada a um método de pontuação. Quando uma tarefa de avaliação é executada, cada entrada é pontuada individualmente de acordo com a configuração da dimensão.
O método de pontuação de uma dimensão de avaliação não pode ser alterado após a criação. Para usar um método de pontuação diferente, crie uma nova dimensão de avaliação.

Selecionar um método de pontuação

O Alibaba Cloud Model Studio oferece suporte aos seguintes 5 modos de pontuação (consulte What is Model Evaluation para detalhes). Os principais parâmetros de cada método são: LLM Numerical Scoring: o modelo juiz gera uma pontuação numérica de acordo com o Scorer Prompt. O intervalo de pontuação padrão é 0-5 (mínimo 0, máximo personalizável). O limiar de aprovação padrão é 3,0 (uma pontuação ≥ ao limiar é considerada aprovada). Recomenda-se o Qwen-Max (qwen-max) como modelo juiz; sua estabilidade de pontuação e poder discriminativo são superiores. LLM Classification Scoring: o modelo juiz atribui a saída a rótulos de categoria predefinidos conforme o Scorer Prompt. Você precisa configurar pelo menos dois rótulos de categoria (como Pass e Fail) e especificar quais rótulos são considerados "aprovados". Rótulos de aprovação e de reprovação não devem se sobrepor.
Ao configurar rótulos de categoria, os rótulos de aprovação e de reprovação devem ser mutuamente exclusivos. Por exemplo, Pass e Fail não podem ser marcados como rótulos de aprovação, caso contrário o sistema rejeitará a criação.
String Matching: realiza comparação de strings entre a saída do modelo e a resposta de referência Completion, sem envolver um modelo juiz. As regras de correspondência suportadas incluem: igual, diferente, contém, começa com, termina com. Text Similarity: usa algoritmos para calcular a pontuação de similaridade entre a saída do modelo e a resposta de referência Completion, sem envolver um modelo juiz. Os algoritmos suportados incluem: ROUGE-L (orientado a recall), BLEU (orientado a precisão), Cosine (similaridade semântica), Fuzzy (correspondência difusa) e Accuracy (taxa de correspondência exata). Manual Classification Scoring: a pontuação é realizada manualmente por um anotador, e não por um modelo juiz. A configuração de parâmetros é semelhante à Pontuação por Classificação LLM; você precisa definir rótulos de categoria e rótulos de aprovação. Os parâmetros de configuração de cada método de pontuação são os seguintes (alguns parâmetros são exibidos apenas em métodos de pontuação específicos):

Parâmetro

Descrição

Obrigatório

Descrição do Valor

Nome da dimensão

Nome identificador da dimensão de avaliação

Sim

No máximo 20 caracteres

Descrição da dimensão

Descrição textual da dimensão

Sim

No máximo 100 caracteres

Método de pontuação

Determina como a saída do modelo é avaliada

Sim

Um dos 5 métodos de pontuação; não pode ser alterado após a criação

Modelo juiz

O LLM que pontua a saída do modelo

Obrigatório para pontuação LLM

Qwen-Max (qwen-max) recomendado

Scorer Prompt

Instrução que orienta o modelo juiz na pontuação

Obrigatório para pontuação LLM

Suporta variáveis ${prompt}/${output}/${completion}

Intervalo de pontuação

Intervalo de pontuação para pontuação numérica

Obrigatório para Pontuação Numérica LLM

Padrão 0-5; valor máximo personalizável

Limiar de aprovação

Uma pontuação maior ou igual ao limiar é considerada aprovada

Obrigatório para Pontuação Numérica LLM

Padrão 3,0, suporta incremento de 0,1

Rótulo de categoria

Rótulos de categoria predefinidos

Obrigatório para pontuação por classificação

Pelo menos dois rótulos; aprovação e reprovação não devem se sobrepor

Algoritmo de similaridade

Algoritmo para calcular similaridade de texto

Obrigatório para Similaridade de Texto

ROUGE-L / BLEU / Cosine / Fuzzy / Accuracy

Limiar de similaridade

Nota de corte para a pontuação de similaridade

Obrigatório para Similaridade de Texto

ROUGE-L recomendado 0,4-0,6, BLEU recomendado 0,3-0,5

Diretriz de anotação

Instruções que orientam os anotadores no julgamento

Opcional para Pontuação por Classificação Manual

Descrição de texto personalizada

Configurar um Scorer Prompt

A Pontuação Numérica LLM e a Pontuação por Classificação LLM exigem um Scorer Prompt para orientar o modelo juiz sobre como pontuar. Você pode escolher um modelo de Prompt predefinido pela plataforma ou escrever um Prompt personalizado. O Scorer Prompt suporta as três variáveis a seguir, que são substituídas automaticamente pelos dados reais durante a avaliação:
  • ${prompt}: o conteúdo de entrada Prompt da entrada de dados atual.
  • ${output}: o conteúdo de saída gerado pelo modelo a ser avaliado para este Prompt.
  • ${completion}: a resposta de referência Completion para esta entrada de dados (se houver).
Ao personalizar um Prompt, informe claramente ao modelo juiz os critérios de julgamento, o formato de saída e o intervalo de pontuação da dimensão de pontuação para obter resultados estáveis. Para mais técnicas de escrita de Prompt, consulte Prompt Best Practices.

Etapas para criar uma dimensão

  1. Faça login no console do Alibaba Cloud Model Studio e, no painel de navegação à esquerda, escolha Evaluation > Dimension.
  2. Clique em Create Evaluation Dimension.
  3. Preencha o Dimension Name (no máximo 20 caracteres) e a Dimension Description (no máximo 100 caracteres).
  4. Em Scoring Method, selecione um método de pontuação e configure os parâmetros correspondentes.
  5. Se você selecionar um método de pontuação LLM, escolha um modelo em Judge Model (Qwen-Max recomendado) e configure o Scorer Prompt.
  6. Clique em OK para concluir a criação. O método de pontuação não pode ser alterado após a criação; para usar um método diferente, crie uma nova dimensão.
image
Para parâmetros de configuração detalhados e recomendações de uso de cada método de pontuação, consulte Select a Scoring Method.

Criar uma tarefa de avaliação

Uma tarefa de avaliação combina o modelo a ser avaliado, os dados de avaliação e as dimensões de avaliação para execução. Quando a tarefa é executada, a plataforma envia cada Prompt do conjunto de dados ao modelo a ser avaliado para obter a saída e, em seguida, pontua cada um de acordo com as dimensões de avaliação associadas.

Configurar parâmetros da tarefa de avaliação

  1. Faça login no console do Alibaba Cloud Model Studio e, no painel de navegação à esquerda, escolha Evaluation > Evaluation Task.
  2. Clique em Create Evaluation Task.
  3. Preencha o Task Name (no máximo 50 caracteres; o formato padrão do nome é "Evaluation_CurrentTime").
  4. Em Model to Be Evaluated, selecione um ou mais modelos. Modelos exibidos em cinza na lista suspensa não são suportados atualmente para avaliação e não podem ser selecionados.
  5. Selecione a Data Source: escolha Evaluation Set ou Inference Result Set e associe o conjunto de dados que você criou (consulte Prepare Evaluation Data para detalhes).
  6. Na área Dimension, associe uma ou mais dimensões de avaliação que você criou. Se você desmarcar as dimensões selecionadas, as configurações de associação do leaderboard também serão limpas automaticamente.
  7. Se precisar definir um System Prompt, preencha-o na área correspondente. Clique em OK para enviar a tarefa.
Após o envio de uma tarefa de avaliação, o modelo a ser avaliado não pode ser alterado. Para avaliar outros modelos, crie uma nova tarefa de avaliação.
image

System Prompt vs. Scorer Prompt

Dois tipos de Prompts estão envolvidos em uma tarefa de avaliação, com objetos-alvo diferentes:
  • System Prompt: configurado na tarefa de avaliação e enviado ao modelo a ser avaliado como uma instrução de sistema. É usado para definir a função, o formato de saída ou as restrições de comportamento do modelo a ser avaliado e afeta a saída do modelo.
  • Scorer Prompt: configurado na dimensão de avaliação e enviado ao modelo juiz como base de pontuação. Ele orienta o modelo juiz sobre como pontuar a saída do modelo a ser avaliado e é usado apenas por métodos de pontuação LLM.
Os dois não se afetam mutuamente: o System Prompt controla "o que o modelo a ser avaliado gera", e o Scorer Prompt controla "como o modelo juiz pontua".

Item de Comparação

System Prompt

Scorer Prompt

Local de configuração

Configurado na tarefa de avaliação

Configurado na dimensão de avaliação

Objeto-alvo

Modelo a ser avaliado

Modelo juiz

Finalidade

Definir a função do modelo, formato de saída ou restrições de comportamento

Orientar o modelo juiz sobre como pontuar a saída

Obrigatório

Opcional

Obrigatório para métodos de pontuação LLM

Atribuição de taxa

Contabilizado na taxa de inferência do modelo a ser avaliado

Contabilizado na taxa de pontuação do modelo juiz

Configurações de participação no Leaderboard

Ao criar uma tarefa de avaliação, você pode definir se os resultados da tarefa participarão da classificação do leaderboard. Após a ativação, os resultados da avaliação fluirão automaticamente para o leaderboard quando a tarefa for concluída, e serão comparados e exibidos juntamente com os resultados de avaliação de outros modelos. Ao criar uma tarefa de avaliação a partir da entrada da página Leaderboard, o sistema preenche automaticamente as dimensões de avaliação e o conjunto de dados associados ao leaderboard. Você só precisa selecionar o modelo a ser avaliado para enviar a tarefa.

Visualizar resultados da avaliação

Após o envio de uma tarefa, você pode acompanhar o status da tarefa e visualizar os resultados da avaliação na lista de tarefas de avaliação. Faça login no console do Alibaba Cloud Model Studio e, no painel de navegação à esquerda, escolha Evaluation > Evaluation Task.

Status da tarefa

O status de uma tarefa de avaliação muda da seguinte forma:
  • WAITING: a tarefa foi enviada e está aguardando execução.
  • RUNNING: a tarefa está sendo executada, e a plataforma está chamando o modelo e pontuando.
  • FINISH: a execução da tarefa foi concluída, todos os dados foram pontuados e os resultados podem ser visualizados.
  • FAILED: a execução da tarefa falhou, geralmente causada por uma exceção na invocação do modelo ou um problema de formato de dados.
  • ABORTED: a tarefa foi encerrada manualmente.
Para operações disponíveis em cada status, consulte Manage Evaluation Resources.

Visualizar dados e estatísticas da avaliação

Depois que o status da tarefa mudar para FINISH, clique no nome da tarefa para entrar na página de detalhes do resultado, que contém as duas abas a seguir:
  • Data Details: exibe o Prompt, a saída do modelo e a pontuação de cada dimensão para cada entrada de dados individualmente, ajudando você a localizar o desempenho do modelo em questões específicas.
  • Metric Statistics: exibe a pontuação abrangente e a taxa de aprovação de cada dimensão de avaliação. Dimensões numéricas mostram a pontuação média e a taxa de aprovação; dimensões categóricas mostram o gráfico de distribuição de cada rótulo de categoria.
image

Download e análise de resultados

Apenas tarefas com status FINISH suportam download de resultados. Na página de detalhes da tarefa de avaliação, clique em Download Results para exportar os dados completos da avaliação. Ao analisar os resultados da avaliação, preste atenção aos seguintes aspectos:
  • Compare as diferenças de pontuação de diferentes modelos na mesma dimensão para determinar os pontos fortes de cada modelo.
  • Filtre entradas de dados com baixa pontuação e analise em quais tipos de perguntas o modelo tem desempenho inferior.
  • Concentre-se na métrica de taxa de aprovação: a taxa de aprovação reflete a proporção do modelo atingindo a linha de base naquela dimensão e é uma referência central para a seleção de modelos.
  • Se o mesmo modelo for avaliado várias vezes, compare as mudanças de pontuação ao longo do tempo para acompanhar o efeito do ajuste do modelo.

Usar Leaderboards para comparar modelos

Os leaderboards são usados para comparar o desempenho de vários modelos sob as mesmas dimensões de avaliação e exibir visualmente os pontos fortes e fracos de cada modelo na forma de classificações. Cada leaderboard está vinculado a um conjunto de dimensões de avaliação e agrega os resultados de várias tarefas de avaliação na mesma tabela de classificação, ajudando você a tomar decisões rápidas de seleção de modelos.

Criar um Leaderboard

  1. Faça login no console do Alibaba Cloud Model Studio e, no painel de navegação à esquerda, escolha Evaluation > Leaderboard.
  2. Clique em Create Leaderboard.
  3. Preencha o Leaderboard Name (no máximo 50 caracteres).
  4. Em Dimension, selecione uma ou mais dimensões de avaliação que você criou. As dimensões de avaliação vinculadas a um leaderboard não podem ser modificadas após a criação; escolha com cuidado.
  5. Clique em OK para concluir a criação.
image

Adicionar tarefas de avaliação a um Leaderboard

Após a criação de um leaderboard, você pode adicionar tarefas de avaliação a ele de duas maneiras:
  • Criar uma nova tarefa a partir do leaderboard: na página de detalhes do leaderboard, clique em Create Evaluation Task. O sistema bloqueia automaticamente as dimensões de avaliação vinculadas ao leaderboard e associa o leaderboard. Você só precisa selecionar o modelo a ser avaliado e o conjunto de dados.
  • Selecionar a partir de tarefas concluídas: na página de detalhes do leaderboard, clique em Add Evaluation Task e, na lista pop-up, marque as tarefas históricas cujo status seja FINISH e que contenham as dimensões de avaliação do leaderboard. Tarefas já vinculadas ao leaderboard atual têm suas caixas de seleção acinzentadas e não podem ser desmarcadas.
Até 50 tarefas de avaliação podem ser adicionadas a cada leaderboard.

Descrição dos resultados do Leaderboard

O leaderboard exibe os resultados de classificação de todas as tarefas adicionadas em uma tabela, contendo as seguintes colunas:
  • Ranking: organizado do maior para o menor pela pontuação do leaderboard, os três primeiros são marcados em ouro, prata e bronze.
  • Task Name: o nome da tarefa de avaliação. Clique para ir aos detalhes da tarefa.
  • to compare: o nome do modelo a ser avaliado usado pela tarefa.
  • Leaderboard Score: o intervalo de valores é 0-100, derivado da normalização das pontuações da tarefa nas dimensões vinculadas ao leaderboard. A pontuação de uma tarefa em avaliação é exibida como um traço (-) e será atualizada automaticamente após a conclusão da avaliação.
  • [Evaluation Dimension Name]: exibe a pontuação original da tarefa nas dimensões vinculadas ao leaderboard.
  • Actions: suporta a visualização de detalhes da tarefa ou a remoção da tarefa do leaderboard.
As pontuações do leaderboard são atualizadas em tempo real conforme o progresso da tarefa de avaliação. Quando o status da tarefa mudar para FINISH, a classificação será atualizada automaticamente.

Avaliação por anotação manual

A avaliação por anotação manual é adequada para cenários que exigem julgamento subjetivo, como avaliação de criatividade e revisão de qualidade profissional. Quando os métodos de pontuação automática não conseguem medir com precisão a qualidade da saída do modelo, você pode criar uma tarefa de avaliação que contenha uma dimensão de pontuação por classificação manual, e os anotadores julgarão manualmente a saída do modelo uma a uma. Faça login no console do Alibaba Cloud Model Studio e, no painel de navegação à esquerda, escolha Evaluation > Evaluation Task.

Modos de anotação

A anotação manual suporta 3 modos, aplicáveis a diferentes objetivos de avaliação:
  • Single Annotation
  • Comparative Annotation
  • Application Annotation
O modo Single Annotation (base) pontua a saída do modelo de cada entrada de dados individualmente, e o anotador seleciona um rótulo de categoria para cada saída. É adequado para cenários que exigem pontuação independente de cada saída, como verificar a precisão ou segurança das respostas do modelo uma a uma.
Veja a seguir uma comparação dos 3 modos de anotação:

Modo de Anotação

Descrição

Cenários Aplicáveis

Single Annotation (base)

Pontuar cada saída do modelo individualmente

Necessita pontuar independentemente cada saída

Comparative Annotation (PK)

Comparar e classificar duas saídas de modelo lado a lado

Comparação direta e seleção entre modelos

Application Annotation (app)

Avaliar a saída do modelo em cenários de aplicação

Avaliação de eficácia ponta a ponta

Etapas de anotação

  1. Siga o fluxo de trabalho Create an Evaluation Task para criar uma nova tarefa e associar uma dimensão de avaliação cujo método de pontuação seja Manual Classification Scoring (consulte Create an Evaluation Dimension para detalhes).
  2. Após a criação da tarefa, acesse a página de detalhes da tarefa e selecione a aba Evaluation Data.
  3. Na coluna Actions da lista de dados, clique no botão Annotate para entrar na página de anotação.
  4. Revise o conteúdo de saída do modelo, selecione um rótulo de categoria para esta entrada de dados de acordo com os critérios de julgamento e clique em Submit para concluir a anotação da entrada atual.
  5. Conclua a anotação de todas as entradas de dados uma a uma. Quando todos os dados forem anotados, o status da tarefa mudará automaticamente para FINISH.
image

Recomendações de design de rótulos

A qualidade do design dos rótulos afeta diretamente a confiabilidade dos resultados da anotação. Recomendam-se os seguintes princípios:
  • Os rótulos devem cobrir todas as situações possíveis de saída do modelo para evitar que os anotadores encontrem saídas que não possam ser categorizadas.
  • Use palavras de categoria concisas e claras como nomes de rótulos para reduzir o custo de compreensão do anotador.
  • Organize vários anotadores para anotar cruzadamente o mesmo lote de dados a fim de verificar a consistência da anotação. Se a consistência for baixa, verifique se as definições dos rótulos são ambíguas e otimize os critérios de julgamento.

Gerenciar recursos de avaliação

Após a criação de tarefas de avaliação, dimensões de avaliação e leaderboards, você pode gerenciar esses recursos no console. Algumas operações são irreversíveis; proceda com cautela. Faça login no console do Alibaba Cloud Model Studio e, no painel de navegação à esquerda, escolha Evaluation.

Gerenciamento de tarefas de avaliação

Na página de lista Evaluation > Evaluation Task, você pode realizar as seguintes operações em tarefas de avaliação:
  • Pesquisar, filtrar e ordenar: pesquise por nome da tarefa, filtre por status e ordene por hora de criação para localizar rapidamente a tarefa alvo. Essas operações afetam apenas a exibição da lista e não alteram os dados da tarefa.
  • Encerrar tarefa: apenas tarefas com status RUNNING suportam encerramento. Após clicar em Terminate, o status da tarefa muda para ABORTED. Esta operação é irreversível.
  • Excluir tarefa: tarefas com status FINISH, FAILED ou ABORTED podem ser excluídas. Após a exclusão, os dados da tarefa e os resultados da avaliação serão limpos permanentemente. Esta operação é irreversível.
  • Baixar resultados: apenas tarefas com status FINISH suportam o download de resultados de avaliação (consulte View Evaluation Results para detalhes).
As operações disponíveis em cada status de tarefa estão resumidas a seguir:

Status da Tarefa

Operações Disponíveis

Lembrete de Irreversibilidade

WAITING

Nenhuma (tarefa em fila)

-

RUNNING

Terminate

Após o encerramento, o status muda para ABORTED e não pode ser restaurado

FINISH

Visualizar resultados, Baixar resultados, Excluir

Os dados são limpos permanentemente após a exclusão

FAILED

Excluir

Os dados são limpos permanentemente após a exclusão

ABORTED

Excluir

Os dados são limpos permanentemente após a exclusão

Gerenciamento de dimensões de avaliação

Na página de lista Evaluation > Dimension, você pode editar a descrição da dimensão ou excluir uma dimensão. Ao excluir uma dimensão de avaliação, se a dimensão estiver vinculada a um leaderboard, os dados de pontuação baseados nessa dimensão no leaderboard serão limpos. Confirme se algum leaderboard está usando a dimensão antes de excluí-la.

Gerenciamento de Leaderboards

Na página de lista Evaluation > Leaderboard, você pode realizar as seguintes operações:
  • Excluir leaderboard: após a exclusão de um leaderboard, os dados do leaderboard serão limpos permanentemente, mas as tarefas de avaliação já adicionadas ao leaderboard não serão afetadas.
  • Remover tarefa: na página de detalhes do leaderboard, você pode remover uma tarefa de avaliação do leaderboard. A remoção afeta apenas a exibição do leaderboard; a tarefa de avaliação em si e seus resultados não serão excluídos.
As seguintes operações são irreversíveis; confirme antes de executar: excluir uma tarefa de avaliação limpará permanentemente os dados da tarefa e os resultados da avaliação; uma tarefa encerrada não pode ser retomada; excluir uma dimensão de avaliação também limpará os dados de pontuação baseados nessa dimensão no leaderboard.

Faturamento

As taxas geradas pelo Model Evaluation consistem em duas partes: a taxa de inferência do modelo a ser avaliado e a taxa de pontuação do modelo juiz. Compreender as regras de faturamento ajuda você a planejar a escala de avaliação e controlar os custos adequadamente.

Composição das taxas

Taxa de inferência do modelo a ser avaliado: faturada por token. A fórmula é cost = input_tokens x input_price + output_tokens x output_price. Aqui, input_tokens inclui o System Prompt e o Prompt de cada entrada de dados, e output_tokens é a resposta gerada pelo modelo. O preço unitário específico de cada modelo está sujeito ao console do Model Studio. Taxa de pontuação do modelo juiz: incorrida apenas ao usar o método de pontuação LLM Numerical Scoring ou LLM Classification Scoring. Os tokens consumidos pelo modelo juiz para pontuar cada entrada de dados são faturados de acordo com o preço desse modelo juiz. Para preços específicos, consulte o console do Model Studio. Ao usar o método de pontuação String Matching ou Text Similarity, o processo de pontuação não envolve uma chamada de modelo juiz, portanto, nenhuma taxa de pontuação é incorrida.
Os métodos de pontuação Correspondência de Strings e Similaridade de Texto não chamam um modelo juiz e não incorrem em taxas de pontuação; apenas a taxa de inferência do modelo a ser avaliado é cobrada. Para cenários de avaliação com uma resposta padrão clara, priorizar esses dois métodos pode reduzir significativamente o custo de avaliação.
Para modelos implantados independentemente (ajustados e implantados online), nenhuma taxa adicional de inferência é cobrada durante a avaliação; aplica-se apenas a taxa de implantação existente. A composição de taxas de cada método de pontuação está resumida na tabela a seguir:

Método de Pontuação

Taxa de Inferência do Modelo a Ser Avaliado

Taxa de Pontuação do Modelo Juiz

Composição da Taxa

Pontuação Numérica LLM

Faturado por token

Faturado por token

Inferência + Pontuação

Pontuação por Classificação LLM

Faturado por token

Faturado por token

Inferência + Pontuação

Correspondência de Strings

Faturado por token

Nenhuma

Apenas inferência

Similaridade de Texto

Faturado por token

Nenhuma

Apenas inferência

Pontuação por Classificação Manual

Faturado por token

Nenhuma (custo manual calculado separadamente)

Inferência + Manual

Exemplo de estimativa de taxa

O exemplo a seguir mostra o processo de estimativa de taxa para usar o modelo qwen-plus para realizar uma avaliação de Pontuação Numérica LLM em 100 entradas de dados (o preço unitário é apenas para ilustração; consulte a exibição real no console):
  • Suponha que cada entrada de dados tenha em média input_tokens = 500 e output_tokens = 200.
  • Taxa de inferência do modelo a ser avaliado = 100 x (500 x input_price + 200 x output_price).
  • Taxa de pontuação do modelo juiz = 100 x (tokens consumidos por pontuação x preço unitário do modelo juiz).
  • Taxa total = Taxa de inferência do modelo a ser avaliado + Taxa de pontuação do modelo juiz.

Estratégias de otimização de custos

  • Avaliação faseada: primeiro use 50-100 entradas de dados para validação em pequena escala. Após confirmar que as dimensões de avaliação e a qualidade dos dados atendem às expectativas, escale para o conjunto de dados completo para avaliação formal.
  • Priorize avaliação baseada em regras: Correspondência de Strings e Similaridade de Texto não incorrem em taxas de modelo juiz e têm o menor custo. Para cenários com uma resposta padrão clara, priorize métodos de avaliação baseados em regras.
  • Salve conjuntos de resultados de inferência para reutilização: salve os resultados de inferência do modelo como um conjunto de resultados de inferência. Avaliações subsequentes podem usar diretamente os resultados existentes, evitando o custo de chamar repetidamente o modelo para inferência.

Perguntas frequentes

E se os resultados da avaliação não atenderem às expectativas?

Problema: após a conclusão da tarefa de avaliação, a pontuação do modelo mostra um desvio significativo da experiência real, ou o resultado da pontuação é irracional. Verifique os seguintes aspectos em ordem:
  • Verifique a representatividade dos dados de teste: confirme se o conjunto de dados de avaliação cobre os cenários típicos e casos extremos do negócio. Poucos dados ou uma distribuição enviesada tornarão as pontuações não representativas.
  • Revise a clareza do Scorer Prompt: confirme se o Scorer Prompt descreve claramente os critérios de pontuação e a base de julgamento. Um Prompt ambíguo fará com que o modelo juiz pontue de forma instável.
  • Ajuste o intervalo de pontuação e o limiar: um intervalo de pontuação muito estreito (como 0-2) pode resultar em discriminação insuficiente de pontuação. Ampliar adequadamente o intervalo (como 0-10) pode melhorar a precisão da pontuação.
  • Altere o modelo juiz: diferentes modelos juízes têm capacidades de pontuação diferentes. Recomenda-se o Qwen-Max (qwen-max) para resultados de pontuação mais estáveis.

E se as pontuações estiverem muito concentradas?

Problema: as pontuações de várias entradas de dados estão concentradas na mesma pontuação ou rótulo de categoria, sem discriminação. Pontuações excessivamente concentradas geralmente são causadas pelos seguintes motivos. Investigue-os um a um:
  • Refine os critérios de julgamento: adicione condições claras de julgamento e exemplos para cada nível de pontuação no Scorer Prompt para que o modelo juiz possa distinguir saídas de diferentes níveis de qualidade.
  • Aumente a diversidade de dados: adicione amostras de limite e amostras anormais ao conjunto de dados de avaliação para evitar que todos os Prompts tenham dificuldade muito uniforme.
  • Altere o modelo juiz: um modelo juiz com capacidade de raciocínio mais forte (como Qwen-Max) pode seguir melhor os critérios de julgamento granulares no Scorer Prompt.

Como interpretar resultados contraditórios entre diferentes dimensões de avaliação?

Problema: o mesmo modelo tem grandes diferenças de pontuação em diferentes dimensões de avaliação, podendo até ter excelente desempenho em uma dimensão e mau desempenho em outra. Isso é normal. Diferentes dimensões de avaliação avaliam diferentes aspectos das capacidades do modelo (como precisão, fluência e lógica). O desempenho do modelo em diferentes capacidades varia inerentemente. Recomenda-se tomar decisões ponderadas sobre as pontuações das dimensões com base nas prioridades do negócio, em vez de exigir que o modelo tenha desempenho ótimo em todas as dimensões.

E se o modelo frequentemente gerar conteúdo desatualizado ou irrelevante?

Problema: a saída do modelo é irrelevante para a resposta de referência ou contém informações desatualizadas, resultando em uma baixa pontuação de avaliação. Isso geralmente indica que a cobertura de conhecimento do modelo é insuficiente ou que os dados de treinamento estão defasados. Recomenda-se considerar a introdução de uma base de conhecimento para complementar o modelo com conhecimento de domínio e melhorar a qualidade da saída do modelo em domínios específicos por meio de Geração Aumentada por Recuperação (RAG).

Quais são as armadilhas comuns ao usar a avaliação?

Problema: ao usar o Model Evaluation pela primeira vez, é fácil confundir conceitos ou operar incorretamente, resultando em resultados de avaliação anormais. A seguir estão as armadilhas comuns e as práticas corretas:
  • System Prompt não é o mesmo que Scorer Prompt: o System Prompt é configurado na tarefa de avaliação e enviado ao modelo a ser avaliado; o Scorer Prompt é configurado na dimensão de avaliação e enviado ao modelo juiz (consulte Create an Evaluation Task para detalhes). Os dois têm alvos diferentes; não os confunda.
  • Rótulos de categoria como Pass/Fail não devem se sobrepor: em dimensões que usam Pontuação por Classificação LLM ou Pontuação por Classificação Manual, rótulos de aprovação e de reprovação devem ser mutuamente exclusivos. O mesmo rótulo não pode pertencer a ambos os grupos ao mesmo tempo.
  • Sem taxa adicional para modelos implantados independentemente: modelos que foram ajustados e implantados online não são cobrados com uma taxa adicional de inferência durante a avaliação (consulte Billing para detalhes).
  • Restrição de tipo de conjunto de dados: tarefas de avaliação suportam apenas conjuntos de dados do tipo Evaluation Set. Se um conjunto de dados do tipo training set for selecionado, o sistema recusará a criação da tarefa de avaliação.
Plano de Tokens
Playground de Modelos
  • Music generation
Inferência do Modelo
Avaliação
Compressão de Modelos
Estatísticas e Monitoramento
Suporte