O Model Evaluation é uma ferramenta de avaliação da qualidade de modelos fornecida pela plataforma Alibaba Cloud Model Studio. Ela permite avaliar quantitativamente o desempenho de grandes modelos de linguagem por meio de dimensões de avaliação personalizadas, ajudando você a concluir a seleção de modelos, a verificação de ajustes e a comparação de capacidades.
O que é o Model Evaluation
O Model Evaluation é uma ferramenta de verificação da qualidade de modelos disponibilizada pela plataforma Alibaba Cloud Model Studio. Por meio de dimensões de avaliação e métodos de pontuação personalizados, você pode avaliar quantitativamente o desempenho de grandes modelos de linguagem em cenários de negócios específicos e obter resultados de avaliação comparáveis.

Casos de uso
O Model Evaluation aplica-se aos seguintes cenários:
- Seleção de modelos: compare as pontuações entre vários modelos candidatos para escolher aquele que melhor atende às suas necessidades de negócios.
- Verificação de ajuste: após Prompt tuning or fine-tuning um modelo, utilize a avaliação para verificar se o desempenho melhorou.
- Avaliação quantitativa: converta a qualidade da saída do modelo em métricas de pontuação mensuráveis para substituir o julgamento subjetivo.
- Monitoramento contínuo: execute tarefas de avaliação periodicamente para acompanhar a tendência das capacidades do modelo ao longo das iterações de versão.
Métodos de pontuação
O Model Evaluation oferece suporte a 5 métodos de pontuação, abrangendo tanto a pontuação automática quanto a manual:
- Pontuação Numérica LLM: o modelo juiz atribui uma pontuação numérica (como 0-5 pontos) de acordo com o Scorer Prompt, adequado para cenários que exigem quantificação granular.
- Pontuação por Classificação LLM: o modelo juiz classifica a saída em categorias predefinidas (como Aprovado/Reprovado) conforme o Scorer Prompt, ideal para julgamentos binários ou de múltiplos rótulos.
- Correspondência de Strings: realiza uma comparação exata (igual, contém, começa com, termina com, etc.) entre a saída do modelo e a resposta de referência, indicado para cenários com uma única resposta padrão.
- Similaridade de Texto: utiliza algoritmos (ROUGE-L, BLEU, Cosseno, Fuzzy, Precisão) para calcular a similaridade entre a saída do modelo e a resposta de referência, apropriado para avaliação da qualidade de geração de texto.
- Pontuação por Classificação Manual: anotadores humanos classificam e julgam a saída do modelo, recomendado para cenários de avaliação subjetiva que a pontuação automática não consegue cobrir.
Método de Pontuação | Origem da Pontuação | Cenários Aplicáveis | Custo |
|---|---|---|---|
Pontuação Numérica LLM | Modelo juiz | Compreensão semântica, avaliação aberta | Médio |
Pontuação por Classificação LLM | Modelo juiz | Julgamento binário (segurança/correção) | Médio |
Correspondência de Strings | Regra | Cenários com resposta padrão única | Muito baixo |
Similaridade de Texto | Algoritmo | Avaliação de qualidade de tradução e resumo | Baixo |
Pontuação por Classificação Manual | Anotador humano | Avaliação de criatividade, julgamento subjetivo | Alto |
Pré-requisitos e limites
O fluxo completo de avaliação é: Create an Evaluation Dimension → Prepare Evaluation Data → Create an Evaluation Task → View Evaluation Results.
Antes de usar o Model Evaluation, confirme as seguintes condições:
- Você registrou uma conta Alibaba Cloud e concluiu a verificação de nome real.
- Você ativou o service Alibaba Cloud Model Studio. URL de ativação: https://modelstudio.console.alibabacloud.com.
- Se você operar como usuário RAM, a conta principal deve conceder as permissões correspondentes.
Preparar dados de avaliação
Os dados de avaliação são a entrada de uma tarefa de avaliação e determinam sobre quais questões o modelo será avaliado. O Alibaba Cloud Model Studio oferece suporte a duas fontes de dados: conjuntos de dados de avaliação (perguntas de teste preparadas antecipadamente) e conjuntos de resultados de inferência (resultados de inferência já gerados pelo modelo).
Descrição do formato de dados
Um conjunto de dados de avaliação contém os seguintes campos:
- Prompt (obrigatório): a pergunta de entrada enviada ao modelo a ser avaliado. Cada entrada deve incluir este campo.
- Completion (opcional): a resposta de referência, usada por métodos de pontuação (como Correspondência de Strings e Similaridade de Texto) para comparação com a saída do modelo.
- Output (apenas conjunto de resultados de inferência): o conteúdo de saída já gerado pelo modelo. Ao usar um conjunto de resultados de inferência, a tarefa de avaliação pontua o Output diretamente e não chama o modelo a ser avaliado novamente.
Campo | Obrigatório | Descrição | Cenários Aplicáveis |
|---|---|---|---|
Prompt | Obrigatório | Pergunta de entrada enviada ao modelo a ser avaliado | Todos os métodos de avaliação |
Completion | Opcional | Resposta de referência, usada para comparação com a saída do modelo | Correspondência de Strings, Similaridade de Texto |
Output | Apenas conjunto de resultados de inferência | Conteúdo de saída já gerado pelo modelo | Ao reutilizar resultados de inferência existentes |
Recomendações de volume de dados
O volume de dados afeta diretamente a confiabilidade dos resultados da avaliação. Escolha uma escala de dados adequada com base no seu objetivo de avaliação:
- Validação rápida (50-100 entradas): indicada para confirmação rápida de resultados após o ajuste de Prompt, permitindo concluir a avaliação em pouco tempo.
- Avaliação padrão (200-500 entradas): recomendada para seleção de modelos e avaliação formal, cobre mais cenários e gera resultados mais representativos.
- Avaliação aprofundada (500 entradas ou mais): projetada para cenários que exigem alta precisão na avaliação, capaz de cobrir totalmente a distribuição de perguntas de negócios.
Criar um conjunto de dados
Siga estas etapas para criar um conjunto de dados de avaliação no console:
- Faça login no console do Alibaba Cloud Model Studio.
- No painel de navegação à esquerda, escolha Data Management > Dataset Management.
- Clique em Create Dataset.
- Preencha o Dataset Name e, em Dataset Type, selecione Evaluation Set.
- Carregue um arquivo de dados ou adicione entradas de dados manualmente, garantindo que cada entrada contenha pelo menos o campo Prompt.
- Clique em OK para concluir a criação.

Criar uma dimensão de avaliação
Uma dimensão de avaliação define os critérios de pontuação para a saída do modelo. Cada dimensão está vinculada a um método de pontuação. Quando uma tarefa de avaliação é executada, cada entrada é pontuada individualmente de acordo com a configuração da dimensão.
Selecionar um método de pontuação
O Alibaba Cloud Model Studio oferece suporte aos seguintes 5 modos de pontuação (consulte What is Model Evaluation para detalhes). Os principais parâmetros de cada método são:
LLM Numerical Scoring: o modelo juiz gera uma pontuação numérica de acordo com o Scorer Prompt. O intervalo de pontuação padrão é 0-5 (mínimo 0, máximo personalizável). O limiar de aprovação padrão é 3,0 (uma pontuação ≥ ao limiar é considerada aprovada). Recomenda-se o Qwen-Max (qwen-max) como modelo juiz; sua estabilidade de pontuação e poder discriminativo são superiores.
LLM Classification Scoring: o modelo juiz atribui a saída a rótulos de categoria predefinidos conforme o Scorer Prompt. Você precisa configurar pelo menos dois rótulos de categoria (como Pass e Fail) e especificar quais rótulos são considerados "aprovados". Rótulos de aprovação e de reprovação não devem se sobrepor.
Parâmetro | Descrição | Obrigatório | Descrição do Valor |
|---|---|---|---|
Nome da dimensão | Nome identificador da dimensão de avaliação | Sim | No máximo 20 caracteres |
Descrição da dimensão | Descrição textual da dimensão | Sim | No máximo 100 caracteres |
Método de pontuação | Determina como a saída do modelo é avaliada | Sim | Um dos 5 métodos de pontuação; não pode ser alterado após a criação |
Modelo juiz | O LLM que pontua a saída do modelo | Obrigatório para pontuação LLM | Qwen-Max (qwen-max) recomendado |
Scorer Prompt | Instrução que orienta o modelo juiz na pontuação | Obrigatório para pontuação LLM | Suporta variáveis ${prompt}/${output}/${completion} |
Intervalo de pontuação | Intervalo de pontuação para pontuação numérica | Obrigatório para Pontuação Numérica LLM | Padrão 0-5; valor máximo personalizável |
Limiar de aprovação | Uma pontuação maior ou igual ao limiar é considerada aprovada | Obrigatório para Pontuação Numérica LLM | Padrão 3,0, suporta incremento de 0,1 |
Rótulo de categoria | Rótulos de categoria predefinidos | Obrigatório para pontuação por classificação | Pelo menos dois rótulos; aprovação e reprovação não devem se sobrepor |
Algoritmo de similaridade | Algoritmo para calcular similaridade de texto | Obrigatório para Similaridade de Texto | ROUGE-L / BLEU / Cosine / Fuzzy / Accuracy |
Limiar de similaridade | Nota de corte para a pontuação de similaridade | Obrigatório para Similaridade de Texto | ROUGE-L recomendado 0,4-0,6, BLEU recomendado 0,3-0,5 |
Diretriz de anotação | Instruções que orientam os anotadores no julgamento | Opcional para Pontuação por Classificação Manual | Descrição de texto personalizada |
Configurar um Scorer Prompt
A Pontuação Numérica LLM e a Pontuação por Classificação LLM exigem um Scorer Prompt para orientar o modelo juiz sobre como pontuar. Você pode escolher um modelo de Prompt predefinido pela plataforma ou escrever um Prompt personalizado.
O Scorer Prompt suporta as três variáveis a seguir, que são substituídas automaticamente pelos dados reais durante a avaliação:
${prompt}: o conteúdo de entrada Prompt da entrada de dados atual.${output}: o conteúdo de saída gerado pelo modelo a ser avaliado para este Prompt.${completion}: a resposta de referência Completion para esta entrada de dados (se houver).
Etapas para criar uma dimensão
- Faça login no console do Alibaba Cloud Model Studio e, no painel de navegação à esquerda, escolha Evaluation > Dimension.
- Clique em Create Evaluation Dimension.
- Preencha o Dimension Name (no máximo 20 caracteres) e a Dimension Description (no máximo 100 caracteres).
- Em Scoring Method, selecione um método de pontuação e configure os parâmetros correspondentes.
- Se você selecionar um método de pontuação LLM, escolha um modelo em Judge Model (Qwen-Max recomendado) e configure o Scorer Prompt.
- Clique em OK para concluir a criação. O método de pontuação não pode ser alterado após a criação; para usar um método diferente, crie uma nova dimensão.

Criar uma tarefa de avaliação
Uma tarefa de avaliação combina o modelo a ser avaliado, os dados de avaliação e as dimensões de avaliação para execução. Quando a tarefa é executada, a plataforma envia cada Prompt do conjunto de dados ao modelo a ser avaliado para obter a saída e, em seguida, pontua cada um de acordo com as dimensões de avaliação associadas.
Configurar parâmetros da tarefa de avaliação
- Faça login no console do Alibaba Cloud Model Studio e, no painel de navegação à esquerda, escolha Evaluation > Evaluation Task.
- Clique em Create Evaluation Task.
- Preencha o Task Name (no máximo 50 caracteres; o formato padrão do nome é "Evaluation_CurrentTime").
- Em Model to Be Evaluated, selecione um ou mais modelos. Modelos exibidos em cinza na lista suspensa não são suportados atualmente para avaliação e não podem ser selecionados.
- Selecione a Data Source: escolha Evaluation Set ou Inference Result Set e associe o conjunto de dados que você criou (consulte Prepare Evaluation Data para detalhes).
- Na área Dimension, associe uma ou mais dimensões de avaliação que você criou. Se você desmarcar as dimensões selecionadas, as configurações de associação do leaderboard também serão limpas automaticamente.
- Se precisar definir um System Prompt, preencha-o na área correspondente. Clique em OK para enviar a tarefa.

System Prompt vs. Scorer Prompt
Dois tipos de Prompts estão envolvidos em uma tarefa de avaliação, com objetos-alvo diferentes:
- System Prompt: configurado na tarefa de avaliação e enviado ao modelo a ser avaliado como uma instrução de sistema. É usado para definir a função, o formato de saída ou as restrições de comportamento do modelo a ser avaliado e afeta a saída do modelo.
- Scorer Prompt: configurado na dimensão de avaliação e enviado ao modelo juiz como base de pontuação. Ele orienta o modelo juiz sobre como pontuar a saída do modelo a ser avaliado e é usado apenas por métodos de pontuação LLM.
Item de Comparação | System Prompt | Scorer Prompt |
|---|---|---|
Local de configuração | Configurado na tarefa de avaliação | Configurado na dimensão de avaliação |
Objeto-alvo | Modelo a ser avaliado | Modelo juiz |
Finalidade | Definir a função do modelo, formato de saída ou restrições de comportamento | Orientar o modelo juiz sobre como pontuar a saída |
Obrigatório | Opcional | Obrigatório para métodos de pontuação LLM |
Atribuição de taxa | Contabilizado na taxa de inferência do modelo a ser avaliado | Contabilizado na taxa de pontuação do modelo juiz |
Configurações de participação no Leaderboard
Ao criar uma tarefa de avaliação, você pode definir se os resultados da tarefa participarão da classificação do leaderboard. Após a ativação, os resultados da avaliação fluirão automaticamente para o leaderboard quando a tarefa for concluída, e serão comparados e exibidos juntamente com os resultados de avaliação de outros modelos.
Ao criar uma tarefa de avaliação a partir da entrada da página Leaderboard, o sistema preenche automaticamente as dimensões de avaliação e o conjunto de dados associados ao leaderboard. Você só precisa selecionar o modelo a ser avaliado para enviar a tarefa.
Visualizar resultados da avaliação
Após o envio de uma tarefa, você pode acompanhar o status da tarefa e visualizar os resultados da avaliação na lista de tarefas de avaliação.
Faça login no console do Alibaba Cloud Model Studio e, no painel de navegação à esquerda, escolha Evaluation > Evaluation Task.
Status da tarefa
O status de uma tarefa de avaliação muda da seguinte forma:
- WAITING: a tarefa foi enviada e está aguardando execução.
- RUNNING: a tarefa está sendo executada, e a plataforma está chamando o modelo e pontuando.
- FINISH: a execução da tarefa foi concluída, todos os dados foram pontuados e os resultados podem ser visualizados.
- FAILED: a execução da tarefa falhou, geralmente causada por uma exceção na invocação do modelo ou um problema de formato de dados.
- ABORTED: a tarefa foi encerrada manualmente.
Visualizar dados e estatísticas da avaliação
Depois que o status da tarefa mudar para FINISH, clique no nome da tarefa para entrar na página de detalhes do resultado, que contém as duas abas a seguir:
- Data Details: exibe o Prompt, a saída do modelo e a pontuação de cada dimensão para cada entrada de dados individualmente, ajudando você a localizar o desempenho do modelo em questões específicas.
- Metric Statistics: exibe a pontuação abrangente e a taxa de aprovação de cada dimensão de avaliação. Dimensões numéricas mostram a pontuação média e a taxa de aprovação; dimensões categóricas mostram o gráfico de distribuição de cada rótulo de categoria.

Download e análise de resultados
Apenas tarefas com status FINISH suportam download de resultados. Na página de detalhes da tarefa de avaliação, clique em Download Results para exportar os dados completos da avaliação.
Ao analisar os resultados da avaliação, preste atenção aos seguintes aspectos:
- Compare as diferenças de pontuação de diferentes modelos na mesma dimensão para determinar os pontos fortes de cada modelo.
- Filtre entradas de dados com baixa pontuação e analise em quais tipos de perguntas o modelo tem desempenho inferior.
- Concentre-se na métrica de taxa de aprovação: a taxa de aprovação reflete a proporção do modelo atingindo a linha de base naquela dimensão e é uma referência central para a seleção de modelos.
- Se o mesmo modelo for avaliado várias vezes, compare as mudanças de pontuação ao longo do tempo para acompanhar o efeito do ajuste do modelo.
Usar Leaderboards para comparar modelos
Os leaderboards são usados para comparar o desempenho de vários modelos sob as mesmas dimensões de avaliação e exibir visualmente os pontos fortes e fracos de cada modelo na forma de classificações. Cada leaderboard está vinculado a um conjunto de dimensões de avaliação e agrega os resultados de várias tarefas de avaliação na mesma tabela de classificação, ajudando você a tomar decisões rápidas de seleção de modelos.
Criar um Leaderboard
- Faça login no console do Alibaba Cloud Model Studio e, no painel de navegação à esquerda, escolha Evaluation > Leaderboard.
- Clique em Create Leaderboard.
- Preencha o Leaderboard Name (no máximo 50 caracteres).
- Em Dimension, selecione uma ou mais dimensões de avaliação que você criou. As dimensões de avaliação vinculadas a um leaderboard não podem ser modificadas após a criação; escolha com cuidado.
- Clique em OK para concluir a criação.

Adicionar tarefas de avaliação a um Leaderboard
Após a criação de um leaderboard, você pode adicionar tarefas de avaliação a ele de duas maneiras:
- Criar uma nova tarefa a partir do leaderboard: na página de detalhes do leaderboard, clique em Create Evaluation Task. O sistema bloqueia automaticamente as dimensões de avaliação vinculadas ao leaderboard e associa o leaderboard. Você só precisa selecionar o modelo a ser avaliado e o conjunto de dados.
- Selecionar a partir de tarefas concluídas: na página de detalhes do leaderboard, clique em Add Evaluation Task e, na lista pop-up, marque as tarefas históricas cujo status seja FINISH e que contenham as dimensões de avaliação do leaderboard. Tarefas já vinculadas ao leaderboard atual têm suas caixas de seleção acinzentadas e não podem ser desmarcadas.
Descrição dos resultados do Leaderboard
O leaderboard exibe os resultados de classificação de todas as tarefas adicionadas em uma tabela, contendo as seguintes colunas:
- Ranking: organizado do maior para o menor pela pontuação do leaderboard, os três primeiros são marcados em ouro, prata e bronze.
- Task Name: o nome da tarefa de avaliação. Clique para ir aos detalhes da tarefa.
- to compare: o nome do modelo a ser avaliado usado pela tarefa.
- Leaderboard Score: o intervalo de valores é 0-100, derivado da normalização das pontuações da tarefa nas dimensões vinculadas ao leaderboard. A pontuação de uma tarefa em avaliação é exibida como um traço (-) e será atualizada automaticamente após a conclusão da avaliação.
- [Evaluation Dimension Name]: exibe a pontuação original da tarefa nas dimensões vinculadas ao leaderboard.
- Actions: suporta a visualização de detalhes da tarefa ou a remoção da tarefa do leaderboard.
Avaliação por anotação manual
A avaliação por anotação manual é adequada para cenários que exigem julgamento subjetivo, como avaliação de criatividade e revisão de qualidade profissional. Quando os métodos de pontuação automática não conseguem medir com precisão a qualidade da saída do modelo, você pode criar uma tarefa de avaliação que contenha uma dimensão de pontuação por classificação manual, e os anotadores julgarão manualmente a saída do modelo uma a uma.
Faça login no console do Alibaba Cloud Model Studio e, no painel de navegação à esquerda, escolha Evaluation > Evaluation Task.
Modos de anotação
A anotação manual suporta 3 modos, aplicáveis a diferentes objetivos de avaliação:
- Single Annotation
- Comparative Annotation
- Application Annotation
Modo de Anotação | Descrição | Cenários Aplicáveis |
|---|---|---|
Single Annotation (base) | Pontuar cada saída do modelo individualmente | Necessita pontuar independentemente cada saída |
Comparative Annotation (PK) | Comparar e classificar duas saídas de modelo lado a lado | Comparação direta e seleção entre modelos |
Application Annotation (app) | Avaliar a saída do modelo em cenários de aplicação | Avaliação de eficácia ponta a ponta |
Etapas de anotação
- Siga o fluxo de trabalho Create an Evaluation Task para criar uma nova tarefa e associar uma dimensão de avaliação cujo método de pontuação seja Manual Classification Scoring (consulte Create an Evaluation Dimension para detalhes).
- Após a criação da tarefa, acesse a página de detalhes da tarefa e selecione a aba Evaluation Data.
- Na coluna Actions da lista de dados, clique no botão Annotate para entrar na página de anotação.
- Revise o conteúdo de saída do modelo, selecione um rótulo de categoria para esta entrada de dados de acordo com os critérios de julgamento e clique em Submit para concluir a anotação da entrada atual.
- Conclua a anotação de todas as entradas de dados uma a uma. Quando todos os dados forem anotados, o status da tarefa mudará automaticamente para FINISH.

Recomendações de design de rótulos
A qualidade do design dos rótulos afeta diretamente a confiabilidade dos resultados da anotação. Recomendam-se os seguintes princípios:
- Os rótulos devem cobrir todas as situações possíveis de saída do modelo para evitar que os anotadores encontrem saídas que não possam ser categorizadas.
- Use palavras de categoria concisas e claras como nomes de rótulos para reduzir o custo de compreensão do anotador.
- Organize vários anotadores para anotar cruzadamente o mesmo lote de dados a fim de verificar a consistência da anotação. Se a consistência for baixa, verifique se as definições dos rótulos são ambíguas e otimize os critérios de julgamento.
Gerenciar recursos de avaliação
Após a criação de tarefas de avaliação, dimensões de avaliação e leaderboards, você pode gerenciar esses recursos no console. Algumas operações são irreversíveis; proceda com cautela.
Faça login no console do Alibaba Cloud Model Studio e, no painel de navegação à esquerda, escolha Evaluation.
Gerenciamento de tarefas de avaliação
Na página de lista Evaluation > Evaluation Task, você pode realizar as seguintes operações em tarefas de avaliação:
- Pesquisar, filtrar e ordenar: pesquise por nome da tarefa, filtre por status e ordene por hora de criação para localizar rapidamente a tarefa alvo. Essas operações afetam apenas a exibição da lista e não alteram os dados da tarefa.
- Encerrar tarefa: apenas tarefas com status RUNNING suportam encerramento. Após clicar em Terminate, o status da tarefa muda para ABORTED. Esta operação é irreversível.
- Excluir tarefa: tarefas com status FINISH, FAILED ou ABORTED podem ser excluídas. Após a exclusão, os dados da tarefa e os resultados da avaliação serão limpos permanentemente. Esta operação é irreversível.
- Baixar resultados: apenas tarefas com status FINISH suportam o download de resultados de avaliação (consulte View Evaluation Results para detalhes).
Status da Tarefa | Operações Disponíveis | Lembrete de Irreversibilidade |
|---|---|---|
WAITING | Nenhuma (tarefa em fila) | - |
RUNNING | Terminate | Após o encerramento, o status muda para ABORTED e não pode ser restaurado |
FINISH | Visualizar resultados, Baixar resultados, Excluir | Os dados são limpos permanentemente após a exclusão |
FAILED | Excluir | Os dados são limpos permanentemente após a exclusão |
ABORTED | Excluir | Os dados são limpos permanentemente após a exclusão |
Gerenciamento de dimensões de avaliação
Na página de lista Evaluation > Dimension, você pode editar a descrição da dimensão ou excluir uma dimensão.
Ao excluir uma dimensão de avaliação, se a dimensão estiver vinculada a um leaderboard, os dados de pontuação baseados nessa dimensão no leaderboard serão limpos. Confirme se algum leaderboard está usando a dimensão antes de excluí-la.
Gerenciamento de Leaderboards
Na página de lista Evaluation > Leaderboard, você pode realizar as seguintes operações:
- Excluir leaderboard: após a exclusão de um leaderboard, os dados do leaderboard serão limpos permanentemente, mas as tarefas de avaliação já adicionadas ao leaderboard não serão afetadas.
- Remover tarefa: na página de detalhes do leaderboard, você pode remover uma tarefa de avaliação do leaderboard. A remoção afeta apenas a exibição do leaderboard; a tarefa de avaliação em si e seus resultados não serão excluídos.
Faturamento
As taxas geradas pelo Model Evaluation consistem em duas partes: a taxa de inferência do modelo a ser avaliado e a taxa de pontuação do modelo juiz. Compreender as regras de faturamento ajuda você a planejar a escala de avaliação e controlar os custos adequadamente.
Composição das taxas
Taxa de inferência do modelo a ser avaliado: faturada por token. A fórmula é cost = input_tokens x input_price + output_tokens x output_price. Aqui, input_tokens inclui o System Prompt e o Prompt de cada entrada de dados, e output_tokens é a resposta gerada pelo modelo. O preço unitário específico de cada modelo está sujeito ao console do Model Studio.
Taxa de pontuação do modelo juiz: incorrida apenas ao usar o método de pontuação LLM Numerical Scoring ou LLM Classification Scoring. Os tokens consumidos pelo modelo juiz para pontuar cada entrada de dados são faturados de acordo com o preço desse modelo juiz. Para preços específicos, consulte o console do Model Studio.
Ao usar o método de pontuação String Matching ou Text Similarity, o processo de pontuação não envolve uma chamada de modelo juiz, portanto, nenhuma taxa de pontuação é incorrida.
Método de Pontuação | Taxa de Inferência do Modelo a Ser Avaliado | Taxa de Pontuação do Modelo Juiz | Composição da Taxa |
|---|---|---|---|
Pontuação Numérica LLM | Faturado por token | Faturado por token | Inferência + Pontuação |
Pontuação por Classificação LLM | Faturado por token | Faturado por token | Inferência + Pontuação |
Correspondência de Strings | Faturado por token | Nenhuma | Apenas inferência |
Similaridade de Texto | Faturado por token | Nenhuma | Apenas inferência |
Pontuação por Classificação Manual | Faturado por token | Nenhuma (custo manual calculado separadamente) | Inferência + Manual |
Exemplo de estimativa de taxa
O exemplo a seguir mostra o processo de estimativa de taxa para usar o modelo qwen-plus para realizar uma avaliação de Pontuação Numérica LLM em 100 entradas de dados (o preço unitário é apenas para ilustração; consulte a exibição real no console):
- Suponha que cada entrada de dados tenha em média input_tokens = 500 e output_tokens = 200.
- Taxa de inferência do modelo a ser avaliado = 100 x (500 x input_price + 200 x output_price).
- Taxa de pontuação do modelo juiz = 100 x (tokens consumidos por pontuação x preço unitário do modelo juiz).
- Taxa total = Taxa de inferência do modelo a ser avaliado + Taxa de pontuação do modelo juiz.
Estratégias de otimização de custos
- Avaliação faseada: primeiro use 50-100 entradas de dados para validação em pequena escala. Após confirmar que as dimensões de avaliação e a qualidade dos dados atendem às expectativas, escale para o conjunto de dados completo para avaliação formal.
- Priorize avaliação baseada em regras: Correspondência de Strings e Similaridade de Texto não incorrem em taxas de modelo juiz e têm o menor custo. Para cenários com uma resposta padrão clara, priorize métodos de avaliação baseados em regras.
- Salve conjuntos de resultados de inferência para reutilização: salve os resultados de inferência do modelo como um conjunto de resultados de inferência. Avaliações subsequentes podem usar diretamente os resultados existentes, evitando o custo de chamar repetidamente o modelo para inferência.
Perguntas frequentes
E se os resultados da avaliação não atenderem às expectativas?
Problema: após a conclusão da tarefa de avaliação, a pontuação do modelo mostra um desvio significativo da experiência real, ou o resultado da pontuação é irracional.
Verifique os seguintes aspectos em ordem:
- Verifique a representatividade dos dados de teste: confirme se o conjunto de dados de avaliação cobre os cenários típicos e casos extremos do negócio. Poucos dados ou uma distribuição enviesada tornarão as pontuações não representativas.
- Revise a clareza do Scorer Prompt: confirme se o Scorer Prompt descreve claramente os critérios de pontuação e a base de julgamento. Um Prompt ambíguo fará com que o modelo juiz pontue de forma instável.
- Ajuste o intervalo de pontuação e o limiar: um intervalo de pontuação muito estreito (como 0-2) pode resultar em discriminação insuficiente de pontuação. Ampliar adequadamente o intervalo (como 0-10) pode melhorar a precisão da pontuação.
- Altere o modelo juiz: diferentes modelos juízes têm capacidades de pontuação diferentes. Recomenda-se o Qwen-Max (qwen-max) para resultados de pontuação mais estáveis.
E se as pontuações estiverem muito concentradas?
Problema: as pontuações de várias entradas de dados estão concentradas na mesma pontuação ou rótulo de categoria, sem discriminação.
Pontuações excessivamente concentradas geralmente são causadas pelos seguintes motivos. Investigue-os um a um:
- Refine os critérios de julgamento: adicione condições claras de julgamento e exemplos para cada nível de pontuação no Scorer Prompt para que o modelo juiz possa distinguir saídas de diferentes níveis de qualidade.
- Aumente a diversidade de dados: adicione amostras de limite e amostras anormais ao conjunto de dados de avaliação para evitar que todos os Prompts tenham dificuldade muito uniforme.
- Altere o modelo juiz: um modelo juiz com capacidade de raciocínio mais forte (como Qwen-Max) pode seguir melhor os critérios de julgamento granulares no Scorer Prompt.
Como interpretar resultados contraditórios entre diferentes dimensões de avaliação?
Problema: o mesmo modelo tem grandes diferenças de pontuação em diferentes dimensões de avaliação, podendo até ter excelente desempenho em uma dimensão e mau desempenho em outra.
Isso é normal. Diferentes dimensões de avaliação avaliam diferentes aspectos das capacidades do modelo (como precisão, fluência e lógica). O desempenho do modelo em diferentes capacidades varia inerentemente. Recomenda-se tomar decisões ponderadas sobre as pontuações das dimensões com base nas prioridades do negócio, em vez de exigir que o modelo tenha desempenho ótimo em todas as dimensões.
E se o modelo frequentemente gerar conteúdo desatualizado ou irrelevante?
Problema: a saída do modelo é irrelevante para a resposta de referência ou contém informações desatualizadas, resultando em uma baixa pontuação de avaliação.
Isso geralmente indica que a cobertura de conhecimento do modelo é insuficiente ou que os dados de treinamento estão defasados. Recomenda-se considerar a introdução de uma base de conhecimento para complementar o modelo com conhecimento de domínio e melhorar a qualidade da saída do modelo em domínios específicos por meio de Geração Aumentada por Recuperação (RAG).
Quais são as armadilhas comuns ao usar a avaliação?
Problema: ao usar o Model Evaluation pela primeira vez, é fácil confundir conceitos ou operar incorretamente, resultando em resultados de avaliação anormais.
A seguir estão as armadilhas comuns e as práticas corretas:
- System Prompt não é o mesmo que Scorer Prompt: o System Prompt é configurado na tarefa de avaliação e enviado ao modelo a ser avaliado; o Scorer Prompt é configurado na dimensão de avaliação e enviado ao modelo juiz (consulte Create an Evaluation Task para detalhes). Os dois têm alvos diferentes; não os confunda.
- Rótulos de categoria como Pass/Fail não devem se sobrepor: em dimensões que usam Pontuação por Classificação LLM ou Pontuação por Classificação Manual, rótulos de aprovação e de reprovação devem ser mutuamente exclusivos. O mesmo rótulo não pode pertencer a ambos os grupos ao mesmo tempo.
- Sem taxa adicional para modelos implantados independentemente: modelos que foram ajustados e implantados online não são cobrados com uma taxa adicional de inferência durante a avaliação (consulte Billing para detalhes).
- Restrição de tipo de conjunto de dados: tarefas de avaliação suportam apenas conjuntos de dados do tipo Evaluation Set. Se um conjunto de dados do tipo training set for selecionado, o sistema recusará a criação da tarefa de avaliação.