Skip to main content
模型評測

評測維度

評測維度用於定義模型評測任務中的評分規則,支援大模型評估、規則評估和人工評估三大類共五種評分器類型,建立為模板後可被多個評測任務複用。

評測維度概述

評測維度用於定義模型評測任務中的評分規則。每個維度配置一個評分器,建立為模板後可被多個評測任務引用,實現評估標準的統一管理和複用。 百鍊平台提供以下五種評分器類型,覆蓋大模型自動評估、規則匹配和人工評審三大評估範式:
  • 大模型评估-分类型:由裁判模型按使用者定義的標籤對模型輸出進行分類(Pass/Fail),適合需要語義理解的判定情境,如Alibaba Content Security Service檢測、答案正確性判斷。
  • 大模型评估-数值型:由裁判模型對模型輸出打連續數值分(如 0~5 分),適合需要精細量化的情境,如問答品質評估、內容產生品質評分。
  • 规则评估-字符串匹配:程式化判定模型輸出與參考文本的精確匹配關係(相等/不相等/包含),適合有確定性標準答案的情境,如 Function Calling、NL2SQL。
  • 规则评估-文本相似度:使用演算法計算模型輸出與參考文本的相似性(BLEU/ROUGE/餘弦等),適合開放式回答的相似性量化,如翻譯、摘要、改寫。
  • 人工评估-分类型:由評測人員手動按標籤對模型輸出分類,適合需要主觀判斷的情境,如語氣風格、合規性審核。

維度類型

評估方式

適用情境

需要參考答案

自動化程度

大模型評估-分類型

裁判模型按標籤分類

Alibaba Content Security Service、答案正確性

全自動

大模型評估-數值型

裁判模型按區間打分

問答品質、產生品質

全自動

規則評估-字串匹配

字串精確/部分匹配

Function Calling、NL2SQL

全自動

規則評估-文本相似性

BLEU/ROUGE/餘弦等演算法

翻譯、摘要、改寫

全自動

人工評估-分類型

人工按標籤評審

語氣風格、合規性審核

人工

選擇評分器類型時,可參考以下決策路徑:
  • 有標準答案且格式固定:優先使用规则评估-字符串匹配,成本最低、速度最快。
  • 有標準答案但表述多樣:使用规则评估-文本相似度,通過演算法容納表述差異。
  • 無標準答案、需要語義理解:使用大模型評估(分類型或數值型),由裁判模型進行語義層面的評判。
  • 需要主觀判斷或專業審核:使用人工评估-分类型,由人工逐條評審。
百鍊為大模型評估類型提供預置評分器模板(如標準匹配、情感分析、綜合評測),選擇後自動填滿評分器 Prompt 和預設標籤配置,適合常見情境快速啟動。如需針對特定商務邏輯定製評判標準,可選擇自訂評分器手動編寫 Prompt。 建立維度模板後,您可以在評測任務中引用該模板作為評判標準。關於評測任務的建立和執行,請參見模型評測

建立評測維度模板

登入百鍊控制台,在左側導覽列選擇模型評測 > 評測維度,單擊建立評測維度進入建立頁面。 建立評測維度模板時,需先填寫以下公用欄位:
  • 維度名稱:必填,長度不超過 20 個字元。
  • 描述:選填,長度不超過 100 個字元。用於補充說明該維度評判目標。
  • 類型:必填,從 5 種評分器類型中選擇一種。評分器類型建立後不可更改,選錯只能刪除重建。
下表列出建立評測維度模板時的通用和類型專屬參數。

參數

說明

是否必填

取值說明

維度名稱

評測維度模板的名稱

不超過 20 個字元

描述

維度補充說明

不超過 100 個字元

類型

評分器的評估方式,建立後不可更改

5 種類型選其一

裁判模型

執行評判的大語言模型

大模型評估類型必填

從下拉式清單選擇

評分器模板

指導裁判模型評判的 Prompt 模板

大模型評估類型必填

預置模板或自訂

評分範圍

數值評分的最小值和最大值

數值型必填

整數,預設 0~5

通過閾值

判定通過的最低分值或相似性

數值型/相似性型必填

數值

選擇類型後,頁面會展示該類型的專屬配置項。以下按類型分別說明完整的建立流程。
重要 評分器類型建立後不可更改,選錯只能刪除重建。
  • 大模型評估-分類型
  • 大模型評估-數值型
  • 規則評估-字串匹配
  • 規則評估-文本相似性
  • 人工評估-分類型
大模型評估-分類型由裁判模型按標籤對模型輸出分類。完整建立步驟:
  1. 選擇裁判模型:從下拉式清單中選擇用於評判的大語言模型。
  2. 選擇评分器模版:選擇預置模板(標準匹配、情感分析)或自訂評分器。選擇預置模板後,系統自動填滿 Prompt 和預設標籤。詳見配置評分器Prompt
  3. 編寫評分器 Prompt:Prompt 中至少包含一個變數(${prompt}、${output}、${completion}),長度不超過 50000 個字元。Prompt 定義裁判模型的評判標準和輸出格式。
  4. 配置Pass 標籤Fail 標籤:定義通過和未通過的分類標籤,每個標籤不超過 20 個字元。Pass 和 Fail 標籤不可重複。
  5. 單擊保存

配置評分器Prompt

評分器 Prompt 是指導裁判模型評判輸出品質的提示詞,僅適用於大模型評估類型(分類型和數值型)。通過編寫 Prompt,您定義裁判模型的評判標準和輸出格式。

Prompt 變數

評分器 Prompt 支援以下三個變數,系統在評測執行時自動替換為實際值:
  • ${prompt}:使用者輸入的問題或指令,即發送給被測模型的原始提示詞。
  • ${output}:被測模型的輸出結果,即模型對使用者輸入的回複內容。
  • ${completion}:參考標準答案,即您在評測資料集中預設的期望輸出。
在 Prompt 中使用 ${變數名} 文法引用變數。Prompt 中至少包含一個變數,否則無法提交。

預置模板

系統為大模型評估類型提供預置評分器模板,選擇後自動填滿 Prompt 內容和預設標籤配置。模板列表從系統配置動態擷取。 分類型預置模板:
  • 標準匹配(預設):裁判模型判斷輸出是否符合預期標準。
  • 情感分析:裁判模型判斷輸出的情感傾向。
  • 自訂評分器:使用您編寫的自訂 Prompt。
數值型預置模板:
  • 綜合評測(預設):裁判模型從多個品質維度綜合打分。
  • 語義相似性:裁判模型評估輸出與參考答案的語義接近程度。
  • 自訂評分器:使用您編寫的自訂 Prompt。

自訂 Prompt 編寫

選擇自訂模板時,在 Prompt 編輯地區編寫評分指引。編寫要點:
  • 使用 ${prompt}、${output}、${completion} 變數引用評測資料。
  • 明確定義評分標準。分類型需定義每個標籤的判定條件;數值型需定義每個分值對應的品質標準。
  • 指定輸出格式要求,確保裁判模型的評判結果可被系統正確解析。
以下是一個大模型評估-分類型的自訂 Prompt 樣本: 請評估以下模型回答的品質。使用者問題:${prompt},模型回答:${output},參考答案:${completion}。評分標準:如果回答包含參考答案的核心要素且無事實錯誤,判定為 Pass;如果回答遺漏關鍵資訊或包含事實錯誤,判定為 Fail。請僅輸出 Pass 或 Fail。 切換評分器模板或單擊恢複預設 Prompt按鈕,可將 Prompt 恢複到模板預設內容。切換模板會覆蓋當前 Prompt 內容,手動編輯的內容請先備份。

管理評測維度模板

評測維度列表頁,您可以查看、修改和刪除已建立的維度模板。

查看維度

維度列表頁展示所有已建立的維度模板,支援以下操作:
  • 按名稱搜尋:在搜尋方塊中輸入維度名稱關鍵詞進行模糊查詢。
  • 按類型篩選:單擊類型列頭的篩選圖示,可多選 5 種評分器類型進行篩選。
  • 按建立時間排序:單擊按创建时间排序可切換升序/降序。
在維度列表中單擊目標維度名稱進入詳情頁,查看該維度完整配置(包括評分器類型、Prompt、標籤、評分範圍等)。

修改維度

在維度詳情頁中可修改維度名稱、描述、評分器 Prompt、標籤等配置項。評分器類型在建立後不可更改。修改儲存後立即生效。

刪除維度

在維度列表中單擊目標維度操作列的刪除按鈕。刪除操作不可恢複。如果該維度已被評測任務引用,則無法刪除,需先移除關聯的評測任務後再刪除維度。

評測維度設計建議

設計高品質的評測維度有助於準確衡量模型表現。以下是實踐中的關鍵建議。

類型選擇與迭代

根據評測情境選擇合適的類型:有標準答案的情境優先使用規則評估(成本低、速度快),需要語義理解的情境使用大模型評估,主觀品質判斷使用人工評估。各類型的詳細對比見評測維度概述 建議先選擇預置模板建立維度,用小樣本(10~20 條資料)運行評測驗證效果。根據評測結果中偏差較大的案例,針對性調整 Prompt 的評判標準和分值定義,驗證合理後再擴大評測規模。逐步從預置模板過渡到自訂 Prompt。

參數配置建議

Pass 和 Fail 標籤應互斥且窮盡,即所有可能的輸出都能歸入其中一類。簡單情境使用二分類即可;複雜情境需要多標籤時,控制標籤數量以降低評判歧義。 大模型評估-數值型的評分範圍建議不超過 10(範圍過大會降低 LLM 評分一致性),預設 0~5 通過閾值 3 是常用配置。通過閾值設定需結合業務對品質的容忍度——閾值越高,通過標準越嚴格。 根據評測任務類型選擇合適的相似性演算法:
  • 翻譯任務:BLEU(衡量 n-gram 精確匹配)。
  • 摘要任務:ROUGE-L(衡量最長公用子序列)。
  • 語義相關性:餘弦相似性(衡量語義向量距離)。
  • 分類任務:Accuracy(衡量精確匹配率)。

命名規範

建議採用"評估方面 + 評估方式"的命名模式,如"回答準確性-LLM評分""情感傾向-標籤分類""格式合規-字串匹配"。清晰的命名有助於在評測任務中快速識別和選擇維度。

常見問題

以下是使用評測維度功能時的常見問題及解決方案。
問題:建立評測維度模板後,發現選錯了評分器類型。評分器類型建立後不可更改。只能刪除該維度模板後重新建立。如果該維度已被評測任務引用,需先移除關聯的評測任務才能刪除。
問題:刪除維度模板時提示無法刪除。當維度模板被評測任務引用時無法刪除。請先在評測工作清單中刪除或修改引用該維度評測任務,然後再刪除維度模板。
問題:提交評分器 Prompt 時系統提示缺少變數。評分器 Prompt 中必須至少包含一個變數(${prompt}、${output} 或 ${completion})。請檢查 Prompt 內容,確保使用 ${變數名} 格式正確引用了變數。
問題:配置 Pass/Fail 標籤後無法提交。請檢查 Pass 和 Fail 標籤是否有重複。同一標籤不能同時出現在 Pass 和 Fail 中,且 Pass 標籤之間、Fail 標籤之間也不能重複。
問題:切換評分器模板後,之前手動編輯的 Prompt 內容消失。這是預期行為。切換模板會將 Prompt 替換為模板預設內容。如果您有重要的自訂 Prompt 內容,請在切換模板前先備份。
問題:使用大模型評估類型的評測維度是否會產生費用。評測維度模板的建立和管理本身不收費。但在評測任務執行時,大模型評估類型會調用裁判模型進行推理,由此產生的推理費用按裁判模型的計費標準收取。
Token Plan
模型體驗
  • 音樂產生
用量統計與效能監控
資產中心
服務支援