評測維度用於定義模型評測任務中的評分規則,支援大模型評估、規則評估和人工評估三大類共五種評分器類型,建立為模板後可被多個評測任務複用。
評測維度概述
評測維度用於定義模型評測任務中的評分規則。每個維度配置一個評分器,建立為模板後可被多個評測任務引用,實現評估標準的統一管理和複用。
百鍊平台提供以下五種評分器類型,覆蓋大模型自動評估、規則匹配和人工評審三大評估範式:
- 大模型评估-分类型:由裁判模型按使用者定義的標籤對模型輸出進行分類(Pass/Fail),適合需要語義理解的判定情境,如Alibaba Content Security Service檢測、答案正確性判斷。
- 大模型评估-数值型:由裁判模型對模型輸出打連續數值分(如 0~5 分),適合需要精細量化的情境,如問答品質評估、內容產生品質評分。
- 规则评估-字符串匹配:程式化判定模型輸出與參考文本的精確匹配關係(相等/不相等/包含),適合有確定性標準答案的情境,如 Function Calling、NL2SQL。
- 规则评估-文本相似度:使用演算法計算模型輸出與參考文本的相似性(BLEU/ROUGE/餘弦等),適合開放式回答的相似性量化,如翻譯、摘要、改寫。
- 人工评估-分类型:由評測人員手動按標籤對模型輸出分類,適合需要主觀判斷的情境,如語氣風格、合規性審核。
維度類型 | 評估方式 | 適用情境 | 需要參考答案 | 自動化程度 |
|---|---|---|---|---|
大模型評估-分類型 | 裁判模型按標籤分類 | Alibaba Content Security Service、答案正確性 | 否 | 全自動 |
大模型評估-數值型 | 裁判模型按區間打分 | 問答品質、產生品質 | 否 | 全自動 |
規則評估-字串匹配 | 字串精確/部分匹配 | Function Calling、NL2SQL | 是 | 全自動 |
規則評估-文本相似性 | BLEU/ROUGE/餘弦等演算法 | 翻譯、摘要、改寫 | 是 | 全自動 |
人工評估-分類型 | 人工按標籤評審 | 語氣風格、合規性審核 | 否 | 人工 |
- 有標準答案且格式固定:優先使用规则评估-字符串匹配,成本最低、速度最快。
- 有標準答案但表述多樣:使用规则评估-文本相似度,通過演算法容納表述差異。
- 無標準答案、需要語義理解:使用大模型評估(分類型或數值型),由裁判模型進行語義層面的評判。
- 需要主觀判斷或專業審核:使用人工评估-分类型,由人工逐條評審。
建立評測維度模板
登入百鍊控制台,在左側導覽列選擇模型評測 > 評測維度,單擊建立評測維度進入建立頁面。
建立評測維度模板時,需先填寫以下公用欄位:
- 維度名稱:必填,長度不超過 20 個字元。
- 描述:選填,長度不超過 100 個字元。用於補充說明該維度評判目標。
- 類型:必填,從 5 種評分器類型中選擇一種。評分器類型建立後不可更改,選錯只能刪除重建。
參數 | 說明 | 是否必填 | 取值說明 |
|---|---|---|---|
維度名稱 | 評測維度模板的名稱 | 是 | 不超過 20 個字元 |
描述 | 維度補充說明 | 否 | 不超過 100 個字元 |
類型 | 評分器的評估方式,建立後不可更改 | 是 | 5 種類型選其一 |
裁判模型 | 執行評判的大語言模型 | 大模型評估類型必填 | 從下拉式清單選擇 |
評分器模板 | 指導裁判模型評判的 Prompt 模板 | 大模型評估類型必填 | 預置模板或自訂 |
評分範圍 | 數值評分的最小值和最大值 | 數值型必填 | 整數,預設 0~5 |
通過閾值 | 判定通過的最低分值或相似性 | 數值型/相似性型必填 | 數值 |
重要 評分器類型建立後不可更改,選錯只能刪除重建。
- 大模型評估-分類型
- 大模型評估-數值型
- 規則評估-字串匹配
- 規則評估-文本相似性
- 人工評估-分類型
大模型評估-分類型由裁判模型按標籤對模型輸出分類。完整建立步驟:
- 選擇裁判模型:從下拉式清單中選擇用於評判的大語言模型。
- 選擇评分器模版:選擇預置模板(標準匹配、情感分析)或自訂評分器。選擇預置模板後,系統自動填滿 Prompt 和預設標籤。詳見配置評分器Prompt。
- 編寫評分器 Prompt:Prompt 中至少包含一個變數(${prompt}、${output}、${completion}),長度不超過 50000 個字元。Prompt 定義裁判模型的評判標準和輸出格式。
- 配置Pass 標籤和Fail 標籤:定義通過和未通過的分類標籤,每個標籤不超過 20 個字元。Pass 和 Fail 標籤不可重複。
- 單擊保存。
配置評分器Prompt
評分器 Prompt 是指導裁判模型評判輸出品質的提示詞,僅適用於大模型評估類型(分類型和數值型)。通過編寫 Prompt,您定義裁判模型的評判標準和輸出格式。
Prompt 變數
評分器 Prompt 支援以下三個變數,系統在評測執行時自動替換為實際值:
- ${prompt}:使用者輸入的問題或指令,即發送給被測模型的原始提示詞。
- ${output}:被測模型的輸出結果,即模型對使用者輸入的回複內容。
- ${completion}:參考標準答案,即您在評測資料集中預設的期望輸出。
預置模板
系統為大模型評估類型提供預置評分器模板,選擇後自動填滿 Prompt 內容和預設標籤配置。模板列表從系統配置動態擷取。
分類型預置模板:
- 標準匹配(預設):裁判模型判斷輸出是否符合預期標準。
- 情感分析:裁判模型判斷輸出的情感傾向。
- 自訂評分器:使用您編寫的自訂 Prompt。
- 綜合評測(預設):裁判模型從多個品質維度綜合打分。
- 語義相似性:裁判模型評估輸出與參考答案的語義接近程度。
- 自訂評分器:使用您編寫的自訂 Prompt。
自訂 Prompt 編寫
選擇自訂模板時,在 Prompt 編輯地區編寫評分指引。編寫要點:
- 使用 ${prompt}、${output}、${completion} 變數引用評測資料。
- 明確定義評分標準。分類型需定義每個標籤的判定條件;數值型需定義每個分值對應的品質標準。
- 指定輸出格式要求,確保裁判模型的評判結果可被系統正確解析。
管理評測維度模板
在評測維度列表頁,您可以查看、修改和刪除已建立的維度模板。
查看維度
維度列表頁展示所有已建立的維度模板,支援以下操作:
- 按名稱搜尋:在搜尋方塊中輸入維度名稱關鍵詞進行模糊查詢。
- 按類型篩選:單擊類型列頭的篩選圖示,可多選 5 種評分器類型進行篩選。
- 按建立時間排序:單擊按创建时间排序可切換升序/降序。
修改維度
在維度詳情頁中可修改維度名稱、描述、評分器 Prompt、標籤等配置項。評分器類型在建立後不可更改。修改儲存後立即生效。
刪除維度
在維度列表中單擊目標維度操作列的刪除按鈕。刪除操作不可恢複。如果該維度已被評測任務引用,則無法刪除,需先移除關聯的評測任務後再刪除維度。
評測維度設計建議
設計高品質的評測維度有助於準確衡量模型表現。以下是實踐中的關鍵建議。
類型選擇與迭代
根據評測情境選擇合適的類型:有標準答案的情境優先使用規則評估(成本低、速度快),需要語義理解的情境使用大模型評估,主觀品質判斷使用人工評估。各類型的詳細對比見評測維度概述。
建議先選擇預置模板建立維度,用小樣本(10~20 條資料)運行評測驗證效果。根據評測結果中偏差較大的案例,針對性調整 Prompt 的評判標準和分值定義,驗證合理後再擴大評測規模。逐步從預置模板過渡到自訂 Prompt。
參數配置建議
Pass 和 Fail 標籤應互斥且窮盡,即所有可能的輸出都能歸入其中一類。簡單情境使用二分類即可;複雜情境需要多標籤時,控制標籤數量以降低評判歧義。
大模型評估-數值型的評分範圍建議不超過 10(範圍過大會降低 LLM 評分一致性),預設 0~5 通過閾值 3 是常用配置。通過閾值設定需結合業務對品質的容忍度——閾值越高,通過標準越嚴格。
根據評測任務類型選擇合適的相似性演算法:
- 翻譯任務:BLEU(衡量 n-gram 精確匹配)。
- 摘要任務:ROUGE-L(衡量最長公用子序列)。
- 語義相關性:餘弦相似性(衡量語義向量距離)。
- 分類任務:Accuracy(衡量精確匹配率)。
命名規範
建議採用"評估方面 + 評估方式"的命名模式,如"回答準確性-LLM評分""情感傾向-標籤分類""格式合規-字串匹配"。清晰的命名有助於在評測任務中快速識別和選擇維度。
常見問題
以下是使用評測維度功能時的常見問題及解決方案。
Details
Details
問題:建立評測維度模板後,發現選錯了評分器類型。評分器類型建立後不可更改。只能刪除該維度模板後重新建立。如果該維度已被評測任務引用,需先移除關聯的評測任務才能刪除。
Details
Details
問題:刪除維度模板時提示無法刪除。當維度模板被評測任務引用時無法刪除。請先在評測工作清單中刪除或修改引用該維度評測任務,然後再刪除維度模板。
Details
Details
問題:提交評分器 Prompt 時系統提示缺少變數。評分器 Prompt 中必須至少包含一個變數(${prompt}、${output} 或 ${completion})。請檢查 Prompt 內容,確保使用 ${變數名} 格式正確引用了變數。
Details
Details
問題:配置 Pass/Fail 標籤後無法提交。請檢查 Pass 和 Fail 標籤是否有重複。同一標籤不能同時出現在 Pass 和 Fail 中,且 Pass 標籤之間、Fail 標籤之間也不能重複。
Details
Details
問題:切換評分器模板後,之前手動編輯的 Prompt 內容消失。這是預期行為。切換模板會將 Prompt 替換為模板預設內容。如果您有重要的自訂 Prompt 內容,請在切換模板前先備份。
Details
Details
問題:使用大模型評估類型的評測維度是否會產生費用。評測維度模板的建立和管理本身不收費。但在評測任務執行時,大模型評估類型會調用裁判模型進行推理,由此產生的推理費用按裁判模型的計費標準收取。