Skip to main content
Evaluasi

Evaluasi Model

Model Evaluation adalah alat evaluasi kualitas model yang disediakan oleh platform Alibaba Cloud Model Studio. Fitur ini mendukung evaluasi kuantitatif terhadap performa model bahasa besar melalui dimensi evaluasi kustom, membantu Anda dalam pemilihan model, verifikasi tuning, dan perbandingan kemampuan.

Apa Itu Model Evaluation

Model Evaluation adalah alat verifikasi kualitas model yang disediakan oleh platform Alibaba Cloud Model Studio. Dengan dimensi evaluasi dan metode penilaian kustom, Anda dapat mengevaluasi performa model bahasa besar secara kuantitatif dalam skenario bisnis tertentu serta memperoleh hasil evaluasi yang dapat dibandingkan.
image

Kasus Penggunaan

Model Evaluation berlaku untuk skenario berikut:
  • Pemilihan model: bandingkan skor dari beberapa model kandidat untuk memilih model yang paling sesuai dengan kebutuhan bisnis Anda.
  • Verifikasi tuning: setelah melakukan Prompt tuning atau fine-tuning pada model, gunakan evaluasi untuk memverifikasi apakah performa telah meningkat.
  • Evaluasi kuantitatif: ubah kualitas output model menjadi metrik skor terukur untuk menggantikan penilaian subjektif.
  • Pemantauan berkelanjutan: jalankan tugas evaluasi secara berkala untuk melacak tren kemampuan model sepanjang iterasi versi.

Metode Penilaian

Model Evaluation mendukung lima metode penilaian, mencakup penilaian otomatis maupun manual:
  • LLM Numerical Scoring: model juri memberikan skor numerik (misalnya 0–5 poin) sesuai dengan Scorer Prompt, cocok untuk skenario yang memerlukan kuantifikasi detail halus.
  • LLM Classification Scoring: model juri mengklasifikasikan output ke dalam kategori yang telah ditentukan (misalnya Pass/Fail) sesuai dengan Scorer Prompt, cocok untuk penilaian biner atau multi-label.
  • String Matching: melakukan perbandingan eksak (sama, mengandung, diawali dengan, diakhiri dengan, dll.) antara output model dan jawaban referensi, cocok untuk skenario dengan satu jawaban standar.
  • Text Similarity: menggunakan algoritma (ROUGE-L, BLEU, Cosine, Fuzzy, Accuracy) untuk menghitung kemiripan antara output model dan jawaban referensi, cocok untuk penilaian kualitas generasi teks.
  • Manual Classification Scoring: anotator manusia mengklasifikasikan dan menilai output model, cocok untuk skenario evaluasi subjektif yang tidak dapat dijangkau oleh penilaian otomatis.
Model yang dapat dievaluasi mencakup model komersial seri Qwen, model open-source Qwen, Tongyi Farui, dan lainnya. Model yang tersedia mengacu pada daftar drop-down Model to Be Evaluated di Konsol. Perbandingan ikhtisar kelima metode penilaian tersebut adalah sebagai berikut:

Metode Penilaian

Sumber Penilaian

Skenario yang Berlaku

Biaya

LLM Numerical Scoring

Judge model

Pemahaman semantik, evaluasi terbuka

Sedang

LLM Classification Scoring

Judge model

Penilaian biner (keamanan/kebenaran)

Sedang

String Matching

Aturan

Skenario dengan satu jawaban standar

Sangat rendah

Text Similarity

Algoritma

Penilaian kualitas terjemahan dan ringkasan

Rendah

Manual Classification Scoring

Anotator manusia

Evaluasi kreativitas, penilaian subjektif

Tinggi

Prasyarat dan Batasan

Alur kerja evaluasi lengkap adalah: Buat Dimensi Evaluasi → Siapkan Data Evaluasi → Buat Tugas Evaluasi → Lihat Hasil Evaluasi. Sebelum menggunakan Model Evaluation, pastikan kondisi berikut terpenuhi:
  • Anda telah mendaftarkan Akun Alibaba Cloud dan menyelesaikan verifikasi identitas asli.
  • Anda telah mengaktifkan layanan Alibaba Cloud Model Studio. URL aktivasi: https://modelstudio.console.alibabacloud.com.
  • Jika Anda beroperasi sebagai pengguna RAM, akun utama harus memberikan izin yang sesuai.
Model Evaluation hanya dapat diakses melalui Konsol; tidak tersedia API atau SDK.
Model seri Qwen3 saat ini belum mendukung evaluasi dalam Thinking Mode. Untuk mengevaluasi model Qwen3, nonaktifkan Thinking Mode sebelum membuat tugas evaluasi.

Siapkan Data Evaluasi

Data evaluasi merupakan input untuk tugas evaluasi dan menentukan pertanyaan mana yang akan digunakan untuk mengevaluasi model. Alibaba Cloud Model Studio mendukung dua sumber data: set data evaluasi (pertanyaan uji yang telah disiapkan sebelumnya) dan set hasil inferensi (hasil inferensi yang telah dihasilkan oleh model).

Deskripsi Format Data

Set data evaluasi berisi bidang-bidang berikut:
  • Prompt (wajib): pertanyaan input yang dikirim ke model yang akan dievaluasi. Setiap entri harus menyertakan bidang ini.
  • Completion (opsional): jawaban referensi, digunakan oleh metode penilaian (seperti String Matching dan Text Similarity) untuk dibandingkan dengan output model.
  • Output (hanya untuk set hasil inferensi): konten output yang telah dihasilkan oleh model. Saat menggunakan set hasil inferensi, tugas evaluasi langsung menilai Output tanpa memanggil ulang model yang dievaluasi.
Jenis set data harus berupa Evaluation Set. Set data jenis training set tidak dapat digunakan dalam tugas evaluasi. Saat membuat set data, pilih Dataset Type dan pilih Evaluation Set.
Saat membuat set data, Anda harus memilih evaluation set sebagai jenis set data. Jika Anda salah memilih training set, set data tersebut tidak dapat digunakan dalam tugas evaluasi. Jenis set data tidak dapat diubah setelah pembuatan, sehingga Anda harus membuat set data baru.
Deskripsi bidang data evaluasi adalah sebagai berikut:

Bidang

Wajib

Deskripsi

Skenario yang Berlaku

Prompt

Wajib

Pertanyaan input yang dikirim ke model yang akan dievaluasi

Semua metode evaluasi

Completion

Opsional

Jawaban referensi, digunakan untuk perbandingan dengan output model

String Matching, Text Similarity

Output

Hanya untuk set hasil inferensi

Konten output yang telah dihasilkan oleh model

Saat menggunakan kembali hasil inferensi yang ada

Rekomendasi Volume Data

Volume data secara langsung memengaruhi keandalan hasil evaluasi. Pilih skala data yang sesuai berdasarkan tujuan evaluasi Anda:
  • Validasi cepat (50–100 entri): cocok untuk konfirmasi hasil cepat setelah Prompt tuning, dapat menyelesaikan evaluasi dalam waktu singkat.
  • Evaluasi standar (200–500 entri): cocok untuk pemilihan model dan evaluasi formal, mencakup lebih banyak skenario, hasil lebih representatif.
  • Evaluasi mendalam (500 entri atau lebih): cocok untuk skenario yang memerlukan presisi evaluasi tinggi, dapat sepenuhnya mencakup distribusi pertanyaan bisnis.
Saat menulis Prompt, cakup skenario khas dan kasus tepi dalam bisnis Anda serta hindari berkonsentrasi pada satu jenis pertanyaan saja. Setiap Prompt harus jelas dan spesifik agar performa model dalam penggunaan nyata dapat dinilai.

Buat Set Data

Ikuti langkah-langkah berikut untuk membuat set data evaluasi di Konsol:
  1. Login ke Konsol Alibaba Cloud Model Studio.
  2. Di panel navigasi kiri, pilih Data Management > Dataset Management.
  3. Klik Create Dataset.
  4. Isi Dataset Name, dan pada Dataset Type pilih Evaluation Set.
  5. Unggah file data atau tambahkan entri data secara manual, pastikan setiap entri minimal berisi bidang Prompt.
  6. Klik OK untuk menyelesaikan pembuatan.
image

Buat Dimensi Evaluasi

Dimensi evaluasi menetapkan kriteria penilaian terhadap output model. Setiap dimensi terikat pada satu metode penilaian. Saat tugas evaluasi dijalankan, setiap entri dinilai satu per satu sesuai konfigurasi dimensi.
Metode penilaian suatu dimensi evaluasi tidak dapat diubah setelah pembuatan. Untuk menggunakan metode penilaian berbeda, buat dimensi evaluasi baru.

Pilih Metode Penilaian

Alibaba Cloud Model Studio mendukung lima mode penilaian berikut (lihat Apa Itu Model Evaluation untuk detailnya). Parameter utama masing-masing metode adalah sebagai berikut: LLM Numerical Scoring: model juri menghasilkan skor numerik sesuai dengan Scorer Prompt. Rentang penilaian default 0–5 (minimum 0, maksimum dapat dikustomisasi). Ambang batas kelulusan default 3,0 (skor ≥ ambang batas dianggap lulus). Qwen-Max (qwen-max) direkomendasikan sebagai model juri karena stabilitas dan daya diskriminasinya lebih unggul. LLM Classification Scoring: model juri mengklasifikasikan output ke label kategori yang telah ditentukan sesuai dengan Scorer Prompt. Anda perlu mengonfigurasi minimal dua label kategori (misalnya Pass dan Fail) dan menentukan label mana yang dianggap "lulus". Label lulus dan tidak-lulus tidak boleh tumpang tindih.
Saat mengonfigurasi label kategori, label lulus dan tidak-lulus harus saling eksklusif. Misalnya, Pass dan Fail tidak boleh keduanya ditandai sebagai label lulus, jika tidak sistem akan menolak pembuatan.
String Matching: melakukan perbandingan string antara output model dan jawaban referensi Completion, tanpa melibatkan model juri. Aturan pencocokan yang didukung meliputi: sama, tidak sama, mengandung, diawali dengan, diakhiri dengan. Text Similarity: menggunakan algoritma untuk menghitung skor kemiripan antara output model dan jawaban referensi Completion, tanpa melibatkan model juri. Algoritma yang didukung meliputi: ROUGE-L (berorientasi recall), BLEU (berorientasi presisi), Cosine (kemiripan semantik), Fuzzy (Pencocokan kabur), dan Accuracy (tingkat kecocokan eksak). Manual Classification Scoring: penilaian dilakukan secara manual oleh anotator, bukan oleh model juri. Konfigurasi parameternya mirip dengan LLM Classification Scoring; Anda perlu menentukan label kategori dan label lulus. Parameter konfigurasi masing-masing metode penilaian adalah sebagai berikut (beberapa parameter hanya ditampilkan di bawah metode penilaian tertentu):

Parameter

Deskripsi

Wajib

Deskripsi Nilai

Nama dimensi

Nama identifikasi dimensi evaluasi

Ya

Maksimal 20 karakter

Deskripsi dimensi

Deskripsi tekstual dimensi

Ya

Maksimal 100 karakter

Metode penilaian

Menentukan cara mengevaluasi output model

Ya

Salah satu dari 5 metode penilaian; tidak dapat diubah setelah pembuatan

Judge model

LLM yang memberikan skor terhadap output model

Wajib untuk penilaian LLM

Qwen-Max (qwen-max) direkomendasikan

Scorer Prompt

Instruksi yang memandu model juri dalam memberikan skor

Wajib untuk penilaian LLM

Mendukung variabel ${prompt}/${output}/${completion}

Rentang penilaian

Interval skor untuk penilaian numerik

Wajib untuk LLM Numerical Scoring

Default 0–5; nilai maksimum dapat dikustomisasi

Ambang batas kelulusan

Skor yang lebih besar atau sama dengan ambang batas dianggap lulus

Wajib untuk LLM Numerical Scoring

Default 3,0, mendukung langkah 0,1

Label kategori

Label kategori yang telah ditentukan

Wajib untuk penilaian klasifikasi

Minimal dua label; label lulus dan tidak-lulus tidak boleh tumpang tindih

Algoritma kemiripan

Algoritma untuk menghitung kemiripan teks

Wajib untuk Text Similarity

ROUGE-L / BLEU / Cosine / Fuzzy / Accuracy

Ambang batas kemiripan

Nilai kelulusan untuk skor kemiripan

Wajib untuk Text Similarity

ROUGE-L direkomendasikan 0,4–0,6, BLEU direkomendasikan 0,3–0,5

Panduan anotasi

Instruksi yang memandu anotator dalam memberikan penilaian

Opsional untuk Manual Classification Scoring

Deskripsi teks kustom

Konfigurasi Scorer Prompt

LLM Numerical Scoring dan LLM Classification Scoring memerlukan Scorer Prompt untuk memandu model juri dalam memberikan skor. Anda dapat memilih templat Prompt yang telah disediakan platform atau menulis Prompt kustom. Scorer Prompt mendukung tiga variabel berikut, yang secara otomatis diganti dengan data aktual selama evaluasi:
  • ${prompt}: konten input Prompt dari entri data saat ini.
  • ${output}: konten output yang dihasilkan oleh model yang dievaluasi untuk Prompt ini.
  • ${completion}: jawaban referensi Completion untuk entri data ini (jika ada).
Saat membuat Prompt kustom, jelaskan secara jelas kepada model juri kriteria penilaian, format output, dan rentang skor dimensi penilaian untuk memperoleh hasil penilaian yang stabil. Untuk teknik penulisan Prompt lebih lanjut, lihat Prompt Best Practices.

Langkah Membuat Dimensi

  1. Login ke Konsol Alibaba Cloud Model Studio, dan di panel navigasi kiri pilih Evaluation > Dimension.
  2. Klik Create Evaluation Dimension.
  3. Isi Dimension Name (maksimal 20 karakter) dan Dimension Description (maksimal 100 karakter).
  4. Pada Scoring Method, pilih metode penilaian dan konfigurasikan parameter yang sesuai.
  5. Jika Anda memilih metode penilaian LLM, pilih model pada Judge Model (Qwen-Max direkomendasikan) dan konfigurasikan Scorer Prompt.
  6. Klik OK untuk menyelesaikan pembuatan. Metode penilaian tidak dapat diubah setelah pembuatan; untuk menggunakan metode penilaian berbeda, buat dimensi baru.
image
Untuk detail parameter konfigurasi dan rekomendasi penggunaan masing-masing metode penilaian, lihat Pilih Metode Penilaian.

Buat Tugas Evaluasi

Tugas evaluasi menggabungkan model yang akan dievaluasi, data evaluasi, dan dimensi evaluasi untuk dieksekusi. Saat tugas dijalankan, platform mengirim setiap Prompt dalam set data ke model yang akan dievaluasi untuk mendapatkan output, lalu menilai satu per satu sesuai dimensi evaluasi yang terkait.

Konfigurasi Parameter Tugas Evaluasi

  1. Login ke Konsol Alibaba Cloud Model Studio, dan di panel navigasi kiri pilih Evaluation > Evaluation Task.
  2. Klik Create Evaluation Task.
  3. Isi Task Name (maksimal 50 karakter; format nama default "Evaluation_WaktuSaatIni").
  4. Pada Model to Be Evaluated, pilih satu atau beberapa model. Model yang ditampilkan dalam warna abu-abu pada daftar drop-down saat ini tidak didukung untuk evaluasi dan tidak dapat dipilih.
  5. Pilih Data Source: pilih Evaluation Set atau Inference Result Set, dan hubungkan set data yang telah Anda buat (lihat Siapkan Data Evaluasi untuk detailnya).
  6. Di area Dimension, hubungkan satu atau beberapa dimensi evaluasi yang telah Anda buat. Jika Anda menghapus dimensi yang dipilih, pengaturan asosiasi leaderboard juga akan dihapus secara otomatis.
  7. Jika perlu mengatur System Prompt, isi di area yang sesuai. Klik OK untuk mengirimkan tugas.
Setelah tugas evaluasi dikirimkan, model yang akan dievaluasi tidak dapat diubah. Untuk mengevaluasi model lain, buat tugas evaluasi baru.
image

System Prompt vs. Scorer Prompt

Dua jenis Prompt terlibat dalam tugas evaluasi, dengan objek target berbeda:
  • System Prompt: dikonfigurasi dalam tugas evaluasi dan dikirim ke model yang akan dievaluasi sebagai instruksi sistem. Digunakan untuk mengatur role, format output, atau batasan perilaku model yang akan dievaluasi dan memengaruhi output model tersebut.
  • Scorer Prompt: dikonfigurasi dalam dimensi evaluasi dan dikirim ke model juri sebagai dasar penilaian. Memandu model juri dalam menilai output model yang akan dievaluasi, dan hanya digunakan oleh metode penilaian LLM.
Keduanya tidak saling memengaruhi: System Prompt mengontrol "apa yang dioutput oleh model yang akan dievaluasi", sedangkan Scorer Prompt mengontrol "bagaimana model juri memberikan skor".

Item Perbandingan

System Prompt

Scorer Prompt

Lokasi konfigurasi

Dikonfigurasi dalam tugas evaluasi

Dikonfigurasi dalam dimensi evaluasi

Objek target

Model yang akan dievaluasi

Model juri

Tujuan

Mengatur role model, format output, atau batasan perilaku

Memandu model juri dalam menilai output

Wajib

Opsional

Wajib untuk metode penilaian LLM

Atribusi biaya

Dihitung sebagai biaya inferensi model yang akan dievaluasi

Dihitung sebagai biaya penilaian model juri

Pengaturan Partisipasi Leaderboard

Saat membuat tugas evaluasi, Anda dapat mengatur apakah hasil tugas berpartisipasi dalam peringkat leaderboard. Setelah diaktifkan, hasil evaluasi akan secara otomatis masuk ke leaderboard saat tugas selesai, dan akan dibandingkan serta ditampilkan bersama hasil evaluasi model lainnya. Saat membuat tugas evaluasi dari entri halaman Leaderboard, sistem secara otomatis mengisi dimensi evaluasi dan set data yang terkait dengan leaderboard tersebut. Anda hanya perlu memilih model yang akan dievaluasi untuk mengirimkan tugas.

Lihat Hasil Evaluasi

Setelah tugas dikirimkan, Anda dapat melacak status tugas dan melihat hasil evaluasi di daftar tugas evaluasi. Login ke Konsol Alibaba Cloud Model Studio, dan di panel navigasi kiri pilih Evaluation > Evaluation Task.

Status Tugas

Status tugas evaluasi berubah sebagai berikut:
  • WAITING: tugas telah dikirim dan sedang menunggu eksekusi.
  • RUNNING: tugas sedang dieksekusi, dan platform sedang memanggil model serta memberikan skor.
  • FINISH: eksekusi tugas selesai, semua data telah dinilai, dan hasil dapat dilihat.
  • FAILED: eksekusi tugas gagal, biasanya disebabkan oleh pengecualian pemanggilan model atau masalah format data.
  • ABORTED: tugas dihentikan secara manual.
Untuk operasi yang tersedia di setiap status, lihat Kelola Sumber Daya Evaluasi.

Lihat Data dan Statistik Evaluasi

Setelah status tugas menjadi FINISH, klik nama tugas untuk masuk ke halaman detail hasil, yang berisi dua tab berikut:
  • Data Details: menampilkan Prompt, output model, dan skor setiap dimensi untuk setiap entri data satu per satu, membantu Anda menemukan performa model pada pertanyaan tertentu.
  • Metric Statistics: menampilkan skor komprehensif dan laju kelulusan setiap dimensi evaluasi. Dimensi numerik menunjukkan skor rata-rata dan laju kelulusan; dimensi kategorikal menunjukkan grafik distribusi setiap label kategori.
image

Unduh dan Analisis Hasil

Hanya tugas dengan status FINISH yang mendukung unduhan hasil. Di halaman detail tugas evaluasi, klik Download Results untuk mengekspor data evaluasi lengkap. Saat menganalisis hasil evaluasi, perhatikan aspek-aspek berikut:
  • Bandingkan perbedaan skor model berbeda pada dimensi yang sama untuk menentukan keunggulan masing-masing model.
  • Filter entri data dengan skor rendah dan analisis jenis pertanyaan mana yang menyebabkan performa model buruk.
  • Fokus pada metrik laju kelulusan: laju kelulusan mencerminkan proporsi model yang mencapai garis dasar pada dimensi tersebut, dan merupakan referensi inti untuk pemilihan model.
  • Jika model yang sama dievaluasi beberapa kali, bandingkan perubahan skor sepanjang periode untuk melacak efek tuning model.

Gunakan Leaderboard untuk Membandingkan Model

Leaderboard digunakan untuk membandingkan performa beberapa model di bawah dimensi evaluasi yang sama, dan menampilkan kekuatan serta kelemahan masing-masing model dalam bentuk peringkat. Setiap leaderboard terikat pada satu set dimensi evaluasi, dan menggabungkan hasil beberapa tugas evaluasi ke dalam satu tabel peringkat, membantu Anda membuat keputusan pemilihan model dengan cepat.

Buat Leaderboard

  1. Login ke Konsol Alibaba Cloud Model Studio, dan di panel navigasi kiri pilih Evaluation > Leaderboard.
  2. Klik Create Leaderboard.
  3. Isi Leaderboard Name (maksimal 50 karakter).
  4. Pada Dimension, pilih satu atau beberapa dimensi evaluasi yang telah Anda buat. Dimensi evaluasi yang terikat pada leaderboard tidak dapat diubah setelah pembuatan; pilih dengan hati-hati.
  5. Klik OK untuk menyelesaikan pembuatan.
image

Tambahkan Tugas Evaluasi ke Leaderboard

Setelah leaderboard dibuat, Anda dapat menambahkan tugas evaluasi ke leaderboard dengan dua cara:
  • Buat tugas baru dari leaderboard: di halaman detail leaderboard, klik Create Evaluation Task. Sistem secara otomatis mengunci dimensi evaluasi yang terikat pada leaderboard dan mengasosiasikan leaderboard tersebut. Anda hanya perlu memilih model yang akan dievaluasi dan set data.
  • Pilih dari tugas yang telah selesai: di halaman detail leaderboard, klik Add Evaluation Task, dan di daftar pop-up, centang tugas historis yang statusnya FINISH dan yang berisi dimensi evaluasi leaderboard tersebut. Tugas yang sudah terikat pada leaderboard saat ini memiliki kotak centang berwarna abu-abu dan tidak dapat dihapus centangnya.
Maksimal 50 tugas evaluasi dapat ditambahkan ke setiap leaderboard.

Deskripsi Hasil Leaderboard

Leaderboard menampilkan hasil peringkat semua tugas yang ditambahkan dalam bentuk tabel, berisi kolom-kolom berikut:
  • Ranking: diurutkan dari tinggi ke rendah berdasarkan skor leaderboard, tiga besar ditandai dengan emas, perak, dan perunggu.
  • Task Name: nama tugas evaluasi. Klik untuk menuju detail tugas.
  • to compare: nama model yang akan dievaluasi oleh Tugas.
  • Leaderboard Score: rentang nilai 0–100, berasal dari normalisasi skor tugas pada dimensi yang terikat pada leaderboard. Skor tugas yang sedang dievaluasi ditampilkan sebagai tanda hubung (-) dan akan diperbarui secara otomatis setelah evaluasi selesai.
  • [Evaluation Dimension Name]: menampilkan skor asli tugas pada dimensi yang terikat pada leaderboard.
  • Actions: mendukung melihat detail tugas atau menghapus tugas dari leaderboard.
Skor leaderboard diperbarui secara real-time seiring perkembangan tugas evaluasi. Saat status tugas menjadi FINISH, peringkat akan diperbarui secara otomatis.

Evaluasi Anotasi Manual

Evaluasi anotasi manual cocok untuk skenario yang memerlukan penilaian subjektif, seperti evaluasi kreativitas dan tinjauan kualitas profesional. Saat metode penilaian otomatis tidak dapat mengukur kualitas output model secara akurat, Anda dapat membuat tugas evaluasi yang berisi dimensi penilaian klasifikasi manual, dan anotator akan menilai output model satu per satu secara manual. Login ke Konsol Alibaba Cloud Model Studio, dan di panel navigasi kiri pilih Evaluation > Evaluation Task.

Mode Anotasi

Anotasi manual mendukung tiga mode, berlaku untuk tujuan evaluasi berbeda:
  • Single Annotation
  • Comparative Annotation
  • Application Annotation
Mode Single Annotation (base) menilai output model setiap entri data satu per satu, dan anotator memilih label kategori untuk setiap output. Cocok untuk skenario yang memerlukan penilaian independen terhadap setiap output, seperti memeriksa keakuratan atau keamanan jawaban model satu per satu.
Perbandingan ketiga mode anotasi adalah sebagai berikut:

Mode Anotasi

Deskripsi

Skenario yang Berlaku

Single Annotation (base)

Menilai setiap output model satu per satu

Perlu menilai setiap output secara independen

Comparative Annotation (PK)

Membandingkan dan memberi peringkat dua output model secara berdampingan

Perbandingan dan pemilihan langsung antar model

Application Annotation (app)

Mengevaluasi output model dalam skenario aplikasi

Evaluasi efektivitas end-to-end

Langkah Anotasi

  1. Ikuti alur kerja Buat Tugas Evaluasi untuk membuat tugas baru dan asosiasikan dimensi evaluasi yang metode penilaiannya adalah Manual Classification Scoring (lihat Buat Dimensi Evaluasi untuk detailnya).
  2. Setelah tugas dibuat, buka halaman detail tugas dan pilih tab Evaluation Data.
  3. Di kolom Actions daftar data, klik tombol Annotate untuk masuk ke halaman anotasi.
  4. Tinjau konten output model, pilih label kategori untuk entri data ini sesuai kriteria penilaian, dan klik Submit untuk menyelesaikan anotasi entri saat ini.
  5. Selesaikan anotasi semua entri data satu per satu. Saat semua data telah dianotasi, status tugas secara otomatis berubah menjadi FINISH.
image

Rekomendasi Desain Label

Kualitas desain label secara langsung memengaruhi keandalan hasil anotasi. Prinsip berikut direkomendasikan:
  • Label harus mencakup semua kemungkinan situasi output model untuk mencegah anotator menghadapi output yang tidak dapat dikategorikan.
  • Gunakan kata kategori yang ringkas dan jelas sebagai nama label untuk mengurangi beban pemahaman anotator.
  • Atur beberapa anotator untuk saling anotasi batch data yang sama guna memeriksa konsistensi anotasi. Jika konsistensi rendah, periksa apakah definisi label ambigu dan optimalkan kriteria penilaian.

Kelola Sumber Daya Evaluasi

Setelah tugas evaluasi, dimensi evaluasi, dan leaderboard dibuat, Anda dapat mengelola sumber daya ini di Konsol. Beberapa operasi tidak dapat dikembalikan; lakukan dengan hati-hati. Login ke Konsol Alibaba Cloud Model Studio, dan di panel navigasi kiri pilih Evaluation.

Manajemen Tugas Evaluasi

Di halaman daftar Evaluation > Evaluation Task, Anda dapat melakukan operasi berikut pada tugas evaluasi:
  • Cari, filter, dan urutkan: cari berdasarkan nama tugas, filter berdasarkan status, dan urutkan berdasarkan waktu pembuatan untuk menemukan tugas target dengan cepat. Operasi ini hanya memengaruhi tampilan daftar dan tidak mengubah data tugas.
  • Hentikan tugas: hanya tugas dengan status RUNNING yang mendukung penghentian. Setelah mengklik Terminate, status tugas berubah menjadi ABORTED. Operasi ini tidak dapat dikembalikan.
  • Hapus tugas: tugas dengan status FINISH, FAILED, atau ABORTED dapat dihapus. Setelah dihapus, data tugas dan hasil evaluasi akan dihapus permanen. Operasi ini tidak dapat dikembalikan.
  • Unduh hasil: hanya tugas dengan status FINISH yang mendukung pengunduhan hasil evaluasi (lihat Lihat Hasil Evaluasi untuk detailnya).
Operasi yang tersedia di setiap status tugas dirangkum sebagai berikut:

Status Tugas

Operasi yang Tersedia

Peringatan Tidak Dapat Dikembalikan

WAITING

Tidak ada (tugas sedang dalam antrian)

-

RUNNING

Terminate

Setelah dihentikan, status berubah menjadi ABORTED dan tidak dapat dipulihkan

FINISH

Lihat hasil, Unduh hasil, Hapus

Data dihapus permanen setelah penghapusan

FAILED

Hapus

Data dihapus permanen setelah penghapusan

ABORTED

Hapus

Data dihapus secara permanen setelah penghapusan

Manajemen Dimensi Evaluasi

Di halaman daftar Evaluation > Dimension, Anda dapat mengedit deskripsi dimensi atau menghapus dimensi. Saat menghapus dimensi evaluasi, jika dimensi tersebut telah terikat pada leaderboard, data skor berdasarkan dimensi tersebut di leaderboard akan dihapus. Pastikan tidak ada leaderboard yang menggunakan dimensi tersebut sebelum menghapus.

Manajemen Leaderboard

Di halaman daftar Evaluation > Leaderboard, Anda dapat melakukan operasi berikut:
  • Hapus leaderboard: setelah leaderboard dihapus, data leaderboard akan dihapus permanen, tetapi tugas evaluasi yang telah ditambahkan ke leaderboard tidak terpengaruh.
  • Hapus tugas: di halaman detail leaderboard, Anda dapat menghapus tugas evaluasi dari leaderboard. Penghapusan hanya memengaruhi tampilan leaderboard; tugas evaluasi itu sendiri dan hasilnya tidak akan dihapus.
Operasi berikut tidak dapat dikembalikan; pastikan sebelum mengeksekusi: menghapus tugas evaluasi akan menghapus permanen data tugas dan hasil evaluasi; tugas yang dihentikan tidak dapat dilanjutkan; menghapus dimensi evaluasi juga akan menghapus data skor berdasarkan dimensi tersebut di leaderboard.

Penagihan

Biaya yang dihasilkan oleh Model Evaluation terdiri dari dua bagian: biaya inferensi model yang akan dievaluasi dan biaya penilaian model juri. Memahami aturan penagihan membantu Anda merencanakan skala evaluasi dan mengontrol biaya secara tepat.

Komposisi Biaya

Biaya inferensi model yang akan dievaluasi: ditagih berdasarkan token. Rumusnya adalah biaya = input_tokens x harga_input + output_tokens x harga_output. Di sini, input_tokens mencakup System Prompt dan Prompt setiap entri data, sedangkan output_tokens adalah jawaban yang dihasilkan oleh model. Harga satuan spesifik setiap model mengacu pada Konsol Model Studio. Biaya penilaian model juri: hanya dikenakan saat menggunakan metode penilaian LLM Numerical Scoring atau LLM Classification Scoring. Token yang dikonsumsi oleh model juri untuk menilai setiap entri data ditagih sesuai harga model juri tersebut. Untuk harga spesifik, lihat Konsol Model Studio. Saat menggunakan metode penilaian String Matching atau Text Similarity, proses penilaian tidak melibatkan pemanggilan model juri, sehingga tidak dikenakan biaya penilaian.
Metode penilaian String Matching dan Text Similarity tidak memanggil model juri dan tidak dikenakan biaya penilaian; hanya biaya inferensi model yang akan dievaluasi yang dikenakan. Untuk skenario evaluasi dengan jawaban standar yang jelas, memprioritaskan kedua metode ini dapat secara signifikan mengurangi biaya evaluasi.
Untuk model yang diterapkan secara independen (fine-tuned dan diterapkan online), tidak dikenakan biaya inferensi tambahan selama evaluasi; hanya biaya penerapan yang berlaku. Komposisi biaya masing-masing metode penilaian dirangkum dalam tabel berikut:

Metode Penilaian

Biaya Inferensi Model yang Akan Dievaluasi

Biaya Penilaian Model Juri

Komposisi Biaya

LLM Numerical Scoring

Ditagih berdasarkan token

Ditagih berdasarkan token

Inferensi + Penilaian

LLM Classification Scoring

Ditagih berdasarkan token

Ditagih berdasarkan token

Inferensi + Penilaian

String Matching

Ditagih berdasarkan token

Tidak ada

Hanya Inferensi

Text Similarity

Ditagih berdasarkan token

Tidak ada

Hanya Inferensi

Manual Classification Scoring

Ditagih berdasarkan token

Tidak ada (biaya manual dihitung terpisah)

Inferensi + Manual

Contoh Estimasi Biaya

Contoh berikut menunjukkan proses estimasi biaya untuk menggunakan model qwen-plus dalam evaluasi LLM Numerical Scoring terhadap 100 entri data (harga satuan hanya ilustrasi; lihat tampilan aktual di Konsol):
  • Asumsikan setiap entri data rata-rata memiliki input_tokens = 500 dan output_tokens = 200.
  • Biaya inferensi model yang akan dievaluasi = 100 x (500 x harga_input + 200 x harga_output).
  • Biaya penilaian model juri = 100 x (token yang dikonsumsi per penilaian x harga satuan model juri).
  • Total biaya = Biaya inferensi model yang akan dievaluasi + Biaya penilaian model juri.

Strategi Optimasi Biaya

  • Evaluasi bertahap: pertama gunakan 50–100 entri data untuk validasi skala kecil. Setelah memastikan dimensi evaluasi dan kualitas data sesuai harapan, tingkatkan ke set data penuh untuk evaluasi formal.
  • Prioritaskan evaluasi berbasis aturan: String Matching dan Text Similarity tidak dikenakan biaya model juri dan memiliki biaya terendah. Untuk skenario dengan jawaban standar yang jelas, prioritaskan metode evaluasi berbasis aturan.
  • Simpan set hasil inferensi untuk digunakan kembali: simpan hasil inferensi model sebagai set hasil inferensi. Evaluasi selanjutnya dapat langsung menggunakan hasil yang ada, menghindari biaya pemanggilan model berulang untuk inferensi.

FAQ

Apa yang harus dilakukan jika hasil evaluasi tidak sesuai harapan?

Masalah: setelah tugas evaluasi selesai, skor model menunjukkan penyimpangan signifikan dari pengalaman aktual, atau hasil penilaian tidak masuk akal. Periksa aspek-aspek berikut secara berurutan:
  • Periksa keterwakilan data uji: pastikan set data evaluasi mencakup skenario khas dan kasus tepi bisnis. Data yang terlalu sedikit atau distribusi yang condong akan membuat skor tidak representatif.
  • Tinjau kejelasan Scorer Prompt: pastikan Scorer Prompt menjelaskan kriteria penilaian dan dasar pertimbangan secara jelas. Prompt yang ambigu akan menyebabkan model juri memberikan skor tidak stabil.
  • Sesuaikan rentang penilaian dan ambang batas: rentang penilaian yang terlalu sempit (misalnya 0–2) dapat mengakibatkan diskriminasi skor tidak cukup. Memperlebar rentang secara tepat (misalnya 0–10) dapat meningkatkan presisi penilaian.
  • Ganti model juri: model juri berbeda memiliki kemampuan penilaian berbeda. Qwen-Max (qwen-max) direkomendasikan untuk hasil penilaian yang lebih stabil.

Apa yang harus dilakukan jika skor terlalu terkonsentrasi?

Masalah: skor beberapa entri data terkonsentrasi pada skor atau label kategori yang sama, kurang diskriminatif. Skor yang terlalu terkonsentrasi biasanya disebabkan oleh alasan berikut. Selidiki satu per satu:
  • Perjelas kriteria penilaian: tambahkan kondisi penilaian dan contoh yang jelas untuk setiap tingkat skor dalam Scorer Prompt agar model juri dapat membedakan output dengan tingkat kualitas berbeda.
  • Tingkatkan keragaman data: tambahkan sampel batas dan sampel anomali ke set data evaluasi untuk mencegah semua Prompt terlalu seragam dalam tingkat kesulitan.
  • Ganti model juri: model juri dengan kemampuan penalaran lebih kuat (seperti Qwen-Max) dapat lebih baik mengikuti kriteria penilaian detail halus dalam Scorer Prompt.

Bagaimana menginterpretasikan hasil yang bertentangan di berbagai dimensi evaluasi?

Masalah: model yang sama memiliki perbedaan skor besar di berbagai dimensi evaluasi, dan bahkan mungkin berkinerja sangat baik pada satu dimensi namun buruk pada dimensi lain. Hal ini normal. Dimensi evaluasi berbeda mengevaluasi aspek berbeda dari kemampuan model (seperti akurasi, kelancaran, dan logika). Performa model di berbagai kemampuan memang secara inheren bervariasi. Disarankan untuk membuat keputusan berbobot berdasarkan prioritas bisnis terhadap skor dimensi, bukan menuntut model berkinerja optimal di semua dimensi.

Apa yang harus dilakukan jika model sering menghasilkan konten usang atau tidak relevan?

Masalah: output model tidak relevan dengan jawaban referensi, atau berisi informasi usang, sehingga menghasilkan skor evaluasi rendah. Hal ini biasanya menunjukkan cakupan pengetahuan model tidak mencukupi atau data pelatihan tertinggal. Disarankan untuk mempertimbangkan pengenalan basis pengetahuan guna melengkapi model dengan pengetahuan domain, serta meningkatkan kualitas output model di domain tertentu melalui Retrieval-Augmented Generation (RAG).

Apa saja jebakan umum saat menggunakan evaluasi?

Masalah: saat pertama kali menggunakan Model Evaluation, mudah terjadi kebingungan konsep atau kesalahan operasi, sehingga menghasilkan evaluasi abnormal. Berikut adalah jebakan umum dan praktik yang benar:
  • System Prompt tidak sama dengan Scorer Prompt: System Prompt dikonfigurasi dalam tugas evaluasi dan dikirim ke model yang akan dievaluasi; Scorer Prompt dikonfigurasi dalam dimensi evaluasi dan dikirim ke model juri (lihat Buat Tugas Evaluasi untuk detailnya). Keduanya menarget objek berbeda; jangan tertukar.
  • Label kategori seperti Pass/Fail tidak boleh tumpang tindih: dalam dimensi yang menggunakan LLM Classification Scoring atau Manual Classification Scoring, label lulus dan tidak-lulus harus saling eksklusif. Label yang sama tidak boleh termasuk dalam kedua kelompok sekaligus.
  • Tidak ada biaya tambahan untuk model yang diterapkan secara independen: model yang telah fine-tuned dan diterapkan online tidak dikenakan biaya inferensi tambahan selama evaluasi (lihat Penagihan untuk detailnya).
  • Batasan jenis set data: tugas evaluasi hanya mendukung set data jenis Evaluation Set. Jika memilih set data jenis training set, sistem akan menolak pembuatan tugas evaluasi.
Rencana Token (Team Edition)
Model playground
  • Pembuatan audio
  • Pembuatan musik
Statistik dan Pemantauan
Asset Center
Dukungan layanan