Anda dapat menggunakan fine-tuning model di Alibaba Cloud Model Studio jika performa model tidak memenuhi ekspektasi Anda setelah mencoba metode optimasi seperti rekayasa prompt dan pemanggilan plugin. Sebagai strategi inti untuk meningkatkan performa model, fine-tuning dapat secara signifikan meningkatkan kemampuan model dalam industri atau skenario bisnis tertentu, menyelaraskan outputnya dengan preferensi manusia, serta mengurangi latensi output. Fine-tuning mencakup tiga metode pelatihan: supervised fine-tuning (SFT), continual pre-training (CPT), dan direct preference optimization (DPO).
Pengenalan fine-tuning model
Fine-tuning model merupakan metode penting untuk mengoptimalkan performa model. Metode ini dapat:
- Meningkatkan performa model dalam industri tertentu atau untuk kebutuhan bisnis spesifik
- Mengurangi latensi output model
- Menekan halusinasi model
- Menyelaraskan model dengan nilai atau preferensi manusia
- Menggantikan model yang lebih besar dengan model ringan hasil fine-tuning
Proses fine-tuning model
Untuk informasi lebih lanjut, lihat:
Model yang didukung
Model yang didukung
Model yang didukung
- Singapura
- North China 2 (Beijing)
- Generasi teks
- Pemahaman visual (Qwen-VL)
Nama model | Kode model | Pelatihan parameter penuh SFT (sft) | Pelatihan efisien SFT (efficient_sft) |
|---|---|---|---|
Qwen3-14B | qwen3-14b | × | Supported |
Perbandingan metode fine-tuning
Fitur | CPT (Continual Pre-training) | SFT (Supervised Fine-tuning) | DPO (Direct Preference Optimization) |
|---|---|---|---|
Rangkuman | Menambahkan pengetahuan (Menyuntikkan pengetahuan domain) | Belajar melakukan tugas (Mengikuti instruksi) | Menjalankan tugas lebih baik (Menyelaraskan dengan preferensi manusia) |
Data input | Lebih dari 10 juta token Teks domain tanpa label | Lebih dari 1.000 entri Pasangan "pertanyaan-jawaban" berkualitas tinggi | Lebih dari 100 set Pasangan respons "lebih baik-lebih buruk" untuk instruksi yang sama |
Tujuan utama | Adaptasi domain. Mempelajari kosakata dan fakta khusus. | Mengajarkan format percakapan dan kemampuan menjalankan tugas kepada model. | Menyelaraskan output model lebih baik dengan nilai dan preferensi manusia. |
Metode pembelajaran | Pembelajaran self-supervised (Memprediksi kata berikutnya) | Supervised learning (Meniru ground truth) | Pembelajaran preferensi langsung (Meningkatkan probabilitas respons baik dan menurunkan probabilitas respons buruk) |
Tahap model | Umumnya sebelum SFT | Setelah CPT dan sebelum DPO | Umumnya setelah SFT, sebagai langkah terakhir untuk penyelarasan. |
Perbandingan pola pelatihan
Pelatihan parameter penuh | Pelatihan efisien (LoRA, direkomendasikan) | |
|---|---|---|
Skenario | • Model perlu mendapatkan kemampuan baru • Mencapai performa global optimal. | • Mengoptimalkan performa model untuk skenario tertentu. • Untuk skenario yang sensitif terhadap biaya dan waktu. |
Waktu pelatihan | Lebih lama, dengan konvergensi lebih lambat. | Lebih singkat, dengan konvergensi lebih cepat. |
Penagihan
| Metode penagihan | Pay-as-you-go berdasarkan jumlah data pelatihan |
| Rumus penagihan | Biaya pelatihan model = (Total token dalam data pelatihan + Total token dalam data pelatihan campuran) × Jumlah epoch × Harga satuan pelatihan (Unit penagihan minimum: 1 token)Anda dapat melihat perkiraan biaya pelatihan di bagian bawah Konsol Fine-tuning Model dan klik Billing Details untuk melihat total jumlah token pelatihan, jumlah epoch, dan harga satuan pelatihan. |
Harga satuan pelatihan
Harga satuan pelatihan
- Singapura
- China Utara 2 (Beijing)
- Qwen
- Qwen-VL
Layanan model | Kode model | Harga |
|---|---|---|
Qwen3-14B | qwen3-14b | $0,0016/1.000 token |
Sebelum Anda melakukan fine-tuning model
-
Meskipun fine-tuning model generasi teks dapat menghasilkan kinerja luar biasa dalam skenario bisnis tertentu, pendekatan ini memiliki keterbatasan berikut:
- Memakan waktu: Ini mencakup pembuatan set data CPT berskala besar (minimal 50 juta token), penyusunan set data SFT yang efektif (lebih dari 1.000 entri), pengumpulan cukup banyak kasus buruk (lebih dari 100) untuk membangun set data DPO yang efektif, serta kecepatan iterasi optimasi model yang lambat.
- Biaya tinggi: Model yang telah melalui fine-tuning hanya dapat digunakan setelah diterapkan, dan penagihan penerapan model cukup tinggi.
-
Alibaba Cloud Model Studio merekomendasikan agar Anda terlebih dahulu mencoba menggunakan Prompt Engineering atau Function Calling untuk menyesuaikan aplikasi Anda. Fine-tuning model biasanya merupakan "pilihan terakhir" untuk meningkatkan kinerja model. Hal ini disebabkan oleh:
- Pada banyak tugas, model mungkin awalnya memberikan kinerja yang buruk, tetapi penerapan teknik prompt yang tepat dapat meningkatkan hasil tanpa perlu melakukan fine-tuning model.
- Optimasi prompt dan plugin secara iteratif lebih lincah dan hemat biaya dibandingkan iterasi fine-tuning model, karena fine-tuning mungkin memerlukan pengumpulan ulang, pembersihan, dan optimasi data, pengumpulan kasus buruk, serta survei pelanggan.
- Bahkan jika Anda akhirnya memutuskan untuk melakukan fine-tuning model, pekerjaan awal pada rekayasa prompt dan optimasi plugin tidak akan sia-sia. Pekerjaan awal ini dapat sepenuhnya digunakan kembali saat membangun set data fine-tuning.
Mulai
Fine-tune model menggunakan Konsol
Langkah-langkah fine-tuning | Tangkapan layar Konsol |
|---|---|
Langkah 1: Di halaman Model Fine-tuning, klik Create Training Task. | Di halaman Create Training Task, lengkapi konfigurasi berikut:
|
Langkah 2: Konfigurasi pelatihan
Kombinasi ini memiliki waktu pelatihan singkat dan kebutuhan data rendah. | |
Langkah 3: Konfigurasi data
| |
Langkah 4: Konfigurasi parameter penyimpanan snapshot parameter model (checkpoint)
Setelah fine-tuning model selesai, Anda dapat mengekspor snapshot parameter di platform Model Studio. Anda kemudian dapat menerapkan model di Model Studio berdasarkan snapshot parameter tersebut. Snapshot parameter yang diekspor disimpan di Cloud Storage dan tidak dapat diakses atau diunduh. | |
Langkah 5: Klik "Start Training" dan tunggu hingga pelatihan model selesai. | |
Langkah 6: Gunakan fitur Deployments Alibaba Cloud Model Studio untuk menerapkan model kustom yang telah dilatih. Setelah penerapan, Anda dapat mengevaluasi model hasil fine-tuning. Untuk informasi lebih lanjut, lihat Model deployment. | |
Proses fine-tuning khas
Ketiga metode fine-tuning yang disediakan oleh Model Studio tidak saling eksklusif, melainkan progresif dan saling melengkapi.
CPT (opsional) → SFT → DPO (opsional)
-
CPT (continual pre-training) – Melengkapi pengetahuan (Model umum memiliki pengetahuan luas tetapi dangkal, yang mungkin tidak memenuhi persyaratan kedalaman dan presisi di bidang profesional)
- Model keuangan:
Mempelajari Istilah Keuangan - Model medis:
Mengingat patologi obat - Model hukum:
Memahami artikel hukum dan yurisprudensi
- Model keuangan:
-
SFT (supervised fine-tuning) – Mempelajari cara melakukan task
- Bot layanan pelanggan:
Mempelajari prosedur layanan pelanggan - Asisten Kode:
Mempelajari paradigma pemrograman - Pemanggilan alat (Agent):
Learns to use MCP
- Bot layanan pelanggan:
-
DPO (direct preference optimization) – Melakukan task dengan lebih baik
- Keamanan dan tanggung jawab:
Menolak saran berbahaya - Keringkasan dan efektivitas:
Memberikan jawaban yang ringkas - Objektivitas dan netralitas:
Mengevaluasi secara adil dan objektif
- Keamanan dan tanggung jawab:
Format data fine-tuning
- Set pelatihan SFT
Parameternamedanweightdari OpenAI tidak didukung. Semua output assistant akan dilatih.
"loss_weight", yang mengatur tingkat kepentingan relatif baris tersebut selama pelatihan. (Rentang: 0.0 hingga 1.0. Nilai yang lebih besar menunjukkan kepentingan yang lebih tinggi.)Parameter ini tersedia untuk pratinjau undangan. Untuk menggunakannya, hubungi account manager Anda.
Tips pembuatan dataset
Persyaratan ukuran dataset
Untuk CPT, dataset memerlukan setidaknya 50 juta token data pre-training berkualitas tinggi. Untuk SFT, dataset memerlukan setidaknya 1.000 entri data fine-tuning berkualitas tinggi. Untuk DPO, dataset umumnya memerlukan ratusan entri data preferensi manusia. Jika hasil evaluasi model setelah fine-tuning data tidak memuaskan, cara paling sederhana untuk meningkatkannya adalah mengumpulkan lebih banyak data untuk pelatihan.
Jika Anda kekurangan data, kami menyarankan untuk membuat aplikasi agen dan menggunakan indeks basis pengetahuan untuk meningkatkan kemampuan model. Dalam banyak skenario bisnis kompleks, Anda juga dapat menggabungkan fine-tuning model dan pengambilan dari basis pengetahuan.
Misalnya, dalam skenario layanan pelanggan, Anda dapat menggunakan fine-tuning model untuk mengatasi masalah terkait nada bicara, gaya ekspresi, dan kesadaran diri agen layanan pelanggan. Pengetahuan profesional yang terkait dengan skenario tersebut dapat dimasukkan secara dinamis ke dalam konteks model melalui basis pengetahuan.
Alibaba Cloud Model Studio merekomendasikan agar Anda terlebih dahulu membangun dan menguji aplikasi Generasi yang Diperkaya dengan Pengambilan Data (RAG). Setelah mengumpulkan cukup data aplikasi, Anda kemudian dapat menggunakan fine-tuning model untuk lebih meningkatkan kinerja model.
Anda juga dapat menggunakan strategi berikut untuk memperluas dataset Anda:
- Gunakan model bahasa besar (LLM) untuk mensimulasikan pembuatan konten untuk skenario bisnis tertentu guna membantu Anda menghasilkan lebih banyak data untuk fine-tuning. (Kami menyarankan memilih model yang lebih besar dan berkinerja tinggi untuk proses generasi.)
- Dapatkan lebih banyak data melalui berbagai metode, seperti pengumpulan dari skenario aplikasi, web scraping, media sosial dan forum daring, dataset publik, mitra serta sumber daya industri, dan kontribusi pengguna.
Keragaman dan keseimbangan data
Persyaratan untuk fine-tuning model bervariasi tergantung skenario. Misalnya, profesionalisme sangat penting untuk skenario bisnis tertentu, sedangkan fleksibilitas lebih penting untuk skenario tanya jawab. Anda perlu merancang kasus penggunaan data berdasarkan modul bisnis atau skenario penggunaan yang menjadi tanggung jawab model. Oleh karena itu, efektivitas pelatihan bergantung bukan hanya pada volume data, tetapi juga pada profesionalisme dan keragaman data untuk skenario spesifik tersebut.
Misalnya, dalam skenario percakapan AI cerdas, dataset profesional dan beragam sebaiknya mencakup skenario bisnis berikut:
Bisnis spesifik | Skenario/bisnis beragam |
|---|---|
E-dagang layanan pelanggan | Dorongan promosi, konsultasi pra-penjualan, panduan saat penjualan, layanan purna jual, tindak lanjut purna jual, penanganan keluhan, dll. |
Layanan keuangan | Konsultasi pinjaman, saran investasi dan manajemen kekayaan, layanan kartu kredit, manajemen rekening bank, dll. |
Layanan kesehatan daring | Konsultasi gejala, pendaftaran janji temu, petunjuk kunjungan, pertanyaan informasi obat, tips kesehatan, dll. |
Sekretaris AI | Informasi IT, informasi administratif, informasi SDM, pertanyaan tunjangan karyawan, kueri kalender perusahaan, dll. |
Asisten perjalanan | Perencanaan perjalanan, panduan masuk dan keluar, konsultasi asuransi perjalanan, pengenalan adat dan budaya destinasi, dll. |
Penasihat hukum perusahaan | Tinjauan kontrak, perlindungan kekayaan intelektual, pemeriksaan kepatuhan, tanya jawab hukum ketenagakerjaan, konsultasi transaksi lintas batas, analisis hukum kasus individual, dll. |
Pemisahan set pelatihan dan set validasi
Anda dapat melakukan fine-tuning model di Konsol.
- Secara otomatis membagi dataset pelatihan lengkap dan mengambil sampel acak sejumlah kecil data untuk membentuk set validasi.
- Memilih untuk mengunggah dataset terpisah.