Skip to main content
Penyetelan model Qwen

Pengenalan fine-tuning model

Anda dapat menggunakan fine-tuning model di Alibaba Cloud Model Studio jika performa model tidak memenuhi ekspektasi Anda setelah mencoba metode optimasi seperti rekayasa prompt dan pemanggilan plugin. Sebagai strategi inti untuk meningkatkan performa model, fine-tuning dapat secara signifikan meningkatkan kemampuan model dalam industri atau skenario bisnis tertentu, menyelaraskan outputnya dengan preferensi manusia, serta mengurangi latensi output. Fine-tuning mencakup tiga metode pelatihan: supervised fine-tuning (SFT), continual pre-training (CPT), dan direct preference optimization (DPO).

Pengenalan fine-tuning model

Fine-tuning model merupakan metode penting untuk mengoptimalkan performa model. Metode ini dapat:
  • Meningkatkan performa model dalam industri tertentu atau untuk kebutuhan bisnis spesifik
  • Mengurangi latensi output model
  • Menekan halusinasi model
  • Menyelaraskan model dengan nilai atau preferensi manusia
  • Menggantikan model yang lebih besar dengan model ringan hasil fine-tuning
Selama proses fine-tuning, model mempelajari fitur-fitur spesifik bisnis atau skenario dari data pelatihan, seperti pengetahuan, nada, gaya ekspresi, dan kesadaran diri. Karena model telah mempelajari banyak contoh untuk industri atau skenario tertentu selama pelatihan, performa prompt one-shot atau zero-shot setelah pelatihan lebih baik daripada performa few-shot sebelum pelatihan. Hal ini menghemat token input dan mengurangi latensi output model.

Proses fine-tuning model

Untuk informasi lebih lanjut, lihat:

Model yang didukung

  • Singapura
  • North China 2 (Beijing)
  • Generasi teks
  • Pemahaman visual (Qwen-VL)

Nama model

Kode model

Pelatihan parameter penuh SFT (sft)

Pelatihan efisien SFT (efficient_sft)

Qwen3-14B

qwen3-14b

×

Supported

Perbandingan metode fine-tuning

Fitur

CPT (Continual Pre-training)

SFT (Supervised Fine-tuning)

DPO (Direct Preference Optimization)

Rangkuman

Menambahkan pengetahuan (Menyuntikkan pengetahuan domain)

Belajar melakukan tugas (Mengikuti instruksi)

Menjalankan tugas lebih baik (Menyelaraskan dengan preferensi manusia)

Data input

Lebih dari 10 juta token

Teks domain tanpa label

Lebih dari 1.000 entri

Pasangan "pertanyaan-jawaban" berkualitas tinggi

Lebih dari 100 set

Pasangan respons "lebih baik-lebih buruk" untuk instruksi yang sama

Tujuan utama

Adaptasi domain. Mempelajari kosakata dan fakta khusus.

Mengajarkan format percakapan dan kemampuan menjalankan tugas kepada model.

Menyelaraskan output model lebih baik dengan nilai dan preferensi manusia.

Metode pembelajaran

Pembelajaran self-supervised (Memprediksi kata berikutnya)

Supervised learning (Meniru ground truth)

Pembelajaran preferensi langsung (Meningkatkan probabilitas respons baik dan menurunkan probabilitas respons buruk)

Tahap model

Umumnya sebelum SFT

Setelah CPT dan sebelum DPO

Umumnya setelah SFT, sebagai langkah terakhir untuk penyelarasan.

Perbandingan pola pelatihan

Pelatihan parameter penuh

Pelatihan efisien (LoRA, direkomendasikan)

Skenario

• Model perlu mendapatkan kemampuan baru

• Mencapai performa global optimal.

• Mengoptimalkan performa model untuk skenario tertentu.

• Untuk skenario yang sensitif terhadap biaya dan waktu.

Waktu pelatihan

Lebih lama, dengan konvergensi lebih lambat.

Lebih singkat, dengan konvergensi lebih cepat.

Penagihan

Metode penagihanPay-as-you-go berdasarkan jumlah data pelatihan
Rumus penagihanBiaya pelatihan model = (Total token dalam data pelatihan + Total token dalam data pelatihan campuran) × Jumlah epoch × Harga satuan pelatihan (Unit penagihan minimum: 1 token)
Anda dapat melihat perkiraan biaya pelatihan di bagian bawah Konsol Fine-tuning Model dan klik Billing Details untuk melihat total jumlah token pelatihan, jumlah epoch, dan harga satuan pelatihan.

Harga satuan pelatihan

Tabel berikut mencantumkan harga satuan pelatihan untuk model yang telah dibuat sebelumnya. Harga satuan pelatihan untuk model kustom sama dengan harga model yang telah dibuat sebelumnya yang sesuai.
  • Singapura
  • China Utara 2 (Beijing)
  • Qwen
  • Qwen-VL

Layanan model

Kode model

Harga

Qwen3-14B

qwen3-14b

$0,0016/1.000 token

Sebelum Anda melakukan fine-tuning model

  • Meskipun fine-tuning model generasi teks dapat menghasilkan kinerja luar biasa dalam skenario bisnis tertentu, pendekatan ini memiliki keterbatasan berikut:
    • Memakan waktu: Ini mencakup pembuatan set data CPT berskala besar (minimal 50 juta token), penyusunan set data SFT yang efektif (lebih dari 1.000 entri), pengumpulan cukup banyak kasus buruk (lebih dari 100) untuk membangun set data DPO yang efektif, serta kecepatan iterasi optimasi model yang lambat.
    • Biaya tinggi: Model yang telah melalui fine-tuning hanya dapat digunakan setelah diterapkan, dan penagihan penerapan model cukup tinggi.
  • Alibaba Cloud Model Studio merekomendasikan agar Anda terlebih dahulu mencoba menggunakan Prompt Engineering atau Function Calling untuk menyesuaikan aplikasi Anda. Fine-tuning model biasanya merupakan "pilihan terakhir" untuk meningkatkan kinerja model. Hal ini disebabkan oleh:
    1. Pada banyak tugas, model mungkin awalnya memberikan kinerja yang buruk, tetapi penerapan teknik prompt yang tepat dapat meningkatkan hasil tanpa perlu melakukan fine-tuning model.
    2. Optimasi prompt dan plugin secara iteratif lebih lincah dan hemat biaya dibandingkan iterasi fine-tuning model, karena fine-tuning mungkin memerlukan pengumpulan ulang, pembersihan, dan optimasi data, pengumpulan kasus buruk, serta survei pelanggan.
    3. Bahkan jika Anda akhirnya memutuskan untuk melakukan fine-tuning model, pekerjaan awal pada rekayasa prompt dan optimasi plugin tidak akan sia-sia. Pekerjaan awal ini dapat sepenuhnya digunakan kembali saat membangun set data fine-tuning.

Mulai

Fine-tune model menggunakan Konsol

Langkah-langkah fine-tuning

Tangkapan layar Konsol

Langkah 1: Di halaman Model Fine-tuning, klik Create Training Task.

Di halaman Create Training Task, lengkapi konfigurasi berikut:

  1. Atur jenis pelatihan ke SFT Fine-tuning Training.

  2. Pilih Qwen3-8B sebagai model.

  3. Atur metode pelatihan ke Efficient Training.

  4. Dalam konfigurasi hiperparameter, atur batch_size ke 16 (rentang: [8, 1024], langkah: 8).

  5. Di panel Training Task Summary di sebelah kanan, pastikan metode penagihan adalah penagihan berbasis token dan 10% dari set pelatihan secara otomatis dipisahkan sebagai set validasi, lalu klik Start Training.

Langkah 2: Konfigurasi pelatihan

  • Training Method: Supervised Fine-tuning (SFT)

  • Select Model: Qwen3-8B

  • Training Method: Efficient Training

  • Configure Parameters: Anda dapat mempertahankan pengaturan default karena Model Studio menyediakan konfigurasi yang direkomendasikan untuk hiperparameter fine-tuning.

Kombinasi ini memiliki waktu pelatihan singkat dan kebutuhan data rendah.

Langkah 3: Konfigurasi data

  • Training Set: Pilih set data fine-tuning yang telah diunggah untuk membangun model.

    Contoh data: SFT-ChatML_format_example.jsonl.

  • Mixed Training: Dinonaktifkan

  • Validation Set: Saat diatur ke Automatic Splitting, 10% data digunakan sebagai set validasi.

Langkah 4: Konfigurasi parameter penyimpanan snapshot parameter model (checkpoint)

  • Untuk Model Name, pertahankan nama default.

  • Maximum Export Count: Pertahankan nilai default.

  • Checkpoint save interval: Pertahankan nilai default.

Setelah fine-tuning model selesai, Anda dapat mengekspor snapshot parameter di platform Model Studio. Anda kemudian dapat menerapkan model di Model Studio berdasarkan snapshot parameter tersebut.

Snapshot parameter yang diekspor disimpan di Cloud Storage dan tidak dapat diakses atau diunduh.

Langkah 5: Klik "Start Training" dan tunggu hingga pelatihan model selesai.

Langkah 6: Gunakan fitur Deployments Alibaba Cloud Model Studio untuk menerapkan model kustom yang telah dilatih. Setelah penerapan, Anda dapat mengevaluasi model hasil fine-tuning. Untuk informasi lebih lanjut, lihat Model deployment.

Proses fine-tuning khas

Ketiga metode fine-tuning yang disediakan oleh Model Studio tidak saling eksklusif, melainkan progresif dan saling melengkapi. CPT (opsional) → SFT → DPO (opsional)
  1. CPT (continual pre-training) – Melengkapi pengetahuan (Model umum memiliki pengetahuan luas tetapi dangkal, yang mungkin tidak memenuhi persyaratan kedalaman dan presisi di bidang profesional)
    • Model keuangan: Mempelajari Istilah Keuangan
    • Model medis: Mengingat patologi obat
    • Model hukum: Memahami artikel hukum dan yurisprudensi
  2. SFT (supervised fine-tuning) – Mempelajari cara melakukan task
    • Bot layanan pelanggan: Mempelajari prosedur layanan pelanggan
    • Asisten Kode: Mempelajari paradigma pemrograman
    • Pemanggilan alat (Agent): Learns to use MCP
  3. DPO (direct preference optimization) – Melakukan task dengan lebih baik
    • Keamanan dan tanggung jawab: Menolak saran berbahaya
    • Keringkasan dan efektivitas: Memberikan jawaban yang ringkas
    • Objektivitas dan netralitas: Mengevaluasi secara adil dan objektif

Format data fine-tuning

  • Set pelatihan SFT
Data pelatihan dalam format SFT ChatML (Chat Markup Language) mendukung percakapan multi-putaran dan berbagai pengaturan role.
Parameter name dan weight dari OpenAI tidak didukung. Semua output assistant akan dilatih.
# Satu baris data pelatihan (dalam format JSON) memiliki struktur khas berikut saat diperluas:
{"messages": [
  {"role": "system", "content": "System input 1"},
  {"role": "user", "content": "User input 1"},
  {"role": "assistant", "content": "Expected model output 1"},
  {"role": "user", "content": "User input 2"},
  {"role": "assistant", "content": "Expected model output 2"}
  ...
]}
Untuk informasi mengenai perbedaan antara system, user, dan assistant, lihat Ikhtisar. Contoh set data pelatihan: SFT-ChatML_format_example.jsonl, SFT-ChatML_format_example.xlsx. Format XLS dan XLSX hanya mendukung percakapan satu putaran.Semua baris assistant dalam satu entri data pelatihan mendukung parameter "loss_weight", yang mengatur tingkat kepentingan relatif baris tersebut selama pelatihan. (Rentang: 0.0 hingga 1.0. Nilai yang lebih besar menunjukkan kepentingan yang lebih tinggi.)
Parameter ini tersedia untuk pratinjau undangan. Untuk menggunakannya, hubungi account manager Anda.
 {"role": "assistant", "content": "Expected model output 1", "loss_weight": 1.0},
 {"role": "assistant", "content": "Expected model output 2", "loss_weight": 0.5}

Tips pembuatan dataset

Persyaratan ukuran dataset

Untuk CPT, dataset memerlukan setidaknya 50 juta token data pre-training berkualitas tinggi. Untuk SFT, dataset memerlukan setidaknya 1.000 entri data fine-tuning berkualitas tinggi. Untuk DPO, dataset umumnya memerlukan ratusan entri data preferensi manusia. Jika hasil evaluasi model setelah fine-tuning data tidak memuaskan, cara paling sederhana untuk meningkatkannya adalah mengumpulkan lebih banyak data untuk pelatihan. Jika Anda kekurangan data, kami menyarankan untuk membuat aplikasi agen dan menggunakan indeks basis pengetahuan untuk meningkatkan kemampuan model. Dalam banyak skenario bisnis kompleks, Anda juga dapat menggabungkan fine-tuning model dan pengambilan dari basis pengetahuan. Misalnya, dalam skenario layanan pelanggan, Anda dapat menggunakan fine-tuning model untuk mengatasi masalah terkait nada bicara, gaya ekspresi, dan kesadaran diri agen layanan pelanggan. Pengetahuan profesional yang terkait dengan skenario tersebut dapat dimasukkan secara dinamis ke dalam konteks model melalui basis pengetahuan. Alibaba Cloud Model Studio merekomendasikan agar Anda terlebih dahulu membangun dan menguji aplikasi Generasi yang Diperkaya dengan Pengambilan Data (RAG). Setelah mengumpulkan cukup data aplikasi, Anda kemudian dapat menggunakan fine-tuning model untuk lebih meningkatkan kinerja model. Anda juga dapat menggunakan strategi berikut untuk memperluas dataset Anda:
  1. Gunakan model bahasa besar (LLM) untuk mensimulasikan pembuatan konten untuk skenario bisnis tertentu guna membantu Anda menghasilkan lebih banyak data untuk fine-tuning. (Kami menyarankan memilih model yang lebih besar dan berkinerja tinggi untuk proses generasi.)
  2. Dapatkan lebih banyak data melalui berbagai metode, seperti pengumpulan dari skenario aplikasi, web scraping, media sosial dan forum daring, dataset publik, mitra serta sumber daya industri, dan kontribusi pengguna.

Keragaman dan keseimbangan data

Persyaratan untuk fine-tuning model bervariasi tergantung skenario. Misalnya, profesionalisme sangat penting untuk skenario bisnis tertentu, sedangkan fleksibilitas lebih penting untuk skenario tanya jawab. Anda perlu merancang kasus penggunaan data berdasarkan modul bisnis atau skenario penggunaan yang menjadi tanggung jawab model. Oleh karena itu, efektivitas pelatihan bergantung bukan hanya pada volume data, tetapi juga pada profesionalisme dan keragaman data untuk skenario spesifik tersebut. Misalnya, dalam skenario percakapan AI cerdas, dataset profesional dan beragam sebaiknya mencakup skenario bisnis berikut:

Bisnis spesifik

Skenario/bisnis beragam

E-dagang layanan pelanggan

Dorongan promosi, konsultasi pra-penjualan, panduan saat penjualan, layanan purna jual, tindak lanjut purna jual, penanganan keluhan, dll.

Layanan keuangan

Konsultasi pinjaman, saran investasi dan manajemen kekayaan, layanan kartu kredit, manajemen rekening bank, dll.

Layanan kesehatan daring

Konsultasi gejala, pendaftaran janji temu, petunjuk kunjungan, pertanyaan informasi obat, tips kesehatan, dll.

Sekretaris AI

Informasi IT, informasi administratif, informasi SDM, pertanyaan tunjangan karyawan, kueri kalender perusahaan, dll.

Asisten perjalanan

Perencanaan perjalanan, panduan masuk dan keluar, konsultasi asuransi perjalanan, pengenalan adat dan budaya destinasi, dll.

Penasihat hukum perusahaan

Tinjauan kontrak, perlindungan kekayaan intelektual, pemeriksaan kepatuhan, tanya jawab hukum ketenagakerjaan, konsultasi transaksi lintas batas, analisis hukum kasus individual, dll.

Perlu juga diperhatikan bahwa jumlah data untuk setiap skenario/bisnis harus relatif seimbang, dan proporsi datanya harus sesuai dengan proporsi skenario aktual. Hal ini mencegah terlalu banyak data dari satu jenis, yang dapat menyebabkan model cenderung mempelajari fitur-fitur tersebut dan mengganggu kemampuan generalisasinya.

Pemisahan set pelatihan dan set validasi

Anda dapat melakukan fine-tuning model di Konsol.
  • Secara otomatis membagi dataset pelatihan lengkap dan mengambil sampel acak sejumlah kecil data untuk membentuk set validasi.
  • Memilih untuk mengunggah dataset terpisah.
Konsol menampilkan loss set validasi dan akurasi token secara real time selama pelatihan. Halaman Data Configuration juga mencakup toggle Mixed Training (nonaktif secara default). Saat Auto Split dipilih, 10% dari set pelatihan secara default dibagi secara acak sebagai set validasi.

FAQ

Apakah saya dapat melakukan fine-tuning model saya sendiri?

Model Studio tidak mendukung fine-tuning, mengunggah model Anda sendiri, atau mengekspor model yang telah diunduh.
Rencana Token (Team Edition)
Model playground
  • Pembuatan audio
  • Pembuatan musik
Statistik dan Pemantauan
Asset Center
Dukungan layanan