Menjelaskan spesifikasi format, persyaratan pengemasan, batas ukuran dan jumlah, serta kuota unggah API untuk data fine-tuning model generasi teks, membantu pengguna menyusun dan mengunggah data pelatihan SFT/DPO/CPT yang sesuai berdasarkan metode pelatihan.
Ikhtisar
Dokumen ini menjelaskan spesifikasi format, persyaratan pengemasan, batas ukuran dan jumlah, serta kuota unggah API untuk data fine-tuning model generasi teks. Cakupannya meliputi fine-tuning model generasi teks (teks/gambar/video → teks), termasuk SFT/DPO/CPT teks biasa, pemahaman gambar dan video Qwen VL, ekstraksi frame video, pemanggilan fungsi, dan pemikiran mendalam. Fine-tuning model generasi video (gambar → video) berada di luar cakupan.
Jenis set data (set pelatihan atau set evaluasi) tidak dapat diubah setelah pembuatan. Dukungan untuk masing-masing metode pelatihan dan elemen dijelaskan secara rinci dalam Matriks dukungan metode dan elemen pelatihan. Aturan penyusunan format untuk setiap kombinasi dijelaskan pada bab-bab terkait di bawah ini.
Operasi manajemen (parameter pembuatan, manajemen versi, aturan manajemen set evaluasi, pemilihan metode impor, pembersihan data, keamanan dan kepatuhan) dibahas dalam dokumen terkait; lihat Set pelatihan dan set evaluasi, Pengantar fine-tuning model, dll. Kami menyarankan mengunduh templat data untuk skenario yang sesuai pada halaman pembuatan set data dan menyiapkan data sesuai struktur templat guna menghindari kegagalan impor.
Untuk rekomendasi penyusunan set data (skala data yang direkomendasikan, diversitas dan keseimbangan, strategi augmentasi data), lihat Pengantar fine-tuning model – Tips penyusunan set data.
Matriks dukungan metode dan elemen pelatihan
Set pelatihan mendukung tiga metode pelatihan: SFT, DPO, dan CPT. Status dukungan masing-masing metode pelatihan dan elemen ditampilkan dalam tabel matriks di bawah ini. Urutan fine-tuning yang direkomendasikan adalah CPT (opsional) → SFT → DPO (opsional); ketiganya bersifat progresif, bukan saling eksklusif.
Ketersediaan wilayah:
- SFT, unggah lokal, backflow log, unggah API, dan format data multimodal didukung di semua wilayah.
- DPO, CPT, impor OSS, dan mount penyimpanan cloud hanya didukung di wilayah Beijing.
Metode pelatihan | Generasi teks | Pemahaman visual – Input gambar | Pemahaman visual – Input video (qwen3.5+) | Pemahaman visual – Pemanggilan alat (qwen3.5+) | Pemikiran mendalam |
|---|---|---|---|---|---|
✓ | ✓ | ✓ | ✓ | ✓ | |
✓ | ✗ | ✗ | ✗ | ✓ | |
✓ | ✗ | ✗ | ✗ | ✗ | |
✓ | ✗ | ✗ | ✗ | ✗ |
Generasi teks – Format SFT
Data pelatihan generasi teks SFT menggunakan format file jsonl, berdasarkan struktur multi-turn ChatML messages.
- Mendukung tiga role: system, user, dan assistant. Bidang content berupa string (untuk struktur array content dalam skenario multimodal, lihat bab format multimodal terkait).
- Ukuran maksimum satu file adalah 200 MB.
- Sebuah set data dapat mencampur baris dengan format berbeda — setiap record memilih formatnya sendiri secara independen, tidak perlu diseragamkan menjadi satu format.
- Format yang tersedia: ChatML standar, pemikiran mendalam, pemanggilan fungsi, dan kombinasi pemanggilan fungsi dengan pemikiran mendalam (lihat contoh pada tab di bawah).
- ChatML Standar
- Pemikiran Mendalam
- Pemanggilan Fungsi
(0.0, 1.0]; semakin besar nilainya, semakin tinggi tingkat kepentingan pelatihannya.Didukung secara default oleh Qwen3.5+; untuk model lain, hubungi account manager Anda jika diperlukan dukungan.
Aturan tag thinking
Konten pemikiran mendalam dibungkus dalam tag <think>\n…\n</think>\n\n, ditempatkan di dalam teks output assistant (berbagi konten assistant terakhir yang sama dengan balasan akhir). Aturan:
- Hanya boleh ditempatkan pada output assistant terakhir; output assistant antara tidak boleh menyertakan tag thinking.
- Jeda baris sebelum dan sesudah tag thinking harus dipertahankan.
- Jika sampel pelatihan dikonfigurasi agar model tidak menghasilkan tag thinking, tidak disarankan mengaktifkan kembali mode pemikiran mendalam saat memanggil model setelah pelatihan.
Format set evaluasi
Set evaluasi hanya berlaku untuk skenario generasi teks dan bersifat independen dari metode pelatihan SFT/DPO/CPT — model yang dilatih dengan DPO/CPT juga menggunakan set evaluasi generasi teks untuk evaluasi, tanpa pembedaan berdasarkan metode pelatihan.
Spesifikasi set evaluasi:
- Format file adalah xlsx; struktur kolom dapat ditemukan pada templat yang diunduh dari Konsol.
- Metode ingest: unggah lokal dan replay log; impor Object Storage Service (OSS) dan mount penyimpanan cloud tidak didukung.
- Hanya versi draft yang mendukung pengeditan daring (Prompt/Completion); versi yang telah dipublikasikan tidak dapat diedit.
- Rentang log yang didukung adalah dalam 30 hari terakhir.
- Maksimal 100.000 record per impor.
- Anda harus mengotorisasi peran terkait layanan dan menentukan API Key serta kondisi filter model.
- Set pelatihan hanya tersedia untuk skenario generasi teks SFT (set evaluasi generasi teks juga didukung).
Generasi teks – Format DPO
Data pelatihan generasi teks DPO menggunakan format jsonl. Berdasarkan struktur multi-turn ChatML messages, data ini juga berisi dua output assistant kontras, chosen dan rejected, untuk pelatihan penyelarasan preferensi. Seluruh konten dalam messages digunakan sebagai input, dan DPO digunakan untuk melatih umpan balik positif/negatif model terhadap input user terakhir. Untuk aturan struktur multi-turn messages, lihat Generasi teks – Format SFT.
Untuk konten pemikiran mendalam, output assistant chosen atau rejected dapat dibungkus dengan tag thinking. Tag thinking hanya boleh ditempatkan pada baris assistant terakhir. Untuk aturannya, lihat Generasi teks – Format SFT.
Parameter loss_weight (hanya berdasarkan undangan, hanya didukung oleh Qwen3.5+) mendukung modul chosen. Rentang nilainya 0,0 hingga 1,0; semakin besar nilainya, semakin tinggi tingkat kepentingan pelatihannya. Untuk detailnya, lihat Generasi teks – Format SFT.
Batas ukuran file tunggal untuk data pelatihan DPO adalah 200 MB, konsisten dengan generasi teks SFT. Untuk definisi DPO, lihat Pengantar fine-tuning model. Untuk operasi draft dan publikasi, lihat Set pelatihan dan set evaluasi.
Lihat blok kode di bawah ini untuk contoh data pelatihan generasi teks DPO:
- ChatML Standar
- Pemikiran Mendalam (thinking)
Generasi teks – Format CPT
Data pelatihan generasi teks CPT menggunakan format teks biasa jsonl, dengan satu objek jsonl per baris, berstruktur sebagai {text}, di mana bidang text berisi konten teks biasa. Untuk aturan struktur multi-turn messages, lihat Generasi teks – Format SFT.
Batasan data pelatihan CPT:
- Minimal 50 juta token direkomendasikan, dan batas ukuran file tunggal adalah 300 MB.
- Status draft dan pewarisan data tidak didukung; setiap versi baru memerlukan pembuatan data baru dan langsung dipublikasikan.
Strategi pewarisan data | SFT | DPO | CPT |
|---|---|---|---|
Mewarisi data yang ada | ✓ | ✓ | ✗ |
Membuat data baru | ✓ | ✓ | Didukung (wajib baru) |
Format SFT – Pemahaman Visual
Data pelatihan gambar SFT digunakan untuk pemahaman multimodal Qwen VL (opsi UI Konsol adalah "Image Understanding"). Data ini menggunakan format paket zip yang berisi file data pelatihan teks data.jsonl dan file gambar. data.jsonl harus ditempatkan di direktori root paket. Setiap record pelatihan dalam data.jsonl menggunakan struktur array content, dengan item array berisi bidang gambar (image) dan bidang teks (text). Struktur direktori satu lapis direkomendasikan. Untuk aturan pengemasan, lihat Aturan pengemasan paket zip multimodal.
- Batas input gambar
- Batas input video
- Lebar dan tinggi satu gambar tidak boleh melebihi 1024 px.
- Satu gambar tidak boleh melebihi 10 MB.
- Format yang didukung: bmp, jpeg, jpg, png, tif, tiff, webp.
- ChatML Standar
- Pemikiran (pemikiran)
- Pemanggilan Fungsi (function calling)
- Input Gambar
- Mode Path File Video
- Mode Daftar Frame Gambar
Deskripsi bidang Tool
Mode pemanggilan fungsi menambahkan definisi tools dan mekanisme tool_calls/role:tool di atas struktur pesan multi-turn. Batasan bidang adalah sebagai berikut:
- tools: array definisi tool; setiap item berisi type:"function" dan function{name, description, parameters}; parameters berupa JSON Schema (berisi type/properties/required).
- messages: array dialog multi-turn; role mencakup user, assistant, dan tool.
- content: array konten multimodal; dapat berisi item gambar, teks, video, dan lainnya (konsisten dengan format pemahaman multimodal).
- assistant.tool_calls: array pemanggilan tool yang dihasilkan model; berisi id, type:"function", function{name, arguments}; arguments berupa string JSON.
- role:"tool": respons tool; tool_call_id harus berkorespondensi satu-satu dengan tool_calls[].id yang sesuai; content berisi hasil respons tool.
- Parameter hanya berdasarkan undangan; rentang nilai 0,0 hingga 1,0; semakin besar nilainya, semakin tinggi kepentingan relatif baris ini selama pelatihan.
- Untuk model SFT dengan pemikiran mendalam, hanya baris assistant terakhir yang mendukung loss_weight.
Aturan tag thinking
Konten pemikiran mendalam dibungkus dalam tag <think>\n…\n</think>\n\n dan ditempatkan di dalam teks output assistant (termasuk dalam konten assistant terakhir yang sama dengan balasan akhir). Aturan:
- Hanya boleh ditempatkan pada output assistant terakhir; output assistant antara tidak boleh menambahkan tag thinking.
- Jeda baris sebelum dan sesudah tag thinking harus dipertahankan.
- Jika sampel pelatihan mengatur agar model tidak menghasilkan tag thinking, setelah pelatihan selesai tidak disarankan mengaktifkan mode pemikiran mendalam saat melakukan pemanggilan.
Aturan pengemasan paket zip multimodal
Data pelatihan pemahaman multimodal diunggah sebagai paket zip melalui halaman Add Dataset. Pengemasan harus memenuhi batasan berikut:
- Paket zip mendukung hingga 2 GB.
- Set karakter yang diizinkan untuk nama folder dan file di dalam paket adalah huruf ASCII (a-z, A-Z), angka (0-9), garis bawah (_), dan tanda hubung (-).
- File data teks pelatihan tetap sebagai data.jsonl dan harus berada di direktori root paket zip — pastikan setelah ekstraksi, membuka file zip secara langsung menampilkan data.jsonl, tanpa pembungkus folder luar tambahan.
Batas ukuran dan jumlah file
Batas atas ukuran file dan jumlah unggah lokal ditentukan berdasarkan metode pelatihan dan skenario, seperti dijelaskan rinci dalam tabel spesifik skenario di bawah ini. Untuk batas penerimaan gambar, lihat Format SFT – Pemahaman Visual; untuk batas format set evaluasi, lihat Format set evaluasi; untuk batas ingest backflow log, lihat Format set evaluasi.
max_length mengambil nilai dalam rentang 500 hingga 131072 sebagai parameter konfigurasi panjang urutan pelatihan, bukan batas atas penerimaan unggah. Batas atas ukuran penerimaan untuk satu record data pelatihan tidak diberikan nilai numerik dalam dokumen sumber; merujuk pada nilai yang ditampilkan di halaman Konsol.
Batas atas ukuran file dan jumlah unggah lokal ditentukan berdasarkan metode pelatihan dan skenario. Volume data yang direkomendasikan adalah nilai minimum yang disarankan:
Metode pelatihan/skenario | Ukuran maks file tunggal | Jumlah file maks (maxCount) | Volume data yang direkomendasikan |
|---|---|---|---|
Generasi teks – Format SFT | 200 MB | 10 (default) | Minimal ribuan sampel |
Generasi teks – Format DPO | 200 MB | 10 (default) | Minimal ratusan sampel |
Generasi teks – Format CPT | 300 MB | 1 | Minimal 50 juta Token |
Multimodal (zip) | 2 GB | 1 | Siapkan sampel yang cukup berdasarkan skenario aktual |
Nama file (tanpa ekstensi) | ≤120 karakter dan unik | — | — |
Ekstensi | Harus ada dalam daftar Create dataset | — | — |
Kuota unggah API
Kuota untuk mengunggah file fine-tuning melalui API DashScope (dengan purpose ditandai sebagai model fine-tuning) ditampilkan dalam tabel kuota di bawah ini. Saat membuat set data di Konsol, daftar File API mendukung penggabungan dan pendaftaran hingga 10 file; file fine-tuning yang diunggah melalui API terlihat dan dapat digunakan baik di halaman fine-tuning model Konsol maupun pemanggilan API.
Batasan untuk memuat set data melalui mount penyimpanan cloud:
- Tentukan path manifes direktori root data.jsonl melalui file_path MountStorage; arsip zip tidak didukung.
- Saat memilih mount penyimpanan cloud sebagai lokasi penyimpanan, publikasi langsung diberlakukan; status draft tidak didukung.
- Sebelum melakukan mount, Anda harus mengotorisasi layanan Bailian untuk mengakses data OSS.
- File tunggal melebihi 300 MB: unggah melalui mount penyimpanan cloud atau saluran ZIP multimodal 2 GB.
- Kuota total terlampaui: hapus file historis untuk membebaskan ruang.
- Data yang diimpor secara otomatis mengaktifkan Enkripsi sisi server OSS (SSE-OSS, AES256).
Item kuota | Batas | Deskripsi |
|---|---|---|
Ukuran file tunggal | Hingga 300 MB | File fine-tuning (untuk tujuan model fine-tuning) |
Ruang file valid total | 100 GB | Akumulasi file yang belum dihapus |
Jumlah file valid total | 10000 | Akumulasi file yang belum dihapus |
Durasi penyimpanan file | Tidak ada batas waktu | Tidak kedaluwarsa otomatis |
Batas atas daftar File API | 10 | Pendaftaran gabungan saat membuat set data di Konsol |
Dimensi | Impor OSS | Pemasangan Cloud Storage |
|---|---|---|
Prasyarat | Tag otorisasi akses data Bailian | Otorisasi layanan Bailian untuk mengakses data OSS |
Bentuk data | File tunggal atau batch | Seluruh folder set data yang tidak terkompresi (zip tidak didukung) |
Entri | Data Management > New Dataset > OSS Import | Model Fine-tuning > Create Training Task > Data Configuration > Dataset Mount |
Versi draft | Mendukung draft dan publikasi langsung | Memaksa publikasi langsung (draft tidak didukung) |
Set evaluasi ✓ | ✗ | ✗ |
Validasi unggah dan kesalahan umum
Saat mengunggah file secara lokal di halaman Add Dataset, validasi frontend menolak file yang tidak memenuhi aturan penerimaan dan menampilkan prompt. Penolakan validasi umum dan skenario kesalahan unggah ditampilkan dalam item yang dapat dilipat di bawah ini:
Details
Details
- Periksa batas atas maxCount yang sesuai dengan metode pelatihan saat ini; untuk detail lihat Batas ukuran dan jumlah file.
- Kurangi jumlah file hingga dalam batas atas; gabungkan data multimodal menjadi satu zip, dan gabungkan data CPT menjadi satu jsonl.
- Jika jumlah file masih melebihi batas, bagi menjadi beberapa set data dan unggah secara batch.
Details
Details
- Ubah nama file sehingga nama file (tanpa ekstensi) dipersingkat hingga dalam 120 karakter.
- Gunakan hanya karakter a-z/A-Z/0-9/_/-; hapus karakter Tionghoa dan karakter non-ASCII lainnya.
- Nama file di dalam arsip multimodal juga harus unik secara global.
Details
Details
- Periksa file dengan nama duplikat dan ubah namanya sehingga bagian tanpa ekstensi menjadi unik.
- File dengan nama sama tetapi ekstensi berbeda (misalnya, image.jpg dan image.png) juga dianggap duplikat dan harus dibedakan secara bersamaan.
- Nama file di dalam zip multimodal harus unik secara global, bahkan jika tersebar di folder berbeda.
Details
Details
- Periksa apakah ukuran file melebihi batas atas metode pelatihan terkait.
- Pisahkan jsonl menjadi beberapa file untuk unggah batch (SFT/DPO); pemisahan data CPT memerlukan pembuatan beberapa set data baru.
- Untuk metode penanganan overflow saat file tunggal melebihi 300 MB, lihat Kuota unggah API.
Details
Details
- Periksa apakah ekstensi file ada dalam daftar yang didukung untuk skenario terkait.
- Konversi file ke ekstensi yang didukung dan kemas ulang untuk diunggah.
- Ekstensi gambar dan video di dalam zip multimodal masing-masing harus sesuai, jika tidak seluruh impor paket akan gagal.
Details
Details
- Verifikasi bahwa Bucket OSS telah ditambahkan tag otorisasi akses data Bailian.
- Konfirmasi bahwa layanan Bailian telah diotorisasi untuk mengakses data OSS.
- Periksa apakah data.jsonl dan format file sesuai dengan aturan pengemasan dan coba unggah lagi; untuk detail lihat Aturan pengemasan paket zip multimodal.
- Operasi publikasi dan penghapusan keduanya ireversibel; versi yang telah dipublikasikan tidak dapat diedit lagi, dan hanya versi draft yang dapat dihapus atau diedit secara daring.
- Jenis set data (set pelatihan/set evaluasi) tidak dapat diubah atau ditukar setelah pembuatan; memilih yang salah memerlukan pembuatan set data baru dan impor ulang seluruh data.
- Mengganti jenis set data, skenario pelatihan, atau metode pelatihan akan menghapus file yang telah diunggah dan mengatur ulang lokasi penyimpanan serta metode impor.