Deployment komputasi khusus menawarkan dua paket: Dedicated Throughput Unit (DTU) dan Model Unit (MU), yang menyediakan sumber daya GPU khusus untuk model tertentu. DTU ditujukan untuk model yang baru dirilis (ditagih berdasarkan TPM input/output x durasi); MU digunakan untuk model yang sudah ada (ditagih berdasarkan jumlah unit model x durasi). Dokumen ini memperkenalkan fitur, penagihan, alur penggunaan, dan model yang didukung untuk kedua paket tersebut.
Ikhtisar
Deployment komputasi khusus menyediakan sumber daya GPU khusus dan jaminan kinerja untuk model tertentu, mendukung deployment model dasar maupun kustom. Bailian menawarkan dua paket komputasi khusus:
- DTU (Dedicated Throughput Unit): Dijual berdasarkan TPM Input/Output, memberikan jaminan throughput yang lebih langsung. Layanan inferensi yang dikelola sepenuhnya dengan sumber daya GPU dasar khusus yang dipelihara oleh platform.
- Model Unit (MU): Mengonfigurasi daya komputasi berdasarkan durasi penggunaan dan jumlah unit model, dengan sumber daya khusus. Mendukung metrik kinerja kustom dan mode disagregasi PD. Granularitas penagihan adalah jumlah unit model x durasi.
- Sumber daya GPU khusus; lingkungan inferensi terisolasi secara fisik dari pengguna lain.
- Mendukung model dasar dan model kustom (model fine-tuned Bailian atau model yang diunggah pengguna).
- Platform memelihara operasi dasar, tidak perlu mengelola GPU.
- Tidak ada batas RPM/TPM proaktif; lalu lintas terikat oleh kapasitas aktual.
Pemilihan Solusi
Bailian menawarkan berbagai paket kapasitas dan penagihan untuk panggilan inferensi. DTU cocok untuk skenario yang memerlukan deployment khusus, deployment model fine-tuned, latensi rendah dengan konkurensi tinggi, atau isolasi data. Paket-paket tersebut dibandingkan dalam tabel di bawah ini.
Untuk perbandingan lengkap semua metode penagihan termasuk Token pay-as-you-go dan PTU, lihat tabel utama Dedicated Deployment Overview.
Dimensi Perbandingan | DTU | PTU | Token Bayar Sesuai Pemakaian | PAI/Lingjun |
|---|---|---|---|---|
Fitur | Komputasi khusus + model fine-tuned | Jaminan throughput + latensi rendah | Elastis dan tanpa ambang batas | Runtime kustom |
Isolasi sumber daya | Isolasi fisik | Isolasi logis | Pool bersama | Isolasi fisik |
Model fine-tuned | Parameter penuh + LoRA | Tidak didukung | LoRA | Didukung |
Framework kustom | Tidak didukung | Tidak didukung | Tidak didukung | Didukung |
Mode penagihan | Kuota TPM × durasi | Kuota TPM × durasi | Penggunaan token | GPU × durasi |
Aturan penagihan
- Penagihan DTU
- Penagihan MU
Model yang didukung dan harga
- Harga dan tolok ukur kinerja DTU
- Harga MU
- Singapore
Model | Input Dasar (TPM) | Output Dasar (TPM) | Harga Satuan Input (USD/kTPM·bln) | Harga Satuan Output (USD/kTPM·bln) | Harga Bulanan (USD) |
|---|---|---|---|---|---|
qwen3.7-plus-2026-05-26 | 1,192,000 | 148,000 | 37 | 295 | 87,764 |
1,372,000 | 170,000 | 32 | 257 | 87,594 | |
660,000 | 124,000 | 66 | 352 | 87,208 | |
704,000 | 132,000 | 62 | 331 | 87,340 |
Data referensi kinerja berikut diukur pada tingkat hit cache 0%. Dalam penggunaan aktual, seiring dengan meningkatnya tingkat hit cache, kinerja model juga meningkat.
Model | Panjang Input | Panjang Output | Tingkat Hit Cache | Latensi Token Pertama (ms) | Latensi Per Token (ms) |
|---|---|---|---|---|---|
qwen3.7-plus-2026-05-26 | 16,000 | 2,000 | 0 | 888 | 10 |
16,000 | 2,000 | 0 | 2,418 | 15 | |
2,600 | 500 | 0 | 819 | 14 | |
2,600 | 500 | 0 | 970 | 13 |
Pembuatan deployment
- Pembuatan deployment DTU
- Konfigurasi deployment MU
Parameter | Deskripsi | Wajib | Deskripsi Nilai |
|---|---|---|---|
Service Name | Nama layanan deployment | Ya | Kustom |
Model | Model target untuk dideploy | Ya | Pilihan dropdown |
Deployment Template | Arsitektur deployment | Tidak | Pilihan dropdown, default ke yang pertama |
Payment Type | Metode penagihan | Ya | Prabayar (bulanan) |
Input Throughput Quota | Kapasitas TPM input yang dibeli | Ya | Kelipatan bilangan bulat dari TPM input baseline (kTPM) |
Output Throughput Quota | Kapasitas TPM output yang dibeli | Ya | Kelipatan bilangan bulat dari TPM output baseline (kTPM) |
Purchase Duration | Periode pembelian | Ya | 1-12 (bilangan bulat, bulan) |
Auto Renewal | Perpanjang otomatis saat kedaluwarsa | Tidak | Aktif/Nonaktif |
Single Renewal Duration | Wajib jika perpanjangan otomatis diaktifkan | Ya | 1-12 (bilangan bulat, bulan) |
Perencanaan Kapasitas
DTU dijual berdasarkan TPM input/output; TPM yang dibeli menentukan jumlah token maksimum yang dapat diproses per menit. Perencanaan kapasitas bertujuan untuk mendapatkan kelipatan pembelian dari permintaan token puncak bisnis Anda, kemudian memverifikasi melalui pengujian beban bahwa konkurensi dan latensi yang benar-benar dapat dipertahankan memenuhi persyaratan. Referensi TPM input/output baseline dan kinerja beban kerja standar untuk setiap model tersedia di tabel di atas.
Gunakan alat pengujian beban seperti evalscope untuk menguji terhadap skenario bisnis nyata Anda (panjang input/output, konkurensi, persyaratan latensi), kemudian tentukan kelipatan pembelian berdasarkan tabel harga.
Metode Perencanaan Kapasitas
- Profilkan metrik bisnis puncak: panjang token input/output permintaan tipikal, konkurensi target, dan persyaratan untuk latensi token pertama (TTFT) serta latensi pembuatan per token (TPOT).
- Perkirakan permintaan throughput puncak: TPM input puncak ≈ konkurensi × panjang input per permintaan ÷ waktu pemrosesan per permintaan (menit); TPM output puncak ≈ konkurensi × panjang output per permintaan ÷ waktu pembuatan per permintaan (menit).
- Hitung kelipatan pembelian: kelipatan input = ⌈TPM input puncak ÷ TPM input baseline⌉, kelipatan output = ⌈TPM output puncak ÷ TPM output baseline⌉. DTU mengharuskan input dan output diskalakan bersama, jadi ambil nilai yang lebih besar dari keduanya sebagai kelipatan akhir.
- Verifikasi dengan pengujian beban: setelah membeli kelipatan yang dihitung, uji ulang dengan evalscope di bawah beban kerja target untuk memastikan throughput dan latensi aktual memenuhi persyaratan bisnis. Jika latensi tinggi, tingkatkan konkurensi dalam ruang kosong TPM untuk meningkatkan throughput efektif.
Penskalaan dan perpanjangan/penghentian langganan
- Penskalaan dan perpanjangan/penghentian langganan DTU
- Penskalaan dan perpanjangan MU