Skip to main content
Deployment

Deployment komputasi khusus DTU

Deployment komputasi khusus menawarkan dua paket: Dedicated Throughput Unit (DTU) dan Model Unit (MU), yang menyediakan sumber daya GPU khusus untuk model tertentu. DTU ditujukan untuk model yang baru dirilis (ditagih berdasarkan TPM input/output x durasi); MU digunakan untuk model yang sudah ada (ditagih berdasarkan jumlah unit model x durasi). Dokumen ini memperkenalkan fitur, penagihan, alur penggunaan, dan model yang didukung untuk kedua paket tersebut.

Ikhtisar

Deployment komputasi khusus menyediakan sumber daya GPU khusus dan jaminan kinerja untuk model tertentu, mendukung deployment model dasar maupun kustom. Bailian menawarkan dua paket komputasi khusus:
  • DTU (Dedicated Throughput Unit): Dijual berdasarkan TPM Input/Output, memberikan jaminan throughput yang lebih langsung. Layanan inferensi yang dikelola sepenuhnya dengan sumber daya GPU dasar khusus yang dipelihara oleh platform.
  • Model Unit (MU): Mengonfigurasi daya komputasi berdasarkan durasi penggunaan dan jumlah unit model, dengan sumber daya khusus. Mendukung metrik kinerja kustom dan mode disagregasi PD. Granularitas penagihan adalah jumlah unit model x durasi.
DTU dan MU dibedakan berdasarkan keberlakuan model: model yang baru dirilis menggunakan DTU (diukur berdasarkan TPM input/output), sementara model yang sudah ada terus menggunakan MU (diukur berdasarkan jumlah unit model). Keduanya menyediakan komputasi khusus, isolasi sumber daya, dan deployment model fine-tuned. Untuk deployment baru, pilih DTU jika model mendukungnya. Kemampuan bersama kedua paket:
  • Sumber daya GPU khusus; lingkungan inferensi terisolasi secara fisik dari pengguna lain.
  • Mendukung model dasar dan model kustom (model fine-tuned Bailian atau model yang diunggah pengguna).
  • Platform memelihara operasi dasar, tidak perlu mengelola GPU.
  • Tidak ada batas RPM/TPM proaktif; lalu lintas terikat oleh kapasitas aktual.
Untuk alur kerja deployment model umum, lihat Dedicated Deployment Overview dan Provisioned Throughput.

Pemilihan Solusi

Bailian menawarkan berbagai paket kapasitas dan penagihan untuk panggilan inferensi. DTU cocok untuk skenario yang memerlukan deployment khusus, deployment model fine-tuned, latensi rendah dengan konkurensi tinggi, atau isolasi data. Paket-paket tersebut dibandingkan dalam tabel di bawah ini. Untuk perbandingan lengkap semua metode penagihan termasuk Token pay-as-you-go dan PTU, lihat tabel utama Dedicated Deployment Overview.

Dimensi Perbandingan

DTU

PTU

Token Bayar Sesuai Pemakaian

PAI/Lingjun

Fitur

Komputasi khusus + model fine-tuned

Jaminan throughput + latensi rendah

Elastis dan tanpa ambang batas

Runtime kustom

Isolasi sumber daya

Isolasi fisik

Isolasi logis

Pool bersama

Isolasi fisik

Model fine-tuned

Parameter penuh + LoRA

Tidak didukung

LoRA

Didukung

Framework kustom

Tidak didukung

Tidak didukung

Tidak didukung

Didukung

Mode penagihan

Kuota TPM × durasi

Kuota TPM × durasi

Penggunaan token

GPU × durasi

Aturan penagihan

  • Penagihan DTU
  • Penagihan MU
DTU ditagih secara terpisah berdasarkan TPM input dan TPM output, menggunakan model prabayar (bulanan). Setiap model memiliki TPM baseline input/output tetap (lihat tabel di bawah), dan Anda harus membeli dalam kelipatan bilangan bulat dari TPM baseline. Beli minimal 1× TPM baseline untuk input dan output; untuk produksi, disarankan 2× atau lebih untuk masing-masing.Biaya dihitung oleh backend berdasarkan model, TPM input/output, wilayah layanan, dan durasi pembelian. Harga satuan input/output dan harga bulanan untuk setiap model ditampilkan dalam tabel di bawah ini. Harga satuan ditagih per kTPM·bulan, dan harga bulanan adalah total untuk 1× TPM dasar dari input dan output. Harga model yang disesuaikan sama dengan model dasar yang sesuai, tergantung pada tampilan konsol yang sebenarnya.

Model yang didukung dan harga

  • Harga dan tolok ukur kinerja DTU
  • Harga MU
  • Singapore

Model

Input Dasar (TPM)

Output Dasar (TPM)

Harga Satuan Input (USD/kTPM·bln)

Harga Satuan Output (USD/kTPM·bln)

Harga Bulanan (USD)

qwen3.7-plus-2026-05-26

1,192,000

148,000

37

295

87,764

1,372,000

170,000

32

257

87,594

660,000

124,000

66

352

87,208

704,000

132,000

62

331

87,340

Data referensi kinerja untuk setiap model di bawah beban kerja standar ditunjukkan pada tabel di bawah ini, tunduk pada tampilan konsol yang sebenarnya.
Data referensi kinerja berikut diukur pada tingkat hit cache 0%. Dalam penggunaan aktual, seiring dengan meningkatnya tingkat hit cache, kinerja model juga meningkat.

Model

Panjang Input

Panjang Output

Tingkat Hit Cache

Latensi Token Pertama (ms)

Latensi Per Token (ms)

qwen3.7-plus-2026-05-26

16,000

2,000

0

888

10

16,000

2,000

0

2,418

15

2,600

500

0

819

14

2,600

500

0

970

13

Di antaranya, qwen3.8-27b saat ini memerlukan akses whitelist, sementara model lainnya tersedia di situs resmi Singapore.

Pembuatan deployment

  • Pembuatan deployment DTU
  • Konfigurasi deployment MU
Sebelum menggunakan DTU, aktifkan fitur DTU di konsol dan ajukan kuota sumber daya. Setelah diaktifkan, pilih model target di halaman Dedicated Deployment konsol Bailian dan pilih DTU sebagai metode penagihan untuk membuat deployment.
Deployment DTU saat ini tidak mendukung pembuatan dan pengelolaan melalui API. Harap selesaikan pengaktifan, pembuatan, penskalaan, dan perpanjangan di konsol Bailian.
Untuk alur kerja dasar deployment model umum, lihat Dedicated Deployment Overview.Kolom formulir untuk membuat deployment ditunjukkan pada tabel di bawah ini.

Parameter

Deskripsi

Wajib

Deskripsi Nilai

Service Name

Nama layanan deployment

Ya

Kustom

Model

Model target untuk dideploy

Ya

Pilihan dropdown

Deployment Template

Arsitektur deployment

Tidak

Pilihan dropdown, default ke yang pertama

Payment Type

Metode penagihan

Ya

Prabayar (bulanan)

Input Throughput Quota

Kapasitas TPM input yang dibeli

Ya

Kelipatan bilangan bulat dari TPM input baseline (kTPM)

Output Throughput Quota

Kapasitas TPM output yang dibeli

Ya

Kelipatan bilangan bulat dari TPM output baseline (kTPM)

Purchase Duration

Periode pembelian

Ya

1-12 (bilangan bulat, bulan)

Auto Renewal

Perpanjang otomatis saat kedaluwarsa

Tidak

Aktif/Nonaktif

Single Renewal Duration

Wajib jika perpanjangan otomatis diaktifkan

Ya

1-12 (bilangan bulat, bulan)

Perencanaan Kapasitas

DTU dijual berdasarkan TPM input/output; TPM yang dibeli menentukan jumlah token maksimum yang dapat diproses per menit. Perencanaan kapasitas bertujuan untuk mendapatkan kelipatan pembelian dari permintaan token puncak bisnis Anda, kemudian memverifikasi melalui pengujian beban bahwa konkurensi dan latensi yang benar-benar dapat dipertahankan memenuhi persyaratan. Referensi TPM input/output baseline dan kinerja beban kerja standar untuk setiap model tersedia di tabel di atas. Gunakan alat pengujian beban seperti evalscope untuk menguji terhadap skenario bisnis nyata Anda (panjang input/output, konkurensi, persyaratan latensi), kemudian tentukan kelipatan pembelian berdasarkan tabel harga.

Metode Perencanaan Kapasitas

  1. Profilkan metrik bisnis puncak: panjang token input/output permintaan tipikal, konkurensi target, dan persyaratan untuk latensi token pertama (TTFT) serta latensi pembuatan per token (TPOT).
  2. Perkirakan permintaan throughput puncak: TPM input puncak ≈ konkurensi × panjang input per permintaan ÷ waktu pemrosesan per permintaan (menit); TPM output puncak ≈ konkurensi × panjang output per permintaan ÷ waktu pembuatan per permintaan (menit).
  3. Hitung kelipatan pembelian: kelipatan input = ⌈TPM input puncak ÷ TPM input baseline⌉, kelipatan output = ⌈TPM output puncak ÷ TPM output baseline⌉. DTU mengharuskan input dan output diskalakan bersama, jadi ambil nilai yang lebih besar dari keduanya sebagai kelipatan akhir.
  4. Verifikasi dengan pengujian beban: setelah membeli kelipatan yang dihitung, uji ulang dengan evalscope di bawah beban kerja target untuk memastikan throughput dan latensi aktual memenuhi persyaratan bisnis. Jika latensi tinggi, tingkatkan konkurensi dalam ruang kosong TPM untuk meningkatkan throughput efektif.
Jika persyaratan latensi tidak ketat, Anda dapat meningkatkan konkurensi — dalam batas TPM yang dibeli — untuk meningkatkan throughput aktual. Contoh estimasi bisnis: Untuk model dengan input dasar 656K TPM dan output dasar 82K TPM: pemrofilan puncak bisnis menunjukkan puncak input ~1,300K TPM dan puncak output ~160K TPM. Hitung kelipatan komputasi: input ⌈1300÷656⌉=2, output ⌈160÷82⌉=2; ambil nilai yang lebih besar (2×), beli input 1,312K TPM (656K×2) + output 164K TPM (82K×2). Kemudian lakukan uji beban dengan evalscope pada beban kerja puncak untuk memastikan latensi terpenuhi. Jika volume bisnis meningkat dua kali lipat (puncak input ~2,600K, output ~320K), kelipatan menjadi input ⌈2600÷656⌉=4, output ⌈320÷82⌉=4; beli 4×: input 2,624K TPM (656K×4) + output 328K TPM (82K×4), dan uji ulang. Rumus estimasi:
Purchase multiple = max(⌈peak input TPM ÷ baseline input TPM⌉, ⌈peak output TPM ÷ baseline output TPM⌉)

Penskalaan dan perpanjangan/penghentian langganan

  • Penskalaan dan perpanjangan/penghentian langganan DTU
  • Penskalaan dan perpanjangan MU
Daftar deployment menampilkan kuota TPM input/output yang dibeli; halaman detail menampilkan rincian kapasitas TPM.Penskalaan: Klik "Scale" dalam daftar deployment untuk mengubah kapasitas TPM input/output. Penskalaan naik menampilkan jumlah tambahan yang harus dibayar; penskalaan turun menampilkan estimasi pengembalian dana. Input dan output harus ditingkatkan atau diturunkan secara bersamaan; salah satu tidak dapat ditingkatkan sementara yang lain diturunkan. Hanya deployment yang sedang berjalan yang dapat dioperasikan.Perpanjangan: Deployment bulanan prabayar dapat diperpanjang saat kedaluwarsa. Tombol perpanjangan pada halaman detail memasuki alur perpanjangan, mendukung sakelar perpanjangan otomatis dan durasi perpanjangan tunggal.Penghentian langganan: Pesanan bulanan prabayar mendukung pengakhiran dini; bagian yang digunakan diselesaikan dengan koefisien 1.2x untuk pengembalian dana. Untuk detailnya, lihat Refund rules for configuration downgrades. Penghentian langganan tidak dapat dibatalkan; setelah penghentian langganan, sumber daya khusus dilepaskan dan layanan berhenti.

FAQ

Apa perbedaan antara deployment DTU dan penagihan Token pay-as-you-go? Token pay-as-you-go menagih berdasarkan penggunaan token pada kumpulan sumber daya bersama; DTU menggunakan sumber daya GPU khusus dan menagih berdasarkan TPM input/output, cocok untuk skenario yang memerlukan throughput stabil dan deployment khusus. Metode penagihan apa yang didukung oleh deployment DTU? Hanya penagihan prabayar (bulanan) yang didukung. Bagaimana cara melihat penggunaan TPM yang telah dibeli? Anda dapat melihat kuota TPM input/output yang dibeli di daftar deployment dan halaman detail Dedicated Deployment di konsol Bailian. Lihat Dedicated Deployment Overview.
Rencana Token (Team Edition)
Model playground
  • Pembuatan audio
  • Pembuatan musik
Statistik dan Pemantauan
Asset Center
Dukungan layanan
Deployment komputasi khusus DTU - Alibaba Cloud Model Studio