Skip to main content
Deployment

Ikhtisar Penerapan Khusus

Anda dapat memperoleh layanan inferensi independen dengan sumber daya khusus melalui penerapan untuk memenuhi kebutuhan bisnis pada berbagai tingkat kinerja, seperti konkurensi tinggi dan latensi rendah.

Metode penagihan

Sebelum penerapan, Anda dapat melihat perkiraan biaya per jam berbagai model di Konsol Penerapan Model.
Metode penagihan tidak dapat diubah setelah layanan dibuat. Untuk beralih, Anda harus menghentikan model yang diterapkan secara offline, lalu menerapkannya kembali.

Provisioned Throughput (PTU, Provisioned Throughput Unit)

(Throughput tinggi; kinerja tinggi)

Model Unit

(Metrik kinerja kustom; isolasi sumber daya)

Token-based usage

(Bayar sesuai penggunaan setelah fine-tuning/validasi efek)

Definisi

Metode penerapan model yang menyediakan sumber daya platform untuk menjamin kapasitas throughput TPM tertentu; tidak ada pembatasan laju dalam kuota yang dijamin.

Metode penerapan model yang mengonfigurasi daya komputasi berdasarkan durasi penggunaan dan jumlah Model Unit, dengan sumber daya khusus.

Metode penerapan model yang menggunakan Tokens input dan Tokens output yang dihasilkan per panggilan sebagai dasar pengukuran penggunaan.

Keunggulan

  1. Menyediakan kapasitas throughput stabil, latensi lebih rendah, dan kepastian sumber daya lebih kuat untuk lingkungan produksi beban tinggi.

  2. Dibandingkan dengan penagihan berbasis Token, TPS (Tokens yang dihasilkan per detik) biasanya meningkat sekitar 1,5 hingga 2,0 kali lipat.

  3. Mendukung pengaturan perpanjangan otomatis.

  1. Metrik kinerja seperti latensi/throughput dapat dikustomisasi.

  2. Mendukung pengaturan perpanjangan otomatis.

Tidak dikenai biaya saat tidak digunakan.

Model yang didukung

Beberapa model yang telah dikonfigurasi sebelumnya

Beberapa model yang telah dikonfigurasi sebelumnya dan semua model yang telah difine-tune

Beberapa model yang telah difine-tune dengan LoRA

Kasus penggunaan

  1. Layanan pelanggan cerdas untuk aplikasi perbankan (lalu lintas stabil, memerlukan pengalaman konkuren terjamin).

  2. moderasi konten real-time untuk platform sosial (memerlukan pemrosesan stabil untuk tugas pipeline yang dapat diprediksi).

  3. API terjemahan cloud publik (menyediakan jaminan layanan garis dasar bagi pengguna paket standar).

  1. Model besar eksklusif E-dagang yang telah difine-tune (menerapkan model privat, penskalaan manual selama promosi besar).

  2. Model skrining molekul perusahaan farmasi (memerlukan sumber daya khusus untuk tugas berdurasi panjang).

  3. Simulasi mengemudi otonom (memerlukan komputasi berkelanjutan berdurasi panjang).

Validasi efek model fine-tuned

Diagram penagihan

image

image

image

Metode penagihan

Berdasarkan durasi penggunaan dan throughput yang disediakan

Bayar sesuai penggunaan, paket harian

Berdasarkan durasi penggunaan dan jumlah Model Unit

Bayar sesuai penggunaan, paket bulanan

Berdasarkan penggunaan Token model

Bayar sesuai penggunaan

Metode penskalaan

Peningkatan/penurunan throughput mandiri

Peningkatan/penurunan Model Unit mandiri

Kirim permohonan di konsol dan tunggu tinjauan manual.

Batasan produk

  1. Tagihan prabayar dihitung harian. Tidak tersedia pengembalian dana lebih awal.

  2. Jika penggunaan dalam satu unit waktu melebihi throughput yang dibeli, akan ditangani sesuai strategi overflow yang dipilih saat pembuatan: auto-overflow beralih ke penagihan pemanggilan model bayar sesuai penggunaan untuk model tersebut, sedangkan use-only-PTU-capacity mengembalikan kode 429.

Setelah pembelian prabayar, jika Anda membatalkan lebih awal dalam bulan pertama, harga satuan harian (≈ harga satuan bulanan / 30) akan ditagih sebesar 1,2 kali lipat.

  1. Hanya mendukung beberapa model setelah fine-tuning efisien (LoRA).

  2. Akan dilepas secara otomatis jika tidak digunakan dalam satu bulan.

Untuk melihat statistik historis penggunaan Token dan jumlah panggilan untuk setiap panggilan, buka: Pemantauan Model.

Rincian penagihan

  • Penagihan berdasarkan durasi penggunaan (Provisioned Throughput)
  • Penagihan berdasarkan durasi penggunaan (Model Unit)
  • Berdasarkan penggunaan token model
Biaya = Durasi penggunaan × (Harga satuan TPM input × TPM input + Harga satuan TPM output × TPM output)Postpaid dihitung per jam: satuan durasi penggunaan adalah jam, dan harga satuan diambil dari kolom "1 jam berkelanjutan" pada tabel di bawah ini; prepaid dihitung per hari: satuan durasi penggunaan adalah hari, dan harga satuan diambil dari kolom "1 hari berkelanjutan" pada tabel di bawah ini.
  • Pesanan prepaid berlaku secara real time setelah pembayaran, dengan periode validitas N hari yang berakhir pukul 23.59 pada hari ke-N. Jika pesanan dilakukan setelah pukul 22.00, tanggal kedaluwarsa akan diperpanjang secara otomatis 1 hari.
  • Setelah pesanan prepaid kedaluwarsa, layanan akan dihentikan dengan penundaan 2 jam, dan sumber daya akan dipertahankan selama 14 jam setelah penghentian lalu dilepas.
  • Pesanan prepaid tidak dapat menghentikan layanan lebih awal.
  • Untuk penagihan postpaid, jika akun mengalami tunggakan, sumber daya yang diterapkan akan tetap dipertahankan dan ditagih selama 24 jam, di mana layanan masih dapat digunakan secara normal. Setelah 24 jam, sistem menghentikan penagihan, penerapan model memasuki status tunggakan, dan sumber daya dasar akan dihapus, tetapi tugas penerapan model akan dipertahankan. Setelah tunggakan dilunasi, sistem akan mengalokasikan ulang sumber daya dan memulihkan penggunaan (biaya akan terus berjalan setelah pemulihan). Jika Anda tidak ingin terus dikenai biaya, Anda dapat menghapus tugas penerapan model, dan penagihan akan berhenti setelah penghapusan berhasil.
Saat input model melebihi Token input maksimum, panggilan terkait akan secara otomatis beralih ke mode bayar sesuai penggunaan model saat ini; saat TPM yang dibeli terlampaui, akan ditangani sesuai strategi overflow yang dipilih saat pembuatan ("auto-overflow" beralih ke bayar sesuai penggunaan, "use-only-PTU-capacity" mengembalikan 429). Saat ini, kinerja inferensi mungkin menurun dan akan tunduk pada pengendalian lalu lintas publik model snapshot saat ini di ruang bisnis, dan biaya akan dikenakan sesuai standar pemanggilan model (bayar sesuai penggunaan).
  • Dalam kasus ini (hanya di bawah strategi "auto-overflow"), Header respons API akan mencakup: x-dashscope-ptu-overflow:true.
  • Untuk statistik TPM, buka: Pemantauan Model.
Untuk aturan spesifik pengurangan biaya dan pengembalian dana dalam skenario skala turun (downgrade), silakan merujuk ke: Aturan pengembalian dana untuk downgrade konfigurasi.
Penerapan PTU mendukung koefisien kapasitas bertingkat input panjang dan diskon cache; lihat Input panjang dan caching Provisioned Throughput untuk detailnya.
  • Singapura
  • China Utara 2 (Beijing)
  • Qwen
  • DeepSeek
  • Qwen-VL
  • GLM

Nama Model

Kode Model

Token Input Maks

Input Pascabayar

Per 10K TPM/Jam

Output Postpaid

Per 1K TPM/Jam

Input Prabayar

Per 10K TPM/Hari

Prepaid Output

Per 1K TPM/Hari

Qwen3.8-Max

qwen3.8-max

1M

$4,8

$1,44

$57,6

$17,28

Qwen3.7-Flash-2026-07-15 Hubungi manajer bisnis Anda untuk mengaktifkan

qwen3.7-flash-2026-07-15

128K

$0,072

$0,031

$0,864

$0,374

Qwen3.7-Max-2026-05-20

qwen3.7-max-2026-05-20

256K

$1,92

$1,8

$72

$21,6

Qwen3.7-Plus-2026-05-26

qwen3.7-plus-2026-05-26

256K

$0,96

$0,384

$11,52

$4,608

Qwen3.6-Plus-2026-04-02

qwen3.6-plus-2026-04-02

128K

$1,2

$0,72

$14,4

$8,64

Qwen3.5-Plus-2026-04-20

qwen3.5-plus-2026-04-20

128K

$0,96

$0,576

$11,52

$6,912

Untuk menerapkan lebih banyak model, rujuk ke solusi ini dan pilih rencana penerapan yang paling sesuai dengan kebutuhan bisnis Anda.

Metode penerapan

Anda dapat menerapkan model di konsol. Ikuti langkah-langkah berikut:
Jika Anda mendapat pesan izin tidak mencukupi, rujuk ke: Apa yang harus saya lakukan jika muncul pesan "izin tidak mencukupi" saat penerapan?
  1. Buka konsol penerapan model.

image

image

  1. Masukkan nama layanan, pilih model dan metode penagihan, biarkan pengaturan lainnya tetap default, lalu klik OK.

  1. Saat status penerapan adalah Running, model telah berhasil diterapkan.

Biaya akan dikenakan setelah model berhasil diterapkan.

Konfigurasi penerapan

  • Model Unit

Item konfigurasi

Rincian konfigurasi

Nama layanan

Nama kustom untuk layanan penerapan.

Model

Pilih model yang akan diterapkan, termasuk model preset platform dan model yang telah difine-tune.

Jenis unit model

Pilih spesifikasi penerapan. Spesifikasi berbeda sesuai dengan daya komputasi dan kinerja berbeda.

Jumlah replika

Tetapkan jumlah awal replika penerapan, yang memengaruhi kemampuan pemrosesan konkuren layanan.

Template penerapan

Pilih template penerapan (misalnya, "penerapan single-node"). Template berbeda sesuai dengan skema konfigurasi sumber daya berbeda. Hanya tersedia dalam mode penagihan unit model.

Mode inferensi model

Untuk beberapa model, saat diterapkan dalam modeModel Unit, Anda dapat mengonfigurasi mode inferensi, konteks maksimum, dan lainnya.

  • Instruct - Model melakukan inferensi dalam mode non-thinking setelah penerapan.

  • Thinking - Model melakukan inferensi dalam mode thinking setelah penerapan.

Konteks maksimum

Mode penerapanModel Unit beberapa model mendukung pengaturan ini. Panjang konteks maksimum bergantung pada jenis model.

Pembatasan laju layanan

Mode penerapanModel Unit beberapa model mendukung pengaturan ini, yang dapat membatasi RPM dan TPM panggilan model.

Halaman daftar penerapan

Setelah penerapan berhasil, Anda dapat melihat dan mengelola semua layanan penerapan di halaman daftar penerapan. Halaman daftar berisi informasi berikut:
  • Nama layanan: Nama layanan penerapan. Klik untuk melihat detail penerapan.
  • Nama model: Model yang digunakan untuk penerapan.
  • Kode Model: Pengidentifikasi unik yang dihasilkan setelah model berhasil diterapkan, digunakan untuk menentukan model saat memanggil API.
  • Status penerapan/Status event: Termasuk Menunggu penerapan, Menerapkan, Running, Penerapan gagal, Offline, Layanan dijeda, Dihentikan, Menghapus, Langganan ditangguhkan/Pembayaran tertunda ditangguhkan, Memulihkan layanan, Running (Mengubah konfigurasi), Running (Perubahan gagal), dan status lainnya.
  • Metode penagihan: Metode penagihan layanan penerapan saat ini.
  • Detail penerapan: Informasi konfigurasi seperti jenis unit model dan jumlah replika.
  • Detail pembatasan laju: Menampilkan konfigurasi pembatasan laju layanan penerapan saat ini, seperti RPM (permintaan per menit) dan TPM (token per menit).
  • Waktu layanan: Menampilkan waktu pembuatan dan waktu kedaluwarsa layanan penerapan.
  • Operasi: Bergantung pada status penerapan dan metode penagihan, Anda dapat melakukan operasi seperti Perbarui, Pantau, Penskalaan, Perpanjang, Offline, Hapus, dan Coba.

Panggilan pasca-penerapan

Setelah model berhasil diterapkan, Anda dapat memanggilnya melalui antarmuka yang kompatibel OpenAI, DashScope, dan Assistant SDK. Saat memanggil model yang berhasil diterapkan, nilai model harus berupa kode model yang dihasilkan setelah penerapan berhasil. Buka konsol penerapan model untuk mendapatkan Model Code.
image
import os
import dashscope

messages = [
    {"role": "system", "content": "You are a helpful assistant."},
    {"role": "user", "content": "Who are you?"},
]
dashscope.base_http_api_url = 'https://dashscope-intl.aliyuncs.com/api/v1'
response = dashscope.Generation.call(
    # Jika Anda belum mengonfigurasi variabel lingkungan, ganti baris berikut dengan Bailian API Key Anda: api_key="sk-xxx",
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    model="qwen3-max-xxx-xxx",  # Harap ganti dengan kode yang dikembalikan setelah model berhasil diterapkan
    messages=messages,
    result_format="message",
    enable_thinking=False,
)
print(response)

Penskalaan Layanan Penerapan

  • Throughput preset (ditagih berdasarkan durasi): Klik tombol Scaling untuk layanan mandiri, menyesuaikan jumlah instans secara manual. Untuk aturan pengurangan biaya dan pengembalian dana terperinci, silakan merujuk ke: Aturan pengembalian dana untuk downgrade konfigurasi.
  • Model unit (ditagih berdasarkan durasi): Klik tombol Scaling untuk layanan mandiri, menyesuaikan jumlah instans secara manual.
Selain itu, Anda dapat mengonfigurasi kebijakan penskalaan otomatis (termasuk ambang batas penskalaan, jumlah replika minimum/maksimum, penskalaan terjadwal, dll.) melalui tombol konfigurasi penskalaan di kolom operasi.

Menonaktifkan Layanan Penerapan

Buka Konsol Penerapan Model, temukan layanan penerapan yang ingin Anda hentikan, lalu klik operasi yang sesuai berdasarkan jenis penagihan:
  • Model unit prepaid: Klik Deactivate dan konfirmasi.
  • Postpaid: Klik Delete dan konfirmasi.
Tidak akan ada penagihan lebih lanjut setelah operasi selesai.
image

Operasi Lainnya

Selain menonaktifkan, kolom operasi di halaman daftar penerapan juga mendukung operasi berikut:
  • Perbarui: Perbarui versi model layanan yang diterapkan, mendukung pembaruan penuh atau pembaruan batch (rilis canary).
  • Hapus: Layanan bayar sesuai penggunaan dapat dihapus langsung untuk menghentikan penagihan.
  • Perpanjang: Layanan prepaid dapat diperpanjang untuk memperpanjang waktu layanan, dan mendukung perpanjangan otomatis.
  • Beli paket kapasitas: Beli paket kapasitas untuk penerapan throughput preset.

FAQ

Bisakah saya mengunggah dan menerapkan model saya sendiri?

Mengunggah dan menerapkan model Anda sendiri belum didukung. Kami menyarankan Anda terus mengikuti pembaruan terbaru Alibaba Cloud Model Studio. Selain itu, Platform Kecerdasan Buatan Alibaba Cloud PAI menyediakan kemampuan untuk menerapkan model Anda sendiri. Anda dapat merujuk ke Penerapan Model Bahasa Besar PAI-LLM untuk mempelajari metode penerapan.

Apa yang harus saya lakukan jika muncul pesan "izin tidak mencukupi" saat penerapan?

  1. Jika muncul pesan "Missing permission for this module", pastikan akun Anda memiliki izin Model Deployment - Operation di halaman pengelolaan izin ruang bisnis.
    PixPin_2025-11-27_15-09-44
    Jika Anda tidak dapat beroperasi secara normal, hubungi organisasi atau administrator TI Anda untuk menambahkan izin terkait atau memeriksa masalah izin atas nama Anda.
  2. Jika terjadi kesalahan "ruang bisnis xx tidak memiliki izin untuk menerapkan model xx" selama penerapan, buka halaman Pengelolaan Ruang Bisnis Model Studio untuk menambahkan izin penerapan model yang sesuai untuk ruang bisnis yang sesuai.
    Kesalahan pemanggilan API: Workspace xxx does not have deployment privilege for model xxxx.
    PixPin_2025-11-27_15-03-57
    PixPin_2025-11-27_15-06-41
    Jika muncul pesan izin tidak mencukupi, hubungi organisasi atau administrator TI Anda untuk menambahkan izin terkait atau beroperasi atas nama Anda.
Rencana Token (Team Edition)
Model playground
  • Pembuatan audio
  • Pembuatan musik
Statistik dan Pemantauan
Asset Center
Dukungan layanan