Skip to main content
Inferensi Model

Reservasi TPM

Reservasi TPM mengunci kapasitas inferensi khusus untuk model tertentu, memastikan layanan Anda tidak terpengaruh oleh batas laju publik selama jam sibuk bisnis. Topik ini menjelaskan cara membuat, mengintegrasikan, dan mengelola reservasi TPM.

Ikhtisar

Dengan reservasi TPM (Tokens Per Minute), Anda dapat mengunci throughput inferensi khusus untuk model tertentu. Panggilan dalam kapasitas terjadwal tidak tunduk pada batas laju kolam sumber daya publik.
  • Jaminan kapasitas: Kapasitas TPM terjadwal dikhususkan untuk workload Anda dan tidak dibagi dengan pengguna lain.
  • Kode model khusus: Setelah membuat reservasi TPM, sistem secara otomatis menghasilkan kode model khusus. Anda harus mengganti parameter model dalam permintaan API Anda dengan kode ini.
  • Strategi overflow: Saat membuat reservasi, Anda dapat memilih cara menangani traffic berlebih—secara otomatis overflow ke pay-as-you-go (default, tanpa gangguan layanan) atau hanya menggunakan kapasitas terjadwal (permintaan berlebih mengembalikan error 429, tanpa biaya tambahan).

Bandingkan dan pilih rencana

Model Studio menawarkan berbagai rencana kapasitas dan penagihan untuk panggilan inferensi, termasuk pay-as-you-go, paket sumber daya, rencana penghematan, reservasi TPM, serta penerapan khusus PTU. Setiap rencana memiliki karakteristik berbeda terkait unit penagihan, tingkat jaminan kapasitas, penanganan overflow, dan perubahan integrasi. Bagian ini membantu Anda memilih rencana yang sesuai dengan kebutuhan bisnis.

Rencana

Unit penagihan

Jaminan kapasitas

Kasus penggunaan

Penanganan overflow

Perubahan kode

Pay-as-you-go

Per token

Tidak ada (kolam publik bersama)

Traffic sangat bervariasi/jangka pendek

Dilayani secara otomatis, tunduk pada batas laju publik

Tidak perlu perubahan

Paket sumber daya/Rencana penghematan

Kuota prabayar

Diskon penggunaan komitmen (bukan kapasitas khusus)

Optimasi biaya

Traffic berlebih beralih ke pay-as-you-go

Tidak perlu perubahan

Reservasi TPM

Prabayar per kTPM

Kapasitas khusus dengan jaminan kuat

Traffic dapat diprediksi, tidak toleran terhadap pembatasan laju

Opsional: luapan otomatis ke pay-as-you-go (default) / hanya kapasitas terpesan mengembalikan 429

Ganti parameter model

PTU (Penerapan model)

Prabayar per kTPM

Instans penerapan khusus

Throughput dan performa tinggi

Opsi: auto-overflow ke pay-as-you-go (default) / hanya kapasitas PTU mengembalikan 429

Ganti parameter model

Model yang didukung

Harga mengikuti Konsol; tabel hanya sebagai Referensi.
  • China (Beijing)
  • Singapura

Nama model

Prabayar - harian

Input (per 10.000 TPM)

Output (per 1.000 TPM)

Qwen3.8-Max

$16,63

$4,99

Qwen3.7-Flash-2026-07-15 Hubungi account manager Anda untuk aktivasi

$0,28

$0,11

Qwen3.7-Max-2026-05-20

$16,63

$4,99

Qwen3.7-Plus-2026-05-26

$2,77

$1,11

Qwen3.6-Flash-2026-04-16

$1,66

$1,00

GLM-5.2

$11,09

$3,88

GLM-5.1

$8,32

$3,33

DeepSeek-v4-Pro-0813

$12,82

$3,85

DeepSeek-v4-Flash

$1,39

$0,28

DeepSeek-v4-Pro

$16,63

$3,33

DeepSeek-v4-Flash-0731

$4,27

$1,28

Kimi-K2.6

$9,01

$3,74

Catatan penagihan dan penggunaan

  • Penagihan dimulai setelah penerapan berhasil. Panggilan dalam kapasitas terjadwal tidak dikenakan biaya tambahan.
  • Biaya prabayar dibayarkan sekaligus di muka dan berlaku sejak saat pembelian. Lihat Pusat Tagihan Bailian untuk biaya aktual.
  • Siklus penagihan "harian" dihitung berdasarkan hari kalender: dari saat instans berlaku hingga pukul 00.00.00 hari berikutnya, bukan 24 jam berkelanjutan sejak waktu pembelian. Misalnya, reservasi 1 hari yang dibeli pukul 16.00 berakhir pukul 00.00 (berlaku sekitar 8 jam). Kami menyarankan melakukan pembelian di awal hari atau mengaktifkan Auto-renewal on expiry untuk menghindari gangguan layanan.
  • Penurunan spesifikasi dan pengembalian dana pembatalan langganan: bagian yang telah digunakan diselesaikan dengan koefisien 1,2x. Rumus: Refund = biaya prabayar bagian yang dikurangi - (biaya prabayar bagian yang dikurangi × durasi penggunaan / durasi pembelian × 1,2)
  • Saat kebijakan overflow diatur ke "Auto overflow", permintaan yang melebihi kuota terjamin secara otomatis beralih ke penagihan pay-as-you-go standar tanpa gangguan layanan. Anda dapat melihat jumlah degradasi pada halaman detail di Overflow degradation statistics. Jika diatur ke "Reserved capacity only", permintaan yang melebihi kuota mengembalikan error 429 dan tidak dikenakan biaya tambahan.
  • Dalam 2 jam setelah layanan berakhir: instans masih Berjalan, dapat dipanggil, dan dapat diperpanjang; 2 hingga 14 jam setelah berakhir: instans dihentikan, tidak dapat dipanggil, tetapi masih dapat diperpanjang; 14 jam setelah berakhir: instans dihapus dan tidak dapat dipulihkan.
Beberapa model mendukung koefisien tier input panjang dan diskon cache. Kalkulator kapasitas menerapkan parameter ini secara otomatis. Detailnya sebagai berikut:

Model

Panjang input maks

Diskon Cache

Koefisien tier input panjang

Qwen3.8-max

1 Juta

0,125

Tidak ada tier (1,0)

Qwen3.6-flash-2026-04-16

256K

Cache tidak didukung

Tidak ada tier (1,0)

Seri Qwen lainnya

256K

0,2 (cache hit mengonsumsi kapasitas sebesar 20% dari laju normal)

Tidak ada tier (1,0)

glm-5.2

1 Juta

0,25 (cache hit mengonsumsi kapasitas sebesar 25% dari laju normal)

Tidak ada tier (1,0)

glm-5.1

200K

0,2 (cache hit mengonsumsi kapasitas sebesar 20% dari laju normal)

[0, 32K): input 1,0 / output 1,0
[32K, 200K]: input 1,33 / output 1,17

DeepSeek-v4-Pro-0813

1 Juta

0,1 (cache hit mengonsumsi kapasitas sebesar 10% dari laju normal)

Tidak ada tier (1,0)

DeepSeek-v4-Pro

256K

0,08 (cache hit mengonsumsi kapasitas sebesar 8% dari laju normal)

Tidak ada tier (1,0)

DeepSeek-v4-Flash-0731

1 Juta

0,1 (cache hit mengonsumsi kapasitas sebesar 10% dari laju normal)

Tidak ada tier (1,0)

DeepSeek-v4-Flash

256K

0,2 (cache hit mengonsumsi kapasitas sebesar 20% dari laju normal)

Tidak ada tier (1,0)

Kimi-K2.6

256K

0,2 (cache hit mengonsumsi kapasitas sebesar 20% dari laju normal)

Tidak ada tier (1,0)

Buat reservasi TPM

Prasyarat: layanan model Bailian telah diaktifkan dan ruang kerja telah dibuat. Masuk ke Konsol Bailian dan klik Create TPM reservation.
image
Membuat reservasi TPM memerlukan pembayaran di muka sekaligus. Kami menyarankan menggunakan kalkulator kapasitas TPM untuk memperkirakan TPM yang dibutuhkan dan mengonfirmasi biaya sebelum mengirimkan.
  1. Isi parameter berikut:

    Parameter

    Deskripsi

    Wajib

    Deskripsi nilai

    Nama reservasi

    Nama kustom untuk identifikasi.

    Ya

    ≤ 50 karakter

    Pilih model

    Pilih model yang akan dipesan kapasitasnya. Kode model khusus akan dihasilkan secara otomatis setelah pengiriman.

    Ya

    Hanya model yang mendukung reservasi TPM yang tersedia; lihat tampilan Konsol.

    Siklus penagihan

    Siklus penagihan.

    Ya

    Harian

    TPM input

    Throughput masukan yang dicadangkan, dalam kTPM (1 kTPM = 1.000 token/menit).

    Ya

    Nilai awal dan langkah bervariasi tergantung model; lihat tampilan Konsol.

    TPM output

    Throughput output terjadwal, dalam kTPM.

    Ya

    Nilai awal dan langkah bervariasi tergantung model; lihat tampilan Konsol.

    Durasi pembelian

    Durasi validitas reservasi.

    Ya

    Masukkan jumlah hari dalam kotak input. Nilai yang didukung: 1-30, 60, 90, 120, 365 hari.

    Auto-renewal on expiry

    Secara otomatis memotong pembayaran dan memperpanjang pada pukul 08.00 satu hari sebelum berakhir. Diaktifkan secara default.

    Tidak

    On / Off

    Durasi perpanjangan tunggal

    Durasi setiap perpanjangan otomatis.

    Tidak

    Masukkan jumlah hari dalam kotak input. Rentang nilainya sama dengan durasi pembelian.

    Kebijakan overflow

    Cara menangani permintaan yang melebihi kapasitas terjadwal saat habis.

    Ya

    Auto overflow ke pay-as-you-go per token (default; overflow beralih ke pay-as-you-go, tanpa gangguan layanan) / Hanya kapasitas terjadwal (overflow mengembalikan 429, tanpa biaya tambahan)

  2. Setelah mengonfirmasi parameter, klik Buy now. Pada dialog konfirmasi biaya, verifikasi biaya dan klik Confirm payment.
  3. Pada tab Overview halaman detail reservasi TPM, temukan Dedicated model code dan klik copy.
  4. Ganti parameter model dalam permintaan API Anda dengan kode model khusus yang telah disalin:
    Prasyarat: instans reservasi TPM telah dibuat dan statusnya Running.
    Parameter thinking_budget GLM-5.2 (yang membatasi panjang pemrosesan) tidak berlaku saat dipanggil.
# Saat volume permintaan melonjak dalam periode singkat, sistem memerlukan pemanasan singkat untuk mencocokkan komputasi yang dibutuhkan.
# Selama pemanasan, beberapa permintaan mungkin mengalami fluktuasi latensi. Stabilitas pulih setelah pemanasan selesai.
# Pastikan Anda memiliki mekanisme antrian permintaan atau retry.

import dashscope

response = dashscope.Generation.call(
    api_key="your-api-key",
    model="your-dedicated-model-code",   # Ganti dengan kode model khusus Anda
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.output.text)
# Saat volume permintaan melonjak dalam periode singkat, sistem memerlukan pemanasan singkat untuk mencocokkan komputasi yang dibutuhkan.
# Selama pemanasan, beberapa permintaan mungkin mengalami fluktuasi latensi. Stabilitas pulih setelah pemanasan selesai.
# Pastikan Anda memiliki mekanisme antrian permintaan atau retry.
curl -X POST https://dashscope.aliyuncs.com/compatible-mode/v1/chat/completions \
  -H "Authorization: Bearer $DASHSCOPE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"your-dedicated-model-code","messages":[{"role":"user","content":"Hello"}]}'

Kalkulator kapasitas TPM

Kalkulator kapasitas TPM di sisi kanan halaman pembuatan membantu Anda memperkirakan kuota TPM yang akan dibeli berdasarkan beban bisnis Anda. Setelah mengisi parameter berikut, kalkulator secara otomatis menghasilkan rekomendasi TPM input dan TPM output.

Parameter

Deskripsi

Dampak terhadap hasil

Permintaan per menit (RPM)

Jumlah permintaan yang dikirim per menit selama jam sibuk bisnis.

Semakin besar RPM, semakin besar TPM input dan output yang direkomendasikan secara proporsional.

Panjang input rata-rata (token)

Jumlah rata-rata token input per permintaan.

Semakin panjang input, semakin tinggi tier dan semakin besar koefisiennya, sehingga semakin tinggi TPM input yang direkomendasikan. Batas tier berbeda-beda tergantung model; lihat tampilan Konsol aktual.

Panjang output rata-rata (token)

Jumlah rata-rata token output per permintaan.

Semakin panjang output, semakin besar koefisiennya, sehingga semakin tinggi TPM output yang direkomendasikan.

Tingkat hit cache

Proporsi permintaan yang memiliki awalan berulang dan menghasilkan cache hit. Tingkat hit aktual bergantung pada pengulangan konten permintaan; lihat hasil waktu proses.

Semakin tinggi tingkat hit, semakin lambat konsumsi kapasitas input, sehingga semakin rendah TPM input yang direkomendasikan. Hanya memengaruhi TPM input, bukan TPM output.

image

Lihat dan kelola

Buka Konsol Bailian dan buka halaman daftar reservasi. Daftar menampilkan semua instans reservasi sebagai kartu model dan mendukung penyaringan berdasarkan model, waktu, dan status.
image

Detail reservasi

Klik kartu model target untuk membuka halaman detail, yang berisi tiga tab berikut:
  • Overview
  • Monitoring
  • API access
image
  • Informasi dasar: nama reservasi, kode model khusus (dapat disalin), model dasar, kapasitas input/output.
  • Kartu statistik (7 hari terakhir): jumlah reservasi aktif, total dan TPM penggunaan puncak, rata-rata utilisasi.
  • Tren utilisasi: alihkan antara arah input/output; menampilkan garis kapasitas terjadwal dan penggunaan aktual.
  • Statistik degradasi overflow: menunjukkan jumlah permintaan yang mengalami degradasi setelah melebihi kapasitas terjadwal (degradasi hanya terjadi di bawah kebijakan "Auto overflow").

Operasi manajemen

Pada daftar reservasi di tab Overview halaman detail, temukan instans target dan gunakan kolom Operasi untuk melakukan hal berikut:
  • Scaling
  • Renewal
  • Unsubscribe
image
Klik Scaling dan sesuaikan TPM input dan TPM output dalam dialog.
TPM input dan TPM output dapat diatur ke 0: setelah di-nol-kan, tidak ada biaya kapasitas yang dikenakan dan kode model khusus tetap dipertahankan, menghindari ketidakberlakuan kode akibat kedaluwarsa atau pembatalan langganan. Namun, penyetelan nol merupakan penurunan spesifikasi, dan bagian yang telah digunakan diselesaikan dengan koefisien penalti 1,5x (lihat Catatan penagihan dan penggunaan di atas).
Dalam 2 jam setelah layanan berakhir, statusnya Running; dari 2 hingga 14 jam setelah berakhir, statusnya Stopped; setelah 14 jam, statusnya Expired dan akhirnya dihapus.

Status

Deskripsi

Running

Berjalan normal; dapat dipanggil menggunakan kode model khusus.

Pending

Dibuat; menunggu berlaku.

Modifying

Scaling sedang berlangsung; layanan tidak terganggu selama periode ini.

Stopped

Dihentikan karena alasan seperti Pembayaran tertunda; dapat dipulihkan setelah perpanjangan.

Expired

Kedaluwarsa tanpa perpanjangan; sumber daya telah dilepas.

Canceled

Pembatalan langganan selesai; tidak dapat dikembalikan.

FAQ

Bergantung pada kebijakan overflow yang dipilih saat pembuatan: di bawah "Auto overflow", permintaan yang melebihi kapasitas terjadwal secara otomatis beralih ke penagihan pay-as-you-go tanpa gangguan layanan. Anda dapat melihat jumlah dan waktu degradasi pada tab Overview halaman detail di Overflow degradation statistics; jika degradasi sering terjadi, kami menyarankan melakukan scaling up. Di bawah "Reserved capacity only", permintaan yang melebihi kuota mengembalikan error 429 dan tidak dikenakan biaya tambahan; jika error 429 sering terjadi, kami menyarankan melakukan scaling up.
Setelah reservasi TPM dibuat, sistem secara otomatis menghasilkan kode model khusus. Anda dapat menyalin kode tersebut pada tab Overview halaman detail reservasi TPM. Anda harus mengganti parameter model dalam permintaan API Anda dengan kode ini untuk menggunakan kapasitas terjadwal.
Setelah reservasi berakhir, kode model khusus menjadi tidak berlaku, dan permintaan selanjutnya secara otomatis kembali ke pemrosesan sumber daya publik (pay-as-you-go). Kami menyarankan mengaktifkan Auto-renewal on expiry terlebih dahulu untuk menghindari dampak pada layanan.
Pada tab Overview halaman detail, lihat grafik tren penggunaan TPM dan statistik degradasi overflow. Jika utilisasi mendekati 100% atau degradasi sering terjadi, kami menyarankan meningkatkan TPM input/output.
"Harian" dihitung berdasarkan hari kalender: periode validitas berjalan dari saat instans berlaku hingga pukul 00.00.00 hari berikutnya, bukan 24 jam berkelanjutan sejak waktu pembelian. Misalnya, reservasi yang dibeli pukul 16.00 berakhir pukul 00.00, dengan durasi efektif sekitar 8 jam. Untuk mendapatkan kapasitas penuh satu hari, kami menyarankan melakukan pembelian di awal hari atau mengaktifkan Auto-renewal on expiry untuk memastikan layanan berkelanjutan.
Rencana Token (Team Edition)
Model playground
  • Pembuatan audio
  • Pembuatan musik
Statistik dan Pemantauan
Asset Center
Dukungan layanan