Dokumen ini mencakup kemampuan input panjang dan prefix caching pada penerapan throughput yang disediakan (PTU), termasuk aturan konsumsi kuota, penggunaan kalkulator kapasitas, serta deskripsi bidang respons API terkait.
Ikhtisar
Penerapan PTU mendukung permintaan input panjang (hingga 200K token untuk beberapa model) dan prefix caching, menggunakan faktor kapasitas bertingkat serta diskon cache untuk manajemen kuota yang fleksibel.
Fitur utama:
- Dukungan input panjang: Beberapa model mendukung input yang melebihi 32K token. Token input yang melebihi batas ini mengonsumsi kuota token per menit (TPM) Anda dengan laju lebih tinggi berdasarkan faktor bertingkat. Untuk informasi selengkapnya, lihat Aturan konsumsi kuota.
- Diskon prefix caching: Beberapa model mendukung prefix caching. Ketika suatu permintaan mengenai cache, token input yang di-cache mengonsumsi kuota dengan laju diskon yang bervariasi tergantung model. Hal ini dapat mengurangi konsumsi kuota untuk kasus penggunaan seperti percakapan multi-putaran dan permintaan dengan awalan berulang.
- Fallback otomatis ke bayar sesuai penggunaan: Jika suatu permintaan melebihi kuota PTU Anda atau panjang input maksimum model (128K untuk model Qwen / 64K untuk DeepSeek), sistem secara otomatis beralih ke metode penagihan bayar sesuai penggunaan. Anda tidak perlu mengubah kode pemanggilan Anda.
Aturan konsumsi kuota
Faktor kapasitas bertingkat untuk input panjang dan diskon cache bervariasi tergantung model. Tabel berikut mencantumkan parameter untuk model yang saat ini didukung.
Model | Panjang input maksimum | Diskon Cache | Faktor kapasitas bertingkat |
|---|---|---|---|
glm-5.1 | 200K | 0,2 (Token yang di-cache mengonsumsi kapasitas pada 20% dari laju normal) | [0, 32K): Input 1,0 / Output 1,0 |
deepseek-v4-pro | 64K | 0,08 (Token yang di-cache mengonsumsi kapasitas pada 8% dari laju normal) | Tidak ada tingkatan (1,0) |
qwen3.7-plus-2026-05-26 | 128K | 0,2 (Token yang di-cache mengonsumsi kapasitas pada 20% dari laju normal) | Tidak ada tingkatan (1,0) |
Model lainnya | Lihat detail di Konsol. | Tidak didukung | Tidak ada tingkatan (1,0) |
Contoh perhitungan (glm-5.1)
Perkirakan kuota dengan kalkulator kapasitas

Parameter | Deskripsi | Dampak terhadap hasil |
|---|---|---|
Requests per minute (RPM) | Jumlah permintaan per menit selama trafik puncak. | RPM yang lebih tinggi meningkatkan TPM input dan output yang direkomendasikan secara proporsional. |
Average input length (tokens) | Rata-rata jumlah token input per permintaan. | Input yang lebih panjang mungkin masuk ke tingkat yang lebih tinggi dengan faktor kapasitas lebih besar, sehingga meningkatkan TPM input yang direkomendasikan. Batas tingkat bervariasi tergantung model dan ditampilkan di Konsol. |
Average output length (tokens) | Rata-rata jumlah token output per permintaan. | Output yang lebih panjang mungkin memiliki faktor kapasitas lebih besar, sehingga meningkatkan TPM output yang direkomendasikan. |
Estimated cache hit rate (%) | Persentase awalan berulang dalam permintaan yang diperkirakan mengenai cache. Tingkat hit aktual bergantung pada tingkat pengulangan konten permintaan Anda dan dihitung saat waktu proses. | Tingkat hit yang lebih tinggi memperlambat konsumsi kuota input, sehingga menurunkan TPM input yang direkomendasikan. Ini hanya memengaruhi TPM input, bukan TPM output. |
Bidang respons API
Respons API untuk penerapan PTU mencakup bidang terkait kuota berikut untuk mengidentifikasi metode penagihan dan konsumsi kuota.
Bidang | Tipe | Deskripsi |
|---|---|---|
| String | Bidang tingkat atas dalam badan respons, konsisten di semua format API. Nilai |
| Integer | Jumlah token kuota PTU yang dikonsumsi, disesuaikan dengan faktor kapasitas bertingkat dan diskon cache. |
| Integer | Jumlah token yang mengenai prefix cache. Untuk informasi selengkapnya, lihat Context caching. |
- Kompatibilitas OpenAI Chat
- Respons OpenAI
- Kompatibilitas Anthropic
- DashScope
Bidang | Jalur JSON | Deskripsi |
|---|---|---|
|
| Hit cache untuk input. |
|
| Kuota PTU yang dikonsumsi oleh input. |
|
| Kuota PTU yang dikonsumsi oleh output. |
Pemantauan dan verifikasi
Anda dapat memantau penerapan PTU menggunakan fitur pemantauan model di Model Studio. Fitur ini memungkinkan Anda melihat metrik berikut yang terkait input panjang dan caching:
- Pemanfaatan PTU: Mencakup tiga kurva terpisah untuk input, output, dan output mode thought. Dalam skenario input panjang, faktor kapasitas bertingkat dapat menyebabkan pemanfaatan melebihi 100%, yang merupakan perilaku yang diharapkan.
- Penggunaan token dan hit cache: Mencakup deret data
cached_tokens, yang menunjukkan rasio token yang di-cache terhadap total token input. - Panggilan dalam kuota/luar kuota: Menunjukkan persentase permintaan yang beralih ke metode penagihan bayar sesuai penggunaan setelah melebihi kuota PTU.
FAQ
T: Apa yang terjadi ketika penggunaan melebihi kuota PTU?
T: Apa yang terjadi ketika penggunaan melebihi kuota PTU?
service_tier tidak ada atau diatur ke default, dan header respons berisi x-dashscope-ptu-overflow:true. Layanan Anda tetap berjalan tanpa gangguan.T: Apa yang terjadi jika satu input melebihi panjang maksimum model?
T: Apa yang terjadi jika satu input melebihi panjang maksimum model?
T: Bagaimana cara memastikan caching berfungsi?
T: Bagaimana cara memastikan caching berfungsi?
cached_tokens dalam respons API. Nilai lebih dari 0 menunjukkan adanya hit prefix cache. Bagian yang di-cache mengonsumsi kuota dengan laju diskon spesifik model (untuk detailnya, lihat Aturan konsumsi kuota). Anda juga dapat melihat trennya di grafik penggunaan token pada halaman pemantauan di Konsol.T: Mengapa cached_tokens selalu 0, yang menunjukkan caching tidak berfungsi?
T: Mengapa cached_tokens selalu 0, yang menunjukkan caching tidak berfungsi?
T: Mengapa pemanfaatan melebihi 100%?
T: Mengapa pemanfaatan melebihi 100%?