Mode Cepat menyediakan TPS yang lebih tinggi untuk skenario yang sensitif terhadap latensi.
Penggunaan
Mode Cepat menyediakan fitur-fitur utama berikut:
- Output berkecepatan tinggi: TPS ditingkatkan menjadi 1,5 hingga 2 kali lipat dibandingkan API standar. Fitur ini cocok untuk asisten pengkodean AI, penalaran Agent multi-langkah, percakapan real-time, dan skenario sensitif latensi lainnya.
- Penagihan berbasis token: Logika penagihan sama dengan API standar, dengan biaya berdasarkan token input dan output.
- Pembatasan laju khusus: Ketika volume panggilan mencapai batas laju, jika platform masih memiliki sumber daya cadangan, pembatasan laju tidak dipicu, sehingga TPS yang tersedia secara aktual tidak lebih rendah dari batas laju tersebut.
https://{workspace_id}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1, di mana {workspace_id} dapat ditemukan di halaman Business Space Management setelah Anda beralih ke wilayah yang sesuai.
Contoh panggilan dasar:
Nama model untuk mode prime glm 5.2 tetap glm-5.2-fast-preview.
Model yang Didukung
- Tiongkok (Beijing)
- Singapura
Model generasi teks | Harga (per juta token) | ||
|---|---|---|---|
Harga satuan input | Harga satuan output | Cache hit | |
glm-5.2-fast-preview | $2,200 | $7,702 | $0,550 |
Model generasi video | Harga ($/detik) | ||
480P | 720P | 1080P | |
wan3.0-video-prime | $0,068/detik | $0,14/detik | $0,28/detik |
Contoh
Model glm-5.2 secara default mengembalikan bidang reasoning_content untuk penalaran. Selama streaming, konten penalaran dan konten respons dikirimkan melalui delta.reasoning_content dan delta.content masing-masing. Contoh panggilan streaming: