Skip to main content
Inferensi Model

Mode Cepat

Mode Cepat menyediakan TPS yang lebih tinggi untuk skenario yang sensitif terhadap latensi.

Penggunaan

Mode Cepat menyediakan fitur-fitur utama berikut:
  • Output berkecepatan tinggi: TPS ditingkatkan menjadi 1,5 hingga 2 kali lipat dibandingkan API standar. Fitur ini cocok untuk asisten pengkodean AI, penalaran Agent multi-langkah, percakapan real-time, dan skenario sensitif latensi lainnya.
  • Penagihan berbasis token: Logika penagihan sama dengan API standar, dengan biaya berdasarkan token input dan output.
  • Pembatasan laju khusus: Ketika volume panggilan mencapai batas laju, jika platform masih memiliki sumber daya cadangan, pembatasan laju tidak dipicu, sehingga TPS yang tersedia secara aktual tidak lebih rendah dari batas laju tersebut.
Untuk mengaktifkan Mode Cepat, atur parameter model ke ID model pada daftar Model yang Didukung. Tidak diperlukan parameter tambahan. Titik akhir menggunakan format https://{workspace_id}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1, di mana {workspace_id} dapat ditemukan di halaman Business Space Management setelah Anda beralih ke wilayah yang sesuai. Contoh panggilan dasar:
Nama model untuk mode prime glm 5.2 tetap glm-5.2-fast-preview.
curl -X POST https://{workspace_id}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.2-fast-preview",
    "messages": [{"role": "user", "content": "Who are you"}],
    "stream": false
}'

Model yang Didukung

  • Tiongkok (Beijing)
  • Singapura

Model generasi teks

Harga (per juta token)

Harga satuan input

Harga satuan output

Cache hit

glm-5.2-fast-preview

$2,200

$7,702

$0,550

Model generasi video

Harga ($/detik)

480P

720P

1080P

wan3.0-video-prime

$0,068/detik

$0,14/detik

$0,28/detik

Contoh

Model glm-5.2 secara default mengembalikan bidang reasoning_content untuk penalaran. Selama streaming, konten penalaran dan konten respons dikirimkan melalui delta.reasoning_content dan delta.content masing-masing. Contoh panggilan streaming:
from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ.get("API_KEY"),
    base_url=os.environ.get("BASE_URL"),
)

completion = client.chat.completions.create(
    model="glm-5.2-fast-preview",
    messages=[{"role": "user", "content": "Who are you"}],
    stream=True,
)

for chunk in completion:
    if not chunk.choices:
        continue
    delta = chunk.choices[0].delta
    if hasattr(delta, "reasoning_content") and delta.reasoning_content:
        print(delta.reasoning_content, end="", flush=True)
    if hasattr(delta, "content") and delta.content:
        print(delta.content, end="", flush=True)
Contoh tanggapan:
{
  "id": "chatcmpl-xxx",
  "object": "chat.completion",
  "model": "glm-5.2-fast-preview",
  "choices": [{
    "index": 0,
    "message": {
      "role": "assistant",
      "reasoning_content": "...",
      "content": "..."
    },
    "finish_reason": "stop"
  }],
  "usage": {
    "prompt_tokens": 14,
    "completion_tokens": 137,
    "total_tokens": 151,
    "prompt_tokens_details": { "cached_tokens": 0 },
    "completion_tokens_details": { "reasoning_tokens": 127 }
  }
}

Penagihan

Untuk aturan penagihan dan harga Mode Cepat, lihat Harga inferensi model.

Kode kesalahan

Untuk kode kesalahan yang mungkin terjadi saat Anda memanggil Mode Cepat dan solusi yang sesuai, lihat Kode kesalahan.
Rencana Token (Team Edition)
Model playground
  • Pembuatan audio
  • Pembuatan musik
Statistik dan Pemantauan
Asset Center
Dukungan layanan