Skip to main content
模型推理

快速模式

高速模式為對輸出速度敏感的情境提供更高的 TPS。

使用方式

優速模式具備以下關鍵特性:
  • 高速輸出:TPS 提升至標準 API 的 1.5~2 倍;適用於 AI 編程助手、Agent 多步推理、即時對話等對輸出速度敏感的情境。
  • 按 token 計費:計費邏輯與標準 API 一致,按輸入與輸出 token 計費。
  • 特殊限流:調用量達到限流值時,若平台仍有剩餘資源,則不會觸發限流,因此實際可用 TPS 不低於限流值。
調用時將 model 參數指定為支援的模型的 model ID 即可開啟,無需額外參數。接入網域名稱格式為 https://{workspace_id}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1,其中 {workspace_id}可在業務空間管理頁面切換到對應地區後查看。 基礎調用樣本:
glm 5.2 的 prime 模式的模型名稱仍然為 glm-5.2-fast-preview。
curl -X POST https://{workspace_id}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.2-fast-preview",
    "messages": [{"role": "user", "content": "你是誰"}],
    "stream": false
}'

支援的模型

  • 華北2(北京)
  • 新加坡

文本產生模型

模型計費(每百萬Token)

輸入單價

輸出單價

快取命中

glm-5.2-fast-preview

$2.200

$7.702

$0.550

視頻產生模型

模型計費($/秒)

480P

720P

1080P

wan3.0-video-prime

$0.068/秒

$0.14/秒

$0.28/秒

使用樣本

glm-5.2 預設返回 reasoning_content 思考欄位;流式輸出時思考內容與回答內容分別通過 delta.reasoning_contentdelta.content 推送。流式調用樣本:
from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ.get("API_KEY"),
    base_url=os.environ.get("BASE_URL"),
)

completion = client.chat.completions.create(
    model="glm-5.2-fast-preview",
    messages=[{"role": "user", "content": "你是誰"}],
    stream=True,
)

for chunk in completion:
    if not chunk.choices:
        continue
    delta = chunk.choices[0].delta
    if hasattr(delta, "reasoning_content") and delta.reasoning_content:
        print(delta.reasoning_content, end="", flush=True)
    if hasattr(delta, "content") and delta.content:
        print(delta.content, end="", flush=True)
返回樣本:
{
  "id": "chatcmpl-xxx",
  "object": "chat.completion",
  "model": "glm-5.2-fast-preview",
  "choices": [{
    "index": 0,
    "message": {
      "role": "assistant",
      "reasoning_content": "...",
      "content": "..."
    },
    "finish_reason": "stop"
  }],
  "usage": {
    "prompt_tokens": 14,
    "completion_tokens": 137,
    "total_tokens": 151,
    "prompt_tokens_details": { "cached_tokens": 0 },
    "completion_tokens_details": { "reasoning_tokens": 127 }
  }
}

計費說明

關於快速模式的計費規則與價格表,請參見 模型調用計費

錯誤碼

關於快速模式調用過程中可能出現的錯誤碼及對應的解決方案,請參見 錯誤碼
Token Plan
模型體驗
  • 音樂產生
用量統計與效能監控
資產中心
服務支援