高速模式為對輸出速度敏感的情境提供更高的 TPS。
使用方式
優速模式具備以下關鍵特性:
- 高速輸出:TPS 提升至標準 API 的 1.5~2 倍;適用於 AI 編程助手、Agent 多步推理、即時對話等對輸出速度敏感的情境。
- 按 token 計費:計費邏輯與標準 API 一致,按輸入與輸出 token 計費。
- 特殊限流:調用量達到限流值時,若平台仍有剩餘資源,則不會觸發限流,因此實際可用 TPS 不低於限流值。
https://{workspace_id}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1,其中 {workspace_id}可在業務空間管理頁面切換到對應地區後查看。
基礎調用樣本:
glm 5.2 的 prime 模式的模型名稱仍然為 glm-5.2-fast-preview。
支援的模型
- 華北2(北京)
- 新加坡
文本產生模型 | 模型計費(每百萬Token) | ||
|---|---|---|---|
輸入單價 | 輸出單價 | 快取命中 | |
glm-5.2-fast-preview | $2.200 | $7.702 | $0.550 |
視頻產生模型 | 模型計費($/秒) | ||
480P | 720P | 1080P | |
wan3.0-video-prime | $0.068/秒 | $0.14/秒 | $0.28/秒 |
使用樣本
glm-5.2 預設返回 reasoning_content 思考欄位;流式輸出時思考內容與回答內容分別通過 delta.reasoning_content 與 delta.content 推送。流式調用樣本: