本文檔介紹如何在阿里雲百鍊平台叫用 Z.AI 直供的模型推理服務。
服務開通
- 前往百鍊控制台,搜尋 ZHIPU/GLM,找到Z.AIGLM系列文本模型卡片,單擊立即開通;
- 在彈窗內確認開通及授權。
快速開始
ZHIPU/GLM-5.3 是 GLM 系列最新模型,支援真正可用的 1M 上下文。運行以下代碼快速調用思考模式的 ZHIPU/GLM-5.3 模型。
需要已擷取與配置 API Key並完成配置API Key到環境變數。如果通過SDK調用,需要安裝SDK。
- OpenAI相容
enable_thinking非 OpenAI 標準參數,OpenAI Python SDK 通過 extra_body傳入,Node.js SDK 作為頂層參數傳入。- Python
- Node.js
- HTTP
範例程式碼
返回結果
流式工具調用
ZHIPU/GLM-5.3、ZHIPU/GLM-5.2支援tool_stream參數(boolean,預設false),僅在stream為true時生效。開啟後,Function Calling 返回的 tool_call 參數(arguments)會以流式增量方式逐步返回。
stream與tool_stream的組合行為如下:
stream | tool_stream | tool_call 返回方式 |
|---|---|---|
true | true | arguments 以增量方式分多個 chunk 返回 |
true | false(預設) | arguments 在一個 chunk 中完整返回 |
false | true/false | tool_stream 不生效,arguments 在完整響應中一次性返回 |
- OpenAI相容
- Python
- Node.js
- curl
範例程式碼
思考控制(thinking.type 與 reasoning_effort)
ZHIPU/GLM-5.3 始終以思考模式運行,不支援關閉思考,請保持 thinking.type 為 enabled(使用 enable_thinking 時保持為 true),並通過 reasoning_effort 控制推理深度。
參數 | 說明 | 支援的值 |
|---|---|---|
| 控制是否開啟思考,預設為 |
|
| 控制模型的推理深度。未傳入時預設為 |
|
清除歷史思考(clear_thinking)
clear_thinking 參數用於控制多輪對話中是否將歷史輪次的 reasoning_content(思考過程)作為上下文輸入給模型。僅 GLM 系列模型支援。
true:忽略歷史輪次的reasoning_content,僅使用可見文本、工具調用與結果等非推理內容作為上下文輸入,可降低上下文長度與成本。false(預設):保留歷史輪次的reasoning_content並隨上下文一同提供給模型。若希望啟用 Preserved Thinking,必須在 messages 中完整、未修改、按原順序透傳歷史reasoning_content,缺失、裁剪、改寫或重排會導致效果下降或無法生效。
assistant 訊息中攜帶 reasoning_content)。設定 clear_thinking=true 後,歷史思考內容不會被計入上下文,因此 prompt_tokens 少於 false(預設)的情況,實際數值取決於歷史 reasoning_content 的長度。
- OpenAI相容
其它功能
| 模型 | 多輪對話 | Function Calling | 結構化輸出 | 連網搜尋 | 首碼續寫 | 上下文緩衝 | 思考深度控制 |
|---|---|---|---|---|---|---|---|
| ZHIPU/GLM-5.3 | 支援 | 支援 | 不支援 | 不支援 | 支援 | 支援 | 支援reasoning_effort |
| ZHIPU/GLM-5.2 | 支援 | 支援 | 支援僅非思考模式 | 不支援 | 支援 | 支援 | 支援reasoning_effort |
- 緩衝最少 Token 數為 512(百鍊為 256)。
參數預設值
模型 | enable_thinking | temperature | top_p | top_k | repetition_penalty |
|---|---|---|---|---|---|
ZHIPU/GLM-5.3 | true(不可關閉) | 1.0 | 0.95 | - | - |
ZHIPU/GLM-5.2 | true | 1.0 | 0.95 | - | - |
模型列表與計費
GLM 系列模型是Z.AI專為智能體設計的混合推理模型,提供思考與非思考兩種模式,其中 ZHIPU/GLM-5.3 僅支援思考模式。
模型上下文長度與價格資訊請參見百鍊控制台。
按照模型的輸入與輸出 Token 計費。
思考模式下,思維鏈按照輸出 Token 計費。
錯誤碼
如果執行報錯,請參見錯誤碼進行解決。
以下為Z.AI專屬的業務錯誤碼。HTTP 錯誤碼與百鍊通用錯誤碼一致,請參見上述連結。
錯誤分類 | 錯誤碼 | 錯誤資訊 |
|---|---|---|
基礎錯誤 | 500 | 內部錯誤 |
身分識別驗證錯誤 | 1000 | 身分識別驗證失敗 |
1001 | Header 中未收到 Authentication 參數,無法進行身分識別驗證 | |
1002 | Authentication Token 非法,請確認 Authentication Token 正確傳遞 | |
1003 | Authentication Token 已到期,請重建/擷取 | |
1004 | 通過 Authentication Token 的驗證失敗 | |
1100 | 賬戶讀寫 | |
賬戶錯誤 | 1110 | 您的賬戶當前處於非使用中。請檢查賬戶資訊 |
1111 | 您的賬戶不存在 | |
1112 | 您的賬戶已被鎖定,請聯絡客服解鎖 | |
1113 | 您的賬戶已欠費,請儲值後重試 | |
1120 | 無法成功訪問您的賬戶,請稍後重試 | |
1121 | 賬戶存違規行為,帳號已被鎖定 | |
API 呼叫錯誤 | 1200 | API 呼叫錯誤 |
1210 | API 呼叫參數有誤,請檢查文檔 | |
1211 | 模型不存在,請檢查模型代碼 | |
1212 | 當前模型不支援 | |
1213 | 未正常接收到 | |
1214 |
| |
1215 |
| |
1220 | 您無權訪問 | |
1221 | API | |
1222 | API | |
1230 | API 呼叫流程出錯 | |
1231 | 您已有請求: | |
1234 | 網路錯誤,錯誤id: | |
1261 | Prompt 超長 | |
API 策略阻止錯誤 | 1300 | API 呼叫被策略阻止 |
1301 | 系統檢測到輸入或產生內容可能包含不安全或敏感內容,請您避免輸入易產生敏感內容的提示,感謝您的配合 | |
1302 | 您當前使用該 API 的並發數過高,請降低並發,或聯絡客服增加限額 | |
1303 | 您當前使用該 API 的頻率過高,請降低頻率,或聯絡客服增加限額 | |
1304 | 該 API 已達今日調用次數限額,如有更多需求,請聯絡客服購買 | |
1305 | 該 API 已觸發流量限制 | |
1308 | 已達到 | |
1309 | 您的 GLM Coding Plan 套餐已到期,暫無法使用,前往官方續訂後即可恢複 https://bigmodel.cn/claude-code | |
1310 | 您已達到每周/每月使用上限,您的限額將在 | |
1311 | 當前訂閱套餐暫未開放 | |
1312 | 該模型當前訪問量過大,請您稍後再試,或切換其他模型如 | |
1313 | 您的賬戶當前使用模式不符合公平使用原則,請求頻率已受到限制。詳情請參閱《條款與協議-訂閱及自動續約協議》,如需恢複請前往個人中心-編程套餐總覽-頂部申請釋放保留 |