對於資料標註、內容產生等無需即時響應的情境,即時推理API存在成本高、並發受限的問題。阿里雲百鍊的批量對話(Batch Chat)API ,保持了與即時API一致的同步調用方式,您只需發起請求等待最終結果返回。目前該功能享有 官網限時 5 折優惠 ,能將您的推理成本直接降低 50%。
本介面僅支援提交單個請求。如需一次性傳入多個請求,可通過檔案方式提交,詳情請參考OpenAI相容-Batch(檔案輸入)。
工作原理
- 請求提交:用戶端發起請求並建立串連。
- 串連保持:請求進入隊列排隊,用戶端保持串連等待。
-
同步返回:請求處理完成後,服務端通過之前持續連線,將完整結果一次性返回給用戶端。
如果超過最長等待時間,串連將自動斷開並返回逾時錯誤。
適用範圍
- 華北2(北京)
- 文本產生模型:qwen3.7-max、qwen3.7-plus、qwen3.6-plus、qwen3.7-flash、qwen3.7-flash-2026-07-15、qwen3.6-flash、qwen3.5-plus、qwen3.5-flash、qwen3-max、qwen-plus、qwen-flash、deepseek-v3.2
- 映像與視頻理解模型:qwen3.7-plus、qwen3.6-plus、qwen3.7-flash、qwen3.7-flash-2026-07-15、qwen3.6-flash、qwen3.5-plus、qwen3.5-flash、qwen3.5-omni-plus、qwen3-vl-plus、qwen3-vl-flash
如何使用
前提條件
-
已開通阿里雲百鍊服務,並已擷取 API Key。
建議配置API Key到環境變數中以降低API Key的泄露風險。
- 若通過OpenAI SDK進行調用,需要安裝SDK。
步驟1:配置 API 端點
只需修改 API 端點(base_url),即可輕鬆將現有的即時推理請求切換至批量推理。請根據調用方式,配置正確的 API 端點。
SDK配置:將base_url設定為https://batch.dashscope.aliyuncs.com/compatible-mode/v1
HTTP調用:請求端點為POST https://batch.dashscope.aliyuncs.com/compatible-mode/v1/chat/completions
步驟2:發起調用
此處以文本對話為例,展示如何調用 Batch Chat 介面。
請求的預設等待逾時時間為3600秒(1小時),在多數情況下無需額外配置。
下方樣本展示如何主動設定一個自訂的逾時時間(60-3600秒)作為參考。
- Python
- Java
- Node.js
- Go
- C#(HTTP)
- PHP(HTTP)
- curl
請求樣本響應樣本
使用限制
- 等待時間:提交請求後,會同步等待結果,服務端最長會保持串連3600秒(1小時)。可根據實際需求設定自訂逾時時間,取值範圍為60-3600秒。
- 並發限制:單個賬戶為每個模型最多可維持10,000個等待中的請求。超出此限制的新請求將被拒絕並返回相應錯誤碼,直到有請求完成並釋放出可用位置。
-
調用速率:單個賬戶提交請求的頻率上限為 1000 QPS(10,000次 / 10秒)。
此上限為系統設定的理論最大值。在實際調用中,API的可用資源會受到整體系統負載的動態影響,建議您在代碼中實現重試邏輯。
計費說明
- 計費單價:按成功請求的輸入和輸出Token計費,目錄價與對應模型即時調用價格一致。官網限時為 Batch Chat 調用提供 5 折優惠,其最終費用為即時調用價格的 50%,具體請參見模型列表。
- 計費範圍:僅對任務中成功執行的請求進行計費。任何失敗的請求(包括系統錯誤或逾時)均不計費。
錯誤碼
如果模型調用失敗並返回報錯資訊,請參見錯誤碼進行解決。
常見問題
- Batch Chat 請求耗時和即時 API 比較有區別嗎? 有區別。Batch Chat 請求需要排隊等待調度,因此端到端耗時通常高於即時 API。請求在服務端最長等待時間為1小時,逾時未執行將自動斷開並返回錯誤。
- 如何選擇使用 Batch Chat 還是Batch File? 當商務邏輯需要以 API 同步調用的方式、高並發地提交大量獨立的對話請求時,選擇 Batch Chat。當需要處理的是包含大量請求的單個大檔案,並且可以接受非同步擷取結果檔案,則選擇 Batch File。
- Batch Chat 能保證請求全部完成嗎? 不保證。Batch Chat 使用的是 Batch 資源,完成情況取決於系統資源分派情況。如果系統資源繁忙,請求可能在隊列中等待。若超過最長等待時間仍未被調度執行,串連將逾時斷開,此時請求不會被計費,可以稍後重試。
相關文檔
- 查看模型即時調用的完整參數列表,請參閱OpenAI相容-Chat。
- 如需通過提交檔案進行批量處理,並非同步擷取結果,請參閱OpenAI相容-Batch(檔案輸入)。