Skip to main content
開始使用

限流

百鍊按主帳號維度對模型調用設定限流,帳號下所有RAM子帳號、業務空間和API Key 的調用量合并計算。超出限制時請求會被拒絕,通常在一分鐘內自動回復。

限流規則

  • 帳號層級限流:限流按主帳號維度計算,帳號下所有RAM子帳號、業務空間和API Key 的調用量合并計算。
  • 模型獨立限流:不同模型限流額度相互獨立,具體參見下方表格。

請求體大小限制

透過API發送請求時,網關對請求體(Request Body)大小有以下限制:
請求類型限制
不含Base64的請求請求體最大16 MiB
含Base64的請求(Anthropic協議)單個Base64內容最大32 MiB
含Base64的請求(其他協議)單個Base64內容最大20 MiB
含Base64的請求(整體請求體)最大64 MiB
含Base64的請求在服務端解碼後,整體請求體大小仍不得超過16 MiB。超過限制時,請求將被網關拒絕並返回HTTP 413錯誤。

FAQ

為什麼觸發限流?

根據錯誤資訊判斷觸發了哪類限流:
  • Requests rate limit exceededYou exceeded your current requests list:觸發了每分鐘請求數(RPM)限流。
  • Allocated quota exceededYou exceeded your current quota:觸發了每分鐘 Token 消耗(TPM)限流。
  • Request rate increased too quickly:請求頻率在短時間內激增,觸發了系統穩定性保護——即使總調用量未達到 RPM 或 TPM 上限也會觸發。
  • 其他報錯,參見錯誤碼確認原因。
除 RPM 和 TPM 外,限流策略可能按秒級 RPS(RPM/60)與 TPS(TPM/60)執行。即使每分鐘總調用量未超限,短時間內的請求爆發也可能觸發限流。

如何查看模型調用量?

模型調用完一小時後,在模型監控(新加坡北京)版面設定查詢條件(例如,選擇時間範圍、業務空間等),再在模型列表地區找到目標模型並單擊操作列的监控,即可查看該模型的調用統計結果。具體請參見模型監控文檔。
資料按小時更新,高峰期可能有小時級延遲,請您耐心等待。
image

遇到限流後多久恢複?

通常在一分鐘內恢複。如出現其他報錯,參見錯誤碼進行處理。

模型響應速度與付費有關嗎?

模型輸出速度與是否付費無關。免費額度和付費調用使用相同的模型服務基礎設施,同一模型的產生速度相同。免費額度僅控制請求是否被接受——額度耗盡時返回 403 錯誤(開通免費額度用完即停後),不會降低已接受請求的產生速度。

什麼因素影響模型響應速度?

  • 模型類型:輕量模型(如 qwen-flash)比大型模型(如 qwen-max)產生更快。
  • 輸出長度:輸出 Token 越多,總耗時越長。
  • 伺服器負載:高峰期可能略有波動。

限流會降低已接受請求的產生速度嗎?

不會。限流(RPM/TPM)僅導致超出限制的請求被拒絕(返回 429 錯誤)。免費額度耗盡時(開通免費額度用完即停)返回 403 錯誤,同樣不影響已接受請求的速度。429 為速率限制,403 為配額耗盡,兩者均為拒絕機制。

如何避免限流?

  1. 選用高限流模型:穩定版或最新版比帶日期的快照版本限流更寬鬆。
  2. 最佳化調用策略
    • 降低調用頻率:收到 Requests rate limit exceededYou exceeded your current requests list 時,降低API調用頻率。
    • 減少 Token 消耗:收到 Allocated quota exceededYou exceeded your current quota 時,縮短輸入或限制輸出長度。
    • 平滑請求速率:收到 Request rate increased too quickly 時,採用勻速調度、指數退避或請求隊列將請求均勻分散,避免瞬時高峰。
  3. 添加備選模型 觸發限流後切換到備用模型繼續產生,可降低失敗機率、提升輸送量。以下代碼在調用 qwen-plus-2025-07-28 觸發限流後,自動改用 qwen-plus-2025-07-14 重試。也可以選擇不同系列的模型(如 qwen-flash)作為備選模型,進一步降低主備模型同時限流的風險。
    import os
    import asyncio
    from openai import AsyncOpenAI, APIStatusError
    
    # 配置
    API_KEY = os.getenv("DASHSCOPE_API_KEY")
    # 主用模型
    MODEL = "qwen-plus-2025-07-28"
    # 備選模型
    BACKUP_MODEL = "qwen-plus-2025-07-14"
    # 測試問題
    QUESTION = "你是誰?"
    # 並發設定
    NUM_REQUESTS = 10
    
    client = AsyncOpenAI(
        api_key=API_KEY,
        # 調用時請將WorkspaceId替換為真實的業務空間ID
        base_url="https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/compatible-mode/v1"
    )
    
    async def send_request(model):
        """發送單個請求"""
        try:
            await client.chat.completions.create(
                model=model,
                messages=[{"role": "user", "content": QUESTION}]
            )
            return True
        except APIStatusError as e:
            if e.status_code == 429:
                print(f"[限流觸發] 模型 {model}")
                return False
            raise
        except Exception as e:
            print(f"[請求失敗] 模型 {model},錯誤:{e}")
            return False
    
    async def task(i):
        # 嘗試主模型
        if await send_request(MODEL):
            return True
        # 限流時嘗試備用模型
        return await send_request(BACKUP_MODEL)
    
    async def main():
        results = await asyncio.gather(*(task(i) for i in range(NUM_REQUESTS)))
        print(f"成功請求: {sum(results)}, 失敗請求: {len(results) - sum(results)}")
    
    if __name__ == "__main__":
        asyncio.run(main())
    
  4. 分割任務:長對話或大型文檔會快速消耗大量 Token。將大批量任務拆分為小批次,分時段提交。
  5. 批量推理:無需即時響應時,使用批量推理(Batch API)。批量請求不受即時限流約束,但需考慮排隊和處理時間。
  6. 提升限流額度:預設限流額度不足時,在百鍊控制台的限流提額頁面提升模型的臨時 TPM 額度,提交後立即生效。詳見提升臨時限流額度

如何控制 Token 用量或費用支出?

限流僅約束單位時間內的調用速率,不限制累計用量。如需控制 Token 用量或費用支出,可通過以下方式管理:
  • 設定消費限額與費用警示:在賬單費用卡片設定費用警示,開啟月度消費限額並配置閾值通知,達到閾值即提醒,避免超額支出。詳見賬單查詢與成本管理
  • 開啟免費額度用完即停:對支援免費額度的模型,可開啟免費額度用完即停,免費額度耗盡後自動停止調用,避免產生額外費用。詳見新人免費額度
  • 監控模型調用量:定期查看各模型的 Token 用量,及時發現異常增長,參見上文如何查看模型調用量?

儲值後是否還會被限流?

儲值不改變模型預設的 RPM 和 TPM 限流閾值。限流按阿里雲主帳號維度配置,與計費相互獨立;儲值(隨用隨付)僅確保帳號不因欠費停服,不會提升限流值。 如需更高的限流額度,請參見本文如何避免限流?,或在百鍊控制台的限流提額頁面申請提升臨時限流額度

提升臨時限流額度

預設限流額度不足時,可在百鍊控制台提升模型的臨時 TPM 額度。提交後立即生效,有效期間 30 天,到期後自動回復為系統預設值。 目前支援華北2(北京)和新加坡地區。
  1. 登入百鍊控制台,進入限流提額頁面。
  2. 單擊頁面右上方的提升模型臨時限流額度
  3. 在彈窗中選擇模型,填寫期望的 Token 帳號限流(Token/60 秒)值。彈窗中會顯示當前額度和可設定上限。
  4. 單擊確定,提額立即生效。
提額生效後,可通過以下方式確認:
  • 限流提額頁面的列表中,查看已提額的模型及對應限流資料。
  • 模型列表中進入對應模型的詳情頁,查看更新後的限流資料。
  • 支援臨時提額的模型以限流提額頁面彈窗的可選列表為準。
  • 對已提額的模型再次提交視為重新申請,有效期間隨之重設為 30 天。
  • 按實際需求申請額度。若配置容量長期顯著超過實際使用量,系統可能在提前通知後將其恢複為預設值。
  • 若限流額度不滿足需求,請聯絡商務經理申請提額。

文本產生-千問

千問語言模型

  • 新加坡
  • 美國(維吉尼亞)
  • 華北2(北京)
  • 德國(法蘭克福)
  • 中國香港
  • 日本(東京)
模型名稱服務部署範圍限流條件(超出任一數值時觸發限流)
以下為每分鐘限流條件,服務可能按 RPS(RPM/60)與 TPS(TPM/60)限制
每分鐘調用次數(RPM)每分鐘消耗Token數(TPM)
含輸入與輸出Token
qwen3.8-max國際15,0002,000,000
qwen3.8-max-0902國際15,000150,000
qwen3.8-flash國際15,0002,000,000
qwen3.7-max國際6001,000,000
qwen3.7-max-2026-06-08國際601,000,000
qwen3.7-max-2026-05-20國際601,000,000
qwen3.7-max-preview國際6001,000,000
qwen3.7-max-2026-05-17國際6001,000,000
qwen3.6-max-preview國際6001,000,000
qwen3-max國際6001,000,000
qwen3-max-2026-01-23國際6001,000,000
qwen3-max-2025-09-23國際60100,000
qwen3-max-preview國際6001,000,000
qwen-max
Batch API調用服務時,不受限流限制。
國際6001,000,000
qwen3.7-plus國際15,0005,000,000
qwen3.7-plus-2026-05-26國際601,000,000
qwen3.6-plus國際15,0005,000,000
qwen3.6-plus-2026-04-02國際601,000,000
qwen3.7-flash國際15,0005,000,000
qwen3.7-flash-2026-07-15國際15,0005,000,000
qwen3.6-flash國際15,0005,000,000
qwen3.6-flash-2026-04-16國際601,000,000
qwen3.5-plus國際15,0005,000,000
qwen3.5-plus-2026-04-20國際6001,000,000
qwen3.5-plus-2026-02-15國際601,000,000
qwen-plus
Batch API調用服務時,不受限流限制。
國際6001,000,000
qwen-plus-latest國際6001,000,000
qwen-plus-2025-12-01國際1201,000,000
qwen-plus-2025-09-11國際1201,000,000
qwen-plus-2025-07-28國際60100,000
qwen-plus-2025-07-14(qwen-plus-0714)國際60100,000
qwen-plus-2025-04-28(qwen-plus-0428)國際601,000,000
qwen-plus-2025-01-25(qwen-plus-0125)國際60100,000
qwen3.5-flash國際15,0005,000,000
qwen3.5-flash-2026-02-23國際601,000,000
qwen-flash
Batch API調用服務時,不受限流限制。
國際6005,000,000
qwen-flash-2025-07-28國際6005,000,000
qwq-plus國際60100,000
qwen-turbo
Batch API調用服務時,不受限流限制。
國際6005,000,000

千問VL(視覺理解/圖生文)

  • 新加坡
  • 美國(維吉尼亞)
  • 華北2(北京)
  • 德國(法蘭克福)
  • 中國香港
模型名稱服務部署範圍限流條件(超出任一數值時觸發限流)
以下為每分鐘限流條件,服務可能按 RPS(RPM/60)與 TPS(TPM/60)限制
每分鐘調用次數(RPM)每分鐘消耗Token數(TPM)
含輸入與輸出Token
qwen3-vl-plus國際1,2001,000,000
qwen3-vl-plus-2025-12-19國際60100,000
qwen3-vl-plus-2025-09-23國際1201,000,000
qwen3-vl-flash國際1,2001,000,000
qwen3-vl-flash-2026-01-22國際60100,000
qwen3-vl-flash-2025-10-15國際1201,000,000
qwen-vl-max國際1,2001,000,000
qwen-vl-plus國際1,2001,000,000
qvq-max國際60100,000

千問Omni(全模態)

  • 新加坡
  • 華北2(北京)
模型名稱服務部署範圍限流條件(超出任一數值時觸發限流)
以下為每分鐘限流條件,服務可能按 RPS(RPM/60)與 TPS(TPM/60)限制
每分鐘調用次數(RPM)每分鐘消耗Token數(TPM)
含輸入與輸出Token
qwen3.5-omni-flash國際60100,000
qwen3.5-omni-flash-2026-03-15國際60100,000
qwen3.5-omni-plus國際60100,000
qwen3.5-omni-plus-2026-03-15國際60100,000
qwen3-omni-flash國際60100,000
qwen3-omni-flash-2025-12-01國際60100,000
qwen3-omni-flash-2025-09-15國際60100,000
qwen-omni-turbo國際60100,000
qwen-omni-turbo-latest國際60100,000
qwen-omni-turbo-2025-03-26國際60100,000

千問Omni-Realtime(即時多模態)

  • 新加坡
  • 華北2(北京)
模型名稱服務部署範圍限流條件(超出任一數值時觸發限流)
以下為每分鐘限流條件,服務可能按 RPS(RPM/60)與 TPS(TPM/60)限制
每分鐘調用次數(RPM)每分鐘消耗Token數(TPM)
含輸入與輸出Token
qwen3.5-omni-plus-realtime國際60100,000
qwen3.5-omni-plus-realtime-2026-03-15國際60100,000
qwen3.5-omni-flash-realtime國際60100,000
qwen3.5-omni-flash-realtime-2026-03-15國際60100,000
qwen3-omni-flash-realtime國際60100,000
qwen3-omni-flash-realtime-2025-12-01國際60100,000
qwen3-omni-flash-realtime-2025-09-15國際60100,000
qwen-omni-turbo-realtime國際6010,000
qwen-omni-turbo-realtime-latest國際6010,000
qwen-omni-turbo-realtime-2025-05-08國際6010,000

千問OCR(文字提取)

  • 新加坡
  • 美國(維吉尼亞)
  • 華北2(北京)
  • 德國(法蘭克福)
模型名稱服務部署範圍限流條件(超出任一數值時觸發限流)
以下為每分鐘限流條件,服務可能按 RPS(RPM/60)與 TPS(TPM/60)限制
每分鐘調用次數(RPM)每分鐘消耗Token數(TPM)
含輸入與輸出Token
qwen-vl-ocr國際6006,000,000
qwen-vl-ocr-2025-11-20國際1,2006,000,000

千問數學模型

  • 華北2(北京)
模型名稱限流條件(超出任一數值時觸發限流)
以下為每分鐘限流條件,服務可能按 RPS(RPM/60)與 TPS(TPM/60)限制
每分鐘調用次數(RPM)每分鐘消耗Token數(TPM)
含輸入與輸出Token
qwen-math-plus1,2001,000,000
qwen-math-plus-latest1,2001,000,000
qwen-math-plus-2024-09-19(qwen-math-plus-0919)60100,000
qwen-math-plus-2024-08-16(qwen-math-plus-0816)1020,000
qwen-math-turbo12001,000,000

千問Coder

  • 新加坡
  • 美國(維吉尼亞)
  • 華北2(北京)
  • 德國(法蘭克福)
模型名稱服務部署範圍限流條件(超出任一數值時觸發限流)
以下為每分鐘限流條件,服務可能按 RPS(RPM/60)與 TPS(TPM/60)限制
每分鐘調用次數(RPM)每分鐘消耗Token數(TPM)
含輸入與輸出Token
qwen3-coder-plus國際2,4002,000,000
qwen3-coder-plus-2025-09-23國際6001,000,000
qwen3-coder-plus-2025-07-22國際601,000,000
qwen3-coder-flash國際6005,000,000
qwen3-coder-flash-2025-07-28國際6005,000,000

千問翻譯模型

  • 新加坡
  • 美國(維吉尼亞)
  • 華北2(北京)
  • 德國(法蘭克福)
模型名稱服務部署範圍限流條件(超出任一數值時觸發限流)
以下為每分鐘限流條件,服務可能按 RPS(RPM/60)與 TPS(TPM/60)限制
每分鐘調用次數(RPM)每分鐘消耗Token數(TPM)
含輸入與輸出Token
qwen-mt-plus國際60100,000
qwen-mt-flash國際60100,000
qwen-mt-lite國際60100,000
qwen-mt-turbo國際60100,000

千問資料採礦模型

  • 華北2(北京)
模型名稱限流條件(超出任一數值時觸發限流)
以下為每分鐘限流條件,服務可能按 RPS(RPM/60)與 TPS(TPM/60)限制
每分鐘調用次數(RPM)每分鐘消耗Token數(TPM)
含輸入與輸出Token
qwen-doc-turbo6003,000,000

千問深入研究模型

  • 華北2(北京)
模型名稱限流條件(超出任一數值時觸發限流)
以下為每分鐘限流條件,服務可能按 RPS(RPM/60)與 TPS(TPM/60)限制
每分鐘調用次數(RPM)每分鐘消耗Token數(TPM)
含輸入與輸出Token
qwen-deep-research1201,200,000

文本產生-千問-開源版

千問語言模型開源版

  • 新加坡
  • 美國(維吉尼亞)
  • 華北2(北京)
  • 德國(法蘭克福)
模型名稱服務部署範圍限流條件(超出任一數值時觸發限流)
以下為每分鐘限流條件,服務可能按 RPS(RPM/60)與 TPS(TPM/60)限制
每分鐘調用次數(RPM)每分鐘消耗Token數(TPM)
含輸入與輸出Token
qwen3.8-2.4t-a95b國際5,0005,000,000
qwen3.8-27b國際5,0005,000,000
qwen3.6-35b-a3b國際6001,000,000
qwen3.6-27b國際6001,000,000
qwen3.5-397b-a17b國際6001,000,000
qwen3.5-122b-a10b國際6001,000,000
qwen3.5-27b國際6001,000,000
qwen3.5-35b-a3b國際6005,000,000
qwen3-next-80b-a3b-thinking國際6001,000,000
qwen3-next-80b-a3b-instruct國際6001,000,000
qwen3-235b-a22b-thinking-2507國際6001,000,000
qwen3-235b-a22b-instruct-2507國際6001,000,000
qwen3-30b-a3b-thinking-2507國際6005,000,000
qwen3-30b-a3b-instruct-2507國際6005,000,000
qwen3-235b-a22b國際6001,000,000
qwen3-32b國際6001,000,000
qwen3-30b-a3b國際6001,000,000
qwen3-14b國際6001,000,000
qwen3-8b國際6001,000,000

Qwen-VL(視覺理解/圖生文)

  • 新加坡
  • 美國(維吉尼亞)
  • 華北2(北京)
  • 德國(法蘭克福)
模型名稱服務部署範圍限流條件(超出任一數值時觸發限流)
以下為每分鐘限流條件,服務可能按 RPS(RPM/60)與 TPS(TPM/60)限制
每分鐘調用次數(RPM)每分鐘消耗Token數(TPM)
含輸入與輸出Token
qwen3-vl-32b-thinking國際60100,000
qwen3-vl-32b-instruct國際60100,000
qwen3-vl-30b-a3b-thinking國際60100,000
qwen3-vl-30b-a3b-instruct國際60100,000
qwen3-vl-8b-thinking國際60100,000
qwen3-vl-8b-instruct國際60100,000
qwen3-vl-235b-a22b-thinking國際60100,000
qwen3-vl-235b-a22b-instruct國際60100,000

Qwen3-Omni

  • 新加坡
  • 華北2(北京)
模型名稱服務部署範圍限流條件(超出任一數值時觸發限流)
以下為每分鐘限流條件,服務可能按 RPS(RPM/60)與 TPS(TPM/60)限制
每分鐘調用次數(RPM)每分鐘消耗Token數(TPM)
含輸入與輸出Token
qwen2.5-omni-7b國際60100,000

Qwen3-Omni-Captioner

  • 新加坡
  • 華北2(北京)
模型名稱服務部署範圍限流條件(超出任一數值時觸發限流)
以下為每分鐘限流條件,服務可能按 RPS(RPM/60)與 TPS(TPM/60)限制
每分鐘調用次數(RPM)每分鐘消耗Token數(TPM)
含輸入與輸出Token
qwen3-omni-30b-a3b-captioner國際60100,000

Qwen-Coder

  • 新加坡
  • 美國(維吉尼亞)
  • 華北2(北京)
  • 德國(法蘭克福)
模型名稱服務部署範圍限流條件(超出任一數值時觸發限流)
以下為每分鐘限流條件,服務可能按 RPS(RPM/60)與 TPS(TPM/60)限制
每分鐘調用次數(RPM)每分鐘消耗Token數(TPM)
含輸入與輸出Token
qwen3-coder-next國際6001,000,000
qwen3-coder-480b-a35b-instruct國際6001,000,000
qwen3-coder-30b-a3b-instruct國際6001,000,000

文本產生-第三方模型

DeepSeek

  • 新加坡
  • 美國(維吉尼亞)
  • 華北2(北京)
  • 德國(法蘭克福)
  • 日本(東京)
  • 中國香港
模型名稱服務部署範圍限流條件(超出任一數值時觸發限流)
以下為每分鐘限流條件,服務可能按 RPS(RPM/60)與 TPS(TPM/60)限制
每分鐘調用次數(RPM)每分鐘消耗Token數(TPM)
含輸入與輸出Token
deepseek-v4-pro國際10,0001,200,000
deepseek-v4-pro-0813國際10,0001,200,000
deepseek-v4-flash-0731國際15,0001,200,000
deepseek-v4-flash國際10,0001,200,000
deepseek-v3.2國際10,0001,200,000

Kimi

  • 華北2(北京)
  • 美國(維吉尼亞)
  • 德國(法蘭克福)
  • 中國香港
  • 日本(東京)
  • 新加坡
模型名稱限流條件(超出任一數值時觸發限流)
以下為每分鐘限流條件,服務可能按 RPS(RPM/60)與 TPS(TPM/60)限制
每分鐘調用次數(RPM)每分鐘消耗Token數(TPM)
含輸入與輸出Token
kimi-k315,0001,200,000
kimi-k2.7-code5001,000,000
kimi-k2.65001,000,000
kimi-k2.55001,000,000
kimi-k2-thinking5001,000,000
Moonshot-Kimi-K2-Instruct5001,000,000

MiniMax

  • 華北2(北京)
模型名稱限流條件(超出任一數值時觸發限流)
以下為每分鐘限流條件,服務可能按 RPS(RPM/60)與 TPS(TPM/60)限制
每分鐘調用次數(RPM)每分鐘消耗Token數(TPM)
含輸入與輸出Token
MiniMax-M2.55001,000,000

GLM

  • 美國(維吉尼亞)
  • 華北2(北京)
  • 德國(法蘭克福)
  • 新加坡
  • 中國香港
  • 日本(東京)
模型名稱服務部署範圍限流條件(超出任一數值時觸發限流)
以下為每分鐘限流條件,服務可能按 RPS(RPM/60)與 TPS(TPM/60)限制
每分鐘調用次數(RPM)每分鐘消耗Token數(TPM)
含輸入與輸出Token
glm-5.2全球5001,000,000
glm-5.2-us美國5001,000,000
glm-5.1全球5001,000,000

GLM-Z.AI直供

  • 新加坡
模型名稱限流條件(超出任一數值時觸發限流)
以下為每分鐘限流條件,服務可能按 RPS(RPM/60)與 TPS(TPM/60)限制
每分鐘調用次數(RPM)每分鐘消耗Token數(TPM)
含輸入與輸出Token
ZHIPU/GLM-5.32003,000,000
ZHIPU/GLM-5.22003,000,000

映像產生

千問(Qwen-Image)

  • 新加坡
  • 華北2(北京)
  • 德國(法蘭克福)
  • 中國香港
  • 日本(東京)

模型名稱

服務部署範圍

限流條件(超出任一數值時觸發限流)

任務下發介面調用限制

同時處理中任務數量(並發數)

qwen-image-3.0-pro

國際

5 次/分鐘

同步介面無限制 / 非同步介面 10

qwen-image-3.0

國際

20 次/分鐘

同步介面無限制 / 非同步介面 10

qwen-image-2.0-pro

國際

2 次/分鐘

同步介面無限制

qwen-image-2.0-pro-2026-06-22

國際

2 次/分鐘

同步介面無限制

qwen-image-2.0-pro-2026-04-22

國際

2 次/分鐘

同步介面無限制

qwen-image-2.0-pro-2026-03-03

國際

2 次/分鐘

同步介面無限制

qwen-image-2.0

國際

2 次/秒

同步介面無限制

qwen-image-2.0-2026-03-03

國際

2 次/秒

同步介面無限制

qwen-image-max

國際

2 次/分鐘

同步介面無限制

qwen-image-max-2025-12-30

國際

2 次/分鐘

同步介面無限制

qwen-image-plus

國際

2 次/秒

同步介面無限制 / 非同步介面 2

qwen-image-plus-2026-01-09

國際

2 次/秒

同步介面無限制

qwen-image

國際

2 次/秒

同步介面無限制 / 非同步介面 2

qwen-image-edit-max

國際

2 次/分鐘

同步介面無限制

qwen-image-edit-max-2026-01-16

國際

2 次/分鐘

同步介面無限制

qwen-image-edit-plus

國際

2 次/秒

同步介面無限制

qwen-image-edit-plus-2025-12-15

國際

2 次/秒

同步介面無限制

qwen-image-edit-plus-2025-10-30

國際

2 次/秒

同步介面無限制

qwen-image-edit

國際

2 次/秒

同步介面無限制

文生圖-Z-Image

  • 新加坡
  • 華北2(北京)

模型名稱

服務部署範圍

限流條件(超出任一數值時觸發限流)

每秒鐘任務下發介面RPS限制

同時處理中任務數量(並發數)

z-image-turbo

國際

2

同步介面無限制

萬相

  • 新加坡
  • 美國(維吉尼亞)
  • 華北2(北京)
  • 德國(法蘭克福)

模型名稱

服務部署範圍

限流條件(超出任一數值時觸發限流)

每秒鐘任務下發介面RPS限制

同時處理中任務數量(並發數)

wan2.7-image-pro

國際

5

5

wan2.7-image

國際

5

5

wan2.6-image

國際

5

5

wan2.6-t2i

國際

5

5

wan2.5-t2i-preview

國際

5

5

wan2.2-t2i-flash

國際

2

2

wan2.2-t2i-plus

國際

2

2

wan2.1-t2i-turbo

國際

2

2

wan2.1-t2i-plus

國際

2

2

wan2.5-i2i-preview

國際

5

5

AI試衣OutfitAnyone

  • 華北2(北京)

模型名稱

限流條件(超出任一數值時觸發限流)

作業提交介面RPS限制

同時處理中任務數量

aitryon-plus

10

5

aitryon-parsing-v1

10

同步介面無限制

視頻產生

HappyHorse系列

  • 新加坡
  • 美國(維吉尼亞)
  • 華北2(北京)
  • 德國(法蘭克福)
  • 日本(東京)

模型名稱

服務部署範圍

限流條件(超出任一數值時觸發限流)

每秒鐘任務下發介面RPS限制

同時處理中任務數量(並發數)

happyhorse-1.1-t2v

國際

5

5

happyhorse-1.1-i2v

國際

5

5

happyhorse-1.1-r2v

國際

5

5

happyhorse-1.0-t2v

國際

5

5

happyhorse-1.0-i2v

國際

5

5

happyhorse-1.0-r2v

國際

5

5

happyhorse-1.0-video-edit

國際

5

5

萬相系列

  • 新加坡
  • 美國(維吉尼亞)
  • 華北2(北京)
  • 德國(法蘭克福)
  • 日本(東京)
  • 中國香港

模型名稱

服務部署範圍

限流條件(超出任一數值時觸發限流)

每秒鐘任務下發介面RPS限制

同時處理中任務數量(並發數)

wan3.0-video-prime

國際

5

5

wan3.0-video

國際

5

5

wan2.7-t2v-2026-06-12

國際

5

5

wan2.7-t2v-2026-04-25

國際

5

5

wan2.7-t2v

國際

5

5

wan2.6-t2v

國際

5

5

wan2.5-t2v-preview

國際

5

5

wan2.2-t2v-plus

國際

2

2

wan2.1-t2v-turbo

國際

2

2

wan2.1-t2v-plus

國際

2

2

wan2.7-i2v-2026-04-25

國際

5

5

wan2.7-i2v

國際

5

5

wan2.6-i2v-flash

國際

5

5

wan2.6-i2v

國際

5

5

wan2.5-i2v-preview

國際

5

5

wan2.2-i2v-flash

國際

2

2

wan2.1-i2v-plus

國際

2

2

wan2.1-i2v-turbo

國際

2

2

wan2.2-i2v-plus

國際

2

2

wan2.2-kf2v-flash

國際

2

2

wan2.1-kf2v-plus

國際

1

2

wan2.1-vace-plus

國際

2

2

wan2.7-videoedit

國際

5

5

wan2.7-r2v

國際

5

5

wan2.6-r2v-flash

國際

5

5

wan2.6-r2v

國際

5

5

wan2.2-animate-move

國際

5

1

wan2.2-animate-mix

國際

5

1

舞動人像AnimateAnyone

  • 華北2(北京)

模型名稱

任務下發介面RPS限制

同時處理中任務數量

animate-anyone-detect-gen2

5

同步介面無限制

animate-anyone-template-gen2

5

1

在同一時刻,只有1個作業實際處於運行狀態,其他隊列中的作業處於排隊狀態。

animate-anyone-gen2

5

1

在同一時刻,只有1個作業實際處於運行狀態,其他隊列中的作業處於排隊狀態。

悅動人像EMO

  • 華北2(北京)

模型名稱

任務下發介面RPS限制

同時處理中任務數量

emo-detect-v1

5

同步介面無限制

emo-v1

5

1

在同一時刻,只有1個作業實際處於運行狀態,其他隊列中的作業處於排隊狀態。

靈動人像LivePortrait

  • 華北2(北京)

模型名稱

任務下發介面RPS限制

同時處理中任務數量

liveportrait-detect

5

同步介面無限制

liveportrait

5

1

在同一時刻,只有1個作業實際處於運行狀態,其他隊列中的作業處於排隊狀態。

聲動人像VideoRetalk

  • 華北2(北京)

模型名稱

任務下發介面RPS限制

同時處理中任務數量

videoretalk

1

1

在同一時刻,只有1個作業實際處於運行狀態,其他隊列中的作業處於排隊狀態。

表情包Emoji

  • 華北2(北京)

模型名稱

任務下發介面RPS限制

同時處理中任務數量

emoji-detect-v1

1

同步介面無限制

emoji-v1

1

1

在同一時刻,只有1個作業實際處於運行狀態,其他隊列中的作業處於排隊狀態。

視頻風格重繪

  • 華北2(北京)

模型名稱

任務下發介面RPS限制

同時處理中任務數量

video-style-transform

20

2

在同一時刻,只有1個作業實際處於運行狀態,其他隊列中的作業處於排隊狀態。

音樂產生

  • 華北2(北京)

模型名稱

每分鐘調用次數(RPM)

fun-music-preview

180

fun-music-v1

180

語音對話

即時語音對話

  • 新加坡
  • 華北2(北京)
模型名稱服務部署範圍限流條件(超出任一數值時觸發限流)
以下為每分鐘限流條件,服務可能按 RPS(RPM/60)與 TPS(TPM/60)限制
每分鐘調用次數(RPM)每分鐘消耗Token數(TPM)
含輸入與輸出Token
qwen-audio-3.0-realtime-plus國際60100,000
qwen-audio-3.0-realtime-flash國際60100,000

語音合成(文本轉語音)

Qwen-Audio-TTS

  • 新加坡
  • 華北2(北京)

模型名稱

服務部署範圍

提交作業介面RPS限制

qwen-audio-3.0-tts-plus

國際

3

qwen-audio-3.0-tts-flash

國際

3

Qwen-TTS

  • 新加坡
  • 華北2(北京)
  • Qwen3-TTS-Instruct-Flash
  • Qwen3-TTS-VD
  • Qwen3-TTS-VC
  • Qwen3-TTS-Flash

模型名稱

服務部署範圍

每分鐘調用次數(RPM)

qwen3-tts-instruct-flash

國際

180

qwen3-tts-instruct-flash-2026-01-26

國際

180

Qwen-TTS-Realtime

  • 新加坡
  • 華北2(北京)
  • Qwen3-TTS-Instruct-Flash-Realtime
  • Qwen3-TTS-VD-Realtime
  • Qwen3-TTS-VC-Realtime
  • Qwen3-TTS-Flash-Realtime

模型名稱

服務部署範圍

每分鐘調用次數(RPM)

qwen3-tts-instruct-flash-realtime

國際

180

qwen3-tts-instruct-flash-realtime-2026-01-22

國際

180

Qwen-TTS聲音複刻

  • 新加坡
  • 華北2(北京)

模型名稱

服務部署範圍

每分鐘調用次數(RPM)

qwen-voice-enrollment

國際

180

Qwen-TTS聲音設計

  • 新加坡
  • 華北2(北京)

模型名稱

服務部署範圍

每分鐘調用次數(RPM)

qwen-voice-design

國際

180

CosyVoice

  • 新加坡
  • 華北2(北京)

模型名稱

服務部署範圍

提交作業介面RPS限制

cosyvoice-v3-plus

國際

3

cosyvoice-v3-flash

國際

Qwen-Audio-TTS/CosyVoice聲音複刻/設計

Qwen-Audio-TTS/CosyVoice聲音複刻/設計共用一個模型,共用限流額度。
  • 新加坡
  • 華北2(北京)

模型名稱

服務部署範圍

提交作業介面RPS限制

voice-enrollment

國際

10

語音辨識(語音轉文本)與翻譯(語音轉成指定語種的文本)

Qwen3-LiveTranslate-Flash

  • 新加坡
  • 華北2(北京)
模型名稱服務部署範圍限流條件(超出任一數值時觸發限流)
以下為每分鐘限流條件,服務可能按 RPS(RPM/60)與 TPS(TPM/60)限制
每分鐘調用次數(RPM)每分鐘消耗Token數(TPM)
含輸入與輸出Token
qwen3-livetranslate-flash國際100100,000
qwen3-livetranslate-flash-2025-12-01國際100100,000

Qwen-LiveTranslate-Flash-Realtime

  • 新加坡
  • 華北2(北京)
模型名稱服務部署範圍限流條件(超出任一數值時觸發限流)
以下為每分鐘限流條件,服務可能按 RPS(RPM/60)與 TPS(TPM/60)限制
每分鐘調用次數(RPM)每分鐘消耗Token數(TPM)
含輸入與輸出Token
qwen3.5-livetranslate-flash-realtime國際10100,000
qwen3.5-livetranslate-flash-realtime-2026-05-19國際
qwen3-livetranslate-flash-realtime國際
qwen3-livetranslate-flash-realtime-2025-09-22國際

Qwen-Audio-3.0-ASR-Flash-Streaming

  • 新加坡
  • 華北2(北京)

模型名稱

服務部署範圍

提交作業介面RPS限制

qwen-audio-3.0-asr-flash-streaming

國際

20

Qwen-Audio-3.0-ASR-Flash-Filetrans

  • 新加坡
  • 華北2(北京)

模型名稱

服務部署範圍

每分鐘調用次數(RPM)

qwen-audio-3.0-asr-flash-filetrans

國際

600

Qwen-Audio-3.0-ASR-Flash

  • 新加坡
  • 華北2(北京)

模型名稱

服務部署範圍

每分鐘調用次數(RPM)

qwen-audio-3.0-asr-flash

國際

600

Qwen-ASR

  • 新加坡
  • 美國(維吉尼亞)
  • 華北2(北京)
  • Qwen3-ASR-Flash-Filetrans
  • Qwen3-ASR-Flash

模型名稱

服務部署範圍

每分鐘調用次數(RPM)

qwen3-asr-flash-filetrans

國際

100

qwen3-asr-flash-filetrans-2025-11-17

國際

Qwen-ASR-Realtime

  • 新加坡
  • 華北2(北京)

模型名稱

服務部署範圍

每秒鐘調用次數(RPS)

qwen3-asr-flash-realtime

國際

20

qwen3-asr-flash-realtime-2026-02-10

國際

qwen3-asr-flash-realtime-2025-10-27

國際

Paraformer

  • 華北2(北京)

模型名稱

提交作業介面RPS限制

paraformer-realtime-v2

20

paraformer-realtime-8k-v2

模型名稱

每分鐘調用次數(RPM)

paraformer-v2

1,200

模型名稱

提交作業介面RPS限制

同時處理中任務數量(並發數)

paraformer-8k-v2

20

100

Fun-ASR

  • 新加坡
  • 華北2(北京)

模型名稱

服務部署範圍

每分鐘調用次數(RPM)

fun-asr

國際

600

fun-asr-2025-11-07

國際

600

fun-asr-2025-08-25

國際

600

fun-asr-mtl

國際

100

fun-asr-mtl-2025-08-25

國際

100

fun-asr-flash-2026-06-15

國際

600

Fun-ASR-Realtime

  • 新加坡
  • 華北2(北京)

模型名稱

服務部署範圍

提交作業介面RPS限制

fun-asr-realtime

國際

20

fun-asr-realtime-2025-11-07

國際

文本向量

  • 新加坡
  • 華北2(北京)
  • 中國香港
模型名稱服務部署範圍限流條件(超出任一數值時觸發限流)
以下為每分鐘限流條件,服務可能按 RPS(RPM/60)與 TPS(TPM/60)限制
每分鐘調用次數(RPM)每分鐘消耗Token數(TPM)
含輸入與輸出Token
qwen3.7-text-embedding國際24,0001,000,000
text-embedding-v4國際1,8001,000,000
text-embedding-v3國際6,00024,000,000

多模態向量

  • 新加坡
  • 華北2(北京)
模型名稱服務部署範圍限流條件
以下為每分鐘限流條件,服務可能按 RPS(RPM/60)與 TPS(TPM/60)限制
每分鐘調用次數(RPM)每分鐘消耗Token數(TPM)
僅輸入Token
tongyi-embedding-vision-plus國際600200,000
tongyi-embedding-vision-flash國際600200,000

排序模型

  • 新加坡
  • 華北2(北京)
模型名稱服務部署範圍限流條件
以下為每分鐘限流條件,服務可能按 RPS(RPM/60)與 TPS(TPM/60)限制
每分鐘調用次數(RPM)每分鐘消耗Token數(TPM)
僅輸入Token
qwen3-rerank國際5,4005,000,000,000

行業

意圖理解

  • 華北2(北京)
模型名稱限流條件(超出任一數值時觸發限流)
以下為每分鐘限流條件,服務可能按 RPS(RPM/60)與 TPS(TPM/60)限制
每分鐘調用次數(RPM)每分鐘消耗Token數(TPM)
含輸入與輸出Token
tongyi-intent-detect-v31,2001,000,000

角色扮演

  • 新加坡
  • 華北2(北京)
  • 美國(維吉尼亞)
模型名稱服務部署範圍限流條件(超出任一數值時觸發限流)
以下為每分鐘限流條件,服務可能按 RPS(RPM/60)與 TPS(TPM/60)限制
每分鐘調用次數(RPM)每分鐘消耗Token數(TPM)
含輸入與輸出Token
qwen-plus-character國際120500,000
qwen-flash-character國際120500,000
qwen-plus-character-ja國際120500,000

已下線模型

詳細資料,請參見 模型下線機制說明
  • 2026年1月30日下線
  • 2025年8月20日下線
類別模型名稱限流條件(超出任一數值時觸發限流)
每分鐘調用次數(RPM)每分鐘消耗Token數(TPM)
含輸入與輸出Token
千問Plusqwen-plus-2024-11-2700
qwen-plus-2024-11-25
qwen-plus-2024-09-19
qwen-plus-2024-08-06
千問Turboqwen-turbo-2024-09-19
千問VLqwen-vl-max-2024-10-30
qwen-vl-max-2024-08-09
qwen-vl-plus-2024-08-09
Token Plan
模型體驗
  • 音樂產生
用量統計與效能監控
資產中心
服務支援