Skip to main content
更多

查詢模型限額

調用 GET /api/v1/models/limits 介面查詢當前 API Key 下各模型的限流配額,包括請求頻率限制和用量限制,用於瞭解和規劃 API 呼叫量。

前提條件

已建立 API Key 並配置為環境變數 DASHSCOPE_API_KEY。配置方法請參見配置API Key到環境變數

請求說明

  • HTTP 方法:GET
  • 請求地址
    調用時請將 {WorkspaceId} 替換為您的業務空間 ID。

    地區

    Endpoint

    華北2(北京)

    https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/models/limits

  • 認證方式 在請求 Header 中設定 Authorization: Bearer {API_KEY}

請求參數

所有參數均通過 Query String 傳遞。

參數

類型

必選

描述

name

String

按模型名稱進行模糊搜尋。樣本:qwen

model

String

按模型 ID 進行精確查詢。樣本:qwen3-max

page_no

Integer

頁碼,從 1 開始。預設值:1

page_size

Integer

每頁返回的模型數量。預設值:20

返回參數

參數

類型

描述

request_id

String

請求 ID,用於問題排查。

output.total

Number

合格模型總數。

output.page_no

Number

當前頁碼。

output.page_size

Number

每頁條數。

output.quotas[].model

String

模型 ID。

output.quotas[].workspace_id

String

業務空間 ID。

output.quotas[].model_limit

Object

帳號層級限流,即該模型在當前帳號下的總限流上限。包含以下欄位:

  • request_limit(Number):請求頻率限制值。

  • request_limit_period(Number):請求限流的時間周期,單位秒。值為 60 表示每分鐘(RPM),值為 1 表示每秒(QPS)。

  • usage_limit(Number):用量限制數。值為 null 表示無用量限制。

  • usage_limit_field(String):用量限制類型,如 total_tokens

  • usage_limit_period(Number):用量限制的時間周期,單位秒。

  • async_user_queue_limit(Number):非同步任務排隊數上限。

  • async_user_concurrency_limit(Number):非同步任務最大並發數。

output.quotas[].workspace_limit

Object

業務空間層級限流。您可以為每個業務空間單獨設定限流,但所有業務空間的總限流不能超過 model_limit。值為 null 表示未設定業務空間層級限制。包含的欄位與 model_limit 相同。

請求樣本

樣本一:查詢所有模型的限額
curl "https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/models/limits?page_no=1&page_size=100" \
    --header "Authorization: Bearer $DASHSCOPE_API_KEY" \
    --header "Content-Type: application/json"
樣本二:查詢特定模型的限額
curl "https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/models/limits?model=qwen3-max" \
    --header "Authorization: Bearer $DASHSCOPE_API_KEY" \
    --header "Content-Type: application/json"

返回樣本

{
    "code": null,
    "message": null,
    "success": true,
    "output": {
        "total": 453,
        "page_no": 1,
        "page_size": 10,
        "quotas": [
            {
                "model": "qwen3-max",
                "workspace_id": "llm-8l75168qayuhsr3o",
                "model_limit": {
                    "request_limit": 500,
                    "request_limit_period": 1,
                    "usage_limit": 500000,
                    "usage_limit_field": "total_tokens",
                    "usage_limit_period": 6,
                    "async_user_queue_limit": null,
                    "async_user_concurrency_limit": null
                },
                "workspace_limit": null
            },
            {
                "model": "wan2.6-i2v-flash",
                "workspace_id": "llm-8l75168qayuhsr3o",
                "model_limit": {
                    "request_limit": 5,
                    "request_limit_period": 1,
                    "usage_limit": null,
                    "usage_limit_field": null,
                    "usage_limit_period": null,
                    "async_user_queue_limit": 500,
                    "async_user_concurrency_limit": 5
                },
                "workspace_limit": null
            },
            {
                "model": "qwen-image-max",
                "workspace_id": "llm-8l75168qayuhsr3o",
                "model_limit": {
                    "request_limit": 2,
                    "request_limit_period": 60,
                    "usage_limit": 1000000,
                    "usage_limit_field": "total_tokens",
                    "usage_limit_period": 60,
                    "async_user_queue_limit": null,
                    "async_user_concurrency_limit": null
                },
                "workspace_limit": null
            }
        ]
    },
    "request_id": "2043b55f-f0d2-95ee-a449-234e1ee57042"
}
以上樣本中:
  • qwen3-max:每秒最多 500 次請求,每 6 秒最多使用 500,000 Token,未設定業務空間層級限制。
  • wan2.6-i2v-flash:每秒最多 5 次請求,無用量限制,非同步任務最大排隊數 500、最大並發數 5。
  • qwen-image-max:每分鐘最多 2 次請求,每分鐘最多使用 1,000,000 Token,未設定業務空間層級限制。

錯誤碼

如果調用失敗,會返回錯誤資訊。更多錯誤碼及解決方案,請參見錯誤資訊