Skip to main content
文本產生

深度思考

深度思考模型在產生回複前先進行推理,從而在邏輯推理、數學計算等複雜任務中提升準確性。本文介紹如何通過API調用 Qwen、DeepSeek 等深度思考模型。

本文介紹如何通過 OpenAI 相容的 Chat Completion 介面或 DashScope 介面調用深度思考模型。 Responses API用法參見: 深度思考

效果示範

以下是一個深度思考模型的對話樣本,展示模型如何先進行推理再給出回答。

使用者提問

9.9和9.11誰大

思考過程(reasoning_content 欄位)

首先,使用者的問題是:"9.9和9.11誰大",這看起來是在比較兩個數字:9.9 和 9.11。

我需要理解這些數位含義。在數學中,9.9 等同於 9.90,而 9.11 是 9.11。

為了比較它們,我應該將它們視為小數。9.9 是 9 + 9/10 = 9.9,而 9.11 是 9 + 11/100 = 9.11。

現在,比較 9.9 和 9.11:9.9 等於 9.90(因為 9.9 = 9.90),9.11 是 9.11。現在,9.90 與 9.11 比較:9.90 大於 9.11,因為 90/100 > 11/100。

更精確地:9.9 = 99/10 = 990/100,9.11 = 911/100,990/100 與 911/100 比較,顯然 990 > 911,所以 990/100 > 911/100,因此 9.9 > 9.11。

我也可以直接看小數部分:9.9 的小數部分是 0.9,9.11 的小數部分是 0.11。0.9 大於 0.11,因為 0.9 = 0.90 > 0.11。

所以,9.9 大於 9.11。

模型回答(content 欄位)

結論:9.9 大於 9.11。

使用方式

百鍊深度思考模型分為兩種模式:
  • 混合思考模式:通過enable_thinking參數控制思考開關:
    • 設為true:模型先思考再回複;
    • 設為false:模型直接回複;
    • OpenAI 相容
    • DashScope
    # 匯入依賴與建立用戶端...
    completion = client.chat.completions.create(
        model="qwen3.8-max", # 選擇模型
        messages=[{"role": "user", "content": "你是誰"}],
        # 由於 enable_thinking 非 OpenAI 標準參數,需要通過 extra_body 傳入
        extra_body={"enable_thinking":True},
        # 流式輸出方式調用
        stream=True,
        # 使流式返回的最後一個資料包包含Token消耗資訊
        stream_options={
            "include_usage": True
        }
    )
    
  • 僅思考模式:模型始終在回複前進行思考,無法關閉。除無需設定 enable_thinking 參數外,請求格式與混合思考模式一致。
思考內容通過reasoning_content欄位返回,回複內容通過content欄位返回。深度思考需要額外推理時間,本文樣本預設採用流式調用(推薦,可即時查看思考過程、避免長時間等待)。商業版深度思考模型同時支援非流式(同步)輸出,用法及注意事項參見下方常見問題;部分模型(如 qwen3-235b-a22b、qwen3-32b 等開源版)僅支援流式輸出,非流式調用會報錯。

支援的模型

  • Qwen3.8
  • Qwen3.7
  • Qwen3.6
  • Qwen3.5
  • Qwen3
  • QwQ (基於 Qwen2.5)
  • DeepSeek
  • GLM
  • Kimi
  • MiniMax
千問3.8 Max系列(混合思考模式,預設開啟思考模式):qwen3.8-max千問3.8 Flash系列(混合思考模式,預設開啟思考模式):qwen3.8-flash千問3.8 開源系列(混合思考模式,預設開啟思考模式):qwen3.8-2.4t-a95b

快速開始

API 使用前提:已擷取與配置 API Key並完成配置API Key到環境變數。如果通過SDK調用,需要安裝 OpenAI 或 DashScope SDK(DashScope Java SDK需不低於 2.19.4 版本)。 以下代碼以流式調用 qwen3.8-max 開啟思考模式為例。
  • OpenAI相容
  • DashScope
  • Python
  • Node.js
  • HTTP

範例程式碼

from openai import OpenAI
import os

# 初始化OpenAI用戶端
client = OpenAI(
    # 各地區的API Key不同。擷取API Key:https://www.alibabacloud.com/help/zh/model-studio/get-api-key
    # 如果沒有配置環境變數,請用阿里雲百鍊API Key替換:api_key="sk-xxx"
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    # 以下為新加坡地區配置,調用時請將{WorkspaceId}替換為真實的業務空間ID,各地區的配置不同。
    base_url="https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/compatible-mode/v1",
)

messages = [{"role": "user", "content": "你是誰"}]

completion = client.chat.completions.create(
    model="qwen3.8-max",  # 您可以按需更換為其它深度思考模型
    messages=messages,
    extra_body={"enable_thinking": True},
    stream=True,
    stream_options={
        "include_usage": True
    },
)

reasoning_content = ""  # 完整思考過程
answer_content = ""  # 完整回複
is_answering = False  # 是否進入回複階段
print("\n" + "=" * 20 + "思考過程" + "=" * 20 + "\n")

for chunk in completion:
    if not chunk.choices:
        print("\nUsage:")
        print(chunk.usage)
        continue

    delta = chunk.choices[0].delta

    # 只收集思考內容
    if hasattr(delta, "reasoning_content") and delta.reasoning_content is not None:
        if not is_answering:
            print(delta.reasoning_content, end="", flush=True)
        reasoning_content += delta.reasoning_content

    # 收到content,開始進行回複
    if hasattr(delta, "content") and delta.content:
        if not is_answering:
            print("\n" + "=" * 20 + "完整回複" + "=" * 20 + "\n")
            is_answering = True
        print(delta.content, end="", flush=True)
        answer_content += delta.content

返回結果

====================思考過程====================

好的,使用者問“你是誰”,我需要給出一個準確且友好的回答。首先,我要確認自己的身份,即千問,由阿里巴巴集團旗下的通義實驗室研發。接下來,應該說明我的主要功能,比如回答問題、創作文字、邏輯推理等。同時,要保持語氣親切,避免過於技術化,讓使用者感覺輕鬆。還要注意不要使用複雜術語,確保回答簡潔明了。另外,可能需要加入一些互動元素,邀請使用者提問,促進進一步交流。最後,檢查是否有遺漏的重要訊息,比如我的中文名稱“千問”和英文名稱“Qwen”,以及所屬公司和實驗室。確保回答全面且符合使用者期望。
====================完整回複====================

你好!我是千問,是阿里巴巴集團旗下的通義實驗室自主研發的超大規模語言模型。我可以回答問題、創作文字、進行邏輯推理、編程等,旨在為使用者提供高品質的資訊和服務。你可以叫我Qwen,或者直接叫我千問。有什麼我可以幫你的嗎?

核心能力

切換思考/非思考模式

啟用思考模式可提升回複品質,但會增加響應延遲和 Token 消耗。使用混合思考模式的模型時,可根據問題複雜度動態切換,無需更換模型:
  • 簡單任務(日常聊天、簡單問答):將enable_thinking設為false關閉思考;
  • 複雜任務(邏輯推理、代碼產生、數學解答):將enable_thinking設為true開啟思考。
  • OpenAI相容
  • DashScope
enable_thinking非 OpenAI 標準參數,若使用 OpenAI Python SDK請通過 extra_body傳入,Node.js SDK中作為頂層參數傳入。
  • Python
  • Node.js
  • HTTP

範例程式碼

from openai import OpenAI
import os

# 初始化OpenAI用戶端
client = OpenAI(
    # 如果沒有配置環境變數,請用阿里雲百鍊API Key替換:api_key="sk-xxx"
    # 各地區的API Key不同。擷取API Key:https://www.alibabacloud.com/help/zh/model-studio/get-api-key
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    # 以下為新加坡地區配置,調用時請將{WorkspaceId}替換為真實的業務空間ID,各地區的配置不同。
    base_url="https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/compatible-mode/v1",
)

messages = [{"role": "user", "content": "你是誰"}]
completion = client.chat.completions.create(
    model="qwen3.8-max",
    messages=messages,
    # 通過 extra_body 設定 enable_thinking 開啟思考過程
    extra_body={"enable_thinking": True},
    stream=True,
    stream_options={
        "include_usage": True
    },
)

reasoning_content = ""  # 完整思考過程
answer_content = ""  # 完整回複
is_answering = False  # 是否進入回複階段
print("\n" + "=" * 20 + "思考過程" + "=" * 20 + "\n")

for chunk in completion:
    if not chunk.choices:
        print("\n" + "=" * 20 + "Token 消耗" + "=" * 20 + "\n")
        print(chunk.usage)
        continue

    delta = chunk.choices[0].delta

    # 只收集思考內容
    if hasattr(delta, "reasoning_content") and delta.reasoning_content is not None:
        if not is_answering:
            print(delta.reasoning_content, end="", flush=True)
        reasoning_content += delta.reasoning_content

    # 收到content,開始進行回複
    if hasattr(delta, "content") and delta.content:
        if not is_answering:
            print("\n" + "=" * 20 + "完整回複" + "=" * 20 + "\n")
            is_answering = True
        print(delta.content, end="", flush=True)
        answer_content += delta.content

返回結果

====================思考過程====================

嗯,使用者問“你是誰”,我需要先確定他們想知道什麼。可能他們第一次接觸我,或者想確認我的身份。我應該先介紹自己是千問,由通義實驗室研發。然後要說明我的功能,比如回答問題、創作文字、編程等,這樣使用者瞭解我能提供什麼協助。還要提到我支援多種語言,這樣國際使用者也會知道他們可以用不同語言交流。最後保持友好,邀請他們提問,這樣可以促進進一步互動。要注意簡潔明了,避免技術術語太多,讓使用者容易理解。可能使用者需要的是快速瞭解我的能力,所以重點放在功能和用途上。還要檢查有沒有遺漏的資訊,比如是否要提到阿里巴巴集團,或者更多技術細節。不過使用者可能只需要基本的資訊,不需要太深入。確保回答友好且專業,同時鼓勵使用者繼續提問。
====================完整回複====================

我是千問,由通義實驗室研發的超大規模語言模型。我可以協助你回答問題、創作文字、編程、表達觀點等,支援多語言交流。有什麼需要我幫忙的嗎?
====================Token 消耗====================

CompletionUsage(completion_tokens=221, prompt_tokens=10, total_tokens=231, completion_tokens_details=CompletionTokensDetails(accepted_prediction_tokens=None, audio_tokens=None, reasoning_tokens=172, rejected_prediction_tokens=None), prompt_tokens_details=PromptTokensDetails(audio_tokens=None, cached_tokens=0))
此外,Qwen3 開源版混合思考模型以及 qwen-plus-2025-04-28 模型支援通過提示詞動態控制思考模式。enable_thinkingtrue時,在提示詞中加入/no_think可關閉思考;多輪對話中如需重新開啟,在最新提示詞中加入/think即可。模型始終遵循最新的/think/no_think指令。

限制思考長度

深度思考模型有時會產生冗長的推理過程,增加等待時間並消耗更多 Token。通過thinking_budget參數可設定推理過程的最大 Token 數,超過限制後模型立即輸出回複。
thinking_budget 預設值為模型的最大思維鏈長度,請參見百鍊控制台的模型卡片。
thinking_budget參數支援思考過程的最大 Token 數。適用於Qwen3.7、Qwen3.6、Qwen3.5、Qwen3-VL、Qwen3、GLM、Kimi系列模型。

控制台體驗深度思考

  1. 登入大模型服務平台百鍊控制台。
  2. 在左側導覽列選擇體驗 > 文本模型,進入模型體驗中心。
  3. 頁面預設展示 Qwen3.7-Max 模型,也可單擊模型名稱,在下拉式清單中選擇其他 Qwen3 系列模型。
  4. 在輸入框底部單擊深度思考,開啟推理模式,查看模型的思考過程。
  5. 切換到模型調試標籤頁,在配置面板中設定thinking_budget參數,控制思維鏈輸出的最大 Token 數量,取值範圍 1~32768,預設值 4000。如需體驗更多模型,可前往百鍊模型廣場。
  • OpenAI相容
  • DashScope
  • Python
  • Node.js
  • HTTP

範例程式碼

from openai import OpenAI
import os

# 初始化OpenAI用戶端
client = OpenAI(
    # 如果沒有配置環境變數,請用阿里雲百鍊API Key替換:api_key="sk-xxx"
    # 各地區的API Key不同。擷取API Key:https://www.alibabacloud.com/help/zh/model-studio/get-api-key
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    # 以下為新加坡地區配置,調用時請將{WorkspaceId}替換為真實的業務空間ID,各地區的配置不同。
    base_url="https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/compatible-mode/v1",
)

messages = [{"role": "user", "content": "你是誰"}]

completion = client.chat.completions.create(
    model="qwen3.8-max",
    messages=messages,
    # enable_thinking 參數開啟思考過程,thinking_budget 參數設定最大推理過程 Token 數
    extra_body={
        "enable_thinking": True,
        "thinking_budget": 50
        },
    stream=True,
    stream_options={
        "include_usage": True
    },
)

reasoning_content = ""  # 完整思考過程
answer_content = ""  # 完整回複
is_answering = False  # 是否進入回複階段
print("\n" + "=" * 20 + "思考過程" + "=" * 20 + "\n")

for chunk in completion:
    if not chunk.choices:
        print("\nUsage:")
        print(chunk.usage)
        continue

    delta = chunk.choices[0].delta

    # 只收集思考內容
    if hasattr(delta, "reasoning_content") and delta.reasoning_content is not None:
        if not is_answering:
            print(delta.reasoning_content, end="", flush=True)
        reasoning_content += delta.reasoning_content

    # 收到content,開始進行回複
    if hasattr(delta, "content") and delta.content:
        if not is_answering:
            print("\n" + "=" * 20 + "完整回複" + "=" * 20 + "\n")
            is_answering = True
        print(delta.content, end="", flush=True)
        answer_content += delta.content

返回結果

====================思考過程====================

好的,使用者問“你是誰”,我需要給出一個清晰且友好的回答。首先,應該明確自己的身份,即千問,由阿里巴巴集團旗下的通義實驗室研發。接下來,要說明自己的主要功能,比如回答
====================完整回複====================

我是千問,是阿里巴巴集團旗下的通義實驗室研發的超大規模語言模型。我能夠回答問題、創作文字、邏輯推理、編程等,旨在為使用者提供協助和便利。有什麼我可以幫您的嗎?

傳遞思考過程

多輪對話中,模型預設不會讀取歷史訊息裡的messages數組中的reasoning_content。將preserve_thinking設為true後,assistant 訊息中的reasoning_content將被拼接到下一輪輸入,讓模型參考之前的推理過程。
preserve_thinking參數僅支援 qwen3.8-max、qwen3.7-max、qwen3.7-max-2026-05-20、qwen3.7-max-2026-06-08、qwen3.7-max-preview、qwen3.7-max-2026-05-17、qwen3.7-plus、qwen3.7-plus-2026-05-26、qwen3.6-max-preview、qwen3.6-plus、qwen3.6-plus-2026-04-02、qwen3.7-flash、qwen3.7-flash-2026-07-15、kimi-k2.7-code(阿里雲百鍊部署)、kimi-k2.6(阿里雲百鍊部署)、kimi/kimi-k3(月之暗面部署)、kimi/kimi-k2.7-code-highspeed(月之暗面部署)、kimi/kimi-k2.7-code(月之暗面部署)、kimi/kimi-k2.6(月之暗面部署)。
若歷史訊息中不包含 reasoning_content ,開啟此參數不會報錯。
開啟後,歷史對話中的 reasoning_content 會計入輸入 Token 數量和計費。
  • OpenAI相容
  • DashScope
preserve_thinking非 OpenAI 標準參數,使用 Python SDK需通過extra_body傳入。
  • Python
  • Node.js
  • HTTP

範例程式碼

from openai import OpenAI
import os

client = OpenAI(
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    # 以下為新加坡地區配置,調用時請將{WorkspaceId}替換為真實的業務空間ID,各地區的配置不同。
    base_url="https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/compatible-mode/v1",
)

# 第一輪對話
messages = [
    {"role": "user", "content": "我需要為一個日均千萬訊息的電商系統選擇訊息佇列,請推薦"}
]

first_reasoning = ""
first_content = ""
is_answering = False

completion = client.chat.completions.create(
    model="qwen3.8-max",
    messages=messages,
    extra_body={"enable_thinking": True},
    stream=True,
    stream_options={"include_usage": True},
)

print("=" * 20 + "第一輪思考過程" + "=" * 20)

for chunk in completion:
    if not chunk.choices:
        continue
    delta = chunk.choices[0].delta
    if hasattr(delta, "reasoning_content") and delta.reasoning_content is not None:
        first_reasoning += delta.reasoning_content
        if not is_answering:
            print(delta.reasoning_content, end="", flush=True)
    if hasattr(delta, "content") and delta.content:
        if not is_answering:
            print("\n" + "=" * 20 + "第一輪迴複" + "=" * 20)
            is_answering = True
        print(delta.content, end="", flush=True)
        first_content += delta.content

# 第二輪對話:傳遞思考過程,追問模型為什麼排除了Kafka
messages = [
    {"role": "user", "content": "我需要為一個日均千萬訊息的電商系統選擇訊息佇列,請推薦"},
    {
        "role": "assistant",
        "content": first_content,
        "reasoning_content": first_reasoning,
    },
    {"role": "user", "content": "你在對比時為什麼排除了Kafka?"},
]

reasoning_content = ""
answer_content = ""
is_answering = False

# preserve_thinking 通過 extra_body 傳入
completion = client.chat.completions.create(
    model="qwen3.8-max",
    messages=messages,
    extra_body={
        "enable_thinking": True,
        "preserve_thinking": True,
    },
    stream=True,
    stream_options={"include_usage": True},
)

print("\n" + "=" * 20 + "第二輪思考過程" + "=" * 20)

for chunk in completion:
    if not chunk.choices:
        continue
    delta = chunk.choices[0].delta
    if hasattr(delta, "reasoning_content") and delta.reasoning_content is not None:
        if not is_answering:
            print(delta.reasoning_content, end="", flush=True)
        reasoning_content += delta.reasoning_content
    if hasattr(delta, "content") and delta.content:
        if not is_answering:
            print("\n" + "=" * 20 + "第二輪迴複" + "=" * 20)
            is_answering = True
        print(delta.content, end="", flush=True)
        answer_content += delta.content

返回結果

====================第一輪思考過程====================
使用者需要為日均千萬訊息的電商系統選擇訊息佇列。讓我從輸送量、可靠性、延遲訊息、事務支援等維度對比主流方案...

RocketMQ:阿里電商情境驗證,原生支援事務訊息和延遲訊息,分區級嚴格有序...
Kafka:極高輸送量,但無原生事務訊息和延遲訊息支援,需自研補償機制...
RabbitMQ:延遲低,但叢集擴充能力有限,峰值萬級TPS...
====================第一輪迴複====================
綜合電商情境的核心需求(事務訊息、延遲訊息、順序性、峰值應對),推薦 Apache RocketMQ。如果團隊已有 Kafka 生態或需強即時分析能力,Kafka 也是可行方案。
====================第二輪思考過程====================
使用者在追問為什麼排除了Kafka。回顧我的歷史思考過程,我並沒有排除Kafka,而是給了它4星評分。讓我參考之前的詳細對比分析來解釋...

在上一輪思考中,我對比了RocketMQ和Kafka在事務訊息、延遲訊息、順序性方面的差異。Kafka的劣勢主要在於需要額外架構設計來補齊電商特有語義...
====================第二輪迴複====================
我並沒有排除Kafka。Kafka在輸送量和生態方面表現優秀,之所以RocketMQ評分略高,是因為電商核心鏈路的"開箱即用"特性匹配度:RocketMQ原生支援事務訊息和延遲訊息,而Kafka需要通過Outbox Pattern等架構模式自行實現。如果團隊已有Kafka生態,它完全能勝任千萬級訊息情境。

其他功能

計費說明

  • 思考內容按輸出 Token 計費。
  • 部分混合思考模型在思考與非思考模式下價格不同。
    模型在思考模式下若未輸出思考過程,按非思考模式價格計費。

常見問題

是否能關閉思考模式取決於所用模型:
  • 混合思考模式模型(如 qwen3.6-plus、deepseek-v4-pro):將 enable_thinking 設為 false 即可關閉;
  • 僅思考模式模型(如 qwen3-235b-a22b-thinking-2507、deepseek-r1):無法關閉。
qwen3.7-plus 屬於混合思考模式模型,且預設開啟思考模式。思考過程會產生大量推理 Token(實測佔總輸出 Token 的 60% 以上),因此單次調用的總耗時明顯長於非思考模式。此時 Token 產生速度本身並無異常(實測約 52~54 Tokens/s),總耗時的差異主要來自思考過程產生的 Token 數量,而非模型或網路變慢。排查步驟:
  1. 確認是否開啟了思考模式。qwen3.7-plus 預設開啟,可根據響應中是否返回 reasoning_content 欄位判斷。
  2. 查看響應用量中的 completion_tokensreasoning_tokens。若 reasoning_tokens 佔比較高,則總耗時間長度屬于思考模式的預期表現。
  3. 若無需思考過程,在請求中將 enable_thinking 設為 false 關閉思考模式。關閉後輸出 Token 大幅減少,實測總耗時可降低 60%~75%。
  4. 若需保留思考能力,可改用流式輸出,以更快獲得首個 Token 並即時查看思考過程,避免長時間等待完整響應。
用量統計中展示的是單次調用的整體耗時(含思考 Token 的產生時間),並非單個 Token 的產生延遲。
本文樣本預設採用流式輸出(推薦,可即時查看思考過程、避免長時間等待)。商業版深度思考模型(如 qwen-plus、qwen3-max、qwen-flash 等)也支援非流式(同步)輸出,一次性返回完整的思考過程與回複。
將流式樣本改為非流式時,請同步修改結果解析代碼:非流式調用返回的是完整的響應對象(completion),不能再像流式樣本那樣通過 for chunk in completion 迭代(否則會報錯 'tuple' object has no attribute 'choices'),而應直接讀取 completion.choices[0].message.reasoning_content(思考過程)與 completion.choices[0].message.content(回複內容)。此外,stream=False 時不能設定 stream_options 參數。
以下以 OpenAI 相容介面、非流式調用 qwen3.8-max 開啟思考模式為例:
from openai import OpenAI
import os

client = OpenAI(
    # 各地區的API Key不同。擷取API Key:https://www.alibabacloud.com/help/zh/model-studio/get-api-key
    # 如果沒有配置環境變數,請用阿里雲百鍊API Key替換:api_key="sk-xxx"
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    # 以下為新加坡地區配置,調用時請將{WorkspaceId}替換為真實的業務空間ID,各地區的配置不同。
    base_url="https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/compatible-mode/v1",
)

completion = client.chat.completions.create(
    model="qwen3.8-max",  # 請替換為支援非流式輸出的深度思考模型
    messages=[{"role": "user", "content": "你是誰"}],
    extra_body={"enable_thinking": True},
    stream=False,  # 非流式(同步)輸出;stream=False 時不能設定 stream_options
)

# 非流式返回完整響應對象,直接讀取 message,無需(也不能)迭代
message = completion.choices[0].message
print("=" * 20 + "思考過程" + "=" * 20 + "\n")
print(getattr(message, "reasoning_content", "") or "")
print("\n" + "=" * 20 + "完整回複" + "=" * 20 + "\n")
print(message.content)
部分模型(如 qwen3-235b-a22b、qwen3-32b 等開源版)僅支援流式輸出,非流式調用會報錯 parameter.enable_thinking only support stream call,此類模型請使用流式調用。
前往費用與成本中心儲值,保持賬戶餘額充足即可正常調用模型。
超出免費額度後自動計費,出賬周期為分鐘級,消費明細請前往 **賬單詳情** 進行查看。
本文涉及的模型僅支援文本輸入。Qwen3-VL、QVQ 模型支援圖片深度思考。
模型調用完一小時後,在模型監控(新加坡北京)版面設定查詢條件(例如,選擇時間範圍、業務空間等),再在模型列表地區找到目標模型並單擊操作列的监控,即可查看該模型的調用統計結果。具體請參見模型監控文檔。
資料按小時更新,高峰期可能有小時級延遲,請您耐心等待。
image
使用長提示詞調用模型時出現產生失敗或響應逾時,通常是因為開啟了思考模式(enable_thinkingtrue)。思考模式會增加處理時間,長提示詞情境下可能導致響應被截斷或請求逾時。解決方案:
  • 關閉思考模式:將 enable_thinking 設為 false,處理時間可從約 50 秒降至約 30 秒。
  • 開啟流式輸出:將 stream 設為 true,避免非流式調用的逾時限制。
  • 調大逾時時間:如需保留思考模式,請將用戶端逾時時間設為 180 秒以上。
該問題屬於用戶端側問題,並非模型限制思考過程輸出。百鍊平台通過 enable_thinking 參數控制思考模式開關,模型返回結果中的 reasoning_content 欄位包含完整思考過程內容,模型側會正常返回思考內容。斷連通常由用戶端網路波動或用戶端版本相容問題引起。排查步驟:
  • 檢查用戶端網路連接的穩定性。
  • 將用戶端升級至最新版本。
  • 查看用戶端日誌,確認斷連時間點與思考標籤輸出的關聯。
您也可以通過 DashScope API 直接調用模型,驗證思考功能是否正常工作。

API 參考

深度思考模型的輸入輸出參數,請參見文本產生

錯誤碼

執行報錯時,請參見錯誤碼排查解決。
Token Plan
模型體驗
用量統計與效能監控
資產中心
服務支援