Skip to main content
Generasi teks

Pemikiran mendalam

Model pemikiran mendalam melakukan penalaran sebelum memberikan respons, sehingga meningkatkan akurasi pada tugas-tugas kompleks seperti penalaran logis dan matematika.

Contoh-contoh ini menggunakan API Chat Completion yang kompatibel dengan OpenAI dan API DashScope. Untuk respons API, lihat Pemikiran mendalam.

Penggunaan

Model Studio mendukung pemikiran mendalam dalam dua mode:
  • Mode pemikiran hibrida: Gunakan parameter enable_thinking untuk beralih antara mode berpikir dan tidak berpikir secara per permintaan:
    • Atur ke true — model melakukan penalaran sebelum merespons.
    • Atur ke false — model merespons langsung, melewati langkah penalaran.
    • Kompatibel dengan OpenAI
    • DashScope
    # Impor dependensi dan buat klien...
    completion = client.chat.completions.create(
        model="qwen3.8-max", # Pilih model
        messages=[{"role": "user", "content": "Siapa kamu"}],
        # Karena enable_thinking bukan parameter standar OpenAI, lewatkan dalam extra_body.
        extra_body={"enable_thinking":True},
        # Aktifkan keluaran streaming.
        stream=True,
        # Konfigurasikan aliran agar menyertakan informasi konsumsi token dalam paket data terakhir.
        stream_options={
            "include_usage": True
        }
    )
    
  • Mode hanya berpikir: Model selalu melakukan penalaran sebelum merespons — perilaku ini tidak dapat dinonaktifkan. Format permintaan sama dengan mode pemikiran hibrida; tidak diperlukan parameter enable_thinking.
API mengembalikan proses penalaran dalam bidang reasoning_content dan jawaban dalam bidang content. Karena penalaran menambah latensi, semua contoh menggunakan streaming secara default (disarankan agar Anda dapat melihat proses penalaran secara real time). Model pemikiran komersial juga mendukung keluaran non-streaming (sinkron); lihat FAQ di bawah untuk penggunaan dan pertimbangannya. Beberapa model (seperti qwen3-235b-a22b dan qwen3-32b sumber terbuka) hanya mendukung streaming, dan panggilan non-streaming akan mengembalikan error.

Model yang didukung

  • Qwen3.8
  • Qwen3.7
  • Qwen3.6
  • Qwen3.5
  • Qwen3
  • QwQ (berbasis Qwen2.5)
  • DeepSeek
  • GLM
  • Kimi
  • MiniMax
Seri Qwen3.8 Max (mode pemikiran hibrida, pemikiran diaktifkan secara default): qwen3.8-maxSeri Qwen3.8 Flash (mode pemikiran hibrida, pemikiran diaktifkan secara default): qwen3.8-flashSeri sumber terbuka Qwen3.8 (mode pemikiran hibrida, pemikiran diaktifkan secara default): qwen3.8-2.4t-a95b
Nama model, ukuran jendela konteks, harga, dan versi snapshot tersedia di Daftar Model. Batas laju dijelaskan di Pembatasan Laju.

Mulai

Dapatkan Kunci API dan tetapkan sebagai variabel lingkungan. Jika Anda menggunakan SDK, instal SDK OpenAI atau DashScope (SDK DashScope Java versi 2.19.4 atau lebih baru diperlukan). Contoh berikut memanggil qwen3.8-max dalam mode berpikir dengan keluaran streaming.
  • Kompatibel dengan OpenAI
  • DashScope
  • Python
  • Node.js
  • HTTP

Kode contoh

from openai import OpenAI
import os

# Inisialisasi klien OpenAI.
client = OpenAI(
    # Kunci API bervariasi berdasarkan wilayah. Untuk mendapatkan Kunci API, lihat https://www.alibabacloud.com/help/en/model-studio/get-api-key
    # Jika variabel lingkungan tidak dikonfigurasi, berikan Kunci API Model Studio Anda secara langsung: api_key="sk-xxx"
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    # Konfigurasi bervariasi berdasarkan wilayah. Ubah base_url sesuai wilayah Anda.
    base_url="https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/compatible-mode/v1",
)

messages = [{"role": "user", "content": "Siapa kamu"}]

completion = client.chat.completions.create(
    model="qwen3.8-max",  # Anda dapat menggantinya dengan model pemikiran mendalam lainnya sesuai kebutuhan.
    messages=messages,
    extra_body={"enable_thinking": True},
    stream=True,
    stream_options={
        "include_usage": True
    },
)

reasoning_content = ""  # Proses berpikir lengkap
answer_content = ""  # Respons lengkap
is_answering = False  # Melacak apakah fase respons telah dimulai
print("\n" + "=" * 20 + "Proses berpikir" + "=" * 20 + "\n")

for chunk in completion:
    if not chunk.choices:
        print("\nUsage:")
        print(chunk.usage)
        continue

    delta = chunk.choices[0].delta

    # Kumpulkan hanya konten penalaran.
    if hasattr(delta, "reasoning_content") and delta.reasoning_content is not None:
        if not is_answering:
            print(delta.reasoning_content, end="", flush=True)
        reasoning_content += delta.reasoning_content

    # Saat konten diterima, mulai merespons.
    if hasattr(delta, "content") and delta.content:
        if not is_answering:
            print("\n" + "=" * 20 + "Respons lengkap" + "=" * 20 + "\n")
            is_answering = True
        print(delta.content, end="", flush=True)
        answer_content += delta.content

Respons

====================Proses berpikir====================

Kueri pengguna "Siapa kamu?" memerlukan respons yang akurat dan ramah. Jawaban harus terlebih dahulu menetapkan identitas saya sebagai Qwen, yang dikembangkan oleh Tongyi Lab di Alibaba Cloud. Kemudian akan menguraikan kemampuan utama seperti menjawab pertanyaan, generasi teks, dan penalaran logis. Bahasa harus sederhana dan nada bersahabat. Untuk mendorong interaksi, saya akan mengundang pengguna untuk mengajukan lebih banyak pertanyaan. Terakhir, saya akan memeriksa bahwa semua detail penting ada, termasuk nama saya (Qwen) dan pengembang, untuk memberikan jawaban yang komprehensif.
====================Respons lengkap====================

Halo! Saya Qwen, model bahasa besar yang dikembangkan oleh Tongyi Lab di Alibaba Group. Saya dapat menjawab pertanyaan, menghasilkan teks, melakukan penalaran logis, menulis kode, dan lainnya, untuk memberikan informasi dan layanan berkualitas tinggi kepada Anda. Anda dapat memanggil saya Qwen. Bagaimana saya bisa membantu Anda?

Kemampuan inti

Beralih antara mode berpikir dan tidak berpikir

Mode berpikir meningkatkan kualitas respons tetapi menambah latensi dan biaya. Pada model pemikiran hibrida, aktifkan/nonaktifkan mode ini per permintaan berdasarkan kompleksitas kueri:
  • Atur enable_thinking ke false untuk kueri sederhana — percakapan santai, tanya jawab langsung.
  • Atur enable_thinking ke true untuk penalaran kompleks — masalah logika, generasi kode, atau matematika.
  • Kompatibel dengan OpenAI
  • DashScope
enable_thinking bukan parameter standar OpenAI. Di SDK Python OpenAI, lewatkan melalui extra_body. Di SDK Node.js, lewatkan sebagai parameter tingkat atas.
  • Python
  • Node.js
  • HTTP

Kode contoh

from openai import OpenAI
import os

# Inisialisasi klien OpenAI.
client = OpenAI(
    # Jika variabel lingkungan tidak dikonfigurasi, ganti nilai dengan Kunci API Model Studio Anda: api_key="sk-xxx"
    # Kunci API berbeda berdasarkan wilayah. Untuk mendapatkan Kunci API, lihat https://www.alibabacloud.com/help/en/model-studio/get-api-key
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    # URL berikut untuk wilayah Singapura. Saat memanggil, ganti WorkspaceId dengan ID ruang kerja aktual Anda. URL bervariasi berdasarkan wilayah.
    base_url="https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/compatible-mode/v1",
)

messages = [{"role": "user", "content": "Siapa kamu?"}]
completion = client.chat.completions.create(
    model="qwen3.8-max",
    messages=messages,
    # Atur enable_thinking di extra_body untuk mengaktifkan proses penalaran.
    extra_body={"enable_thinking": True},
    stream=True,
    stream_options={
        "include_usage": True
    },
)

reasoning_content = ""  # Proses penalaran lengkap
answer_content = ""  # Respons lengkap
is_answering = False  # Menunjukkan apakah fase respons telah dimulai
print("\n" + "=" * 20 + "Proses penalaran" + "=" * 20 + "\n")

for chunk in completion:
    if not chunk.choices:
        print("\n" + "=" * 20 + "Penggunaan token" + "=" * 20 + "\n")
        print(chunk.usage)
        continue

    delta = chunk.choices[0].delta

    # Kumpulkan hanya konten penalaran.
    if hasattr(delta, "reasoning_content") and delta.reasoning_content is not None:
        if not is_answering:
            print(delta.reasoning_content, end="", flush=True)
        reasoning_content += delta.reasoning_content

    # Saat konten diterima, mulai respons.
    if hasattr(delta, "content") and delta.content:
        if not is_answering:
            print("\n" + "=" * 20 + "Respons lengkap" + "=" * 20 + "\n")
            is_answering = True
        print(delta.content, end="", flush=True)
        answer_content += delta.content

Respons

====================Proses penalaran====================

Pengguna bertanya "Siapa kamu?". Saya perlu menentukan apa yang ingin mereka ketahui. Mereka mungkin berinteraksi dengan saya untuk pertama kalinya atau ingin mengonfirmasi identitas saya. Saya harus memperkenalkan diri sebagai Qwen, yang dikembangkan oleh Tongyi Lab. Kemudian, saya harus menjelaskan kemampuan saya, seperti menjawab pertanyaan, membuat teks, dan pengkodean, sehingga pengguna memahami bagaimana saya dapat membantu mereka. Saya juga harus menyebutkan dukungan multibahasa saya sehingga pengguna internasional tahu mereka dapat berkomunikasi dalam berbagai bahasa. Terakhir, saya harus mempertahankan nada ramah dan mengundang mereka untuk mengajukan pertanyaan untuk mendorong interaksi lebih lanjut. Penjelasan harus jelas dan sederhana, menghindari jargon teknis. Pengguna kemungkinan menginginkan gambaran cepat tentang kemampuan saya, jadi saya akan fokus pada fungsi dan aplikasi saya. Saya juga harus mempertimbangkan apakah ada informasi yang hilang, seperti menyebutkan Alibaba Group atau detail teknis lebih lanjut. Namun, pengguna mungkin hanya membutuhkan informasi dasar. Saya akan memastikan responsnya ramah dan profesional, dan mendorong mereka untuk melanjutkan percakapan.
====================Respons lengkap====================

Saya Qwen, model bahasa skala besar yang dikembangkan oleh Tongyi Lab. Saya dapat membantu Anda menjawab pertanyaan, membuat teks, kode, dan mengungkapkan pendapat. Saya mendukung komunikasi dalam berbagai bahasa. Bagaimana saya bisa membantu Anda?
====================Penggunaan token====================

CompletionUsage(completion_tokens=221, prompt_tokens=10, total_tokens=231, completion_tokens_details=CompletionTokensDetails(accepted_prediction_tokens=None, audio_tokens=None, reasoning_tokens=172, rejected_prediction_tokens=None), prompt_tokens_details=PromptTokensDetails(audio_tokens=None, cached_tokens=0))
Untuk model pemikiran hibrida sumber terbuka Qwen3, bersama dengan qwen-plus-2025-04-28 dan model-model berikutnya, Anda juga dapat mengontrol mode berpikir dengan sufiks prompt. Ketika enable_thinking adalah true, tambahkan /no_think ke prompt untuk melewati penalaran pada giliran tersebut, atau tambahkan /think untuk mengaktifkannya kembali. Model selalu mengikuti instruksi /think atau /no_think terbaru.

Batasi panjang proses berpikir

Jejak penalaran meningkatkan latensi dan biaya token. Gunakan thinking_budget untuk membatasi token penalaran. Saat batas tercapai, model berhenti melakukan penalaran dan langsung merespons. Ini berlaku untuk model Qwen3.8, Qwen3.7, Qwen3.6, Qwen3.5, Qwen3-VL, Qwen3, GLM dan Kimi.
thinking_budget secara default menggunakan panjang maksimum rantai-pikiran model. Periksa nilai default untuk setiap model di halaman konsolnya.

Coba pemikiran mendalam di konsol

  1. Masuk ke konsol Model Studio.
  2. Di panel navigasi sebelah kiri, pilih Playground > Text models untuk membuka pusat pengalaman model.
  3. Model Qwen3.7-Max ditampilkan secara default. Anda juga dapat mengklik nama model untuk memilih model seri Qwen3 lainnya dari daftar drop-down.
  4. Klik tombol Deep thinking di bagian bawah kotak input untuk mengaktifkan mode penalaran dan melihat proses berpikir model.
  5. Beralih ke tab Model debugging. Di panel konfigurasi, atur parameter thinking_budget untuk mengontrol jumlah maksimum token yang dihasilkan untuk rantai pikiran. Nilainya berkisar dari 1 hingga 32768, dengan default 4000. Untuk model lainnya, kunjungi pasar model Model Studio.
  • Kompatibel dengan OpenAI
  • DashScope
  • Python
  • Node.js
  • HTTP

Kode contoh

from openai import OpenAI
import os

# Inisialisasi klien OpenAI.
client = OpenAI(
    # Jika variabel lingkungan tidak dikonfigurasi, ganti "sk-xxx" dengan Kunci API Model Studio Anda.
    # Kunci API bersifat spesifik wilayah. Untuk mendapatkan Kunci API, kunjungi https://www.alibabacloud.com/help/en/model-studio/get-api-key.
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    # Konfigurasi bervariasi berdasarkan wilayah. Ubah base_url sesuai wilayah Anda.
    base_url="https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/compatible-mode/v1",
)

messages = [{"role": "user", "content": "Siapa kamu"}]

completion = client.chat.completions.create(
    model="qwen3.8-max",
    messages=messages,
    # Parameter enable_thinking mengaktifkan proses berpikir, dan thinking_budget mengatur batas tokennya.
    extra_body={
        "enable_thinking": True,
        "thinking_budget": 50
        },
    stream=True,
    stream_options={
        "include_usage": True
    },
)

reasoning_content = ""  # Proses berpikir lengkap
answer_content = ""  # Respons lengkap
is_answering = False  # Melacak apakah fase respons telah dimulai
print("\n" + "=" * 20 + "Proses berpikir" + "=" * 20 + "\n")

for chunk in completion:
    if not chunk.choices:
        print("\nUsage:")
        print(chunk.usage)
        continue

    delta = chunk.choices[0].delta

    # Kumpulkan hanya konten berpikir.
    if hasattr(delta, "reasoning_content") and delta.reasoning_content is not None:
        if not is_answering:
            print(delta.reasoning_content, end="", flush=True)
        reasoning_content += delta.reasoning_content

    # Saat konten diterima, fase respons dimulai.
    if hasattr(delta, "content") and delta.content:
        if not is_answering:
            print("\n" + "=" * 20 + "Respons lengkap" + "=" * 20 + "\n")
            is_answering = True
        print(delta.content, end="", flush=True)
        answer_content += delta.content

Respons

====================Proses berpikir====================

Oke, pengguna bertanya, "Siapa kamu?" Saya perlu memberikan respons yang jelas dan ramah. Pertama, saya harus menyatakan identitas saya sebagai Qwen, yang dikembangkan oleh Tongyi Lab di Alibaba Group. Selanjutnya, saya perlu menjelaskan fungsi utama saya, seperti menjawab
====================Respons lengkap====================

Saya Qwen, model bahasa skala besar yang dikembangkan oleh Tongyi Lab di Alibaba Group. Saya dapat menjawab pertanyaan, membuat teks, melakukan penalaran logis, dan menulis kode.

Teruskan proses berpikir

Secara default, model mengabaikan reasoning_content dalam riwayat messages. Atur preserve_thinking ke true untuk meneruskan penalaran sebelumnya ke giliran berikutnya. reasoning_content dari pesan asisten sebelumnya kemudian ditambahkan ke input model.
Parameter preserve_thinking hanya didukung untuk qwen3.8-max, qwen3.8-flash, qwen3.7-max, qwen3.7-max-us, qwen3.7-max-2026-05-20, qwen3.7-max-2026-06-08, qwen3.7-max-preview, qwen3.7-max-2026-05-17, qwen3.7-plus, qwen3.7-plus-us, qwen3.7-plus-2026-05-26, qwen3.6-max-preview, qwen3.6-plus, qwen3.6-plus-2026-04-02, qwen3.7-flash, qwen3.7-flash-2026-07-15, kimi-k2.7-code (di-deploy di Alibaba Cloud Model Studio), kimi-k2.6 (di-deploy di Alibaba Cloud Model Studio), kimi/kimi-k3 (di-deploy di Moonshot AI), kimi/kimi-k2.7-code-highspeed (di-deploy di Moonshot AI), kimi/kimi-k2.7-code (di-deploy di Moonshot AI), dan kimi/kimi-k2.6 (di-deploy di Moonshot AI).
Mengaktifkan parameter ini ketika pesan riwayat tidak memiliki reasoning_content tidak menyebabkan error.
Ketika diaktifkan, reasoning_content dari riwayat percakapan dihitung sebagai token input dan penagihan.
  • Kompatibel dengan OpenAI
  • DashScope
preserve_thinking bukan parameter standar OpenAI. Saat Anda menggunakan SDK Python, lewatkan parameter ini di extra_body.
  • Python
  • Node.js
  • HTTP

Kode contoh

from openai import OpenAI
import os

client = OpenAI(
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    # Konfigurasi bervariasi berdasarkan wilayah. Ubah ini sesuai wilayah aktual Anda.
    base_url="https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/compatible-mode/v1",
)

# Giliran pertama percakapan
messages = [
    {"role": "user", "content": "Saya perlu memilih antrian pesan untuk sistem E-dagang yang menangani puluhan juta pesan per hari. Mohon berikan rekomendasi."}
]

first_reasoning = ""
first_content = ""
is_answering = False

completion = client.chat.completions.create(
    model="qwen3.8-max",
    messages=messages,
    extra_body={"enable_thinking": True},
    stream=True,
    stream_options={"include_usage": True},
)

print("=" * 20 + "Proses berpikir giliran pertama" + "=" * 20)

for chunk in completion:
    if not chunk.choices:
        continue
    delta = chunk.choices[0].delta
    if hasattr(delta, "reasoning_content") and delta.reasoning_content is not None:
        first_reasoning += delta.reasoning_content
        if not is_answering:
            print(delta.reasoning_content, end="", flush=True)
    if hasattr(delta, "content") and delta.content:
        if not is_answering:
            print("\n" + "=" * 20 + "Respons giliran pertama" + "=" * 20)
            is_answering = True
        print(delta.content, end="", flush=True)
        first_content += delta.content

# Giliran kedua: Teruskan proses berpikir dan tanyakan mengapa model mengecualikan Kafka
messages = [
    {"role": "user", "content": "Saya perlu memilih antrian pesan untuk sistem E-dagang yang menangani puluhan juta pesan per hari. Mohon berikan rekomendasi."},
    {
        "role": "assistant",
        "content": first_content,
        "reasoning_content": first_reasoning,
    },
    {"role": "user", "content": "Mengapa Anda mengecualikan Kafka dalam perbandingan Anda?"},
]

reasoning_content = ""
answer_content = ""
is_answering = False

# Teruskan preserve_thinking melalui extra_body
completion = client.chat.completions.create(
    model="qwen3.8-max",
    messages=messages,
    extra_body={
        "enable_thinking": True,
        "preserve_thinking": True,
    },
    stream=True,
    stream_options={"include_usage": True},
)

print("\n" + "=" * 20 + "Proses berpikir giliran kedua" + "=" * 20)

for chunk in completion:
    if not chunk.choices:
        continue
    delta = chunk.choices[0].delta
    if hasattr(delta, "reasoning_content") and delta.reasoning_content is not None:
        if not is_answering:
            print(delta.reasoning_content, end="", flush=True)
        reasoning_content += delta.reasoning_content
    if hasattr(delta, "content") and delta.content:
        if not is_answering:
            print("\n" + "=" * 20 + "Respons giliran kedua" + "=" * 20)
            is_answering = True
        print(delta.content, end="", flush=True)
        answer_content += delta.content

Respons

====================Proses berpikir giliran pertama====================
Pengguna membutuhkan antrian pesan untuk sistem E-dagang dengan puluhan juta pesan harian. Saya akan membandingkan solusi utama berdasarkan dimensi seperti throughput, keandalan, pesan tertunda, dan dukungan transaksi...

RocketMQ: Divalidasi dalam skenario E-dagang Alibaba, mendukung secara native pesan transaksional dan pesan tertunda, serta menyediakan pengurutan tingkat partisi yang ketat...
Kafka: Throughput sangat tinggi, tetapi kurang dukungan native untuk pesan transaksional dan pesan tertunda, memerlukan mekanisme kompensasi kustom...
RabbitMQ: Latensi rendah, tetapi skalabilitas kluster terbatas, dengan TPS puncak dalam puluhan ribu...
====================Respons giliran pertama====================
Mempertimbangkan kebutuhan inti skenario E-dagang (pesan transaksional, pesan tertunda, pengurutan, dan penanganan puncak), saya merekomendasikan Apache RocketMQ. Jika tim Anda sudah memiliki ekosistem Kafka atau memerlukan analitik real-time yang kuat, Kafka juga merupakan opsi yang layak.
====================Proses berpikir giliran kedua====================
Pengguna bertanya mengapa Kafka dikecualikan. Meninjau proses berpikir historis saya, saya tidak mengecualikan Kafka; saya memberinya peringkat 4 bintang. Saya akan merujuk pada perbandingan terperinci sebelumnya untuk menjelaskan...

Pada giliran terakhir, saya membandingkan perbedaan antara RocketMQ dan Kafka mengenai pesan transaksional, pesan tertunda, dan pengurutan. Kerugian utama Kafka adalah memerlukan desain arsitektural tambahan untuk mengkompensasi semantik khusus E-dagang...
====================Respons giliran kedua====================
Saya tidak mengecualikan Kafka. Kafka unggul dalam throughput dan ekosistem. Alasan RocketMQ mendapat peringkat sedikit lebih tinggi adalah kecocokannya yang lebih baik secara out-of-the-box untuk alur kerja inti E-dagang. RocketMQ mendukung secara native pesan transaksional dan pesan tertunda, sedangkan Kafka memerlukan implementasi sendiri melalui pola arsitektural seperti Pola Outbox. Jika tim Anda sudah memiliki ekosistem Kafka, ia sepenuhnya mampu menangani skenario dengan puluhan juta pesan.

Fitur lainnya

Penagihan

  • Konten berpikir ditagih per token output.
  • Beberapa model pemikiran hibrida menerapkan harga yang berbeda untuk mode berpikir dan non-berpikir.
    Jika model mode berpikir tidak menghasilkan output penalaran, harga mode tidak berpikir berlaku.

FAQ

Ini tergantung pada jenis model:
  • Untuk model pemikiran hibrida, seperti qwen-plus dan deepseek-v3.2-exp, atur enable_thinking ke false.
  • Untuk model hanya berpikir, seperti qwen3-235b-a22b-thinking-2507 dan deepseek-r1, mode berpikir tidak dapat dinonaktifkan.
qwen3.7-plus adalah model pemikiran hibrida dengan mode berpikir diaktifkan secara default. Proses berpikir menghasilkan banyak token penalaran — lebih dari 60% dari total token output dalam pengukuran — sehingga latensi total satu panggilan jauh lebih tinggi dibandingkan mode tidak berpikir. Kecepatan generasi token itu sendiri normal, sekitar 52 hingga 54 token/detik. Latensi total yang lebih lama berasal dari jumlah token yang dihasilkan proses berpikir, bukan dari model yang lebih lambat atau gangguan jaringan.Untuk mengatasi latensi, ikuti langkah-langkah berikut:
  1. Periksa apakah mode berpikir diaktifkan. Mode ini diaktifkan secara default untuk qwen3.7-plus. Jika respons mengembalikan bidang reasoning_content, mode berpikir aktif.
  2. Tinjau completion_tokens dan reasoning_tokens dalam statistik penggunaan respons. Proporsi tinggi reasoning_tokens berarti latensi total yang lama adalah perilaku yang diharapkan dari mode berpikir.
  3. Jika Anda tidak memerlukan proses berpikir, atur enable_thinking ke false dalam permintaan untuk menonaktifkan mode berpikir. Ini sangat mengurangi token output dan menurunkan latensi total sebesar 60% hingga 75% dalam pengukuran.
  4. Jika Anda ingin mempertahankan kemampuan penalaran, gunakan keluaran streaming. Anda menerima token pertama lebih cepat dan dapat melihat proses berpikir secara real time alih-alih menunggu respons lengkap.
Statistik penggunaan menunjukkan latensi total satu panggilan, termasuk waktu yang dihabiskan untuk menghasilkan token penalaran. Ini bukan latensi generasi token individual.
Contoh dalam topik ini menggunakan streaming secara default (disarankan agar Anda dapat melihat proses berpikir secara real time dan menghindari penantian lama). Model berpikir komersial (seperti qwen-plus, qwen3-max, dan qwen-flash) juga mendukung keluaran non-streaming (sinkron), mengembalikan penalaran dan jawaban lengkap dalam satu respons.
Saat Anda mengubah contoh dari streaming ke non-streaming, perbarui juga kode penguraian respons: panggilan non-streaming mengembalikan objek respons lengkap (completion). Jangan iterasi dengan for chunk in completion seperti pada contoh streaming (ini menimbulkan 'tuple' object has no attribute 'choices'). Sebagai gantinya, baca completion.choices[0].message.reasoning_content (penalaran) dan completion.choices[0].message.content (jawaban) secara langsung. Juga, saat stream=False, jangan atur parameter stream_options.
Contoh berikut memanggil qwen3.8-max dalam mode berpikir tanpa streaming, menggunakan antarmuka kompatibel OpenAI:
from openai import OpenAI
import os

client = OpenAI(
    # Kunci API berbeda berdasarkan wilayah. Dapatkan Kunci API: https://www.alibabacloud.com/help/en/model-studio/get-api-key
    # Jika variabel lingkungan tidak dikonfigurasi, ganti baris di bawah ini dengan Kunci API Model Studio Anda: api_key="sk-xxx"
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    # Berikut adalah konfigurasi untuk wilayah Singapura. Ganti WorkspaceId dengan ID ruang kerja asli Anda; konfigurasi berbeda berdasarkan wilayah.
    base_url="https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/compatible-mode/v1",
)

completion = client.chat.completions.create(
    model="qwen3.8-max",  # Ganti dengan model berpikir yang mendukung keluaran non-streaming
    messages=[{"role": "user", "content": "Siapa kamu?"}],
    extra_body={"enable_thinking": True},
    stream=False,  # Keluaran non-streaming (sinkron); jangan atur stream_options saat stream=False
)

# Panggilan non-streaming mengembalikan objek respons lengkap. Baca pesan secara langsung; jangan iterasi.
message = completion.choices[0].message
print("=" * 20 + "Penalaran" + "=" * 20 + "\n")
print(getattr(message, "reasoning_content", "") or "")
print("\n" + "=" * 20 + "Jawaban" + "=" * 20 + "\n")
print(message.content)
Beberapa model (seperti qwen3-235b-a22b dan qwen3-32b sumber terbuka) hanya mendukung streaming. Panggilan non-streaming mengembalikan error parameter.enable_thinking only support stream call; gunakan streaming untuk model-model ini.
Isi ulang akun Anda di pusat Biaya dan Pengeluaran. Akun Anda harus tidak memiliki pembayaran tertunda untuk memanggil model.
Setelah kuota gratis habis, panggilan ditagih per menit. Lihat pengeluaran di Detail Tagihan.
Model-model ini hanya menerima teks. Qwen3-VL dan QVQ mendukung pemikiran mendalam pada gambar .
Satu jam setelah Anda memanggil model, buka halaman Pemantauan (Singapura atau Beijing). Atur kondisi kueri, seperti rentang waktu dan ruang kerja. Kemudian, di area Model, temukan model target dan klik Monitor di kolom Aksi untuk melihat statistik panggilan model. Untuk informasi lebih lanjut, lihat dokumen Pemantauan.
Data diperbarui setiap jam. Selama periode puncak, mungkin terjadi latensi tingkat jam.
image
Jika panggilan dengan prompt panjang gagal atau timeout, biasanya mode berpikir (enable_thinking=true) diaktifkan. Mode berpikir meningkatkan waktu pemrosesan, yang dapat memotong respons atau menyebabkan permintaan timeout saat prompt panjang.Solusi:
  • Nonaktifkan mode berpikir: atur enable_thinking ke false. Waktu pemrosesan dapat turun dari sekitar 50 detik menjadi sekitar 30 detik.
  • Aktifkan keluaran streaming: atur stream ke true untuk menghindari batas timeout mode non-streaming.
  • Tingkatkan timeout: untuk tetap mengaktifkan mode berpikir, atur timeout klien ke 180 detik atau lebih lama.
Ini adalah masalah sisi klien, bukan pembatasan platform pada eksposur proses berpikir. Model Studio menggunakan parameter enable_thinking untuk mengaktifkan/nonaktifkan mode berpikir, dan bidang reasoning_content dalam respons berisi proses berpikir lengkap, sehingga model mengembalikan konten berpikir seperti yang diharapkan. Pemutusan biasanya disebabkan oleh kondisi jaringan klien yang tidak stabil atau masalah kompatibilitas versi klien.Langkah pemecahan masalah:
  • Periksa stabilitas koneksi jaringan klien.
  • Perbarui klien ke versi terbaru.
  • Tinjau log klien untuk mengorelasikan stempel waktu pemutusan dengan output tag berpikir.
Anda juga dapat memanggil model langsung melalui API DashScope untuk memverifikasi bahwa kemampuan berpikir berfungsi seperti yang diharapkan.

Referensi API

Untuk parameter input dan respons, lihat Generasi Teks.

Kode error

Jika panggilan gagal, lihat Kode error.
Rencana Token (Team Edition)
Model playground
Statistik dan Pemantauan
Asset Center
Dukungan layanan