Alibaba Cloud Model Studio mendukung API Responses yang kompatibel dengan OpenAI. Berdasarkan API Chat Completions, API Responses menyederhanakan fungsionalitas agen native.
Keunggulan dibandingkan API OpenAI Chat Completions:
Pertama, dapatkan Kunci API dan tetapkan sebagai variabel lingkungan. Jika Anda menggunakan SDK OpenAI, instal SDK tersebut.
Kirim pesan dan dapatkan respons.
Contoh respons
Parameter
Contoh respons putaran kedua
Catatan: Pada putaran kedua, jumlah
Gunakan parameter
Contoh respons
Terima konten dari model secara real-time, terutama berguna untuk generasi teks panjang.
Contoh respons
Aktifkan alat bawaan untuk tugas kompleks. Ekstraktor web dan interpreter kode gratis untuk waktu terbatas. Lihat pemanggilan alat untuk daftar alat yang didukung.
Contoh respons
Dalam percakapan multi-putaran, aktifkan cache sesi agar server secara otomatis menyimpan konteks percakapan. Ini mengurangi latensi dan biaya tanpa perlu manajemen cache manual.
Penggunaan: Untuk mengaktifkan cache sesi, tambahkan
Responses API menyederhanakan antarmuka Chat Completions API sekaligus mempertahankan kompatibilitas. Untuk melakukan migrasi, ikuti langkah-langkah berikut.
Perbarui alamat endpoint dari
Responses API mengembalikan struktur respons yang berbeda. Gunakan pintasan
Dengan Chat Completions API, Anda harus mengelola array riwayat pesan secara manual. Responses API menyederhanakan proses ini dengan menggunakan parameter
Responses API mencakup alat bawaan. Tentukan alat tersebut dalam parameter
A: Teruskan
A: Atribut ini tidak tersedia di beberapa versi OpenAI Python SDK, seperti versi 1.99.2. Untuk mengatasi error ini, perbarui SDK ke versi terbaru.
- Alat bawaan: Tingkatkan hasil untuk tugas kompleks dengan pencarian web, scraping web, interpreter kode, teks-ke-gambar, dan gambar-ke-gambar. Untuk detailnya, lihat Panggil alat bawaan.
- Input lebih fleksibel: API mendukung input berupa string langsung maupun array pesan dalam format chat standar.
- Pengelolaan konteks yang disederhanakan: Mengirimkan
previous_response_idmenghilangkan kebutuhan untuk membangun array riwayat pesan secara manual.
Prasyarat
Pertama, dapatkan Kunci API dan tetapkan sebagai variabel lingkungan. Jika Anda menggunakan SDK OpenAI, instal SDK tersebut.
Model yang didukung
qwen3.8-max, qwen3.8-flash, qwen3.7-max, qwen3.7-max-2026-05-20, qwen3.7-max-2026-06-08, qwen3.7-max-2026-05-17, qwen3.7-max-preview, qwen3-max, qwen3-max-2026-01-23, qwen3.7-plus, qwen3.7-plus-2026-05-26, qwen3.6-plus, qwen3.6-plus-2026-04-02, qwen3.5-plus, qwen3.5-plus-2026-04-20, qwen3.5-plus-2026-02-15, qwen3.7-flash, qwen3.7-flash-2026-07-15, qwen3.6-flash, qwen3.6-flash-2026-04-16, qwen3.5-flash, qwen3.5-flash-2026-02-23, qwen3.8-2.4t-a95b, qwen3.8-27b, qwen3.6-35b-a3b, qwen3.5-397b-a17b, qwen3.5-122b-a10b, qwen3.5-27b, qwen3.5-35b-a3b, deepseek-v4-pro, deepseek-v4-pro-0813, deepseek-v4-flash, deepseek-v4-flash-0731, glm-5.2, kimi-k3
Titik akhir
- Singapore
- China (Beijing)
- AS (Virginia)
- China (Hong Kong)
- Jerman (Frankfurt)
- Jepang (Tokyo)
Konfigurasi pemanggilan SDK
base_url: https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/compatible-mode/v1URL permintaan HTTP: POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/compatible-mode/v1/responsesGanti WorkspaceId dengan ID Ruang Kerja aktual Anda.Contoh kode
Pemanggilan dasar
Kirim pesan dan dapatkan respons.
Python
Ini adalah respons API lengkap.
Percakapan multi-putaran
Parameter previous_response_id secara otomatis mempertahankan konteks percakapan, sehingga Anda tidak perlu membangun riwayat pesan secara manual. Setiap id respons berlaku selama 7 hari.
previous_response_idharus merupakanidtingkat atas dari respons sebelumnya (misalnya,resp_xxx, dalam format UUID), bukanidpesan dari dalam arrayoutput(misalnya,msg_56c860c4-3ad8-4a96-8553-d2f94c259xxx).
Python
input_tokens adalah 78. Angka ini mencakup konteks dari putaran pertama, menunjukkan bahwa model berhasil mengingat nama "John".
Pemikiran mendalam
Gunakan parameter reasoning untuk mengontrol kekuatan penalaran model. Saat Anda mengatur reasoning.effort, model akan berpikir sebelum menjawab, dan mengembalikan proses berpikir dalam item output reasoning. Parameter effort mendukung nilai-nilai berikut:
none: Menonaktifkan pemikiran dan memberikan jawaban langsung.minimal: Meminimalkan pemikiran untuk respons tercepat.low: Melakukan pemikiran ringan, memprioritaskan respons cepat.medium(default): Melakukan pemikiran moderat, menyeimbangkan kecepatan dan kedalaman.high: Melakukan pemikiran mendalam, fokus pada masalah kompleks dan spesialis.
Anda tidak dapat menggunakan parameterthinking_budgetuntuk mengontrol panjang maksimum pemikiran.reasoning.effortmemiliki prioritas lebih tinggi daripadaenable_thinking. Gunakanreasoning.effort, karenaenable_thinkingakan ditinggalkan.
Python
Output aliran
Terima konten dari model secara real-time, terutama berguna untuk generasi teks panjang.
Python
Gunakan alat bawaan
Aktifkan alat bawaan untuk tugas kompleks. Ekstraktor web dan interpreter kode gratis untuk waktu terbatas. Lihat pemanggilan alat untuk daftar alat yang didukung.
Python
Cache sesi
Dalam percakapan multi-putaran, aktifkan cache sesi agar server secara otomatis menyimpan konteks percakapan. Ini mengurangi latensi dan biaya tanpa perlu manajemen cache manual.
Penggunaan: Untuk mengaktifkan cache sesi, tambahkan x-dashscope-session-cache: enable ke header permintaan. Untuk menonaktifkannya, atur nilainya menjadi disable. Nilai default-nya adalah disable.
Model yang didukung: qwen3.8-max, qwen3.8-flash, qwen3.7-max, qwen3.7-max-2026-05-20, qwen3.7-max-2026-06-08, qwen3-max, qwen3.7-plus, qwen3.6-plus, qwen3.5-plus, qwen3.7-flash, qwen3.6-flash, qwen3.5-flash, qwen-plus, qwen-flash, qwen3-coder-plus, qwen3-coder-flash
Cache sesi memerlukan panjang prompt minimum 1.024 token dan kedaluwarsa setelah 5 menit. Cache ini memiliki batasan yang sama dengan cache eksplisit.
Python
Migrasi dari Chat Completions API ke Responses API
Responses API menyederhanakan antarmuka Chat Completions API sekaligus mempertahankan kompatibilitas. Untuk melakukan migrasi, ikuti langkah-langkah berikut.
1. Perbarui alamat endpoint
Perbarui alamat endpoint dari /v1/chat/completions menjadi /v1/responses.
Python
2. Perbarui penanganan respons
Responses API mengembalikan struktur respons yang berbeda. Gunakan pintasan output_text untuk mengambil output teks, atau akses informasi detail melalui array output.
Perbandingan respons
3. Sederhanakan percakapan multi-putaran
Dengan Chat Completions API, Anda harus mengelola array riwayat pesan secara manual. Responses API menyederhanakan proses ini dengan menggunakan parameter previous_response_id untuk menautkan konteks percakapan secara otomatis. id respons berlaku selama 7 hari.
- Python
- Node.js
4. Gunakan alat bawaan
Responses API mencakup alat bawaan. Tentukan alat tersebut dalam parameter tools. Alat Code Interpreter dan pencarian web gratis untuk waktu terbatas. Lihat pemanggilan alat.
- Python
- Node.js
- Curl
FAQ
Q: Bagaimana cara meneruskan konteks percakapan multi-putaran?
A: Teruskan id dari respons model sebelumnya yang berhasil sebagai parameter previous_response_id dalam permintaan percakapan berikutnya.
Q: Mengapa saya tidak bisa mencetak 'output_text'?
A: Atribut ini tidak tersedia di beberapa versi OpenAI Python SDK, seperti versi 1.99.2. Untuk mengatasi error ini, perbarui SDK ke versi terbaru.
Terkait
- Tanggapan OpenAI
- Dapatkan Kunci API Anda
- Simpan Kunci API Anda dalam variabel lingkungan