Untuk skenario non-real-time seperti anotasi data dan pembuatan konten, API Batch Chat menyediakan alternatif berbiaya rendah dengan konkurensi tinggi menggunakan metode panggilan sinkron yang sama. Tersedia diskon 50% untuk waktu terbatas.
API ini hanya mendukung pengiriman permintaan tunggal. Untuk mengirimkan beberapa permintaan sekaligus, kemas dalam satu file. Lihat OpenAI-compatible - Batch (file input).
Cara kerja
- Kirim permintaan: Klien mengirim permintaan dan membangun koneksi.
- Mengantri dan menunggu: Permintaan masuk ke antrian sementara klien mempertahankan koneksi.
-
Kembalikan hasil: Server mengembalikan hasil lengkap melalui koneksi yang telah dibangun setelah pemrosesan selesai.
Koneksi akan terputus dengan error timeout jika waktu tunggu maksimum terlampaui.
Ketersediaan
- China (Beijing)
- Model generasi teks: qwen3.7-max, qwen3.7-plus, qwen3.6-plus, qwen3.7-flash, qwen3.7-flash-2026-07-15, qwen3.6-flash, qwen3.5-plus, qwen3.5-flash, qwen3-max, qwen-plus, qwen-flash, deepseek-v3.2
- Model pemahaman gambar dan video: qwen3.7-plus, qwen3.6-plus, qwen3.7-flash, qwen3.7-flash-2026-07-15, qwen3.6-flash, qwen3.5-plus, qwen3.5-flash, qwen3.5-omni-plus, qwen3-vl-plus, qwen3-vl-flash
Penggunaan
Prasyarat
-
Aktifkan Alibaba Cloud Model Studio dan dapatkan API key.
Konfigurasikan API key sebagai variabel lingkungan untuk mengurangi risiko kebocoran.
- Untuk menggunakan OpenAI SDK, instal:
Langkah 1: Konfigurasikan titik akhir API
Beralih dari inferensi real-time ke batch dengan mengubah titik akhir API (base_url) sesuai metode pemanggilan Anda:
SDK: Atur base_url ke https://batch.dashscope.aliyuncs.com/compatible-mode/v1
HTTP: POST https://batch.dashscope.aliyuncs.com/compatible-mode/v1/chat/completions
Langkah 2: Lakukan pemanggilan
Contoh berikut menunjukkan cara memanggil API Batch Chat. Timeout default adalah 3600 detik (1 jam); tidak diperlukan konfigurasi tambahan dalam kebanyakan kasus.
Kisaran timeout kustom: 60–3600 detik.
- Python
- Java
- Node.js
- Go
- C# (HTTP)
- PHP (HTTP)
- curl
Contoh permintaanContoh respons
Batasan
- Waktu tunggu: Maksimum 3.600 detik (1 jam) untuk penantian sinkron. Anda dapat mengatur waktu tunggu kustom antara 60–3.600 detik.
- Batas konkurensi: Maksimum 10.000 permintaan tertunda per model per akun. Permintaan yang melebihi batas ini akan ditolak dengan kode kesalahan. Permintaan baru hanya diterima setelah sebagian permintaan tertunda selesai.
-
Laju pemanggilan: Maksimum 1.000 QPS per akun, atau 10.000 panggilan per 10 detik.
Nilai tersebut merupakan batas teoretis maksimum. Ketersediaan aktual tergantung pada beban sistem. Terapkan logika retry.
Penagihan
- Harga satuan: Penagihan didasarkan pada token input/output dari permintaan yang berhasil. Harga daftar sama dengan harga panggilan real-time. Tersedia diskon 50% untuk waktu terbatas di situs resmi. Lihat Daftar model.
- Ruang lingkup penagihan: Hanya permintaan yang berhasil yang dikenai biaya. Permintaan gagal (akibat error sistem atau timeout) tidak ditagih.
- Inferensi batch merupakan item penagihan terpisah. Fitur ini mendukung rencana penghematan AI umum, tetapi tidak mendukung diskon seperti subscription (rencana penghematan lainnya) atau kuota gratis untuk pengguna baru. Fitur ini juga tidak mendukung fitur seperti cache konteks.
- Beberapa model, seperti qwen3.5-plus dan qwen3.5-flash, memiliki mode thinking aktif secara default. Mode ini menghasilkan token thinking tambahan yang ditagih dengan harga token output dan meningkatkan biaya. Untuk mengontrol biaya, atur parameter
enable_thinkingsesuai dengan kompleksitas tugas. Untuk informasi lebih lanjut, lihat Deep thinking.
Kode kesalahan
Jika pemanggilan model gagal dan mengembalikan pesan kesalahan, lihat Kode Kesalahan untuk penyelesaiannya.
FAQ
- Apakah ada perbedaan waktu respons antara Batch Chat dan API real-time? Ya. Permintaan dimasukkan ke dalam antrian untuk penjadwalan, sehingga waktu end-to-end umumnya lebih lama dibandingkan API real-time. Waktu tunggu maksimum adalah 1 jam. Koneksi akan terputus dengan error jika batas waktu tersebut terlampaui.
- Bagaimana cara memilih antara Batch Chat dan Batch File? Pilih Batch Chat untuk banyak permintaan dialog independen dengan konkurensi tinggi melalui panggilan sinkron. Pilih Batch File untuk memproses satu file besar yang berisi banyak permintaan melalui pengambilan asinkron.
- Apakah Batch Chat menjamin semua permintaan akan selesai? Tidak. Penyelesaian bergantung pada alokasi sumber daya bersama. Permintaan mungkin mengantri jika sumber daya sedang sibuk. Koneksi akan timeout jika tidak dieksekusi dalam waktu tunggu maksimum. Permintaan yang mengalami timeout tidak ditagih; silakan coba lagi nanti.
Referensi
- Daftar lengkap parameter untuk panggilan model real-time: OpenAI compatible - Chat.
- Pemrosesan batch melalui pengiriman file dengan hasil asinkron: OpenAI-compatible - Batch (file input).