Skip to main content
Toolkit/Framework

OpenAI-compatible - Batch Chat

Untuk skenario non-real-time seperti anotasi data dan pembuatan konten, API Batch Chat menyediakan alternatif berbiaya rendah dengan konkurensi tinggi menggunakan metode panggilan sinkron yang sama. Tersedia diskon 50% untuk waktu terbatas.

API ini hanya mendukung pengiriman permintaan tunggal. Untuk mengirimkan beberapa permintaan sekaligus, kemas dalam satu file. Lihat OpenAI-compatible - Batch (file input).

Cara kerja

  1. Kirim permintaan: Klien mengirim permintaan dan membangun koneksi.
  2. Mengantri dan menunggu: Permintaan masuk ke antrian sementara klien mempertahankan koneksi.
  3. Kembalikan hasil: Server mengembalikan hasil lengkap melalui koneksi yang telah dibangun setelah pemrosesan selesai.
    Koneksi akan terputus dengan error timeout jika waktu tunggu maksimum terlampaui.

Ketersediaan

  • China (Beijing)
  • Model generasi teks: qwen3.7-max, qwen3.7-plus, qwen3.6-plus, qwen3.7-flash, qwen3.7-flash-2026-07-15, qwen3.6-flash, qwen3.5-plus, qwen3.5-flash, qwen3-max, qwen-plus, qwen-flash, deepseek-v3.2
  • Model pemahaman gambar dan video: qwen3.7-plus, qwen3.6-plus, qwen3.7-flash, qwen3.7-flash-2026-07-15, qwen3.6-flash, qwen3.5-plus, qwen3.5-flash, qwen3.5-omni-plus, qwen3-vl-plus, qwen3-vl-flash
  • Dalam skenario pemrosesan batch, jumlah maksimum token konteks per permintaan adalah 256 K untuk qwen3.7-max, qwen3.7-plus, qwen3.6-plus, qwen3.7-flash, qwen3.7-flash-2026-07-15, qwen3.6-flash, qwen3.5-plus, qwen3.5-flash, dan qwen3.5-omni-plus.
  • Beberapa model mendukung mode thinking. Mengaktifkan mode ini menghasilkan tokens thinking dan meningkatkan biaya.
  • Seri model qwen3.7, qwen3.6, dan qwen3.5 memiliki mode thinking aktif secara default. Jika Anda menggunakan model hybrid thinking, Anda harus secara eksplisit mengatur parameter enable_thinking. Atur parameter ini ke true untuk mengaktifkan mode atau false untuk menonaktifkannya.
  • Dalam badan permintaan JSONL, enable_thinking merupakan parameter tingkat atas dari body dan harus ditempatkan pada level yang sama dengan model. Jangan letakkan di dalam extra_body.

Penggunaan

Prasyarat

  • Aktifkan Alibaba Cloud Model Studio dan dapatkan API key.
    Konfigurasikan API key sebagai variabel lingkungan untuk mengurangi risiko kebocoran.
  • Untuk menggunakan OpenAI SDK, instal:
pip3 install -U openai

Langkah 1: Konfigurasikan titik akhir API

Beralih dari inferensi real-time ke batch dengan mengubah titik akhir API (base_url) sesuai metode pemanggilan Anda: SDK: Atur base_url ke https://batch.dashscope.aliyuncs.com/compatible-mode/v1 HTTP: POST https://batch.dashscope.aliyuncs.com/compatible-mode/v1/chat/completions

Langkah 2: Lakukan pemanggilan

Contoh berikut menunjukkan cara memanggil API Batch Chat. Timeout default adalah 3600 detik (1 jam); tidak diperlukan konfigurasi tambahan dalam kebanyakan kasus.
Kisaran timeout kustom: 60–3600 detik.
  • Python
  • Java
  • Node.js
  • Go
  • C# (HTTP)
  • PHP (HTTP)
  • curl
Contoh permintaan
import os
from openai import OpenAI

client = OpenAI(
   # Jika variabel lingkungan tidak disetel, ganti dengan api_key="sk-xxx".
   # Hindari hard-coding API key di lingkungan produksi untuk mengurangi risiko kebocoran.
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    base_url="https://batch.dashscope.aliyuncs.com/compatible-mode/v1",  # Titik akhir API Batch Chat
).with_options(timeout=1800.0) # Timeout: 1800s (30 menit). Maks: 3600s.

completion = client.chat.completions.create(
    model="qwen-plus",
    messages=[
        {"role": "system", "content": "You are a helpful assistant."},
        {"role": "user", "content": "Who are you?"},
    ]
)
print(completion.choices[0].message.content)
Contoh respons
I am Qwen, a large-scale language model from Alibaba Group. I can answer questions, create text such as stories, official documents, emails, and scripts, perform logical reasoning, write code, and more. I can also express opinions and play games. If you have any questions or need help, feel free to let me know!

Batasan

  • Waktu tunggu: Maksimum 3.600 detik (1 jam) untuk penantian sinkron. Anda dapat mengatur waktu tunggu kustom antara 60–3.600 detik.
  • Batas konkurensi: Maksimum 10.000 permintaan tertunda per model per akun. Permintaan yang melebihi batas ini akan ditolak dengan kode kesalahan. Permintaan baru hanya diterima setelah sebagian permintaan tertunda selesai.
  • Laju pemanggilan: Maksimum 1.000 QPS per akun, atau 10.000 panggilan per 10 detik.
    Nilai tersebut merupakan batas teoretis maksimum. Ketersediaan aktual tergantung pada beban sistem. Terapkan logika retry.

Penagihan

  • Harga satuan: Penagihan didasarkan pada token input/output dari permintaan yang berhasil. Harga daftar sama dengan harga panggilan real-time. Tersedia diskon 50% untuk waktu terbatas di situs resmi. Lihat Daftar model.
  • Ruang lingkup penagihan: Hanya permintaan yang berhasil yang dikenai biaya. Permintaan gagal (akibat error sistem atau timeout) tidak ditagih.
  • Inferensi batch merupakan item penagihan terpisah. Fitur ini mendukung rencana penghematan AI umum, tetapi tidak mendukung diskon seperti subscription (rencana penghematan lainnya) atau kuota gratis untuk pengguna baru. Fitur ini juga tidak mendukung fitur seperti cache konteks.
  • Beberapa model, seperti qwen3.5-plus dan qwen3.5-flash, memiliki mode thinking aktif secara default. Mode ini menghasilkan token thinking tambahan yang ditagih dengan harga token output dan meningkatkan biaya. Untuk mengontrol biaya, atur parameter enable_thinking sesuai dengan kompleksitas tugas. Untuk informasi lebih lanjut, lihat Deep thinking.

Kode kesalahan

Jika pemanggilan model gagal dan mengembalikan pesan kesalahan, lihat Kode Kesalahan untuk penyelesaiannya.

FAQ

  1. Apakah ada perbedaan waktu respons antara Batch Chat dan API real-time? Ya. Permintaan dimasukkan ke dalam antrian untuk penjadwalan, sehingga waktu end-to-end umumnya lebih lama dibandingkan API real-time. Waktu tunggu maksimum adalah 1 jam. Koneksi akan terputus dengan error jika batas waktu tersebut terlampaui.
  2. Bagaimana cara memilih antara Batch Chat dan Batch File? Pilih Batch Chat untuk banyak permintaan dialog independen dengan konkurensi tinggi melalui panggilan sinkron. Pilih Batch File untuk memproses satu file besar yang berisi banyak permintaan melalui pengambilan asinkron.
  3. Apakah Batch Chat menjamin semua permintaan akan selesai? Tidak. Penyelesaian bergantung pada alokasi sumber daya bersama. Permintaan mungkin mengantri jika sumber daya sedang sibuk. Koneksi akan timeout jika tidak dieksekusi dalam waktu tunggu maksimum. Permintaan yang mengalami timeout tidak ditagih; silakan coba lagi nanti.

Referensi

Pembuatan Gambar
  • FAQ
Video Generation
Model Dunia
Audio
  • Pembuatan audio
Realtime API
Penyematan Teks
TokenPlan
Model production