Skip to main content
Memulai

Pembatasan laju

Alibaba Cloud Model Studio menerapkan pembatasan laju pada panggilan model di tingkat Akun Alibaba Cloud dengan mengagregasi penggunaan seluruh Pengguna RAM, ruang kerja, dan Kunci API di bawah akun tersebut. Permintaan akan ditolak ketika batas terlampaui dan biasanya pulih secara otomatis dalam waktu satu menit.

Aturan pembatasan laju

  • Account-level rate limiting: Pembatasan laju diterapkan pada tingkat akun root, dengan menggabungkan penggunaan seluruh Pengguna RAM, ruang kerja, dan Kunci API di bawah akun tersebut.
  • Model-specific rate limiting: Setiap model memiliki batas lajunya sendiri. Untuk informasi lebih lanjut, lihat tabel di bawah ini.

FAQ

Mengapa pembatasan laju dipicu?

Anda dapat mengidentifikasi jenis pembatasan laju yang dipicu berdasarkan pesan error:
  • Requests rate limit exceeded atau You exceeded your current requests list: Ini menunjukkan bahwa batas permintaan per menit (RPM) telah terlampaui.
  • Allocated quota exceeded atau You exceeded your current quota: Ini menunjukkan bahwa batas token per menit (TPM) telah terlampaui.
  • Request rate increased too quickly: Frekuensi permintaan melonjak dalam periode singkat, memicu perlindungan stabilitas sistem. Hal ini dapat terjadi meskipun jumlah total panggilan belum mencapai batas RPM atau TPM.
  • Untuk error lainnya, lihat Kode error untuk mengonfirmasi penyebabnya.
Selain RPM dan TPM, pembatasan laju juga dapat diterapkan pada tingkat per detik untuk permintaan per detik (RPS), yaitu RPM/60, dan token per detik (TPS), yaitu TPM/60. Meskipun jumlah total panggilan per menit tidak melebihi batas, lonjakan permintaan dalam waktu singkat tetap dapat memicu pembatasan laju.

Cara melihat penggunaan model

Satu jam setelah Anda memanggil model, buka halaman Monitoring (Singapura atau Beijing). Tetapkan kondisi kueri, seperti rentang waktu dan ruang kerja. Kemudian, di area Models, temukan model target dan klik Monitor pada kolom Actions untuk melihat statistik pemanggilan model tersebut. Untuk informasi lebih lanjut, lihat dokumen Monitoring.
Data diperbarui setiap jam. Selama periode puncak, mungkin terjadi latensi hingga satu jam.
image

Berapa lama waktu pemulihan dari pembatasan laju?

Pemulihan biasanya terjadi dalam waktu satu menit. Jika terjadi error lain, lihat Kode error untuk troubleshooting.

Apakah kecepatan respons model terkait dengan status pembayaran?

Kecepatan respons model tidak terkait dengan apakah Anda menggunakan kuota gratis atau panggilan berbayar. Kuota gratis dan panggilan berbayar menggunakan infrastruktur layanan model yang sama, sehingga kecepatan generasi untuk model tertentu tetap sama. Kuota gratis hanya mengontrol apakah permintaan diterima: setelah kuota gratis habis, permintaan ditolak dengan error 403 (jika Anda telah mengaktifkan stop when the free quota is used up). Hal ini tidak mengurangi kecepatan generasi untuk permintaan yang telah diterima.

Faktor apa saja yang memengaruhi kecepatan respons model?

  • Jenis model: Model ringan (seperti qwen-flash) menghasilkan respons lebih cepat dibandingkan model yang lebih besar (seperti qwen-max).
  • Panjang output: Semakin banyak token dalam respons, semakin lama waktu generasi totalnya.
  • Beban server: Kecepatan respons mungkin sedikit berfluktuasi selama periode puncak.

Apakah pembatasan laju mengurangi kecepatan generasi permintaan yang telah diterima?

Tidak. Pembatasan laju (RPM/TPM) hanya menolak permintaan yang melebihi batas dengan mengembalikan error 429. Ketika kuota gratis habis (jika Anda telah mengaktifkan stop when the free quota is used up), permintaan ditolak dengan error 403. Kedua kasus tersebut tidak memengaruhi kecepatan generasi permintaan yang telah diterima: 429 menunjukkan pembatasan laju, dan 403 menunjukkan kuota habis — keduanya merupakan mekanisme penolakan, bukan pembatasan kecepatan.

Cara menghindari pembatasan laju

  1. Pilih model dengan batas laju lebih tinggi: Versi stabil atau versi terbaru memiliki batas laju yang lebih tinggi dibandingkan versi snapshot lama.
  2. Optimalkan strategi pemanggilan Anda
    • Kurangi frekuensi pemanggilan: Jika Anda menerima error Requests rate limit exceeded atau You exceeded your current requests list, turunkan frekuensi pemanggilan API.
    • Kurangi konsumsi token: Jika Anda menerima error Allocated quota exceeded atau You exceeded your current quota, perpendek input atau batasi panjang output.
    • Ratakan laju permintaan: Jika Anda menerima error Request rate increased too quickly, gunakan penjadwalan seragam, exponential backoff, atau antrian permintaan untuk mendistribusikan permintaan secara merata dan menghindari lonjakan tiba-tiba.
  3. Tambahkan model cadangan Jika pembatasan laju dipicu, Anda dapat beralih ke model cadangan untuk melanjutkan generasi. Hal ini dapat mengurangi kemungkinan kegagalan dan meningkatkan throughput. Kode berikut secara otomatis mencoba ulang dengan qwen-plus-2025-07-14 setelah pembatasan laju dipicu untuk qwen-plus-2025-07-28.
    import os
    import asyncio
    from openai import AsyncOpenAI, APIStatusError
    
    # Konfigurasi
    API_KEY = os.getenv("DASHSCOPE_API_KEY")
    # Model utama
    MODEL = "qwen-plus-2025-07-28"
    # Model cadangan
    BACKUP_MODEL = "qwen-plus-2025-07-14"
    # Pertanyaan uji
    QUESTION = "Who are you?"
    # Pengaturan konkurensi
    NUM_REQUESTS = 10
    
    client = AsyncOpenAI(
        api_key=API_KEY,
        # Saat memanggil, ganti {WorkspaceId} dengan ID ruang kerja aktual Anda.
        base_url="https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/compatible-mode/v1"
    )
    
    async def send_request(model):
        """Mengirim satu permintaan."""
        try:
            await client.chat.completions.create(
                model=model,
                messages=[{"role": "user", "content": QUESTION}]
            )
            return True
        except APIStatusError as e:
            if e.status_code == 429:
                print(f"[Pembatasan laju dipicu] Model {model}")
                return False
            raise
        except Exception as e:
            print(f"[Permintaan gagal] Model {model}, Error: {e}")
            return False
    
    async def task(i):
        # Coba model utama.
        if await send_request(MODEL):
            return True
        # Jika terkena pembatasan laju, coba model cadangan.
        return await send_request(BACKUP_MODEL)
    
    async def main():
        results = await asyncio.gather(*(task(i) for i in range(NUM_REQUESTS)))
        print(f"Permintaan berhasil: {sum(results)}, Permintaan gagal: {len(results) - sum(results)}")
    
    if __name__ == "__main__":
        asyncio.run(main())
    
  4. Pisahkan tugas: Percakapan panjang atau dokumen besar dapat menghabiskan banyak token dengan cepat. Anda dapat membagi tugas batch besar menjadi batch yang lebih kecil dan mengirimkannya pada waktu berbeda.
  5. Gunakan inferensi batch: Untuk tugas yang tidak memerlukan respons real-time, Anda dapat menggunakan Batch API. Permintaan batch tidak tunduk pada batas laju real-time, tetapi Anda harus mempertimbangkan waktu antrian dan pemrosesan.
  6. Tingkatkan batas laju: Jika batas laju default tidak mencukupi, Anda dapat meningkatkan kuota TPM sementara untuk suatu model di halaman Increase Rate Limits di Konsol Model Studio. Peningkatan berlaku segera. Untuk informasi lebih lanjut, lihat Tingkatkan batas laju sementara.

Cara mengontrol penggunaan token atau biaya

Pembatasan laju hanya membatasi laju permintaan per satuan waktu; tidak membatasi penggunaan kumulatif. Untuk mengontrol penggunaan token atau biaya, gunakan metode berikut:
  • Tetapkan batas pengeluaran dan notifikasi biaya: Di kartu Billing, konfigurasikan Cost alerts untuk mengaktifkan batas pengeluaran bulanan dan notifikasi ambang batas. Anda akan diberi tahu saat ambang batas tercapai, yang membantu menghindari pengeluaran berlebih. Untuk informasi lebih lanjut, lihat Kueri tagihan dan kelola biaya.
  • Aktifkan stop when the free quota is used up: Untuk model yang menyediakan kuota gratis, Anda dapat mengaktifkan stop when the free quota is used up agar panggilan berhenti secara otomatis setelah kuota gratis habis, sehingga mencegah biaya tambahan. Untuk informasi lebih lanjut, lihat Kuota gratis.
  • Monitor penggunaan model: Periksa secara berkala penggunaan token setiap model untuk mendeteksi pertumbuhan abnormal tepat waktu. Lihat Cara melihat penggunaan model di atas.

Tingkatkan batas laju sementara

Jika batas laju default tidak mencukupi, Anda dapat menaikkan kuota TPM sementara suatu model di Konsol Model Studio. Peningkatan tersebut berlaku segera dan valid selama 30 hari. Setelah periode validitas berakhir, kuota akan secara otomatis kembali ke nilai default sistem. Fitur ini saat ini tersedia di Wilayah China (Beijing) dan Singapura.
  1. Masuk ke Konsol Model Studio dan buka halaman Increase Rate Limits.
  2. Klik Increase Temporary Rate Limit di pojok kanan atas.
  3. Pada kotak dialog yang muncul, pilih Model dan masukkan nilai yang diinginkan untuk Token Account Limit (Token/60 seconds). Kotak dialog menampilkan kuota saat ini dan batas maksimum yang dapat dikonfigurasi.
  4. Klik Confirm. Kuota yang ditingkatkan berlaku segera.
Setelah peningkatan kuota berlaku, Anda dapat memverifikasinya dengan cara berikut:
  • Di halaman Increase Rate Limits, lihat daftar model dengan kuota yang ditingkatkan beserta data batas lajunya.
  • Di Model List, buka halaman detail model yang sesuai untuk melihat data batas laju terbaru.
  • Daftar model yang dapat ditingkatkan kuotanya secara sementara ditampilkan dalam kotak dialog di halaman Increase Rate Limits.
  • Mengajukan permintaan baru untuk model yang kuotanya sudah ditingkatkan dianggap sebagai pengajuan baru, dan periode validitasnya diatur ulang menjadi 30 hari.
  • Ajukan kuota sesuai kebutuhan aktual Anda. Jika kapasitas yang disediakan jauh melebihi penggunaan aktual dalam jangka waktu lama, sistem dapat mengembalikannya ke nilai default setelah memberikan notifikasi terlebih dahulu.

Generasi teks - Qwen

Model bahasa Qwen

  • Singapura
  • AS (Virginia)
  • Tiongkok (Beijing)
  • Jerman (Frankfurt)
  • Hong Kong (Tiongkok)
  • Jepang (Tokyo)
Nama modelCakupan penerapan layananKondisi Pembatasan laju (dipicu jika nilai apa pun terlampaui)
Batas berikut berlaku per menit. Layanan juga dapat menerapkan batas berdasarkan permintaan per detik (RPS = RPM/60) dan token per detik (TPS = TPM/60).
Permintaan per menit (RPM)Token per menit (TPM)
Mencakup token input dan output.
qwen3.8-maxInternasional15.0002.000.000
qwen3.8-max-0902Internasional15.000150.000
qwen3.8-flashInternasional15.0002.000.000
qwen3.7-maxInternasional6001.000.000
qwen3.7-max-2026-06-08Internasional601.000.000
qwen3.7-max-2026-05-20Internasional601.000.000
qwen3.7-max-previewInternasional6001.000.000
qwen3.7-max-2026-05-17Internasional6001.000.000
qwen3.6-max-previewInternasional6001.000.000
qwen3-maxInternasional6001.000.000
qwen3-max-2026-01-23Internasional6001.000.000
qwen3-max-2025-09-23Internasional60100.000
qwen3-max-previewInternasional6001.000.000
qwen-max
Pembatasan laju tidak berlaku untuk panggilan layanan yang menggunakan Batch API.
Internasional6001.000.000
qwen3.7-plusInternasional15.0005.000.000
qwen3.7-plus-2026-05-26Internasional601.000.000
qwen3.6-plusInternasional15.0005.000.000
qwen3.6-plus-2026-04-02Internasional601.000.000
qwen3.7-flashInternasional15.0005.000.000
qwen3.7-flash-2026-07-15Internasional15.0005.000.000
qwen3.6-flashInternasional15.0005.000.000
qwen3.6-flash-2026-04-16Internasional601.000.000
qwen3.5-plusInternasional15.0005.000.000
qwen3.5-plus-2026-04-20Internasional6001.000.000
qwen3.5-plus-2026-02-15Internasional601.000.000
qwen-plus
Pembatasan laju tidak berlaku untuk panggilan layanan yang menggunakan Batch API.
Internasional6001.000.000
qwen-plus-latestInternasional6001.000.000
qwen-plus-2025-12-01Internasional1201.000.000
qwen-plus-2025-09-11Internasional1201.000.000
qwen-plus-2025-07-28Internasional60100.000
qwen-plus-2025-07-14(qwen-plus-0714)Internasional60100.000
qwen-plus-2025-04-28(qwen-plus-0428)Internasional601.000.000
qwen-plus-2025-01-25(qwen-plus-0125)Internasional60100.000
qwen3.5-flashInternasional15.0005.000.000
qwen3.5-flash-2026-02-23Internasional601.000.000
qwen-flash
Pembatasan laju tidak berlaku untuk panggilan layanan yang menggunakan Batch API.
Internasional6005.000.000
qwen-flash-2025-07-28Internasional6005.000.000
qwq-plusInternasional60100.000
qwen-turbo
Pembatasan laju tidak berlaku untuk panggilan layanan yang menggunakan Batch API.
Internasional6005.000.000

Qwen-VL (pemahaman visual/gambar-ke-teks)

  • Singapura
  • AS (Virginia)
  • Tiongkok (Beijing)
  • Jerman (Frankfurt)
  • Hong Kong (Tiongkok)
Nama modelCakupan penerapan layananKondisi Pembatasan laju (dipicu jika nilai apa pun terlampaui)
Batas berikut berlaku per menit. Layanan juga dapat menerapkan batas berdasarkan permintaan per detik (RPS = RPM/60) dan token per detik (TPS = TPM/60).
Permintaan per menit (RPM)Token per menit (TPM)
Mencakup token input dan output.
qwen3-vl-plusInternasional1.2001.000.000
qwen3-vl-plus-2025-12-19Internasional60100.000
qwen3-vl-plus-2025-09-23Internasional1201.000.000
qwen3-vl-flashInternasional1.2001.000.000
qwen3-vl-flash-2026-01-22Internasional60100.000
qwen3-vl-flash-2025-10-15Internasional1201.000.000
qwen-vl-maxInternasional1.2001.000.000
qwen-vl-plusInternasional1.2001.000.000
qvq-maxInternasional60100.000

Qwen-Omni (omni-modal)

  • Singapore
  • China (Beijing)
Model nameService deployment scopeRate limiting conditions (triggered if any value is exceeded)
Batas berikut berlaku per menit. Layanan juga dapat menerapkan batas berdasarkan jumlah request per detik (RPS = RPM/60) dan token per detik (TPS = TPM/60).
Requests per minute (RPM)Tokens per minute (TPM)
Mencakup input dan output tokens.
qwen3.5-omni-flashInternational60100.000
qwen3.5-omni-flash-2026-03-15International60100.000
qwen3.5-omni-plusInternational60100.000
qwen3.5-omni-plus-2026-03-15International60100.000
qwen3-omni-flashInternational60100.000
qwen3-omni-flash-2025-12-01International60100.000
qwen3-omni-flash-2025-09-15International60100.000
qwen-omni-turboInternational60100.000
qwen-omni-turbo-latestInternational60100.000
qwen-omni-turbo-2025-03-26International60100.000

Qwen-Omni-Realtime (real-time multimodal)

  • Singapore
  • China (Beijing)
Model nameService deployment scopeKondisi rate limiting (dipicu jika nilai apa pun terlampaui)
Batas berikut berlaku per menit. Layanan juga dapat menerapkan batas berdasarkan jumlah request per detik (RPS = RPM/60) dan token per detik (TPS = TPM/60).
Requests per minute (RPM)Tokens per minute (TPM)
Mencakup input dan output token.
qwen3.5-omni-plus-realtimeInternational60100.000
qwen3.5-omni-plus-realtime-2026-03-15International60100.000
qwen3.5-omni-flash-realtimeInternational60100.000
qwen3.5-omni-flash-realtime-2026-03-15International60100.000
qwen3-omni-flash-realtimeInternational60100.000
qwen3-omni-flash-realtime-2025-12-01International60100.000
qwen3-omni-flash-realtime-2025-09-15International60100.000
qwen-omni-turbo-realtimeInternational6010.000
qwen-omni-turbo-realtime-latestInternational6010.000
qwen-omni-turbo-realtime-2025-05-08International6010.000

Qwen-OCR (text extraction)

  • Singapore
  • US (Virginia)
  • China (Beijing)
  • Germany (Frankfurt)
Model nameService deployment scopeRate limiting conditions (triggered if any value is exceeded)
Batas berikut berlaku per menit. Layanan juga dapat menerapkan batas berdasarkan jumlah permintaan per detik (RPS = RPM/60) dan token per detik (TPS = TPM/60).
Requests per minute (RPM)Tokens per minute (TPM)
Mencakup token input dan output.
qwen-vl-ocrInternational6006.000.000
qwen-vl-ocr-2025-11-20International1.2006.000.000

Qwen math model

  • China (Beijing)
Model nameKondisi rate limiting (dipicu jika nilai apa pun terlampaui)
Batas berikut berlaku per menit. Layanan juga dapat menerapkan batas berdasarkan jumlah permintaan per detik (RPS = RPM/60) dan token per detik (TPS = TPM/60).
Requests per minute (RPM)Tokens per minute (TPM)
Mencakup token input dan output
qwen-math-plus1.2001.000.000
qwen-math-plus-latest1.2001.000.000
qwen-math-plus-2024-09-19(qwen-math-plus-0919)60100.000
qwen-math-plus-2024-08-16(qwen-math-plus-0816)1020.000
qwen-math-turbo12001.000.000

Qwen-Coder

  • Singapore
  • US (Virginia)
  • China (Beijing)
  • Germany (Frankfurt)
Model nameService deployment scopeRate limiting conditions (triggered if any value is exceeded)
Batas berikut berlaku per menit. Layanan juga dapat memberlakukan batas berdasarkan requests per second (RPS = RPM/60) dan tokens per second (TPS = TPM/60).
Requests per minute (RPM)Tokens per minute (TPM)
Mencakup input dan output tokens.
qwen3-coder-plusInternational2.4002.000.000
qwen3-coder-plus-2025-09-23International6001.000.000
qwen3-coder-plus-2025-07-22International601.000.000
qwen3-coder-flashInternational6005.000.000
qwen3-coder-flash-2025-07-28International6005.000.000

Model terjemahan Qwen

  • Singapura
  • AS (Virginia)
  • Tiongkok (Beijing)
  • Jerman (Frankfurt)
Model nameService deployment scopeRate limiting conditions (triggered if any value is exceeded)
Batas berikut berlaku per menit. Layanan juga dapat menerapkan batas berdasarkan jumlah request per detik (RPS = RPM/60) dan token per detik (TPS = TPM/60).
Requests per minute (RPM)Tokens per minute (TPM)
Mencakup token input dan output.
qwen-mt-plusInternational60100.000
qwen-mt-flashInternational60100.000
qwen-mt-liteInternational60100.000
qwen-mt-turboInternational60100.000

Model penambangan data Qwen

  • China (Beijing)
Nama modelKondisi pembatasan laju (dipicu jika nilai apa pun terlampaui)
Batas berikut berlaku per menit. Layanan juga dapat menerapkan batas berdasarkan jumlah permintaan per detik (RPS = RPM/60) dan token per detik (TPS = TPM/60).
Requests per minute (RPM)Tokens per minute (TPM)
Mencakup token input dan output
qwen-doc-turbo6003.000.000

Model riset mendalam Qwen

  • China (Beijing)
Model nameKondisi rate limiting (dipicu jika nilai apa pun terlampaui)
Batas berikut berlaku per menit. Layanan juga dapat memberlakukan batas berdasarkan jumlah request per detik (RPS = RPM/60) dan token per detik (TPS = TPM/60).
Requests per minute (RPM)Tokens per minute (TPM)
Mencakup token input dan output
qwen-deep-research1201.200.000

Generasi teks - Qwen - Open source

Model bahasa Qwen open source

  • Singapura
  • AS (Virginia)
  • Tiongkok (Beijing)
  • Jerman (Frankfurt)
Model nameService deployment scopeRate limiting conditions (triggered if any value is exceeded)
Batas berikut berlaku per menit. Layanan juga dapat memberlakukan batas berdasarkan jumlah request per detik (RPS = RPM/60) dan token per detik (TPS = TPM/60).
Requests per minute (RPM)Tokens per minute (TPM)
Mencakup token input dan output.
qwen3.8-2.4t-a95bInternational5.0005.000.000
qwen3.6-35b-a3bInternational6001.000.000
qwen3.6-27bInternational6001.000.000
qwen3.5-397b-a17bInternational6001.000.000
qwen3.5-122b-a10bInternational6001.000.000
qwen3.5-27bInternational6001.000.000
qwen3.5-35b-a3bInternational6005.000.000
qwen3-next-80b-a3b-thinkingInternational6001.000.000
qwen3-next-80b-a3b-instructInternational6001.000.000
qwen3-235b-a22b-thinking-2507International6001.000.000
qwen3-235b-a22b-instruct-2507International6001.000.000
qwen3-30b-a3b-thinking-2507International6005.000.000
qwen3-30b-a3b-instruct-2507International6005.000.000
qwen3-235b-a22bInternational6001.000.000
qwen3-32bInternational6001.000.000
qwen3-30b-a3bInternational6001.000.000
qwen3-14bInternational6001.000.000
qwen3-8bInternational6001.000.000

Qwen-VL (pemahaman visual/gambar-ke-teks)

  • Singapura
  • AS (Virginia)
  • Tiongkok (Beijing)
  • Jerman (Frankfurt)
Model nameService deployment scopeRate limiting conditions (triggered if any value is exceeded)
Batas berikut berlaku per menit. Layanan juga dapat memberlakukan batas berdasarkan jumlah request per detik (RPS = RPM/60) dan token per detik (TPS = TPM/60).
Requests per minute (RPM)Tokens per minute (TPM)
Mencakup token input dan output.
qwen3-vl-32b-thinkingInternational60100.000
qwen3-vl-32b-instructInternational60100.000
qwen3-vl-30b-a3b-thinkingInternational60100.000
qwen3-vl-30b-a3b-instructInternational60100.000
qwen3-vl-8b-thinkingInternational60100.000
qwen3-vl-8b-instructInternational60100.000
qwen3-vl-235b-a22b-thinkingInternational60100.000
qwen3-vl-235b-a22b-instructInternational60100.000

Qwen3-Omni

  • Singapura
  • Tiongkok (Beijing)
Model nameService deployment scopeRate limiting conditions (triggered if any value is exceeded)
Batas berikut berlaku per menit. Layanan juga dapat memberlakukan batas berdasarkan jumlah request per detik (RPS = RPM/60) dan token per detik (TPS = TPM/60).
Requests per minute (RPM)Tokens per minute (TPM)
Mencakup token input dan output.
qwen2.5-omni-7bInternational60100.000

Qwen3-Omni-Captioner

  • Singapura
  • Tiongkok (Beijing)
Model nameService deployment scopeRate limiting conditions (triggered if any value is exceeded)
Batas berikut berlaku per menit. Layanan juga dapat memberlakukan batas berdasarkan jumlah request per detik (RPS = RPM/60) dan token per detik (TPS = TPM/60).
Requests per minute (RPM)Tokens per minute (TPM)
Mencakup token input dan output.
qwen3-omni-30b-a3b-captionerInternational60100.000

Qwen-Math

  • Tiongkok (Beijing)
Model nameRate limiting conditions (triggered if any value is exceeded)
Batas berikut berlaku per menit. Layanan juga dapat memberlakukan batas berdasarkan jumlah request per detik (RPS = RPM/60) dan token per detik (TPS = TPM/60).
Requests per minute (RPM)Tokens per minute (TPM)
Mencakup token input dan output

Qwen-Coder

  • Singapura
  • AS (Virginia)
  • Tiongkok (Beijing)
  • Jerman (Frankfurt)
Model nameService deployment scopeRate limiting conditions (triggered if any value is exceeded)
Batas berikut berlaku per menit. Layanan juga dapat memberlakukan batas berdasarkan jumlah request per detik (RPS = RPM/60) dan token per detik (TPS = TPM/60).
Requests per minute (RPM)Tokens per minute (TPM)
Mencakup token input dan output.
qwen3-coder-nextInternational6001.000.000
qwen3-coder-480b-a35b-instructInternational6001.000.000
qwen3-coder-30b-a3b-instructInternational6001.000.000

Generasi teks - Model pihak ketiga

DeepSeek

  • Singapura
  • AS (Virginia)
  • China (Beijing)
  • Jerman (Frankfurt)
  • Jepang (Tokyo)
  • Hong Kong (China)
Model nameService deployment scopeRate limiting conditions (triggered if any value is exceeded)
Batas berikut berlaku per menit. Layanan juga dapat menerapkan batas berdasarkan jumlah permintaan per detik (RPS = RPM/60) dan token per detik (TPS = TPM/60).
Requests per minute (RPM)Tokens per minute (TPM)
Mencakup token input dan output.
deepseek-v4-proInternational10.0001.200.000
deepseek-v4-pro-0813International10.0001.200.000
deepseek-v4-flash-0731International15.0001.200.000
deepseek-v4-flashInternational10.0001.200.000
deepseek-v3.2International10.0001.200.000

Kimi

  • China (Beijing)
  • AS (Virginia)
  • Jerman (Frankfurt)
  • Hong Kong (China)
  • Jepang (Tokyo)
  • Singapura
Model nameRate limiting conditions (triggered if any value is exceeded)
Batas berikut berlaku per menit. Layanan juga dapat menerapkan batas berdasarkan jumlah permintaan per detik (RPS = RPM/60) dan token per detik (TPS = TPM/60).
Requests per minute (RPM)Tokens per minute (TPM)
Mencakup token input dan output
kimi-k2.7-code5001.000.000
kimi-k2.65001.000.000
kimi-k2.55001.000.000
kimi-k2-thinking5001.000.000
Moonshot-Kimi-K2-Instruct5001.000.000

MiniMax

  • China (Beijing)
Model nameRate limiting conditions (triggered if any value is exceeded)
Batas berikut berlaku per menit. Layanan juga dapat menerapkan batas berdasarkan jumlah permintaan per detik (RPS = RPM/60) dan token per detik (TPS = TPM/60).
Requests per minute (RPM)Tokens per minute (TPM)
Mencakup token input dan output
MiniMax-M2.55001.000.000

GLM

  • AS (Virginia)
  • China (Beijing)
  • Jerman (Frankfurt)
  • Singapura
  • Hong Kong (China)
  • Jepang (Tokyo)
Model nameService deployment scopeRate limiting conditions (triggered if any value is exceeded)
Batas berikut berlaku per menit. Layanan juga dapat menerapkan batas berdasarkan jumlah permintaan per detik (RPS = RPM/60) dan token per detik (TPS = TPM/60).
Requests per minute (RPM)Tokens per minute (TPM)
Mencakup token input dan output.
glm-5.2Global5001.000.000
glm-5.2-usUS5001.000.000
glm-5.1Global5001.000.000

Penyediaan langsung GLM-Z.AI

  • Singapura
Model nameRate limits (triggered if any value is exceeded)
Berikut ini adalah batas per menit. Layanan juga dapat menerapkan batas berdasarkan jumlah permintaan per detik (RPS = RPM/60) dan token per detik (TPS = TPM/60).
Requests per minute (RPM)Tokens per minute (TPM)
Mencakup token input dan output
ZHIPU/GLM-5.22003.000.000

Image generation

Qwen-Image

  • Singapore
  • China (Beijing)
  • Hong Kong (China)
  • Germany (Frankfurt)
  • Japan (Tokyo)

Model name

Service deployment scope

Rate limiting conditions (triggered if any value is exceeded)

Task submission API call limit

Number of concurrent tasks (concurrency)

qwen-image-3.0-pro

International

5 request/minute

No limit for sync APIs / 10 for async APIs

qwen-image-3.0

International

20 request/minute

No limit for sync APIs / 10 for async APIs

qwen-image-2.0-pro

International

2 times/minute

No limit for synchronous APIs

qwen-image-2.0-pro-2026-06-22

International

2 times/minute

No limit for synchronous APIs

qwen-image-2.0-pro-2026-04-22

International

2 times/minute

No limit for synchronous APIs

qwen-image-2.0-pro-2026-03-03

International

2 times/minute

No limit for synchronous APIs

qwen-image-2.0

International

2 times/second

No limit for synchronous APIs

qwen-image-2.0-2026-03-03

International

2 times/second

No limit for synchronous APIs

qwen-image-max

International

2 times/minute

No limit for synchronous APIs

qwen-image-max-2025-12-30

International

2 times/minute

No limit for synchronous APIs

qwen-image-plus

International

2 times/second

No limit for synchronous APIs / 2 for asynchronous APIs

qwen-image-plus-2026-01-09

International

2 times/second

No limit for synchronous APIs

qwen-image

International

2 times/second

No limit for synchronous APIs / 2 for asynchronous APIs

qwen-image-edit-max

International

2 times/minute

No limit for synchronous APIs

qwen-image-edit-max-2026-01-16

International

2 times/minute

No limit for synchronous APIs

qwen-image-edit-plus

International

2 times/second

No limit for synchronous APIs

qwen-image-edit-plus-2025-12-15

International

2 times/second

No limit for synchronous APIs

qwen-image-edit-plus-2025-10-30

International

2 times/second

No limit for synchronous APIs

qwen-image-edit

International

2 times/second

No limit for synchronous APIs

Text-to-image - Z-Image

  • Singapore
  • China (Beijing)

Model name

Service deployment scope

Rate limiting conditions (triggered if any value is exceeded)

Requests per second (RPS)

Number of concurrent tasks (concurrency)

z-image-turbo

International

2

No limit for synchronous APIs

Wanxiang

  • Singapore
  • US (Virginia)
  • China (Beijing)
  • Germany (Frankfurt)

Model name

Service deployment scope

Rate limiting conditions (triggered if any value is exceeded)

Requests per second (RPS)

Number of concurrent tasks (concurrency)

wan2.7-image-pro

International

5

5

wan2.7-image

International

5

5

wan2.6-image

International

5

5

wan2.6-t2i

International

5

5

wan2.5-t2i-preview

International

5

5

wan2.2-t2i-flash

International

2

2

wan2.2-t2i-plus

International

2

2

wan2.1-t2i-turbo

International

2

2

wan2.1-t2i-plus

International

2

2

wan2.5-i2i-preview

International

5

5

OutfitAnyone

  • China (Beijing)

Model name

Rate limiting conditions (triggered if any value is exceeded)

Requests per second (RPS)

Number of concurrent tasks

aitryon-plus

10

5

aitryon-parsing-v1

10

No limit for synchronous APIs

Video generation

Seri HappyHorse

  • Singapura
  • AS (Virginia)
  • Tiongkok (Beijing)
  • Jerman (Frankfurt)
  • Jepang (Tokyo)

Model name

Service deployment scope

Rate limiting conditions (triggered if any value is exceeded)

Requests per second (RPS)

Number of concurrent tasks (concurrency)

happyhorse-1.1-t2v

International

5

5

happyhorse-1.1-i2v

International

5

5

happyhorse-1.1-r2v

International

5

5

happyhorse-1.0-t2v

International

5

5

happyhorse-1.0-i2v

International

5

5

happyhorse-1.0-r2v

International

5

5

happyhorse-1.0-video-edit

International

5

5

Seri Wanxiang

  • Singapura
  • AS (Virginia)
  • Tiongkok (Beijing)
  • Jerman (Frankfurt)

Model name

Service deployment scope

Rate limiting conditions (triggered if any value is exceeded)

Requests per second (RPS)

Number of concurrent tasks (concurrency)

wan2.7-r2v-2026-06-12

International

5

5

wan2.7-t2v-2026-06-12

International

5

5

wan2.7-t2v-2026-04-25

International

5

5

wan2.7-t2v

International

5

5

wan2.6-t2v

International

5

5

wan2.5-t2v-preview

International

5

5

wan2.2-t2v-plus

International

2

2

wan2.1-t2v-turbo

International

2

2

wan2.1-t2v-plus

International

2

2

wan2.7-i2v-2026-04-25

International

5

5

wan2.7-i2v

International

5

5

wan2.6-i2v-flash

International

5

5

wan2.6-i2v

International

5

5

wan2.5-i2v-preview

International

5

5

wan2.2-i2v-flash

International

2

2

wan2.1-i2v-plus

International

2

2

wan2.1-i2v-turbo

International

2

2

wan2.2-i2v-plus

International

2

2

wan2.2-kf2v-flash

International

2

2

wan2.1-kf2v-plus

International

1

2

wan2.1-vace-plus

International

2

2

wan2.7-videoedit

International

5

5

wan2.7-r2v

International

5

5

wan2.6-r2v-flash

International

5

5

wan2.6-r2v

International

5

5

wan2.2-animate-move

International

5

1

wan2.2-animate-mix

International

5

1

AnimateAnyone

  • Tiongkok (Beijing)

Model name

Requests per second (RPS)

Number of concurrent tasks

animate-anyone-detect-gen2

5

No limit for synchronous APIs

animate-anyone-template-gen2

5

1

Hanya satu job yang dijalankan dalam satu waktu. Job lain dalam antrian berada dalam status menunggu.

animate-anyone-gen2

5

1

Hanya satu job yang dijalankan dalam satu waktu. Job lain dalam antrian berada dalam status menunggu.

EMO

  • Tiongkok (Beijing)

Model name

Requests per second (RPS)

Number of concurrent tasks

emo-detect-v1

5

No limit for synchronous APIs

emo-v1

5

1

Hanya satu job yang dijalankan dalam satu waktu. Job lain dalam antrian berada dalam status menunggu.

LivePortrait

  • Tiongkok (Beijing)

Model name

Requests per second (RPS)

Number of concurrent tasks

liveportrait-detect

5

No limit for synchronous APIs

liveportrait

5

1

Hanya satu job yang dijalankan dalam satu waktu. Job lain dalam antrian berada dalam status menunggu.

VideoRetalk

  • Tiongkok (Beijing)

Model name

Requests per second (RPS)

Number of concurrent tasks

videoretalk

1

1

Hanya satu job yang dijalankan dalam satu waktu. Job lain dalam antrian berada dalam status menunggu.

Emoji

  • Tiongkok (Beijing)

Model name

Requests per second (RPS)

Number of concurrent tasks

emoji-detect-v1

1

No limit for synchronous APIs

emoji-v1

1

1

Hanya satu job yang dijalankan dalam satu waktu. Job lain dalam antrian berada dalam status menunggu.

Video style transform

  • Tiongkok (Beijing)

Model name

Requests per second (RPS)

Number of concurrent tasks

video-style-transform

20

2

Hanya satu job yang dijalankan dalam satu waktu. Job lain dalam antrian berada dalam status menunggu.

Music generation

  • China (Beijing)

Model name

Requests per minute (RPM)

fun-music-preview

180

fun-music-v1

180

Voice chat

Realtime voice chat

  • Singapore
  • China (Beijing)
Model nameService deployment scopeRate limiting conditions (triggered if any value is exceeded)
Batas berikut berlaku per menit. Layanan juga dapat memberlakukan batas berdasarkan jumlah permintaan per detik (RPS = RPM/60) dan token per detik (TPS = TPM/60).
Requests per minute (RPM)Tokens per minute (TPM)
Termasuk token input dan output
qwen-audio-3.0-realtime-plusInternational60100.000
qwen-audio-3.0-realtime-flashInternational60100.000

Sintesis ucapan (text-to-speech)

Qwen-Audio-TTS

  • Singapura
  • Tiongkok (Beijing)

Model name

Service deployment scope

Requests per second (RPS)

qwen-audio-3.0-tts-plus

International

3

qwen-audio-3.0-tts-flash

International

3

Qwen-TTS

  • Singapura
  • Tiongkok (Beijing)
  • Qwen3-TTS-Instruct-Flash
  • Qwen3-TTS-VD
  • Qwen3-TTS-VC
  • Qwen3-TTS-Flash

Model name

Service deployment scope

Requests per minute (RPM)

qwen3-tts-instruct-flash

International

180

qwen3-tts-instruct-flash-2026-01-26

International

180

Qwen-TTS-Realtime

  • Singapura
  • Tiongkok (Beijing)
  • Qwen3-TTS-Instruct-Flash-Realtime
  • Qwen3-TTS-VD-Realtime
  • Qwen3-TTS-VC-Realtime
  • Qwen3-TTS-Flash-Realtime

Model name

Service deployment scope

Requests per minute (RPM)

qwen3-tts-instruct-flash-realtime

International

180

qwen3-tts-instruct-flash-realtime-2026-01-22

International

180

kloning suara Qwen-TTS

  • Singapura
  • Tiongkok (Beijing)

Model name

Service deployment scope

Requests per minute (RPM)

qwen-voice-enrollment

International

180

desain suara Qwen-TTS

  • Singapura
  • Tiongkok (Beijing)

Model name

Service deployment scope

Requests per minute (RPM)

qwen-voice-design

International

180

CosyVoice

  • Singapura
  • Tiongkok (Beijing)

Model name

Service deployment scope

Requests per second (RPS)

cosyvoice-v3-plus

International

3

cosyvoice-v3-flash

International

kloning/desain suara Qwen-Audio-TTS/CosyVoice

Model kloning/desain suara Qwen-Audio-TTS/CosyVoice berbagi satu model dan satu kuota rate limit.
  • Singapura
  • Tiongkok (Beijing)

Model name

Service deployment scope

Requests per second (RPS)

voice-enrollment

International

10

Pengenalan ucapan (speech-to-text) dan terjemahan (ucapan ke teks dalam bahasa tertentu)

Qwen3-LiveTranslate-Flash

  • Singapura
  • Tiongkok (Beijing)
Model nameService deployment scopeKondisi pembatasan laju (pembatasan laju dipicu ketika nilai apa pun dilampaui)
Berikut adalah kondisi pembatasan laju per menit. Layanan juga dapat menerapkan batas RPS (RPM/60) dan TPS (TPM/60)
Requests per minute (RPM)Tokens per minute (TPM)
Termasuk token input dan output
qwen3-livetranslate-flashInternational100100.000
qwen3-livetranslate-flash-2025-12-01International100100.000

Qwen-LiveTranslate-Flash-Realtime

  • Singapura
  • Tiongkok (Beijing)
Model nameService deployment scopeKondisi pembatasan laju (pembatasan laju dipicu ketika nilai apa pun dilampaui)
Berikut adalah kondisi pembatasan laju per menit. Layanan juga dapat menerapkan batas RPS (RPM/60) dan TPS (TPM/60)
Requests per minute (RPM)Tokens per minute (TPM)
Termasuk token input dan output
qwen3.5-livetranslate-flash-realtimeInternational10100.000
qwen3.5-livetranslate-flash-realtime-2026-05-19International
qwen3-livetranslate-flash-realtimeInternational
qwen3-livetranslate-flash-realtime-2025-09-22International

Qwen-Audio-3.0-ASR-Flash-Streaming

  • Singapura
  • Tiongkok (Beijing)

Model name

Service deployment scope

Requests per second (RPS)

qwen-audio-3.0-asr-flash-streaming

International

20

Qwen-Audio-3.0-ASR-Flash-Filetrans

  • Singapura
  • Tiongkok (Beijing)

Model name

Service deployment scope

Requests per minute (RPM)

qwen-audio-3.0-asr-flash-filetrans

International

600

Qwen-Audio-3.0-ASR-Flash

  • Singapura
  • Tiongkok (Beijing)

Model name

Service deployment scope

Requests per minute (RPM)

qwen-audio-3.0-asr-flash

International

600

Qwen-ASR

  • Singapura
  • AS (Virginia)
  • Tiongkok (Beijing)
  • Qwen3-ASR-Flash-Filetrans
  • Qwen3-ASR-Flash

Model name

Service deployment scope

Requests per minute (RPM)

qwen3-asr-flash-filetrans

International

100

qwen3-asr-flash-filetrans-2025-11-17

International

Qwen-ASR-Realtime

  • Singapura
  • Tiongkok (Beijing)

Model name

Service deployment scope

Requests per second (RPS)

qwen3-asr-flash-realtime

International

20

qwen3-asr-flash-realtime-2026-02-10

International

qwen3-asr-flash-realtime-2025-10-27

International

Paraformer

  • Tiongkok (Beijing)

Model name

Requests per second (RPS)

paraformer-realtime-v2

20

paraformer-realtime-8k-v2

Model name

Requests per minute (RPM)

paraformer-v2

1.200

Model name

Requests per second (RPS)

Concurrent tasks (konkurensi)

paraformer-8k-v2

20

100

Fun-ASR

  • Singapura
  • Tiongkok (Beijing)

Model name

Service deployment scope

Requests per minute (RPM)

fun-asr

International

600

fun-asr-2025-11-07

International

600

fun-asr-2025-08-25

International

600

fun-asr-mtl

International

100

fun-asr-mtl-2025-08-25

International

100

fun-asr-flash-2026-06-15

International

600

Fun-ASR-Realtime

  • Singapura
  • Tiongkok (Beijing)

Model name

Service deployment scope

Requests per second (RPS)

fun-asr-realtime

International

20

fun-asr-realtime-2025-11-07

International

Text embedding

  • Singapore
  • China (Beijing)
  • Hong Kong (China)
Model nameService deployment scopeRate limiting conditions (triggered if any value is exceeded)
Batas berikut berlaku per menit. Layanan juga dapat menerapkan batas berdasarkan jumlah permintaan per detik (RPS = RPM/60) dan token per detik (TPS = TPM/60).
Requests per minute (RPM)Tokens per minute (TPM)
Mencakup token input dan output.
text-embedding-v4International1.8001.000.000
text-embedding-v3International6.00024.000.000

Multimodal embedding

  • Singapore
  • China (Beijing)
Model nameService deployment scopeRate limiting conditions
Batas berikut berlaku per menit. Layanan juga dapat menerapkan batas berdasarkan jumlah request per detik (RPS = RPM/60) dan token per detik (TPS = TPM/60).
Requests per minute (RPM)Tokens per minute (TPM)
Hanya token input.
tongyi-embedding-vision-plusInternational600200.000
tongyi-embedding-vision-flashInternational600200.000

Sorting model

  • Singapore
  • China (Beijing)
Model nameService deployment scopeRate limiting conditions
Batas berikut diberlakukan per menit. Layanan juga dapat menerapkan batas berdasarkan jumlah request per detik (RPS = RPM/60) dan token per detik (TPS = TPM/60).
Requests per minute (RPM)Tokens per minute (TPM)
Hanya token input.
qwen3-rerankInternational5.4005.000.000.000

Industri

Intention recognition

  • Tiongkok (Beijing)
Model nameRate limiting conditions (triggered if any value is exceeded)
Batas berikut berlaku per menit. Layanan juga dapat menerapkan batas berdasarkan jumlah permintaan per detik (RPS = RPM/60) dan token per detik (TPS = TPM/60).
Requests per minute (RPM)Tokens per minute (TPM)
Mencakup token input dan output
tongyi-intent-detect-v31.2001.000.000

Role assumption

  • Singapura
  • AS (Virginia)
  • Tiongkok (Beijing)
Model nameService deployment scopeRate limiting conditions (triggered if any value is exceeded)
Batas berikut berlaku per menit. Layanan juga dapat menerapkan batas berdasarkan jumlah permintaan per detik (RPS = RPM/60) dan token per detik (TPS = TPM/60).
Requests per minute (RPM)Tokens per minute (TPM)
Mencakup token input dan output.
qwen-plus-characterInternational120500.000
qwen-flash-characterInternational120500.000
qwen-plus-character-jaInternational120500.000

Model offline

Untuk informasi lebih lanjut, lihat Model unpublishing policy.
  • Offline pada 30 Januari 2026
  • Offline pada 20 Agustus 2025
CategoryModel nameRate limiting conditions (triggered if any value is exceeded)
Requests per minute (RPM)Tokens per minute (TPM)
Includes input and output tokens.
Qwen-Plusqwen-plus-2024-11-2700
qwen-plus-2024-11-25
qwen-plus-2024-09-19
qwen-plus-2024-08-06
Qwen-Turboqwen-turbo-2024-09-19
Qwen-VLqwen-vl-max-2024-10-30
qwen-vl-max-2024-08-09
qwen-vl-plus-2024-08-09
Rencana Token (Team Edition)
Model playground
  • Pembuatan audio
  • Pembuatan musik
Statistik dan Pemantauan
Asset Center
Dukungan layanan