Model Qwen3 Flash menggabungkan secara dinamis mode berpikir dan tidak berpikir selama percakapan, unggul dalam penalaran kompleks serta menunjukkan peningkatan signifikan dalam mengikuti instruksi dan memahami teks. Model ini mendukung panjang konteks hingga 1 juta token dan dikenai biaya berdasarkan model bertingkat sesuai penggunaan konteks. Secara fungsional, versi model ini setara dengan snapshot model qwen-flash-2025-07-28.
Penyedia Layanan Inferensi
Penyedia layanan inferensi untuk qwen-flash adalah Alibaba Cloud Model Studio.
Kemampuan Model
- Tiongkok (Beijing)
- Singapura
- Jerman (Frankfurt)
- AS (Virginia)
| Kemampuan | Dukungan | Kemampuan | Dukungan |
|---|---|---|---|
Input Modality | Text | Output Modality | Text |
Model Experience | Didukung | Function Calling | Didukung |
Structured Outputs | Didukung | Web Search | Didukung |
Prefix Completion | Didukung | Context Caching | Didukung |
Batch Inference | Didukung | Fine-tuning | Tidak didukung |
Batas Konteks
| Parameter | Nilai | Parameter | Nilai |
|---|---|---|---|
Max Input Length | 997952 | Max Output Length | 32768 |
Context Window | 1000000 |
Harga
Halaman ini hanya menampilkan harga standar untuk panggilan API model, tidak termasuk promosi berbatas waktu. Kunjungi Konsol Model Studio untuk informasi penawaran promosi.
- Tiongkok (Beijing)
- Singapura
- Jerman (Frankfurt)
- AS (Virginia)
Input<=128k
Input<=128k
| Item Penagihan | Harga (USD) | Unit |
|---|---|---|
Input | 0,022 | Per 1 juta token |
Output | 0,216 | Per 1 juta token |
Input(Implicit Cache) | 0,005 | Per 1 juta token |
Input(Batch File) | 0,011 | Per 1 juta token |
Output(Batch File) | 0,108 | Per 1 juta token |
Explicit Cache Creation | 0,028 | Per 1 juta token |
Explicit Cache Read | 0,002 | Per 1 juta token |
Input(Batch Chat) | 0,022 | Per 1 juta token |
Output(Batch Chat) | 0,216 | Per 1 juta token |
128k<Input<=256k
128k<Input<=256k
| Item Penagihan | Harga (USD) | Unit |
|---|---|---|
Input | 0,087 | Per 1 juta token |
Output | 0,861 | Per 1 juta token |
Input(Implicit Cache) | 0,018 | Per 1 juta token |
Input(Batch File) | 0,043 | Per 1 juta token |
Output(Batch File) | 0,43 | Per 1 juta token |
Explicit Cache Creation | 0,109 | Per 1 juta token |
Explicit Cache Read | 0,009 | Per 1 juta token |
Input(Batch Chat) | 0,087 | Per 1 juta token |
Output(Batch Chat) | 0,861 | Per 1 juta token |
256k<Input<=1m
256k<Input<=1m
| Item Penagihan | Harga (USD) | Unit |
|---|---|---|
Input | 0,173 | Per 1 juta token |
Output | 1,721 | Per 1 juta token |
Input(Implicit Cache) | 0,035 | Per 1 juta token |
Input(Batch File) | 0,086 | Per 1 juta token |
Output(Batch File) | 0,86 | Per 1 juta token |
Explicit Cache Creation | 0,216 | Per 1 juta token |
Explicit Cache Read | 0,017 | Per 1 juta token |
Input(Batch Chat) | 0,173 | Per 1 juta token |
Output(Batch Chat) | 1,721 | Per 1 juta token |
Batas Laju
- Tiongkok (Beijing)
- Singapura
- Jerman (Frankfurt)
- AS (Virginia)
| Parameter | Nilai |
|---|---|
RPM (Requests Per Minute) | 30.000 |
TPM (Tokens Per Minute) | 10.000.000 |
Versi Snapshot
qwen-flash-2025-07-28
Model Qwen3 Flash (snapshot 2025-07-28) menggabungkan secara dinamis mode berpikir dan tidak berpikir selama percakapan, unggul dalam penalaran kompleks serta menunjukkan peningkatan signifikan dalam mengikuti instruksi dan memahami teks. Model ini mendukung panjang konteks hingga 1 juta token dan dikenai biaya berdasarkan model bertingkat sesuai penggunaan konteks.
Penyedia Layanan Inferensi
Penyedia layanan inferensi untuk qwen-flash-2025-07-28 adalah Alibaba Cloud Model Studio.
Kemampuan Model
- Tiongkok (Beijing)
- Singapura
- Jerman (Frankfurt)
- AS (Virginia)
| Kemampuan | Dukungan | Kemampuan | Dukungan |
|---|---|---|---|
Input Modality | Text | Output Modality | Text |
Model Experience | Didukung | Function Calling | Didukung |
Structured Outputs | Didukung | Web Search | Didukung |
Prefix Completion | Didukung | Context Caching | Tidak didukung |
Batch Inference | Tidak didukung | Fine-tuning | Tidak didukung |
Batas Konteks
| Parameter | Nilai | Parameter | Nilai |
|---|---|---|---|
Max Input Length | 997952 | Max Output Length | 32768 |
Context Window | 1000000 |
Harga
Halaman ini hanya menampilkan harga standar untuk panggilan API model, tidak termasuk promosi berbatas waktu. Kunjungi Konsol Model Studio untuk informasi penawaran promosi.
- Tiongkok (Beijing)
- Singapura
- Jerman (Frankfurt)
- AS (Virginia)
Input<=128k
Input<=128k
| Item Penagihan | Harga (USD) | Unit |
|---|---|---|
Input | 0,022 | Per 1 juta token |
Output | 0,216 | Per 1 juta token |
128k<Input<=256k
128k<Input<=256k
| Item Penagihan | Harga (USD) | Unit |
|---|---|---|
Input | 0,087 | Per 1 juta token |
Output | 0,861 | Per 1 juta token |
256k<Input<=1m
256k<Input<=1m
| Item Penagihan | Harga (USD) | Unit |
|---|---|---|
Input | 0,173 | Per 1 juta token |
Output | 1,721 | Per 1 juta token |
Batas Laju
- Tiongkok (Beijing)
- Singapura
- Jerman (Frankfurt)
- AS (Virginia)
| Parameter | Nilai |
|---|---|
RPM (Requests Per Minute) | 60 |
TPM (Tokens Per Minute) | 1.000.000 |