Model Qwen3 Flash menggabungkan secara dinamis mode berpikir dan tidak berpikir dalam percakapan, unggul dalam penalaran kompleks serta menunjukkan peningkatan signifikan dalam mengikuti instruksi dan memahami teks. Model ini mendukung panjang konteks hingga 1 juta token dan dikenai biaya berdasarkan model bertingkat sesuai penggunaan konteks. Versi ini secara fungsional setara dengan snapshot model qwen-flash-2025-07-28-us.
Penyedia Layanan Inferensi
Penyedia layanan inferensi untuk qwen-flash-us adalah Alibaba Cloud Model Studio.
Kemampuan Model
| Kemampuan | Dukungan | Kemampuan | Dukungan |
|---|---|---|---|
Modalitas Input | Text | Modalitas Output | Text |
Pengalaman Model | Supported | Function Calling | Unsupported |
Structured Outputs | Supported | Web Search | Unsupported |
Prefix Completion | Supported | Context Caching | Supported |
Batch Inference | Unsupported | Fine-tuning | Unsupported |
Batas Konteks
| Parameter | Nilai | Parameter | Nilai |
|---|---|---|---|
Max Input Length | 995904 | Max Output Length | 32768 |
Context Window | 1000000 |
Harga
Halaman ini hanya menampilkan harga asli untuk panggilan API model, tidak termasuk promosi berbatas waktu apa pun. Kunjungi Model Studio Console untuk penawaran promosi.
- AS (Virginia)
Input<=256k
Input<=256k
| Item Penagihan | Harga (USD) | Unit |
|---|---|---|
Input | 0,05 | Per 1 juta token |
Output | 0,4 | Per 1 juta token |
Input(Implicit Cache) | 0,01 | Per 1 juta token |
256k<Input<=1m
256k<Input<=1m
| Item Penagihan | Harga (USD) | Unit |
|---|---|---|
Input | 0,25 | Per 1 juta token |
Output | 2 | Per 1 juta token |
Input(Implicit Cache) | 0,05 | Per 1 juta token |
Batas Laju
- AS (Virginia)
| Parameter | Nilai |
|---|---|
RPM (Requests Per Minute) | 30000 |
TPM (Tokens Per Minute) | 10.000.000 |
Versi Snapshot
qwen-flash-2025-07-28-us
Model Qwen3 Flash (snapshot 2025-07-28) menggabungkan secara dinamis mode berpikir dan tidak berpikir dalam percakapan, unggul dalam penalaran kompleks serta menunjukkan peningkatan signifikan dalam mengikuti instruksi dan memahami teks. Model ini mendukung panjang konteks hingga 1 juta token dan dikenai biaya berdasarkan model bertingkat sesuai penggunaan konteks.
Penyedia Layanan Inferensi
Penyedia layanan inferensi untuk qwen-flash-2025-07-28-us adalah Alibaba Cloud Model Studio.
Kemampuan Model
| Kemampuan | Dukungan | Kemampuan | Dukungan |
|---|---|---|---|
Modalitas Input | Text | Modalitas Output | Text |
Pengalaman Model | Supported | Function Calling | Unsupported |
Structured Outputs | Supported | Web Search | Unsupported |
Prefix Completion | Supported | Context Caching | Unsupported |
Batch Inference | Unsupported | Fine-tuning | Unsupported |
Batas Konteks
| Parameter | Nilai | Parameter | Nilai |
|---|---|---|---|
Max Input Length | 995904 | Max Output Length | 32768 |
Context Window | 1000000 |
Harga
Halaman ini hanya menampilkan harga asli untuk panggilan API model, tidak termasuk promosi berbatas waktu apa pun. Kunjungi Model Studio Console untuk penawaran promosi.
- AS (Virginia)
Input<=256k
Input<=256k
| Item Penagihan | Harga (USD) | Unit |
|---|---|---|
Input | 0,05 | Per 1 juta token |
Output | 0,4 | Per 1 juta token |
256k<Input<=1m
256k<Input<=1m
| Item Penagihan | Harga (USD) | Unit |
|---|---|---|
Input | 0,25 | Per 1 juta token |
Output | 2 | Per 1 juta token |
Batas Laju
- AS (Virginia)
| Parameter | Nilai |
|---|---|
RPM (Requests Per Minute) | 30000 |
TPM (Tokens Per Minute) | 10.000.000 |