Model Flash vision-language native Qwen3.5 dibangun di atas arsitektur hibrida yang mengintegrasikan mekanisme perhatian linear dengan model sparse mixture-of-experts, sehingga mencapai efisiensi inferensi yang lebih tinggi. Dibandingkan dengan seri 3, model ini menunjukkan peningkatan signifikan dalam performa—baik untuk tugas teks murni maupun multimodal—dengan waktu respons cepat sekaligus menjaga keseimbangan antara kecepatan inferensi dan performa keseluruhan. Versi model ini secara fungsional setara dengan Snapshot model qwen3.5-flash-2026-02-23.
Penyedia Layanan Inferensi
Penyedia layanan inferensi untuk qwen3.5-flash adalah Alibaba Cloud Model Studio.
Kemampuan Model
- Tiongkok (Beijing)
- Singapura
- Jerman (Frankfurt)
- AS (Virginia)
- Hong Kong (Tiongkok)
| Kemampuan | Dukungan | Kemampuan | Dukungan |
|---|---|---|---|
Input Modality | Text Image Video | Output Modality | Text |
Model Experience | Didukung | Function Calling | Didukung |
Structured Outputs | Didukung | Web Search | Didukung |
Prefix Completion | Didukung | Context Caching | Didukung |
Batch Inference | Didukung | Fine-tuning | Tidak didukung |
Batas Konteks
| Parameter | Nilai | Parameter | Nilai |
|---|---|---|---|
Max Input Length | 991808 | Max Output Length | 65536 |
Context Window | 1000000 | Max Input Length (Thinking Mode) | 983616 |
Max Output Length (Thinking Mode) | 65536 | Max Chain-of-Thought Length | 81920 |
Harga
Halaman ini hanya menampilkan harga standar untuk panggilan API model, tidak termasuk promosi berbatas waktu. Kunjungi Konsol Model Studio untuk informasi penawaran promosi.
- Tiongkok (Beijing)
- Singapura
- Jerman (Frankfurt)
- AS (Virginia)
- Hong Kong (Tiongkok)
Input<=128k
Input<=128k
| Item Penagihan | Harga (USD) | Unit |
|---|---|---|
Input | 0,029 | Per 1 juta token |
Output | 0,287 | Per 1 juta token |
Input(Batch File) | 0,014 | Per 1 juta token |
Output(Batch File) | 0,143 | Per 1 juta token |
Explicit Cache Creation | 0,036 | Per 1 juta token |
Explicit Cache Read | 0,003 | Per 1 juta token |
Input(Batch Chat) | 0,029 | Per 1 juta token |
Output(Batch Chat) | 0,287 | Per 1 juta token |
128k<Input<=256k
128k<Input<=256k
| Item Penagihan | Harga (USD) | Unit |
|---|---|---|
Input | 0,115 | Per 1 juta token |
Output | 1,147 | Per 1 juta token |
Input(Batch File) | 0,057 | Per 1 juta token |
Output(Batch File) | 0,573 | Per 1 juta token |
Explicit Cache Creation | 0,143 | Per 1 juta token |
Explicit Cache Read | 0,012 | Per 1 juta token |
Input(Batch Chat) | 0,115 | Per 1 juta token |
Output(Batch Chat) | 1,147 | Per 1 juta token |
256k<Input<=1m
256k<Input<=1m
| Item Penagihan | Harga (USD) | Unit |
|---|---|---|
Input | 0,172 | Per 1 juta token |
Output | 1,72 | Per 1 juta token |
Input(Batch File) | 0,086 | Per 1 juta token |
Output(Batch File) | 0,86 | Per 1 juta token |
Explicit Cache Creation | 0,215 | Per 1 juta token |
Explicit Cache Read | 0,017 | Per 1 juta token |
Input(Batch Chat) | 0,172 | Per 1 juta token |
Output(Batch Chat) | 1,72 | Per 1 juta token |
Batas Laju
- Tiongkok (Beijing)
- Singapura
- Jerman (Frankfurt)
- AS (Virginia)
- Hong Kong (Tiongkok)
| Parameter | Nilai |
|---|---|
RPM (Requests Per Minute) | 30000 |
TPM (Tokens Per Minute) | 10.000.000 |
Versi Snapshot
qwen3.5-flash-2026-02-23
Model Flash vision-language native Qwen3.5 dibangun di atas arsitektur hibrida yang mengintegrasikan mekanisme perhatian linear dengan model sparse mixture-of-experts, sehingga mencapai efisiensi inferensi yang lebih tinggi. Dibandingkan dengan seri 3, model ini menunjukkan peningkatan signifikan dalam performa—baik untuk tugas teks murni maupun multimodal—dengan waktu respons cepat sekaligus menjaga keseimbangan antara kecepatan inferensi dan performa keseluruhan. Versi ini merupakan snapshot per tanggal 23 Februari 2026.
Penyedia Layanan Inferensi
Penyedia layanan inferensi untuk qwen3.5-flash-2026-02-23 adalah Alibaba Cloud Model Studio.
Kemampuan Model
- Tiongkok (Beijing)
- Singapura
- Jerman (Frankfurt)
- AS (Virginia)
- Hong Kong (Tiongkok)
| Kemampuan | Dukungan | Kemampuan | Dukungan |
|---|---|---|---|
Input Modality | Text Image Video | Output Modality | Text |
Model Experience | Didukung | Function Calling | Didukung |
Structured Outputs | Didukung | Web Search | Didukung |
Prefix Completion | Didukung | Context Caching | Tidak didukung |
Batch Inference | Tidak didukung | Fine-tuning | Didukung |
Batas Konteks
| Parameter | Nilai | Parameter | Nilai |
|---|---|---|---|
Max Input Length | 991808 | Max Output Length | 65536 |
Context Window | 1000000 | Max Input Length (Thinking Mode) | 983616 |
Max Output Length (Thinking Mode) | 65536 | Max Chain-of-Thought Length | 81920 |
Harga
Halaman ini hanya menampilkan harga standar untuk panggilan API model, tidak termasuk promosi berbatas waktu. Kunjungi Konsol Model Studio untuk informasi penawaran promosi.
- Tiongkok (Beijing)
- Singapura
- Jerman (Frankfurt)
- AS (Virginia)
- Hong Kong (Tiongkok)
Input<=128k
Input<=128k
| Item Penagihan | Harga (USD) | Unit |
|---|---|---|
Input | 0,029 | Per 1 juta token |
Output | 0,287 | Per 1 juta token |
128k<Input<=256k
128k<Input<=256k
| Item Penagihan | Harga (USD) | Unit |
|---|---|---|
Input | 0,115 | Per 1 juta token |
Output | 1,147 | Per 1 juta token |
256k<Input<=1m
256k<Input<=1m
| Item Penagihan | Harga (USD) | Unit |
|---|---|---|
Input | 0,172 | Per 1 juta token |
Output | 1,72 | Per 1 juta token |
Batas Laju
- Tiongkok (Beijing)
- Singapura
- Jerman (Frankfurt)
- AS (Virginia)
- Hong Kong (Tiongkok)
| Parameter | Nilai |
|---|---|
RPM (Requests Per Minute) | 600 |
TPM (Tokens Per Minute) | 1.000.000 |