Seri model Qwen3 untuk pemahaman visual skala kecil secara efektif mengintegrasikan mode berpikir dan tidak berpikir, memberikan kinerja unggul dibandingkan model open-source Qwen3-VL-30B-A3B sekaligus mempertahankan kecepatan respons yang cepat. Model ini menunjukkan peningkatan komprehensif dalam pemahaman gambar dan video, mendukung konteks ultra-panjang seperti video dan dokumen panjang, kesadaran spasial, serta pengenalan objek lintas berbagai domain. Dilengkapi kemampuan lokalisasi visual 2D/3D, model ini sangat cocok untuk menangani tugas-tugas dunia nyata yang kompleks. Versi ini secara fungsional setara dengan snapshot model qwen3-vl-flash-2026-01-22.
Penyedia Layanan Inferensi
Penyedia layanan inferensi untuk qwen3-vl-flash adalah Alibaba Cloud Model Studio.
Kemampuan Model
- Tiongkok (Beijing)
- Singapura
- Jerman (Frankfurt)
- AS (Virginia)
| Kemampuan | Dukungan | Kemampuan | Dukungan |
|---|---|---|---|
Input Modality | Text Image Video | Output Modality | Text |
Model Experience | Didukung | Function Calling | Didukung |
Structured Outputs | Didukung | Web Search | Tidak Didukung |
Prefix Completion | Didukung | Context Caching | Didukung |
Batch Inference | Tidak Didukung | Fine-tuning | Tidak Didukung |
Batas Konteks
| Parameter | Nilai | Parameter | Nilai |
|---|---|---|---|
Max Input Length | 260096 | Max Output Length | 32768 |
Context Window | 262144 | Max Input Length (Thinking Mode) | 258048 |
Max Output Length (Thinking Mode) | 32768 | Max Chain-of-Thought Length | 81920 |
Harga
Halaman ini hanya menampilkan harga standar untuk panggilan API model, tidak termasuk promosi berbatas waktu apa pun. Kunjungi Konsol Model Studio untuk informasi penawaran promosi.
- Tiongkok (Beijing)
- Singapura
- Jerman (Frankfurt)
- AS (Virginia)
Input<=32k
Input<=32k
| Item Penagihan | Harga (USD) | Unit |
|---|---|---|
Input | 0,022 | Per 1 juta token |
Output | 0,215 | Per 1 juta token |
Input(Implicit Cache) | 0,005 | Per 1 juta token |
Input(Batch File) | 0,011 | Per 1 juta token |
Output(Batch File) | 0,108 | Per 1 juta token |
Explicit Cache Creation | 0,028 | Per 1 juta token |
Explicit Cache Read | 0,002 | Per 1 juta token |
Input(Batch Chat) | 0,022 | Per 1 juta token |
Output(Batch Chat) | 0,215 | Per 1 juta token |
32k<Input<=128k
32k<Input<=128k
| Item Penagihan | Harga (USD) | Unit |
|---|---|---|
Input | 0,043 | Per 1 juta token |
Output | 0,43 | Per 1 juta token |
Input(Implicit Cache) | 0,009 | Per 1 juta token |
Input(Batch File) | 0,022 | Per 1 juta token |
Output(Batch File) | 0,215 | Per 1 juta token |
Explicit Cache Creation | 0,054 | Per 1 juta token |
Explicit Cache Read | 0,004 | Per 1 juta token |
Input(Batch Chat) | 0,043 | Per 1 juta token |
Output(Batch Chat) | 0,43 | Per 1 juta token |
128k<Input<=256k
128k<Input<=256k
| Item Penagihan | Harga (USD) | Unit |
|---|---|---|
Input | 0,086 | Per 1 juta token |
Output | 0,859 | Per 1 juta token |
Input(Implicit Cache) | 0,018 | Per 1 juta token |
Input(Batch File) | 0,043 | Per 1 juta token |
Output(Batch File) | 0,43 | Per 1 juta token |
Explicit Cache Creation | 0,108 | Per 1 juta token |
Explicit Cache Read | 0,009 | Per 1 juta token |
Input(Batch Chat) | 0,086 | Per 1 juta token |
Output(Batch Chat) | 0,859 | Per 1 juta token |
Batas Laju
- Tiongkok (Beijing)
- Singapura
- Jerman (Frankfurt)
- AS (Virginia)
| Parameter | Nilai |
|---|---|
RPM (Requests Per Minute) | 3.000 |
TPM (Tokens Per Minute) | 5.000.000 |
Versi Snapshot
qwen3-vl-flash-2026-01-22
Seri model Qwen3 untuk pemahaman visual skala kecil secara efektif mengintegrasikan mode berpikir dan tidak berpikir. Dibandingkan dengan snapshot yang diambil pada 15 Oktober 2025, kinerja keseluruhan model telah meningkat secara signifikan: model ini menunjukkan peningkatan dalam pengenalan dan penalaran visual umum, serta akurasi pengenalan yang lebih baik di berbagai skenario bisnis seperti keamanan, inspeksi toko, pemantauan peralatan, dan pemecahan masalah berbasis foto. Versi ini merupakan snapshot per 22 Januari 2026.
Penyedia Layanan Inferensi
Penyedia layanan inferensi untuk qwen3-vl-flash-2026-01-22 adalah Alibaba Cloud Model Studio.
Kemampuan Model
| Kemampuan | Dukungan | Kemampuan | Dukungan |
|---|---|---|---|
Input Modality | Text Image Video | Output Modality | Text |
Model Experience | Didukung | Function Calling | Tidak Didukung |
Structured Outputs | Tidak Didukung | Web Search | Tidak Didukung |
Prefix Completion | Tidak Didukung | Context Caching | Tidak Didukung |
Batch Inference | Tidak Didukung | Fine-tuning | Tidak Didukung |
Batas Konteks
| Parameter | Nilai | Parameter | Nilai |
|---|---|---|---|
Max Input Length | 258048 | Max Output Length | 32768 |
Context Window | 262144 | Max Input Length (Thinking Mode) | 258048 |
Max Output Length (Thinking Mode) | 32768 | Max Chain-of-Thought Length | 81920 |
Harga
Halaman ini hanya menampilkan harga standar untuk panggilan API model, tidak termasuk promosi berbatas waktu apa pun. Kunjungi Konsol Model Studio untuk informasi penawaran promosi.
- Tiongkok (Beijing)
- Singapura
- Jerman (Frankfurt)
Input<=32k
Input<=32k
| Item Penagihan | Harga (USD) | Unit |
|---|---|---|
Input | 0,022 | Per 1 juta token |
Output | 0,215 | Per 1 juta token |
32k<Input<=128k
32k<Input<=128k
| Item Penagihan | Harga (USD) | Unit |
|---|---|---|
Input | 0,043 | Per 1 juta token |
Output | 0,43 | Per 1 juta token |
128k<Input<=256k
128k<Input<=256k
| Item Penagihan | Harga (USD) | Unit |
|---|---|---|
Input | 0,086 | Per 1 juta token |
Output | 0,859 | Per 1 juta token |
Batas Laju
- Tiongkok (Beijing)
- Singapura
- Jerman (Frankfurt)
| Parameter | Nilai |
|---|---|
RPM (Requests Per Minute) | 60 |
TPM (Tokens Per Minute) | 100.000 |
qwen3-vl-flash-2025-10-15
Seri model Qwen3 untuk pemahaman visual skala kecil secara efektif mengintegrasikan mode berpikir dan tidak berpikir, memberikan kinerja unggul dibandingkan model open-source Qwen3-VL-30B-A3B sekaligus mempertahankan kecepatan respons yang cepat. Model ini menunjukkan peningkatan komprehensif dalam pemahaman gambar dan video, mendukung konteks ultra-panjang seperti video dan dokumen panjang, kesadaran spasial, serta pengenalan objek lintas berbagai domain. Dilengkapi kemampuan lokalisasi visual 2D/3D, model ini sangat cocok untuk menangani tugas-tugas dunia nyata yang kompleks. Versi ini merupakan snapshot per 15 Oktober 2025.
Penyedia Layanan Inferensi
Penyedia layanan inferensi untuk qwen3-vl-flash-2025-10-15 adalah Alibaba Cloud Model Studio.
Kemampuan Model
- Tiongkok (Beijing)
- Singapura
- Jerman (Frankfurt)
- AS (Virginia)
| Kemampuan | Dukungan | Kemampuan | Dukungan |
|---|---|---|---|
Input Modality | Text Image Video | Output Modality | Text |
Model Experience | Didukung | Function Calling | Didukung |
Structured Outputs | Didukung | Web Search | Tidak Didukung |
Prefix Completion | Didukung | Context Caching | Tidak Didukung |
Batch Inference | Tidak Didukung | Fine-tuning | Tidak Didukung |
Batas Konteks
| Parameter | Nilai | Parameter | Nilai |
|---|---|---|---|
Max Input Length | 260096 | Max Output Length | 32768 |
Context Window | 262144 | Max Input Length (Thinking Mode) | 258048 |
Max Output Length (Thinking Mode) | 32768 | Max Chain-of-Thought Length | 81920 |
Harga
Halaman ini hanya menampilkan harga standar untuk panggilan API model, tidak termasuk promosi berbatas waktu apa pun. Kunjungi Konsol Model Studio untuk informasi penawaran promosi.
- Tiongkok (Beijing)
- Singapura
- Jerman (Frankfurt)
- AS (Virginia)
Input<=32k
Input<=32k
| Item Penagihan | Harga (USD) | Unit |
|---|---|---|
Input | 0,022 | Per 1 juta token |
Output | 0,215 | Per 1 juta token |
32k<Input<=128k
32k<Input<=128k
| Item Penagihan | Harga (USD) | Unit |
|---|---|---|
Input | 0,043 | Per 1 juta token |
Output | 0,43 | Per 1 juta token |
128k<Input<=256k
128k<Input<=256k
| Item Penagihan | Harga (USD) | Unit |
|---|---|---|
Input | 0,086 | Per 1 juta token |
Output | 0,859 | Per 1 juta token |
Batas Laju
- Tiongkok (Beijing)
- Singapura
- Jerman (Frankfurt)
- AS (Virginia)
| Parameter | Nilai |
|---|---|
RPM (Requests Per Minute) | 60 |
TPM (Tokens Per Minute) | 100.000 |