Seri model pemahaman visual skala kecil Qwen3 secara efektif mengintegrasikan mode berpikir dan tidak berpikir, memberikan kinerja unggul dibandingkan model open-source Qwen3-VL-30B-A3B sekaligus mempertahankan kecepatan respons yang cepat. Model ini menunjukkan peningkatan komprehensif dalam pemahaman gambar dan video, mendukung konteks ultra-panjang seperti video dan dokumen panjang, kesadaran spasial, serta pengenalan objek di berbagai domain. Dilengkapi kemampuan lokalisasi visual 2D/3D, model ini sangat cocok untuk menangani tugas-tugas kompleks di dunia nyata. Versi ini secara fungsional setara dengan Snapshot qwen3-vl-flash-2026-01-22-us.
Penyedia Layanan Inferensi
Penyedia layanan inferensi untuk qwen3-vl-flash-us adalah Alibaba Cloud Model Studio.
Kemampuan Model
| Kemampuan | Dukungan | Kemampuan | Dukungan |
|---|---|---|---|
Modalitas Input | Text Image Video | Modalitas Output | Text |
Pengalaman Model | Didukung | Function Calling | Tidak Didukung |
Structured Outputs | Didukung | Web Search | Tidak Didukung |
Prefix Completion | Didukung | Context Caching | Didukung |
Batch Inference | Tidak Didukung | Fine-tuning | Tidak Didukung |
Batas Konteks
| Parameter | Nilai | Parameter | Nilai |
|---|---|---|---|
Panjang Input Maksimum | 258048 | Panjang Output Maksimum | 32768 |
Jendela Konteks | 262144 | Panjang Input Maksimum (Mode Berpikir) | 258048 |
Panjang Output Maksimum (Mode Berpikir) | 32768 | Panjang Chain-of-Thought Maksimum | 81920 |
Harga
Halaman ini hanya menampilkan harga asli untuk panggilan API model, tidak termasuk promosi berbatas waktu apa pun. Kunjungi Konsol Model Studio untuk penawaran promosi.
- AS (Virginia)
Input<=32k
Input<=32k
| Item Penagihan | Harga (USD) | Unit |
|---|---|---|
Input | 0,05 | Per 1 juta token |
Output | 0,4 | Per 1 juta token |
Input(Implicit Cache) | 0,01 | Per 1 juta token |
Explicit Cache Creation | 0,0625 | Per 1 juta token |
Explicit Cache Read | 0,005 | Per 1 juta token |
32k<Input<=128k
32k<Input<=128k
| Item Penagihan | Harga (USD) | Unit |
|---|---|---|
Input | 0,075 | Per 1 juta token |
Output | 0,6 | Per 1 juta token |
Input(Implicit Cache) | 0,015 | Per 1 juta token |
Explicit Cache Creation | 0,09375 | Per 1 juta token |
Explicit Cache Read | 0,0075 | Per 1 juta token |
128k<Input<=256k
128k<Input<=256k
| Item Penagihan | Harga (USD) | Unit |
|---|---|---|
Input | 0,12 | Per 1 juta token |
Output | 0,96 | Per 1 juta token |
Input(Implicit Cache) | 0,024 | Per 1 juta token |
Explicit Cache Creation | 0,15 | Per 1 juta token |
Explicit Cache Read | 0,012 | Per 1 juta token |
Batas Laju
- AS (Virginia)
| Parameter | Nilai |
|---|---|
RPM (Requests Per Minute) | 6000 |
TPM (Tokens Per Minute) | 1.000.000 |
Versi Snapshot
qwen3-vl-flash-2026-01-22-us
Seri model pemahaman visual skala kecil Qwen3 secara efektif mengintegrasikan mode berpikir dan tidak berpikir. Dibandingkan dengan snapshot yang diambil pada 15 Oktober 2025, kinerja keseluruhan model meningkat secara signifikan: model ini menawarkan kemampuan yang ditingkatkan dalam pengenalan dan penalaran visual umum, serta menunjukkan peningkatan nyata dalam akurasi pengenalan di berbagai skenario bisnis seperti keamanan, inspeksi toko, pemantauan peralatan, dan pemecahan masalah berbasis foto. Versi ini merupakan Snapshot per 22 Januari 2026.
Penyedia Layanan Inferensi
Penyedia layanan inferensi untuk qwen3-vl-flash-2026-01-22-us adalah Alibaba Cloud Model Studio.
Kemampuan Model
| Kemampuan | Dukungan | Kemampuan | Dukungan |
|---|---|---|---|
Modalitas Input | Text Image Video | Modalitas Output | Text |
Pengalaman Model | Didukung | Function Calling | Tidak Didukung |
Structured Outputs | Tidak Didukung | Web Search | Tidak Didukung |
Prefix Completion | Tidak Didukung | Context Caching | Tidak Didukung |
Batch Inference | Tidak Didukung | Fine-tuning | Tidak Didukung |
Batas Konteks
| Parameter | Nilai | Parameter | Nilai |
|---|---|---|---|
Panjang Input Maksimum | 260096 | Panjang Output Maksimum | 32768 |
Jendela Konteks | 262144 | Panjang Input Maksimum (Mode Berpikir) | 258048 |
Panjang Output Maksimum (Mode Berpikir) | 32768 |
Harga
Halaman ini hanya menampilkan harga asli untuk panggilan API model, tidak termasuk promosi berbatas waktu apa pun. Kunjungi Konsol Model Studio untuk penawaran promosi.
- AS (Virginia)
Input<=32k
Input<=32k
| Item Penagihan | Harga (USD) | Unit |
|---|---|---|
Input | 0,05 | Per 1 juta token |
Output | 0,4 | Per 1 juta token |
32k<Input<=128k
32k<Input<=128k
| Item Penagihan | Harga (USD) | Unit |
|---|---|---|
Input | 0,075 | Per 1 juta token |
Output | 0,6 | Per 1 juta token |
128k<Input<=256k
128k<Input<=256k
| Item Penagihan | Harga (USD) | Unit |
|---|---|---|
Input | 0,12 | Per 1 juta token |
Output | 0,96 | Per 1 juta token |
Batas Laju
- AS (Virginia)
| Parameter | Nilai |
|---|---|
RPM (Requests Per Minute) | 60 |
TPM (Tokens Per Minute) | 1.000.000 |
qwen3-vl-flash-2025-10-15-us
Seri model pemahaman visual skala kecil Qwen3 secara efektif mengintegrasikan mode berpikir dan tidak berpikir, memberikan kinerja unggul dibandingkan model open-source Qwen3-VL-30B-A3B sekaligus mempertahankan kecepatan respons yang cepat. Model ini menunjukkan peningkatan komprehensif dalam pemahaman gambar dan video, mendukung konteks ultra-panjang seperti video dan dokumen panjang, kesadaran spasial, serta pengenalan objek di berbagai domain. Dilengkapi kemampuan lokalisasi visual 2D/3D, model ini sangat cocok untuk menangani tugas-tugas kompleks di dunia nyata. Versi ini merupakan Snapshot per 15 Oktober 2025.
Penyedia Layanan Inferensi
Penyedia layanan inferensi untuk qwen3-vl-flash-2025-10-15-us adalah Alibaba Cloud Model Studio.
Kemampuan Model
| Kemampuan | Dukungan | Kemampuan | Dukungan |
|---|---|---|---|
Modalitas Input | Text Image Video | Modalitas Output | Text |
Pengalaman Model | Didukung | Function Calling | Tidak Didukung |
Structured Outputs | Didukung | Web Search | Tidak Didukung |
Prefix Completion | Didukung | Context Caching | Tidak Didukung |
Batch Inference | Tidak Didukung | Fine-tuning | Tidak Didukung |
Batas Konteks
| Parameter | Nilai | Parameter | Nilai |
|---|---|---|---|
Panjang Input Maksimum | 258048 | Panjang Output Maksimum | 32768 |
Jendela Konteks | 262144 | Panjang Input Maksimum (Mode Berpikir) | 258048 |
Panjang Output Maksimum (Mode Berpikir) | 32768 | Panjang Chain-of-Thought Maksimum | 81920 |
Harga
Halaman ini hanya menampilkan harga asli untuk panggilan API model, tidak termasuk promosi berbatas waktu apa pun. Kunjungi Konsol Model Studio untuk penawaran promosi.
- AS (Virginia)
Input<=32k
Input<=32k
| Item Penagihan | Harga (USD) | Unit |
|---|---|---|
Input | 0,05 | Per 1 juta token |
Output | 0,4 | Per 1 juta token |
32k<Input<=128k
32k<Input<=128k
| Item Penagihan | Harga (USD) | Unit |
|---|---|---|
Input | 0,075 | Per 1 juta token |
Output | 0,6 | Per 1 juta token |
128k<Input<=256k
128k<Input<=256k
| Item Penagihan | Harga (USD) | Unit |
|---|---|---|
Input | 0,12 | Per 1 juta token |
Output | 0,96 | Per 1 juta token |
Batas Laju
- AS (Virginia)
| Parameter | Nilai |
|---|---|
RPM (Requests Per Minute) | 6000 |
TPM (Tokens Per Minute) | 1.000.000 |