Skip to main content
Vision

qwen3-vl-flash

Seri model Qwen3 untuk pemahaman visual skala kecil secara efektif mengintegrasikan mode berpikir dan tidak berpikir, memberikan kinerja unggul dibandingkan model open-source Qwen3-VL-30B-A3B sekaligus mempertahankan kecepatan respons yang cepat. Model ini menunjukkan peningkatan komprehensif dalam pemahaman gambar dan video, mendukung konteks ultra-panjang seperti video dan dokumen panjang, kesadaran spasial, serta pengenalan objek lintas berbagai domain. Dilengkapi kemampuan lokalisasi visual 2D/3D, model ini sangat cocok untuk menangani tugas-tugas dunia nyata yang kompleks. Versi ini secara fungsional setara dengan snapshot model qwen3-vl-flash-2026-01-22.

Penyedia Layanan Inferensi

Penyedia layanan inferensi untuk qwen3-vl-flash adalah Alibaba Cloud Model Studio.

Kemampuan Model

  • Tiongkok (Beijing)
  • Singapura
  • Jerman (Frankfurt)
  • AS (Virginia)
KemampuanDukunganKemampuanDukungan

Input Modality

Text Image Video

Output Modality

Text

Model Experience

Didukung

Function Calling

Didukung

Structured Outputs

Didukung

Web Search

Tidak Didukung

Prefix Completion

Didukung

Context Caching

Didukung

Batch Inference

Tidak Didukung

Fine-tuning

Tidak Didukung

Batas Konteks

ParameterNilaiParameterNilai

Max Input Length

260096

Max Output Length

32768

Context Window

262144

Max Input Length (Thinking Mode)

258048

Max Output Length (Thinking Mode)

32768

Max Chain-of-Thought Length

81920

Harga

Halaman ini hanya menampilkan harga standar untuk panggilan API model, tidak termasuk promosi berbatas waktu apa pun. Kunjungi Konsol Model Studio untuk informasi penawaran promosi.
  • Tiongkok (Beijing)
  • Singapura
  • Jerman (Frankfurt)
  • AS (Virginia)

Input<=32k

Item PenagihanHarga (USD)Unit

Input

0,022

Per 1 juta token

Output

0,215

Per 1 juta token

Input(Implicit Cache)

0,005

Per 1 juta token

Input(Batch File)

0,011

Per 1 juta token

Output(Batch File)

0,108

Per 1 juta token

Explicit Cache Creation

0,028

Per 1 juta token

Explicit Cache Read

0,002

Per 1 juta token

Input(Batch Chat)

0,022

Per 1 juta token

Output(Batch Chat)

0,215

Per 1 juta token

Item PenagihanHarga (USD)Unit

Input

0,043

Per 1 juta token

Output

0,43

Per 1 juta token

Input(Implicit Cache)

0,009

Per 1 juta token

Input(Batch File)

0,022

Per 1 juta token

Output(Batch File)

0,215

Per 1 juta token

Explicit Cache Creation

0,054

Per 1 juta token

Explicit Cache Read

0,004

Per 1 juta token

Input(Batch Chat)

0,043

Per 1 juta token

Output(Batch Chat)

0,43

Per 1 juta token

Item PenagihanHarga (USD)Unit

Input

0,086

Per 1 juta token

Output

0,859

Per 1 juta token

Input(Implicit Cache)

0,018

Per 1 juta token

Input(Batch File)

0,043

Per 1 juta token

Output(Batch File)

0,43

Per 1 juta token

Explicit Cache Creation

0,108

Per 1 juta token

Explicit Cache Read

0,009

Per 1 juta token

Input(Batch Chat)

0,086

Per 1 juta token

Output(Batch Chat)

0,859

Per 1 juta token

Batas Laju

  • Tiongkok (Beijing)
  • Singapura
  • Jerman (Frankfurt)
  • AS (Virginia)
ParameterNilai

RPM (Requests Per Minute)

3.000

TPM (Tokens Per Minute)

5.000.000

Versi Snapshot

qwen3-vl-flash-2026-01-22

Seri model Qwen3 untuk pemahaman visual skala kecil secara efektif mengintegrasikan mode berpikir dan tidak berpikir. Dibandingkan dengan snapshot yang diambil pada 15 Oktober 2025, kinerja keseluruhan model telah meningkat secara signifikan: model ini menunjukkan peningkatan dalam pengenalan dan penalaran visual umum, serta akurasi pengenalan yang lebih baik di berbagai skenario bisnis seperti keamanan, inspeksi toko, pemantauan peralatan, dan pemecahan masalah berbasis foto. Versi ini merupakan snapshot per 22 Januari 2026.

Penyedia Layanan Inferensi

Penyedia layanan inferensi untuk qwen3-vl-flash-2026-01-22 adalah Alibaba Cloud Model Studio.

Kemampuan Model

KemampuanDukunganKemampuanDukungan

Input Modality

Text Image Video

Output Modality

Text

Model Experience

Didukung

Function Calling

Tidak Didukung

Structured Outputs

Tidak Didukung

Web Search

Tidak Didukung

Prefix Completion

Tidak Didukung

Context Caching

Tidak Didukung

Batch Inference

Tidak Didukung

Fine-tuning

Tidak Didukung

Batas Konteks

ParameterNilaiParameterNilai

Max Input Length

258048

Max Output Length

32768

Context Window

262144

Max Input Length (Thinking Mode)

258048

Max Output Length (Thinking Mode)

32768

Max Chain-of-Thought Length

81920

Harga

Halaman ini hanya menampilkan harga standar untuk panggilan API model, tidak termasuk promosi berbatas waktu apa pun. Kunjungi Konsol Model Studio untuk informasi penawaran promosi.
  • Tiongkok (Beijing)
  • Singapura
  • Jerman (Frankfurt)

Input<=32k

Item PenagihanHarga (USD)Unit

Input

0,022

Per 1 juta token

Output

0,215

Per 1 juta token

Item PenagihanHarga (USD)Unit

Input

0,043

Per 1 juta token

Output

0,43

Per 1 juta token

Item PenagihanHarga (USD)Unit

Input

0,086

Per 1 juta token

Output

0,859

Per 1 juta token

Batas Laju

  • Tiongkok (Beijing)
  • Singapura
  • Jerman (Frankfurt)
ParameterNilai

RPM (Requests Per Minute)

60

TPM (Tokens Per Minute)

100.000

qwen3-vl-flash-2025-10-15

Seri model Qwen3 untuk pemahaman visual skala kecil secara efektif mengintegrasikan mode berpikir dan tidak berpikir, memberikan kinerja unggul dibandingkan model open-source Qwen3-VL-30B-A3B sekaligus mempertahankan kecepatan respons yang cepat. Model ini menunjukkan peningkatan komprehensif dalam pemahaman gambar dan video, mendukung konteks ultra-panjang seperti video dan dokumen panjang, kesadaran spasial, serta pengenalan objek lintas berbagai domain. Dilengkapi kemampuan lokalisasi visual 2D/3D, model ini sangat cocok untuk menangani tugas-tugas dunia nyata yang kompleks. Versi ini merupakan snapshot per 15 Oktober 2025.

Penyedia Layanan Inferensi

Penyedia layanan inferensi untuk qwen3-vl-flash-2025-10-15 adalah Alibaba Cloud Model Studio.

Kemampuan Model

  • Tiongkok (Beijing)
  • Singapura
  • Jerman (Frankfurt)
  • AS (Virginia)
KemampuanDukunganKemampuanDukungan

Input Modality

Text Image Video

Output Modality

Text

Model Experience

Didukung

Function Calling

Didukung

Structured Outputs

Didukung

Web Search

Tidak Didukung

Prefix Completion

Didukung

Context Caching

Tidak Didukung

Batch Inference

Tidak Didukung

Fine-tuning

Tidak Didukung

Batas Konteks

ParameterNilaiParameterNilai

Max Input Length

260096

Max Output Length

32768

Context Window

262144

Max Input Length (Thinking Mode)

258048

Max Output Length (Thinking Mode)

32768

Max Chain-of-Thought Length

81920

Harga

Halaman ini hanya menampilkan harga standar untuk panggilan API model, tidak termasuk promosi berbatas waktu apa pun. Kunjungi Konsol Model Studio untuk informasi penawaran promosi.
  • Tiongkok (Beijing)
  • Singapura
  • Jerman (Frankfurt)
  • AS (Virginia)

Input<=32k

Item PenagihanHarga (USD)Unit

Input

0,022

Per 1 juta token

Output

0,215

Per 1 juta token

Item PenagihanHarga (USD)Unit

Input

0,043

Per 1 juta token

Output

0,43

Per 1 juta token

Item PenagihanHarga (USD)Unit

Input

0,086

Per 1 juta token

Output

0,859

Per 1 juta token

Batas Laju

  • Tiongkok (Beijing)
  • Singapura
  • Jerman (Frankfurt)
  • AS (Virginia)
ParameterNilai

RPM (Requests Per Minute)

60

TPM (Tokens Per Minute)

100.000

Rencana Token (Team Edition)
Model playground
  • Pembuatan audio
  • Pembuatan musik
Statistik dan Pemantauan
Asset Center