Skip to main content
Text Generation

qwen3.5-flash

Model Flash vision-language native Qwen3.5 dibangun di atas arsitektur hibrida yang mengintegrasikan mekanisme perhatian linear dengan model sparse mixture-of-experts, sehingga mencapai efisiensi inferensi yang lebih tinggi. Dibandingkan dengan seri 3, model ini menunjukkan peningkatan signifikan dalam performa—baik untuk tugas teks murni maupun multimodal—dengan waktu respons cepat sekaligus menjaga keseimbangan antara kecepatan inferensi dan performa keseluruhan. Versi model ini secara fungsional setara dengan Snapshot model qwen3.5-flash-2026-02-23.

Penyedia Layanan Inferensi

Penyedia layanan inferensi untuk qwen3.5-flash adalah Alibaba Cloud Model Studio.

Kemampuan Model

  • Tiongkok (Beijing)
  • Singapura
  • Jerman (Frankfurt)
  • AS (Virginia)
  • Hong Kong (Tiongkok)
KemampuanDukunganKemampuanDukungan

Input Modality

Text Image Video

Output Modality

Text

Model Experience

Didukung

Function Calling

Didukung

Structured Outputs

Didukung

Web Search

Didukung

Prefix Completion

Didukung

Context Caching

Didukung

Batch Inference

Didukung

Fine-tuning

Tidak didukung

Batas Konteks

ParameterNilaiParameterNilai

Max Input Length

991808

Max Output Length

65536

Context Window

1000000

Max Input Length (Thinking Mode)

983616

Max Output Length (Thinking Mode)

65536

Max Chain-of-Thought Length

81920

Harga

Halaman ini hanya menampilkan harga standar untuk panggilan API model, tidak termasuk promosi berbatas waktu. Kunjungi Konsol Model Studio untuk informasi penawaran promosi.
  • Tiongkok (Beijing)
  • Singapura
  • Jerman (Frankfurt)
  • AS (Virginia)
  • Hong Kong (Tiongkok)

Input<=128k

Item PenagihanHarga (USD)Unit

Input

0,029

Per 1 juta token

Output

0,287

Per 1 juta token

Input(Batch File)

0,014

Per 1 juta token

Output(Batch File)

0,143

Per 1 juta token

Explicit Cache Creation

0,036

Per 1 juta token

Explicit Cache Read

0,003

Per 1 juta token

Input(Batch Chat)

0,029

Per 1 juta token

Output(Batch Chat)

0,287

Per 1 juta token

Item PenagihanHarga (USD)Unit

Input

0,115

Per 1 juta token

Output

1,147

Per 1 juta token

Input(Batch File)

0,057

Per 1 juta token

Output(Batch File)

0,573

Per 1 juta token

Explicit Cache Creation

0,143

Per 1 juta token

Explicit Cache Read

0,012

Per 1 juta token

Input(Batch Chat)

0,115

Per 1 juta token

Output(Batch Chat)

1,147

Per 1 juta token

Item PenagihanHarga (USD)Unit

Input

0,172

Per 1 juta token

Output

1,72

Per 1 juta token

Input(Batch File)

0,086

Per 1 juta token

Output(Batch File)

0,86

Per 1 juta token

Explicit Cache Creation

0,215

Per 1 juta token

Explicit Cache Read

0,017

Per 1 juta token

Input(Batch Chat)

0,172

Per 1 juta token

Output(Batch Chat)

1,72

Per 1 juta token

Batas Laju

  • Tiongkok (Beijing)
  • Singapura
  • Jerman (Frankfurt)
  • AS (Virginia)
  • Hong Kong (Tiongkok)
ParameterNilai

RPM (Requests Per Minute)

30000

TPM (Tokens Per Minute)

10.000.000

Versi Snapshot

qwen3.5-flash-2026-02-23

Model Flash vision-language native Qwen3.5 dibangun di atas arsitektur hibrida yang mengintegrasikan mekanisme perhatian linear dengan model sparse mixture-of-experts, sehingga mencapai efisiensi inferensi yang lebih tinggi. Dibandingkan dengan seri 3, model ini menunjukkan peningkatan signifikan dalam performa—baik untuk tugas teks murni maupun multimodal—dengan waktu respons cepat sekaligus menjaga keseimbangan antara kecepatan inferensi dan performa keseluruhan. Versi ini merupakan snapshot per tanggal 23 Februari 2026.

Penyedia Layanan Inferensi

Penyedia layanan inferensi untuk qwen3.5-flash-2026-02-23 adalah Alibaba Cloud Model Studio.

Kemampuan Model

  • Tiongkok (Beijing)
  • Singapura
  • Jerman (Frankfurt)
  • AS (Virginia)
  • Hong Kong (Tiongkok)
KemampuanDukunganKemampuanDukungan

Input Modality

Text Image Video

Output Modality

Text

Model Experience

Didukung

Function Calling

Didukung

Structured Outputs

Didukung

Web Search

Didukung

Prefix Completion

Didukung

Context Caching

Tidak didukung

Batch Inference

Tidak didukung

Fine-tuning

Didukung

Batas Konteks

ParameterNilaiParameterNilai

Max Input Length

991808

Max Output Length

65536

Context Window

1000000

Max Input Length (Thinking Mode)

983616

Max Output Length (Thinking Mode)

65536

Max Chain-of-Thought Length

81920

Harga

Halaman ini hanya menampilkan harga standar untuk panggilan API model, tidak termasuk promosi berbatas waktu. Kunjungi Konsol Model Studio untuk informasi penawaran promosi.
  • Tiongkok (Beijing)
  • Singapura
  • Jerman (Frankfurt)
  • AS (Virginia)
  • Hong Kong (Tiongkok)

Input<=128k

Item PenagihanHarga (USD)Unit

Input

0,029

Per 1 juta token

Output

0,287

Per 1 juta token

Item PenagihanHarga (USD)Unit

Input

0,115

Per 1 juta token

Output

1,147

Per 1 juta token

Item PenagihanHarga (USD)Unit

Input

0,172

Per 1 juta token

Output

1,72

Per 1 juta token

Batas Laju

  • Tiongkok (Beijing)
  • Singapura
  • Jerman (Frankfurt)
  • AS (Virginia)
  • Hong Kong (Tiongkok)
ParameterNilai

RPM (Requests Per Minute)

600

TPM (Tokens Per Minute)

1.000.000

Rencana Token (Team Edition)
Model playground
  • Pembuatan audio
  • Pembuatan musik
Statistik dan Pemantauan
Asset Center
Dukungan layanan
qwen3.5-flash - Alibaba Cloud Model Studio