Skip to main content
Pengenalan Ucapan

qwen-audio-3.1-asr-flash-streaming

Qwen-Audio-3.1-ASR-Flash-Streaming adalah model pengenalan ucapan waktu nyata end-to-end yang dirancang untuk skenario seperti konferensi waktu nyata, subtitle langsung, dan interaksi cerdas. Model ini memiliki latensi rendah dan akurasi tinggi dalam transkripsi ucapan streaming. Model ini mendukung pengenalan dialek Tiongkok multibahasa dan multi-wilayah, peralihan mulus antara bahasa Tiongkok dan Inggris, peningkatan kata panas dan konteks, prediksi tanda baca, serta normalisasi teks. Model ini juga menunjukkan ketahanan noise yang kuat dan dapat beradaptasi dengan lingkungan akustik yang kompleks. Selain itu, versi ini mendukung output ASR/AST yang dapat dikontrol untuk berbagai dialek.

Penyedia Layanan Inferensi

Penyedia layanan inferensi untuk qwen-audio-3.1-asr-flash-streaming adalah Alibaba Cloud Model Studio.

Kemampuan Model

KemampuanDukunganKemampuanDukungan
Modalitas InputAudioModalitas OutputTeks
Pengalaman ModelTidak DidukungFunction CallingTidak Didukung
Structured OutputsTidak DidukungPencarian WebTidak Didukung
Prefix CompletionTidak DidukungCaching KonteksTidak Didukung
Inferensi BatchTidak DidukungFine-tuningTidak Didukung

Batas Konteks

ParameterNilaiParameterNilai
Panjang Input Maksimum8192 TokenPanjang Output Maksimum1024 Token
Jendela Konteks8192 Token

Harga

Halaman ini hanya menampilkan harga asli untuk panggilan API model, tidak termasuk promosi waktu terbatas. Kunjungi Konsol Model Studio untuk penawaran promosi.
  • Tiongkok (Beijing)
  • Singapore
Item PenagihanHarga (USD)Unit
Input0.848Per juta token
Output0.636Per juta token

Batas Laju

  • Tiongkok (Beijing)
  • Singapore
ParameterNilai
RPM (permintaan per menit)600

Penggunaan API

Rencana Token (Team Edition)
Model playground
  • Pembuatan audio
  • Pembuatan musik
Statistik dan Pemantauan
Asset Center
Dukungan layanan