Skip to main content
Pengenalan Ucapan

qwen-audio-3.1-asr-flash

Qwen-Audio-3.1-ASR-Flash adalah model berskala besar yang mendukung pengenalan ucapan pendek yang efisien, dirancang untuk skenario transkripsi konten berkualitas tinggi, multibahasa, dan budaya. Model ini mendukung pengenalan dialek Tiongkok multibahasa dan multi-wilayah, serta dioptimalkan untuk ritme, intonasi, dan ekspresi bahasa Tiongkok klasik dari puisi Tiongkok kuno. Model ini memiliki kemampuan peningkatan konteks, prediksi tanda baca, dan normalisasi teks. Versi ini juga mendukung output ASR/AST yang dapat dikontrol untuk berbagai dialek. Model ini mencakup kemampuan transkripsi dan penyempurnaan asli, serta kemampuan transkripsi berbasis peran dialog multi-orang tingkat industri.

Penyedia Layanan Inferensi

Penyedia layanan inferensi untuk qwen-audio-3.1-asr-flash adalah Alibaba Cloud Model Studio.

Kemampuan Model

KemampuanDukunganKemampuanDukungan
Modalitas InputAudioModalitas OutputTeks
Pengalaman ModelTidak DidukungFunction CallingTidak Didukung
Structured OutputsTidak DidukungPencarian WebTidak Didukung
Prefix CompletionTidak DidukungCaching KonteksTidak Didukung
Inferensi BatchTidak DidukungFine-tuningTidak Didukung

Batas Konteks

ParameterNilaiParameterNilai
Panjang Input Maksimum7168 TokenPanjang Output Maksimum1024 Token
Jendela Konteks8192 Token

Harga

Halaman ini hanya menampilkan harga asli untuk panggilan API model, tidak termasuk promosi waktu terbatas. Kunjungi Konsol Model Studio untuk penawaran promosi.
  • Tiongkok (Beijing)
  • Singapore
Item PenagihanHarga (USD)Unit
Input0.113Per juta token
Output0.382Per juta token

Batas Laju

  • Tiongkok (Beijing)
  • Singapore
ParameterNilai
RPM (permintaan per menit)600

Penggunaan API

Rencana Token (Team Edition)
Model playground
  • Pembuatan audio
  • Pembuatan musik
Statistik dan Pemantauan
Asset Center
Dukungan layanan