Qwen-Audio-3.1-ASR-Flash adalah model berskala besar yang mendukung pengenalan ucapan pendek yang efisien, dirancang untuk skenario transkripsi konten berkualitas tinggi, multibahasa, dan budaya. Model ini mendukung pengenalan dialek Tiongkok multibahasa dan multi-wilayah, serta dioptimalkan untuk ritme, intonasi, dan ekspresi bahasa Tiongkok klasik dari puisi Tiongkok kuno. Model ini memiliki kemampuan peningkatan konteks, prediksi tanda baca, dan normalisasi teks. Versi ini juga mendukung output ASR/AST yang dapat dikontrol untuk berbagai dialek. Model ini mencakup kemampuan transkripsi dan penyempurnaan asli, serta kemampuan transkripsi berbasis peran dialog multi-orang tingkat industri.
Penyedia Layanan Inferensi
Penyedia layanan inferensi untuk qwen-audio-3.1-asr-flash adalah Alibaba Cloud Model Studio.
Kemampuan Model
| Kemampuan | Dukungan | Kemampuan | Dukungan |
|---|---|---|---|
| Modalitas Input | Audio | Modalitas Output | Teks |
| Pengalaman Model | Tidak Didukung | Function Calling | Tidak Didukung |
| Structured Outputs | Tidak Didukung | Pencarian Web | Tidak Didukung |
| Prefix Completion | Tidak Didukung | Caching Konteks | Tidak Didukung |
| Inferensi Batch | Tidak Didukung | Fine-tuning | Tidak Didukung |
Batas Konteks
| Parameter | Nilai | Parameter | Nilai |
|---|---|---|---|
| Panjang Input Maksimum | 7168 Token | Panjang Output Maksimum | 1024 Token |
| Jendela Konteks | 8192 Token |
Harga
Halaman ini hanya menampilkan harga asli untuk panggilan API model, tidak termasuk promosi waktu terbatas. Kunjungi Konsol Model Studio untuk penawaran promosi.
- Tiongkok (Beijing)
- Singapore
| Item Penagihan | Harga (USD) | Unit |
|---|---|---|
| Input | 0.113 | Per juta token |
| Output | 0.382 | Per juta token |
Batas Laju
- Tiongkok (Beijing)
- Singapore
| Parameter | Nilai |
|---|---|
| RPM (permintaan per menit) | 600 |