Qwen-Audio-3.1-ASR-Flash-Streaming adalah model pengenalan ucapan waktu nyata end-to-end yang dirancang untuk skenario seperti konferensi waktu nyata, subtitle langsung, dan interaksi cerdas. Model ini memiliki latensi rendah dan akurasi tinggi dalam transkripsi ucapan streaming. Model ini mendukung pengenalan dialek Tiongkok multibahasa dan multi-wilayah, peralihan mulus antara bahasa Tiongkok dan Inggris, peningkatan kata panas dan konteks, prediksi tanda baca, serta normalisasi teks. Model ini juga menunjukkan ketahanan noise yang kuat dan dapat beradaptasi dengan lingkungan akustik yang kompleks. Selain itu, versi ini mendukung output ASR/AST yang dapat dikontrol untuk berbagai dialek.
Penyedia Layanan Inferensi
Penyedia layanan inferensi untuk qwen-audio-3.1-asr-flash-streaming adalah Alibaba Cloud Model Studio.
Kemampuan Model
| Kemampuan | Dukungan | Kemampuan | Dukungan |
|---|---|---|---|
| Modalitas Input | Audio | Modalitas Output | Teks |
| Pengalaman Model | Tidak Didukung | Function Calling | Tidak Didukung |
| Structured Outputs | Tidak Didukung | Pencarian Web | Tidak Didukung |
| Prefix Completion | Tidak Didukung | Caching Konteks | Tidak Didukung |
| Inferensi Batch | Tidak Didukung | Fine-tuning | Tidak Didukung |
Batas Konteks
| Parameter | Nilai | Parameter | Nilai |
|---|---|---|---|
| Panjang Input Maksimum | 8192 Token | Panjang Output Maksimum | 1024 Token |
| Jendela Konteks | 8192 Token |
Harga
Halaman ini hanya menampilkan harga asli untuk panggilan API model, tidak termasuk promosi waktu terbatas. Kunjungi Konsol Model Studio untuk penawaran promosi.
- Tiongkok (Beijing)
- Singapore
| Item Penagihan | Harga (USD) | Unit |
|---|---|---|
| Input | 0.848 | Per juta token |
| Output | 0.636 | Per juta token |
Batas Laju
- Tiongkok (Beijing)
- Singapore
| Parameter | Nilai |
|---|---|
| RPM (permintaan per menit) | 600 |