Qwen-Audio-3.1-ASR-Flash-Message adalah model pengenalan ucapan generatif yang dioptimalkan untuk pesan suara, input suara, dan skenario perusahaan. Model ini mendukung bahasa Mandarin, Inggris, dan bahasa lainnya, dengan optimalisasi untuk bahasa Indonesia, Jepang, Thai, Filipina, Vietnam, Korea, dan Melayu. Model ini mendukung transkripsi streaming inkremental, kata panas P0/P1, normalisasi teks, pengenalan yang diinformasikan oleh transkrip sebelumnya dan konteks bisnis, serta pemolesan teks asli opsional. Model ini meningkatkan stabilitas pengenalan dengan beberapa pembicara, percakapan latar belakang, audio medan jauh, dan kebisingan lingkungan. Model ini mendukung deteksi bahasa otomatis atau bahasa target yang ditentukan, dan dapat mentranskripsikan dialek Tiongkok sebagaimana diucapkan atau mengubahnya menjadi teks Mandarin standar.
Penyedia Layanan Inferensi
Penyedia layanan inferensi untuk qwen-audio-3.1-asr-flash-message adalah Alibaba Cloud Model Studio.
Kemampuan Model
| Kemampuan | Dukungan | Kemampuan | Dukungan |
|---|---|---|---|
| Modalitas Input | Audio | Modalitas Output | Teks |
| Pengalaman Model | Tidak Didukung | Function Calling | Tidak Didukung |
| Structured Outputs | Didukung | Pencarian Web | Tidak Didukung |
| Prefix Completion | Tidak Didukung | Caching Konteks | Tidak Didukung |
| Inferensi Batch | Tidak Didukung | Fine-tuning | Tidak Didukung |
Batas Konteks
| Parameter | Nilai | Parameter | Nilai |
|---|---|---|---|
| Panjang Input Maksimum | 7168 Token | Panjang Output Maksimum | 1024 Token |
| Jendela Konteks | 8192 Token |
Harga
Halaman ini hanya menampilkan harga asli untuk panggilan API model, tidak termasuk promosi waktu terbatas. Kunjungi Konsol Model Studio untuk penawaran promosi.
- Tiongkok (Beijing)
- Singapore
| Item penagihan | Harga (USD) | Unit |
|---|---|---|
| Input | 0.848 | Per juta token |
| Output | 0.636 | Per juta token |
Batas Laju
- Tiongkok (Beijing)
- Singapore
| Parameter | Nilai |
|---|---|
| RPM (permintaan per menit) | 1200 |