Skip to main content
Pengenalan Ucapan

qwen-audio-3.1-asr-flash-filetrans

Qwen-Audio-3.1-ASR-Flash-Filetrans adalah model pengenalan ucapan offline end-to-end yang dirancang untuk skenario seperti transkripsi rapat, produksi konten, dan analisis panggilan. Model ini mendukung pengenalan dialek Tiongkok multibahasa dan multi-wilayah. Model ini memiliki kemampuan transkripsi presisi tinggi, peningkatan kata panas dan konteks, pemisahan pembicara, prediksi tanda baca, dan normalisasi teks. Model ini mempertahankan kinerja yang stabil bahkan di lingkungan yang bising dan kompleks, menjadikannya pilihan utama untuk transkripsi audio panjang. Versi ini juga mendukung keluaran ASR/AST yang dapat dikontrol untuk berbagai dialek.

Penyedia Layanan Inferensi

Penyedia layanan inferensi untuk qwen-audio-3.1-asr-flash-filetrans adalah Alibaba Cloud Model Studio.

Kemampuan Model

KemampuanDukunganKemampuanDukungan
Modalitas InputAudioModalitas OutputTeks
Pengalaman ModelTidak DidukungFunction CallingTidak Didukung
Structured OutputsTidak DidukungPencarian WebTidak Didukung
Prefix CompletionTidak DidukungCaching KonteksTidak Didukung
Inferensi BatchTidak DidukungFine-tuningTidak Didukung

Batas Konteks

ParameterNilaiParameterNilai
Panjang Input Maksimum8192 TokenPanjang Output Maksimum1024 Token
Jendela Konteks8192 Token

Harga

Halaman ini hanya menampilkan harga asli untuk panggilan API model, tidak termasuk promosi waktu terbatas. Kunjungi Konsol Model Studio untuk penawaran promosi.
  • Tiongkok (Beijing)
  • Singapore
Item PenagihanHarga (USD)Unit
Input0.113Per juta token
Output0.382Per juta token

Batas Laju

  • Tiongkok (Beijing)
  • Singapore
ParameterNilai
RPM (permintaan per menit)600

Penggunaan API

Rencana Token (Team Edition)
Model playground
  • Pembuatan audio
  • Pembuatan musik
Statistik dan Pemantauan
Asset Center
Dukungan layanan