Model pengenalan ucapan non-real-time mengonversi rekaman audio menjadi teks. Model ini mendukung pengenalan multibahasa, pengenalan nyanyian, penolakan noise, dan diarizasi pembicara, sehingga cocok untuk transkripsi rapat, analisis panggilan, pembuatan subtitle, serta skenario serupa lainnya.
Ikhtisar
Transkripsikan file audio dan video yang telah direkam secara batch melalui tugas asinkron.
- Peningkatan konteks meningkatkan akurasi pengenalan melalui konteks yang dapat dikonfigurasi.
- Kata kunci khusus (hotwords) meningkatkan akurasi pengenalan nama diri melalui daftar kata yang telah ditentukan sebelumnya.
- Fitur yang dapat dikonfigurasi mencakup diarizasi pembicara, penyaringan kata sensitif, serta timestamp tingkat kalimat atau tingkat kata.
- Transkripsi asinkron mendukung satu file audio dengan durasi hingga 12 jam dan ukuran maksimal 2 GB.
- Semua laju sampel didukung, bersama format audio dan video utama seperti AAC, WAV, dan MP3.
Prasyarat
- Diperlukan Kunci API—Dapatkan Kunci API dan konfigurasikan sebagai Variabel lingkungan.
- Untuk memanggil API melalui SDK DashScope, instal SDK terbaru.
Mulai cepat
- Qwen-Audio-3.0-ASR-Flash-Filetrans/Fun-ASR
- Qwen-Audio-3.0-ASR-Flash/Fun-ASR-Flash
- Paraformer
- cURL
- Python
- Java
task_id, lalu kueri hasil tugas menggunakan ID tersebut.- Kirimkan tugas
- Ambil hasil tugas
- Unduh hasil pengenalan
{WorkspaceId} dengan ID Ruang Kerja Anda yang sebenarnya. Konfigurasi berbeda-beda tergantung wilayah.Hasil pengenalan lengkap dicetak ke konsol dalam format JSON. Hasil ini berisi teks transkripsi beserta waktu mulai dan akhir setiap segmen dalam file audio atau video, dalam satuan milidetik.
Hasil pengenalan lengkap dicetak ke konsol dalam format JSON. Hasil ini berisi teks transkripsi beserta waktu mulai dan akhir setiap segmen dalam file audio atau video, dalam satuan milidetik.
- Hasil pengenalan
Fitur lanjutan
Gunakan API kompatibel OpenAI
Hanya model seri Qwen3-ASR-Flash yang mendukung panggilan melalui mode kompatibel OpenAI. Mode ini hanya menerima URL file audio yang dapat diakses publik. Mode ini tidak menerima jalur mutlak file audio lokal.
Gunakan SDK Python OpenAI versi 1.52.0 atau lebih baru, atau SDK Node.js versi 4.68.0 atau lebih baru. Untuk menginstal atau memperbarui SDK, jalankan:
asr_options bukan parameter standar OpenAI. Dengan SDK Python OpenAI, teruskan melalui extra_body. Dengan SDK OpenAI Node.js, teruskan asr_options langsung sebagai parameter tingkat atas dalam badan permintaan.
- Input: URL file audio
- Input: file audio dalam format Base64
- Python SDK
- Node.js SDK
- cURL
Proses file audio panjang
Pengenalan ucapan non-real-time mendukung transkripsi asinkron file audio panjang. Ini cocok untuk skenario seperti notulen rapat, transkrip wawancara, dan pemutaran panggilan.
Batasan:
- Qwen-Audio-3.0-ASR-Flash-Filetrans/Fun-ASR / Qwen3-ASR-Flash-Filetrans / Paraformer: satu file audio dapat memiliki ukuran hingga 2 GB dan durasi hingga 12 jam.
- Qwen-Audio-3.0-ASR-Flash/Fun-ASR-Flash/Qwen3-ASR-Flash: satu file audio dapat memiliki ukuran hingga 10 MB dan durasi hingga 5 menit. Untuk audio yang lebih panjang, gunakan Qwen-Audio-3.0-ASR-Flash-Filetrans, Fun-ASR, atau Qwen3-ASR-Flash-Filetrans.
- Saat diarizasi pembicara diaktifkan: batasi durasi audio dalam 2 jam. Audio yang lebih panjang dapat menyebabkan kegagalan pengenalan atau timeout. Untuk informasi lebih lanjut, lihat Diarizasi pembicara.
- Kirimkan tugas transkripsi dan dapatkan
task_id. - Polling API kueri untuk status tugas, atau gunakan metode wait SDK untuk memblokir hingga tugas selesai.
- Setelah tugas selesai, unduh hasil pengenalan JSON dari URL yang dikembalikan.
keluaran streaming
Qwen-Audio-3.0-ASR-Flash/Fun-ASR-Flash/Qwen3-ASR-Flash mendukung keluaran streaming: mereka mengembalikan hasil antara saat pengenalan berlangsung. Ini cocok untuk skenario yang membutuhkan umpan balik progres real-time.
Model transkripsi asinkron seperti Qwen-Audio-3.0-ASR-Flash-Filetrans, Fun-ASR, Qwen3-ASR-Flash-Filetrans, dan Paraformer tidak mendukung keluaran streaming. Dapatkan hasil akhir dengan polling tugas (untuk informasi lebih lanjut, lihat Proses file audio panjang).
Cara mengaktifkan:
- SDK Python DashScope: atur parameter
streamkeTrue. - SDK Java DashScope: panggil API
streamCall. - HTTP DashScope: atur header
X-DashScope-SSEkeenable. - SDK kompatibel OpenAI: atur parameter
streamkeTrue.
Tingkatkan akurasi dengan hotwords
Hotwords meningkatkan akurasi pengenalan untuk nama diri spesifik domain seperti nama orang, nama tempat, dan nama produk. Untuk detail cara membuat dan menggunakan hotwords, lihat Tingkatkan akurasi pengenalan.
SDK berbeda menggunakan konvensi penamaan berbeda untuk parameter ini, seperti kunci kamus, properti objek, atau metode. Untuk pemetaan bidang lengkap, lihat referensi API untuk setiap SDK.
Tingkatkan akurasi dengan peningkatan konteks
Peningkatan konteks meneruskan riwayat percakapan ke model ASR, yang secara signifikan meningkatkan akurasi transkripsi untuk nama diri. Untuk detail cara menggunakan fitur ini dan contoh hasilnya, lihat Peningkatan konteks.
Diarizasi pembicara
Diarizasi pembicara secara otomatis mengidentifikasi pembicara berbeda dalam audio dan memberi label setiap kalimat dalam hasil transkripsi dengan tag pembicara. Ini cocok untuk skenario seperti rapat multipihak dan rekaman wawancara.
Model yang didukung: model seri Qwen-Audio-3.0-ASR-Flash-Filetrans, Fun-ASR, dan Paraformer.
Cara mengaktifkan: atur parameter diarization_enabled ke true dalam permintaan API. Dalam hasilnya, setiap kalimat menyertakan bidang speaker_id yang mengidentifikasi pembicara.
Struktur respons contoh (cuplikan):
Penyaringan kata sensitif
Penyaringan kata sensitif mengganti atau menghapus kata sensitif dalam hasil pengenalan. Ini cocok untuk skenario seperti inspeksi kualitas layanan pelanggan, kepatuhan konten, dan moderasi subtitle.
Model yang didukung: model seri Qwen-Audio-3.0-ASR-Flash-Filetrans, Fun-ASR, dan Paraformer.
Perilaku default: saat parameter special_word_filter tidak diteruskan, sistem menggunakan daftar kata sensitif Model Studio bawaan. Kata yang cocok diganti dengan string * dengan panjang yang sama.
Konfigurasi khusus: special_word_filter adalah objek JSON dengan tiga subbidang:
filter_with_signed.word_list: larik string kata sensitif yang akan diganti dengan string*dengan panjang yang sama. Misalnya, dengan["test"], "Tolong bantu saya test ini" menjadi "Tolong bantu saya **** ini".filter_with_empty.word_list: larik string kata sensitif yang akan dihapus sepenuhnya dari hasil. Misalnya, dengan["start"], "Apakah permainan akan segera dimulai sekarang" menjadi "Apakah permainan akan segera sekarang".system_reserved_filter: nilai boolean yang default-nyatrue. Ini mengontrol apakah juga menerapkan daftar kata sensitif bawaan sistem, yang berlaku bersama daftar khusus Anda.
Pengenalan emosi
Model seri Qwen3-ASR-Flash-Filetrans dan Qwen3-ASR-Flash memiliki pengenalan emosi yang diaktifkan secara permanen, tanpa konfigurasi tambahan yang diperlukan. Hasilnya mencakup tag emosi untuk pembicara, dipilih dari tujuh emosi detail halus: surprised, neutral, happy, sad, disgusted, angry, dan fearful.
Jalur bidang (berbeda-beda tergantung API):
- API kompatibel OpenAI (transkripsi real-time Qwen3-ASR-Flash): bersarang dalam
choices[].delta.annotations[].emotion(keluaran streaming) atauchoices[].message.annotations[].emotion(non-streaming). - API sinkron DashScope (Qwen3-ASR-Flash): bersarang dalam
output.choices[].message.annotations[].emotion. - API tugas asinkron DashScope (transkripsi file rekaman Qwen3-ASR-Flash-Filetrans): bersarang dalam
transcripts[].sentences[].emotion, bersama timestamp, pembicara, dan bidang lain dalam setiap objek kalimat.
Dapatkan timestamp
Pengenalan ucapan non-real-time dapat mengeluarkan timestamp dalam hasil transkripsi, yang membantu pembuatan subtitle, penyorotan kata kunci, dan pengeditan audio/video. Qwen-Audio-3.0-ASR-Flash-Filetrans, Qwen-Audio-3.0-ASR-Flash, Fun-ASR, Fun-ASR-Flash, Qwen3-ASR-Flash-Filetrans, dan Paraformer semuanya mendukung timestamp, tetapi perilaku default dan metode kontrol berbeda-beda tergantung model:
- Qwen-Audio-3.0-ASR-Flash-Filetrans/Qwen-Audio-3.0-ASR-Flash/Fun-ASR/Fun-ASR-Flash/Paraformer: timestamp diaktifkan secara permanen dan tidak dapat dimatikan.
- Qwen3-ASR-Flash-Filetrans: hanya panggilan asinkron DashScope yang mendukung timestamp, dan timestamp diaktifkan secara permanen. Gunakan parameter permintaan
enable_wordsuntuk mengontrol tingkat timestamp: atur kefalse(default) untuk mengembalikan timestamp tingkat kalimat, atautrueuntuk mengembalikan timestamp tingkat kata. Timestamp tingkat kata hanya mendukung bahasa berikut: Cina, Inggris, Jepang, Korea, Jerman, Prancis, Spanyol, Italia, Portugis, dan Rusia. Akurasi tidak dijamin untuk bahasa lain.
- Tingkat kalimat:
sentences[].begin_timedansentences[].end_timemenandai waktu mulai dan akhir setiap kalimat dalam audio. - Tingkat kata: larik
sentences[].words[], di mana setiap elemen berisibegin_time,end_time, dantext(teks kata tersebut).
Terapkan di produksi
Saat menerapkan pengenalan ucapan non-real-time di produksi, praktik terbaik berikut meningkatkan kualitas pengenalan dan stabilitas sistem.
Skema konkurensi tinggi: gunakan callback alih-alih polling
Untuk tugas transkripsi asinkron (Qwen-Audio-3.0-ASR-Flash-Filetrans, Fun-ASR, Qwen3-ASR-Flash-Filetrans, dan Paraformer), Anda mengirimkan tugas melalui POST /api/v1/services/audio/asr/transcription lalu biasanya mendapatkan hasilnya dengan memanggil API kueri secara berkala GET /api/v1/tasks/{task_id}. API kueri ini secara default memiliki batas 20 QPS dan dapat diskalakan hingga 100 QPS. Dalam skenario batch konkurensi tinggi, polling yang sering mudah memicu Pembatasan kecepatan.
Konfigurasikan notifikasi callback melalui EventBridge. Saat tugas selesai, Model Studio secara otomatis mendorong event dashscope:System:AsyncTaskFinish ke target yang Anda konfigurasi (endpoint HTTP/HTTPS atau topik RocketMQ). Setelah konsumen menerima event tersebut, tidak perlu lagi memanggil API kueri, yang menghindari risiko Pembatasan kecepatan akibat polling yang sering. Untuk informasi lebih lanjut, lihat Konfigurasi notifikasi callback EventBridge.
Model yang didukung
- Didukung: Qwen-Audio-3.0-ASR-Flash-Filetrans, Fun-ASR, Qwen3-ASR-Flash-Filetrans, dan Paraformer (semua tugas transkripsi asinkron).
- Tidak didukung: Qwen3-ASR-Flash (panggilan sinkron atau streaming, yang bukan tugas asinkron).
Isi pesan callback
Untuk ketiga model, isi pesan callback memiliki data.contain_result diatur ke true, dan data.output_result secara langsung membawa transcription_url. Setelah konsumen menerima callback, dapat langsung mendapatkan hasil pengenalan tanpa perlu memanggil GET /api/v1/tasks/{task_id} lagi. Namun, jalur dan struktur bidang hasil berbeda-beda di ketiga model. Lihat tabel berikut.
data.output_result.output tidak lagi berisi results/result; melainkan berisi bidang code dan message. Periksa data.task_status terlebih dahulu, lalu baca hasilnya.Model | Parameter pengiriman | Jalur bidang hasil (berdasarkan isi callback) | bidang Penggunaan |
|---|---|---|---|
Qwen-Audio-3.0-ASR-Flash-Filetrans, Fun-ASR |
|
|
|
Paraformer |
| Sama dengan Qwen-Audio-3.0-ASR-Flash-Filetrans/Fun-ASR: |
|
Qwen3-ASR-Flash-Filetrans |
|
|
|
Catatan penggunaan
Keamanan (pengiriman HTTP/HTTPS): di produksi, verifikasi field header X-Eventbridge-Signature* dalam permintaan callback sebelum mengonsumsinya. Jika tidak, IP eksternal mana pun dapat memalsukan event AsyncTaskFinish dan menyuntikkan hasil pengenalan palsu. Juga atur timeout penerima minimal 5 detik pada penerima. Metode pengiriman RocketMQ tidak memiliki signature tingkat pesan; keamanannya dijamin oleh mekanisme otentikasi RocketMQ.
Latensi pengiriman: dari penyelesaian tugas (end_time) hingga target pengiriman (endpoint HTTP/HTTPS atau topik RocketMQ) menerima pesan, penundaannya biasanya sekitar 1 hingga 90 detik. Latensi tepatnya tergantung pada beban real-time EventBridge.
Idempotensi: event yang sama mungkin dikirim beberapa kali karena retries. Implementasikan pemrosesan idempoten pada konsumen, menggunakan data.id atau data.task_id CloudEvents sebagai kunci deduplikasi.
Rekomendasi produksi
- Hosting file: unggah file audio ke Object Storage Service (OSS) Alibaba Cloud dan panggil API melalui URL. Hindari unggahan file lokal (panggilan file lokal dibatasi hingga 100 QPS dan tidak dapat diskalakan).
- Polling asinkron: transkripsi audio panjang menggunakan model asinkron. Atur interval polling yang wajar (misalnya 2 hingga 5 detik) untuk menghindari kueri yang sering yang menghabiskan kuota Anda. Untuk melebihi batas kueri 20 hingga 100 QPS, beralihlah ke notifikasi callback event. Untuk informasi lebih lanjut, lihat Skema konkurensi tinggi: gunakan callback alih-alih polling.
- Penanganan error: implementasikan mekanisme retry yang kuat. Untuk timeout jaringan atau error sementara di sisi server (5xx), lakukan retry dengan strategi backoff eksponensial.
- Reduksi noise: untuk audio yang berisik, pra-proses dengan alat seperti FFmpeg sebelum mengirimkannya untuk pengenalan.
- Pemilihan model: pilih model yang tepat berdasarkan durasi audio. Untuk audio pendek dalam 5 menit, gunakan Qwen3-ASR-Flash. Untuk audio panjang lebih dari 5 menit, gunakan Qwen-Audio-3.0-ASR-Flash-Filetrans, Fun-ASR, atau Qwen3-ASR-Flash-Filetrans.
Model dan wilayah yang didukung
- Singapura
- AS (Virginia)
- China (Beijing)
- Qwen-Audio-3.0-ASR-Flash-Filetrans: qwen-audio-3.0-asr-flash-filetrans
- Qwen-Audio-3.0-ASR-Flash: qwen-audio-3.0-asr-flash
- Fun-ASR: fun-asr (versi stabil, saat ini setara dengan fun-asr-2025-11-07), fun-asr-2025-11-07 (versi snapshot), fun-asr-2025-08-25 (versi snapshot), fun-asr-mtl (versi stabil, saat ini setara dengan fun-asr-mtl-2025-08-25), fun-asr-mtl-2025-08-25 (versi snapshot)
- Fun-ASR-Flash: fun-asr-flash-2026-06-15
- Qwen3-ASR-Flash-Filetrans: qwen3-asr-flash-filetrans (versi stabil, saat ini setara dengan qwen3-asr-flash-filetrans-2025-11-17), qwen3-asr-flash-filetrans-2025-11-17 (versi snapshot)
- Qwen3-ASR-Flash: qwen3-asr-flash (versi stabil, saat ini setara dengan qwen3-asr-flash-2025-09-08), qwen3-asr-flash-2026-02-10 (versi snapshot terbaru), qwen3-asr-flash-2025-09-08 (versi snapshot)
Referensi API
- Referensi API Pengenalan ucapan non-real-time - Qwen-Audio-3.0-ASR-Flash-Filetrans/Fun-ASR
- Referensi API Pengenalan ucapan non-real-time - Qwen-Audio-3.0-ASR-Flash/Fun-ASR-Flash
- Referensi API Pengenalan ucapan non-real-time - Qwen-ASR
- Referensi API Pengenalan ucapan non-real-time - Paraformer
FAQ
T: Bagaimana cara menyediakan URL audio yang dapat diakses publik ke API?
Gunakan Layanan Penyimpanan Objek (OSS) Alibaba Cloud. OSS menyediakan penyimpanan yang sangat tersedia dan andal, serta memungkinkan Anda menghasilkan URL akses publik.
Verifikasi bahwa URL yang dihasilkan dapat diakses melalui jaringan publik: buka URL di browser atau dengan perintah curl untuk memastikan file audio dapat diunduh atau diputar (kode status HTTP 200).
T: Bagaimana cara memeriksa apakah format audio memenuhi persyaratan?
Gunakan alat open-source ffprobe untuk dengan cepat mendapatkan informasi audio terperinci:
T: Bagaimana cara memproses audio agar memenuhi persyaratan model?
Gunakan alat open-source FFmpeg untuk memangkas atau mengonversi audio:
- Pangkas audio: ekstrak klip dari file audio panjang
- Konversi format Misalnya, konversi audio apa pun ke file WAV mono 16 kHz, 16-bit:
T: Bagaimana cara meningkatkan akurasi pengenalan?
Faktor-faktor berikut memengaruhi akurasi pengenalan. Periksa masing-masing dan optimalkan sesuai kebutuhan.
Faktor utama:
- Kualitas audio: kualitas perangkat perekam, laju sampel, dan noise lingkungan secara langsung memengaruhi kejernihan audio. Input audio berkualitas tinggi adalah fondasi pengenalan yang akurat.
- Karakteristik pembicara: nada suara, kecepatan bicara, aksen, dan perbedaan dialek (terutama dialek langka atau aksen kuat) meningkatkan kesulitan pengenalan.
- Bahasa dan kosakata: campuran bahasa, istilah teknis, atau slang meningkatkan kesulitan pengenalan. Konfigurasikan hotwords untuk meningkatkan akurasi istilah spesifik domain.
- Tingkatkan kualitas audio: gunakan mikrofon berkinerja-tinggi, rekam pada laju sampel yang direkomendasikan, dan minimalkan noise lingkungan serta gema.
- Adaptasi terhadap pembicara: untuk audio dengan aksen kuat atau dialek mencolok, pilih model yang mendukung dialek tersebut.
- Konfigurasikan hotwords: atur hotwords untuk istilah teknis, nama diri, dan kata serupa.