Model Studio speech recognition menyediakan dua cara untuk meningkatkan akurasi pengenalan istilah khusus, nama produk, dan kosakata spesifik domain lainnya: hotwords kustom dan context enhancement. Topik ini menjelaskan cakupan dan penggunaan masing-masing pendekatan.
Ikhtisar
Beberapa istilah bisnis, seperti nama produk, kata benda khusus, dan jargon industri, tidak tersedia dalam kosakata umum model sehingga dikenali dengan akurasi lebih rendah. Model Studio speech recognition menyediakan tiga cara untuk meningkatkan pengenalan istilah tersebut: hotwords precompiled, hotwords instan, dan context enhancement.
Perbandingan hotwords precompiled, hotwords instan, dan context enhancement
Hotwords kustom tersedia dalam dua bentuk: hotwords precompiled dan hotwords instan. Tabel berikut membandingkan ketiga pendekatan tersebut, yang berlaku untuk model dan API yang berbeda:
Dimensi | Hotwords precompiled | Hotwords instan | Context enhancement |
|---|---|---|---|
Cara kerja | Buat kosakata berbobot terlebih dahulu. Model meningkatkan probabilitas pencocokan kata-kata ini selama decoding. | Kirimkan hotwords berbobot langsung bersama permintaan. Model meningkatkan probabilitas pencocokannya selama decoding. | Kirimkan riwayat percakapan atau teks domain. Model menggunakan konteks ini untuk mengoreksi hasil pengenalan. |
Model yang didukung | |||
Kapan digunakan | Kosakata sudah diketahui dan relatif stabil, serta Anda perlu menggunakan kembali daftar kata yang sama di berbagai permintaan (misalnya, nama produk atau istilah medis). | Hotwords sementara tingkat sesi yang tidak perlu digunakan ulang di berbagai permintaan (misalnya, nama seseorang atau istilah ad hoc yang digunakan dalam satu sesi). | Kosakata berubah secara dinamis selama percakapan, atau Anda memerlukan konteks untuk membantu model memahami kata benda khusus (misalnya, peserta dalam notulen rapat atau istilah bisnis dalam percakapan layanan pelanggan). |
Cara mengonfigurasi | Buat daftar hotword terlebih dahulu dan kirimkan ID daftarnya saat melakukan panggilan. | Kirimkan pasangan kunci-nilai | Kirimkan riwayat percakapan atau teks domain bersama setiap permintaan. Untuk pengenalan non-real-time, gunakan |
Prasyarat
- Kunci API telah didapatkan dan dikonfigurasi sebagai variabel lingkungan.
- Untuk memanggil layanan melalui SDK DashScope, instal SDK terbaru.
Hotwords precompiled
Buat daftar hotword terlebih dahulu, dapatkan ID daftarnya, lalu kirimkan ID tersebut selama pengenalan. Pendekatan ini cocok untuk skenario di mana kosakata sudah diketahui dan relatif stabil serta Anda perlu menggunakan kembali daftar kata yang sama di berbagai permintaan, seperti nama produk atau istilah medis.
Model dan wilayah yang didukung
- Singapura
- Tiongkok (Beijing)
-
Pengenalan ucapan real-time:
- Qwen-Audio-3.0-ASR-Flash-Streaming: qwen-audio-3.0-asr-flash-streaming
- Fun-ASR-Realtime: fun-asr-realtime, fun-asr-realtime-2025-11-07
-
Pengenalan ucapan non-real-time:
- Qwen-Audio-3.0-ASR-Flash-Filetrans: qwen-audio-3.0-asr-flash-filetrans
- Qwen-Audio-3.0-ASR-Flash: qwen-audio-3.0-asr-flash
- Fun-ASR-Flash: fun-asr-flash-2026-06-15
- Fun-ASR: fun-asr, fun-asr-2025-11-07, fun-asr-2025-08-25, fun-asr-mtl, fun-asr-mtl-2025-08-25
Panduan cepat
Alur kerja
Buat daftar hotword terlebih dahulu, lalu rujuk ID-nya selama pengenalan ucapan:
- Buat daftar hotword. Panggil API create-hotword-list. Anda harus menentukan target_model (targetModel dalam Java) untuk menunjukkan model pengenalan ucapan mana yang dimiliki daftar tersebut. Jika Anda sudah memiliki daftar hotword (yang dapat Anda periksa melalui API list-all-hotword-lists), lewati langkah ini.
- Panggil API pengenalan ucapan dan kirimkan ID daftar hotword. Model yang digunakan untuk pengenalan harus sesuai dengan target_model (targetModel dalam Java) yang ditentukan saat daftar dibuat. Jika tidak, hotwords tidak berlaku.
Kode contoh
Contoh end-to-end: buat daftar hotword, jalankan pengenalan ucapan, dan hapus daftar tersebut.
Format hotword
Kirimkan hotwords sebagai array JSON, di mana setiap elemen mendefinisikan satu hotword dan atributnya.
Contoh: Tingkatkan akurasi pengenalan judul film.
Bidang | Tipe | Wajib | Deskripsi |
|---|---|---|---|
text | string | Ya | Teks hotword. Harus berupa kata nyata, bukan rangkaian karakter sembarang, dan bahasanya harus berada dalam rentang yang didukung oleh model yang dipilih. Untuk batasan panjang, lihat Aturan teks hotword. |
weight | int | Ya | Bobot hotword. Nilai valid: [1, 5]. Direkomendasikan: 4. Bobot yang lebih tinggi membuat model lebih cenderung mengeluarkan kata tersebut. Seri model Qwen-Audio-3.0-ASR-Flash-Streaming, Qwen-Audio-3.0-ASR-Flash-Filetrans, dan Qwen-Audio-3.0-ASR-Flash juga mendukung |
lang | string | Tidak | Kode bahasa yang membatasi bahasa tempat hotword berlaku. Anda dapat mengabaikannya jika bahasa tidak diketahui. Catatan: |
Hotwords instan
Hotwords instan dikirimkan sebagai pasangan kunci-nilai vocabulary langsung dalam permintaan pengenalan. Pada dasarnya, ini merupakan himpunan hotwords berbobot, sama seperti daftar kata yang digunakan oleh hotwords precompiled, kecuali bahwa hotwords ini dikirimkan langsung bersama permintaan dan tidak memerlukan daftar yang telah dibuat sebelumnya. Pendekatan ini cocok untuk penyetelan hotword sementara tingkat sesi.
Model dan wilayah yang didukung
- Singapura
- Tiongkok (Beijing)
-
Pengenalan ucapan real-time:
- Qwen-Audio-3.0-ASR-Flash-Streaming: qwen-audio-3.0-asr-flash-streaming
-
Pengenalan ucapan non-real-time:
- Qwen-Audio-3.0-ASR-Flash-Filetrans: qwen-audio-3.0-asr-flash-filetrans
- Qwen-Audio-3.0-ASR-Flash: qwen-audio-3.0-asr-flash
Panduan cepat
Kirimkan vocabulary dalam parameters permintaan pengenalan. Tidak diperlukan daftar hotword. Untuk penggunaan detail setiap API, lihat referensi API di bawah Speech-to-text.
Contoh (pengenalan ucapan non-real-time):
Format Hotword
Kirimkan hotwords instan sebagai objek JSON (pasangan kunci-nilai): kuncinya adalah teks hotword (string), dan nilainya adalah bobot hotword (integer). Untuk aturan teks hotword, lihat Aturan teks hotword.
Contoh:
Penyetelan dan aturan hotword
Aturan teks hotword dan tips penyetelan berikut berlaku untuk hotwords precompiled maupun instan.
Aturan teks hotword
Hotword harus berupa kata nyata. Batasan panjang berikut berlaku:
-
Dengan karakter non-ASCII: Jumlah total karakter (jumlah karakter non-ASCII seperti aksara Tionghoa, kana Jepang, hangul Korea, dan huruf Cyrillic, ditambah karakter ASCII apa pun) tidak boleh melebihi 15.
Contoh:
- ✅
"厄洛替尼盐酸盐"(7 karakter) - ✅
"EGFR抑制剂"(7 karakter, di mana EGFR dihitung sebagai 4 karakter ASCII) - ✅
"こんにちは"(5 karakter) - ✅
"Фенибут Белфарм"(15 karakter, termasuk spasi di tengah) - ❌
"Клофелин Белмедпрепараты"(24 karakter)
- ✅
-
Hanya dengan karakter ASCII: Setelah dipisahkan berdasarkan spasi, jumlah segmen tidak boleh melebihi 7.
Contoh:
- ✅
"Exothermic reaction"→ 2 segmen - ✅
"Human immunodeficiency virus type 1"→ 5 segmen - ❌
"The effect of temperature variations on enzyme activity in biochemical reactions"→ 11 segmen
- ✅
Sesuaikan bobot hotword
Bobot mengontrol seberapa kuat model memprioritaskan hotword. Menetapkannya secara tepat meningkatkan akurasi pengenalan kata target sekaligus menghindari salah pengenalan.
Bobot | Efek | Kapan digunakan |
|---|---|---|
1–2 | Preferensi ringan | Hotword terdengar mirip dengan kata umum, dan Anda perlu menghindari koreksi berlebihan. |
3–4 | Preferensi jelas (direkomendasikan) | Nilai awal terbaik untuk sebagian besar skenario. |
5 | Preferensi paksa | Kata muncul sering dalam audio dan tidak mungkin dikacaukan dengan kata lain. Bobot yang terlalu tinggi dapat menyebabkan kata yang terdengar mirip salah dikenali sebagai hotword. |
weight=4 dan sesuaikan berdasarkan hasilnya.
Super hotwords (weight=50): Baik hotwords precompiled maupun instan mendukung super hotwords, tetapi hanya seri model Qwen-Audio-3.0-ASR-Flash-Streaming, Qwen-Audio-3.0-ASR-Flash-Filetrans, dan Qwen-Audio-3.0-ASR-Flash yang mendukungnya. Bobot 50 sangat meningkatkan recall. Anda dapat memiliki maksimal 50 super hotwords.
Rekomendasi desain
- Kelompokkan berdasarkan skenario: Kelola hotwords secara terpisah untuk skenario bisnis yang berbeda (misalnya, satu kelompok untuk istilah medis dan kelompok lain untuk nama produk) untuk menyederhanakan pemeliharaan dan penggunaan ulang. Untuk hotwords precompiled, buat daftar hotword terpisah untuk setiap skenario.
- Campur bahasa (hotwords precompiled): Satu daftar hotword dapat mencampur hotwords dalam bahasa yang berbeda, dibedakan oleh bidang
lang. Saat Anda menentukanlanguage_hintsselama pengenalan, hanya hotwords dalam bahasa tersebut yang berlaku. - Bersihkan secara berkala (hotwords precompiled): Hapus daftar hotword yang tidak lagi digunakan untuk membebaskan kuota Anda (maksimal 10 per akun).
Batasan dan penagihan hotword
Batas | Deskripsi |
|---|---|
Jumlah daftar hotword (hotwords precompiled) | Daftar hotword adalah daftar kata persisten yang dibuat sebelumnya untuk hotwords precompiled (setiap daftar sesuai dengan satu vocabulary_id). Anda dapat memiliki hingga 10 daftar per akun, dibagi di semua model. |
Jumlah maksimum hotwords (hotwords precompiled / instan) | Jumlah maksimum hotwords bergantung pada model yang digunakan untuk pengenalan:
Untuk hotwords precompiled, jumlah dihitung per daftar hotword. Untuk hotwords instan, jumlah dihitung per permintaan. |
Jumlah super hotwords (hotwords precompiled / instan) | Anda dapat memiliki hingga 50 super hotwords (bobot 50). |
Penagihan | Baik hotwords precompiled maupun instan gratis. |
Context enhancement
Model dan wilayah yang didukung
- Singapura
- Tiongkok (Beijing)
-
Pengenalan ucapan real-time:
- Qwen-Audio-3.0-ASR-Flash-Streaming: qwen-audio-3.0-asr-flash-streaming
- Fun-ASR-Realtime: fun-asr-realtime, fun-asr-realtime-2025-11-07
-
Pengenalan ucapan non-real-time:
- Qwen-Audio-3.0-ASR-Flash-Filetrans: qwen-audio-3.0-asr-flash-filetrans
- Qwen-Audio-3.0-ASR-Flash: qwen-audio-3.0-asr-flash
- Fun-ASR-Flash: fun-asr-flash-2026-06-15
Panduan cepat
Context enhancement tidak memerlukan sumber daya yang telah dibuat sebelumnya. Kirimkan parameter konteks langsung dalam permintaan pengenalan:
- Pengenalan ucapan non-real-time: Kirimkan pesan konteks dalam
input.messagespermintaan HTTP, ditempatkan sebelum pesan audio. - Pengenalan ucapan real-time: Kirimkan pesan konteks dalam
input.contexteventrun-taskWebSocket. Untuk memperbarui konteks selama tugas berjalan, kirimkan eventcontinue-task. SDK DashScope membungkus protokol ini, sehingga Anda dapat mengirimkan konteks langsung melalui parameter.
- Pengenalan ucapan non-real-time
- Pengenalan ucapan real-time
input.messages. Peran user dengan tipe input_text mengirimkan hasil pengenalan dari putaran sebelumnya atau daftar kata terkait domain, dan peran assistant mengirimkan balasan model dari putaran sebelumnya (opsional). Tempatkan pesan konteks sebelum pesan audio. Untuk detailnya, lihat Pengenalan ucapan non-real-time (Qwen-Audio-3.0-ASR-Flash/Fun-ASR-Flash).Kirimkan hasil pengenalan dari putaran sebelumnya (user / input_text) dan balasan model (assistant / text). Untuk hanya mengirimkan istilah domain atau daftar kata, abaikan riwayat percakapan (pesan assistant).Contoh
Bidang text pada konteks menerima format yang fleksibel—berupa daftar kata, paragraf bahasa alami, atau kombinasi keduanya—dan sangat toleran terhadap teks yang tidak relevan.
Hasil pengenalan yang benar untuk klip audio tersebut seharusnya: "How many of the insider jargon terms in the investment banking world do you know? First, the nine major foreign investment banks—Bulge Bracket, BB ...".
Without context enhancement Tanpa peningkatan konteks, beberapa nama bank investasi dikenali secara salah. Sebagai contoh, "Bird Rock" seharusnya "Bulge Bracket". Hasil pengenalan: "Berapa banyak istilah jargon internal di dunia perbankan investasi yang Anda ketahui? Pertama, sembilan bank investasi asing utama—Bird Rock, BB …" | With context enhancement Dengan peningkatan konteks, nama-nama bank investasi dikenali dengan benar. Hasil pengenalan: "Berapa banyak istilah internal dalam dunia perbankan investasi yang Anda ketahui? Pertama, sembilan bank investasi asing utama—Bulge Bracket (BB) …" |
text pada konteks.
Referensi API
- Referensi API hotword terkompilasi sebelumnya
- Pengenalan ucapan Real-time – Referensi API Qwen-Audio-ASR-Streaming
- Pengenalan ucapan Real-time – Referensi API Fun-ASR-Realtime
- Pengenalan ucapan Real-time – Referensi API Qwen-ASR
- Pengenalan ucapan Real-time – Referensi API Paraformer
- Pengenalan ucapan tidak real-time - Qwen-Audio-ASR-Filetrans/Fun-ASR Referensi API
- Pengenalan ucapan Non-real-time – Referensi API Qwen-Audio-ASR/Fun-ASR-Flash
- Pengenalan ucapan Non-real-time – Referensi API Qwen-ASR
- Pengenalan ucapan Non-real-time – Referensi API Paraformer
FAQ
T: Pengenalan tidak membaik setelah mengatur hotwords?
Periksa hal-hal berikut secara berurutan:
- Kesesuaian model (hotwords yang telah dikompilasi sebelumnya):
target_modelyang ditentukan saat Anda membuat daftar hotword harus sesuai dengan model yang digunakan oleh API speech recognition. Jika keduanya tidak sesuai, API tidak mengembalikan error dan pengenalan tetap menghasilkan respons, tetapi hotwords tidak berlaku. Jika hasilnya tidak mencakup hotwords yang diharapkan, periksa hal ini terlebih dahulu. - Dukungan model
- Bobot: Naikkan bobot dari 4 ke 5 dan amati efeknya. Jika kata-kata yang terdengar mirip salah dikenali sebagai hotword, kembalikan ke nilai 4.
- Status daftar hotword (hotwords yang telah dikompilasi sebelumnya): Gunakan API query untuk memastikan bahwa
statusbernilaiOK.
T: Apakah hotwords yang telah dikompilasi sebelumnya digunakan dengan cara yang sama pada pengenalan suara Real-time dan non-Real-time?
Cara pembuatannya sama, tetapi cara pemanggilannya berbeda:
- Real-time speech recognition: Sertakan
vocabulary_iddalam parameter koneksi Recognition atau WebSocket. - Audio file transcription: Sertakan
vocabulary_iddalam parameter permintaan Transcription.
target_model harus sesuai dengan model speech recognition yang benar-benar Anda panggil. Hotwords instan tidak memerlukan daftar maupun target_model; cukup sertakan pasangan kunci-nilai vocabulary dalam parameter permintaan. Untuk rangkaian model Qwen-Audio-3.0-ASR-Flash-Streaming, Qwen-Audio-3.0-ASR-Flash-Filetrans, dan Qwen-Audio-3.0-ASR-Flash yang mendukung hotwords instan, sistem akan menggabungkan hotwords yang telah dikompilasi sebelumnya dan hotwords instan jika keduanya dikonfigurasi. Jika himpunan gabungan berisi lebih dari 2.000 hotwords, sistem akan memilih 2.000 hotwords secara acak untuk digunakan.
T: Selain hotwords dan peningkatan konteks, cara lain apa saja yang dapat meningkatkan akurasi pengenalan?
Anda juga dapat mengoptimalkannya dengan cara-cara berikut:
- Kualitas audio: Sesuaikan laju sampel dengan persyaratan model (16 kHz atau 8 kHz) dan kurangi kebisingan latar belakang.
- Pilih model yang tepat: Berbagai skenario memerlukan model yang berbeda. Untuk detail selengkapnya, lihat panduan pemilihan Speech-to-text.
- Tentukan bahasa: Nyatakan bahasa audio melalui
language_hintsuntuk meningkatkan akurasi dalam skenario satu bahasa.