Skip to main content
Speech-to-text

Tingkatkan akurasi pengenalan

Model Studio speech recognition menyediakan dua cara untuk meningkatkan akurasi pengenalan istilah khusus, nama produk, dan kosakata spesifik domain lainnya: hotwords kustom dan context enhancement. Topik ini menjelaskan cakupan dan penggunaan masing-masing pendekatan.

Hanya workspace utama yang mendukung hotwords. Sub-workspaces tidak didukung.

Ikhtisar

Beberapa istilah bisnis, seperti nama produk, kata benda khusus, dan jargon industri, tidak tersedia dalam kosakata umum model sehingga dikenali dengan akurasi lebih rendah. Model Studio speech recognition menyediakan tiga cara untuk meningkatkan pengenalan istilah tersebut: hotwords precompiled, hotwords instan, dan context enhancement.

Perbandingan hotwords precompiled, hotwords instan, dan context enhancement

Hotwords kustom tersedia dalam dua bentuk: hotwords precompiled dan hotwords instan. Tabel berikut membandingkan ketiga pendekatan tersebut, yang berlaku untuk model dan API yang berbeda:

Dimensi

Hotwords precompiled

Hotwords instan

Context enhancement

Cara kerja

Buat kosakata berbobot terlebih dahulu. Model meningkatkan probabilitas pencocokan kata-kata ini selama decoding.

Kirimkan hotwords berbobot langsung bersama permintaan. Model meningkatkan probabilitas pencocokannya selama decoding.

Kirimkan riwayat percakapan atau teks domain. Model menggunakan konteks ini untuk mengoreksi hasil pengenalan.

Model yang didukung

Lihat Model dan wilayah yang didukung.

Lihat Model dan wilayah yang didukung.

Lihat Model dan wilayah yang didukung.

Kapan digunakan

Kosakata sudah diketahui dan relatif stabil, serta Anda perlu menggunakan kembali daftar kata yang sama di berbagai permintaan (misalnya, nama produk atau istilah medis).

Hotwords sementara tingkat sesi yang tidak perlu digunakan ulang di berbagai permintaan (misalnya, nama seseorang atau istilah ad hoc yang digunakan dalam satu sesi).

Kosakata berubah secara dinamis selama percakapan, atau Anda memerlukan konteks untuk membantu model memahami kata benda khusus (misalnya, peserta dalam notulen rapat atau istilah bisnis dalam percakapan layanan pelanggan).

Cara mengonfigurasi

Buat daftar hotword terlebih dahulu dan kirimkan ID daftarnya saat melakukan panggilan.

Kirimkan pasangan kunci-nilai vocabulary langsung dalam permintaan. Tidak diperlukan daftar.

Kirimkan riwayat percakapan atau teks domain bersama setiap permintaan. Untuk pengenalan non-real-time, gunakan input.messages; untuk pengenalan real-time, gunakan input.context.

Prasyarat

  • Kunci API telah didapatkan dan dikonfigurasi sebagai variabel lingkungan.
  • Untuk memanggil layanan melalui SDK DashScope, instal SDK terbaru.

Hotwords precompiled

Buat daftar hotword terlebih dahulu, dapatkan ID daftarnya, lalu kirimkan ID tersebut selama pengenalan. Pendekatan ini cocok untuk skenario di mana kosakata sudah diketahui dan relatif stabil serta Anda perlu menggunakan kembali daftar kata yang sama di berbagai permintaan, seperti nama produk atau istilah medis.
Hotwords instan hanya didukung oleh seri model Qwen-Audio-3.0-ASR-Flash-Streaming, Qwen-Audio-3.0-ASR-Flash-Filetrans, dan Qwen-Audio-3.0-ASR-Flash. Untuk model-model ini, jika Anda mengonfigurasi hotwords precompiled dan instan sekaligus, sistem akan menggabungkan kedua himpunan tersebut. Jika himpunan gabungan berisi lebih dari 2.000 hotwords, sistem akan memilih 2.000 hotwords secara acak untuk digunakan.

Model dan wilayah yang didukung

  • Singapura
  • Tiongkok (Beijing)
Untuk memanggil model berikut, gunakan Kunci API di wilayah Singapura:
  • Pengenalan ucapan real-time:
    • Qwen-Audio-3.0-ASR-Flash-Streaming: qwen-audio-3.0-asr-flash-streaming
    • Fun-ASR-Realtime: fun-asr-realtime, fun-asr-realtime-2025-11-07
  • Pengenalan ucapan non-real-time:
    • Qwen-Audio-3.0-ASR-Flash-Filetrans: qwen-audio-3.0-asr-flash-filetrans
    • Qwen-Audio-3.0-ASR-Flash: qwen-audio-3.0-asr-flash
    • Fun-ASR-Flash: fun-asr-flash-2026-06-15
    • Fun-ASR: fun-asr, fun-asr-2025-11-07, fun-asr-2025-08-25, fun-asr-mtl, fun-asr-mtl-2025-08-25

Panduan cepat

Alur kerja

Buat daftar hotword terlebih dahulu, lalu rujuk ID-nya selama pengenalan ucapan:
  1. Buat daftar hotword. Panggil API create-hotword-list. Anda harus menentukan target_model (targetModel dalam Java) untuk menunjukkan model pengenalan ucapan mana yang dimiliki daftar tersebut. Jika Anda sudah memiliki daftar hotword (yang dapat Anda periksa melalui API list-all-hotword-lists), lewati langkah ini.
  2. Panggil API pengenalan ucapan dan kirimkan ID daftar hotword. Model yang digunakan untuk pengenalan harus sesuai dengan target_model (targetModel dalam Java) yang ditentukan saat daftar dibuat. Jika tidak, hotwords tidak berlaku.

Kode contoh

Contoh end-to-end: buat daftar hotword, jalankan pengenalan ucapan, dan hapus daftar tersebut.
API manajemen hotword dan API pengenalan ucapan harus menggunakan akun yang sama. Jika tidak, API pengenalan tidak dapat mengakses daftar hotword yang sesuai.
Python
import dashscope
from dashscope.audio.asr import *
import os

# Kunci API berbeda antara wilayah Beijing dan Singapura. Dapatkan Kunci API: https://www.alibabacloud.com/help/zh/model-studio/get-api-key
# Jika variabel lingkungan belum dikonfigurasi, ganti baris di bawah dengan: dashscope.api_key = "sk-xxx"
dashscope.api_key = os.environ.get('DASHSCOPE_API_KEY')

# Berikut adalah konfigurasi untuk wilayah Singapura. Saat memanggil, ganti "{WorkspaceId}" dengan ID workspace aktual Anda. Konfigurasi berbeda berdasarkan wilayah.
dashscope.base_http_api_url = 'https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1'

# Berikut adalah konfigurasi untuk wilayah Singapura. Saat memanggil, ganti "{WorkspaceId}" dengan ID workspace aktual Anda. Konfigurasi berbeda berdasarkan wilayah.
dashscope.base_websocket_api_url = 'wss://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api-ws/v1/inference'
prefix = 'testpfx'
target_model = "qwen-audio-3.0-asr-flash-streaming"

my_vocabulary = [
    {"text": "Speech Lab", "weight": 4}
]

service = VocabularyService()
vocabulary_id = service.create_vocabulary(
      prefix=prefix,
      target_model=target_model,
      vocabulary=my_vocabulary)

try:
    if service.query_vocabulary(vocabulary_id)['status'] == 'OK':
        recognition = Recognition(model=target_model,
                              format='wav',
                              sample_rate=16000,
                              callback=None)
        result = recognition.call('{YOUR_AUDIO_FILE}', phrase_id=vocabulary_id)
        print(result.output)
finally:
    # Hapus daftar hotword terlepas dari keberhasilan pengenalan, untuk menghindari konsumsi kuota
    service.delete_vocabulary(vocabulary_id)

Format hotword

Kirimkan hotwords sebagai array JSON, di mana setiap elemen mendefinisikan satu hotword dan atributnya. Contoh: Tingkatkan akurasi pengenalan judul film.
[
    {"text": "Warriors of the Rainbow: Seediq Bale", "weight": 4, "lang": "en"},
    {"text": "Seediq Bale", "weight": 4, "lang": "en"},
    {"text": "Goodbye Mr. Loser", "weight": 4, "lang": "en"},
    {"text": "Never Say Die", "weight": 4, "lang": "en"},
    {"text": "Confucius Family", "weight": 4, "lang": "en"},
    {"text": "Confucius' Family", "weight": 4, "lang": "en"}
]
Deskripsi bidang:

Bidang

Tipe

Wajib

Deskripsi

text

string

Ya

Teks hotword. Harus berupa kata nyata, bukan rangkaian karakter sembarang, dan bahasanya harus berada dalam rentang yang didukung oleh model yang dipilih. Untuk batasan panjang, lihat Aturan teks hotword.

weight

int

Ya

Bobot hotword. Nilai valid: [1, 5]. Direkomendasikan: 4. Bobot yang lebih tinggi membuat model lebih cenderung mengeluarkan kata tersebut. Seri model Qwen-Audio-3.0-ASR-Flash-Streaming, Qwen-Audio-3.0-ASR-Flash-Filetrans, dan Qwen-Audio-3.0-ASR-Flash juga mendukung weight=50 (super hotwords), yang sangat meningkatkan recall. Anda dapat memiliki maksimal 50 super hotwords. Untuk panduan penyetelan, lihat Sesuaikan bobot hotword.

lang

string

Tidak

Kode bahasa yang membatasi bahasa tempat hotword berlaku. Anda dapat mengabaikannya jika bahasa tidak diketahui.

Catatan: language_hints adalah parameter API pengenalan ucapan (bukan API hotword) dan mendeklarasikan bahasa audio. Setelah ditetapkan, hanya hotwords yang bahasanya sesuai dengan language_hints yang berlaku; hotwords dalam bahasa lain diabaikan.

Hotwords instan

Hotwords instan dikirimkan sebagai pasangan kunci-nilai vocabulary langsung dalam permintaan pengenalan. Pada dasarnya, ini merupakan himpunan hotwords berbobot, sama seperti daftar kata yang digunakan oleh hotwords precompiled, kecuali bahwa hotwords ini dikirimkan langsung bersama permintaan dan tidak memerlukan daftar yang telah dibuat sebelumnya. Pendekatan ini cocok untuk penyetelan hotword sementara tingkat sesi.
Hotwords instan hanya didukung oleh seri model Qwen-Audio-3.0-ASR-Flash-Streaming, Qwen-Audio-3.0-ASR-Flash-Filetrans, dan Qwen-Audio-3.0-ASR-Flash. Untuk model-model ini, jika Anda mengonfigurasi hotwords precompiled dan instan sekaligus, sistem akan menggabungkan kedua himpunan tersebut. Jika himpunan gabungan berisi lebih dari 2.000 hotwords, sistem akan memilih 2.000 hotwords secara acak untuk digunakan.

Model dan wilayah yang didukung

  • Singapura
  • Tiongkok (Beijing)
Untuk memanggil model berikut, gunakan Kunci API di wilayah Singapura:
  • Pengenalan ucapan real-time:
    • Qwen-Audio-3.0-ASR-Flash-Streaming: qwen-audio-3.0-asr-flash-streaming
  • Pengenalan ucapan non-real-time:
    • Qwen-Audio-3.0-ASR-Flash-Filetrans: qwen-audio-3.0-asr-flash-filetrans
    • Qwen-Audio-3.0-ASR-Flash: qwen-audio-3.0-asr-flash

Panduan cepat

Kirimkan vocabulary dalam parameters permintaan pengenalan. Tidak diperlukan daftar hotword. Untuk penggunaan detail setiap API, lihat referensi API di bawah Speech-to-text. Contoh (pengenalan ucapan non-real-time):
curl --location --request POST 'https://dashscope.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generation' \
     --header "Authorization: Bearer $DASHSCOPE_API_KEY" \
     --header "Content-Type: application/json" \
     --header "X-DashScope-SSE: disable" \
     --data '{
    "model": "qwen-audio-3.0-asr-flash",
    "input": {
        "messages": [
            {
                "role": "user",
                "content": [
                    {
                        "type": "input_audio",
                        "input_audio": {
                            "data": "https://dashscope.oss-cn-beijing.aliyuncs.com/samples/audio/paraformer/hello_world_female2.wav"
                        }
                    }
                ]
            }
        ]
    },
    "parameters": {
        "format": "wav",
        "sample_rate": "16000",
        "vocabulary": {"John": 5, "Jane": 5}
    }
}'

Format Hotword

Kirimkan hotwords instan sebagai objek JSON (pasangan kunci-nilai): kuncinya adalah teks hotword (string), dan nilainya adalah bobot hotword (integer). Untuk aturan teks hotword, lihat Aturan teks hotword. Contoh:
{"Michael": 5, "Jennifer": 5, "Speech Lab": 50}
Bobot berkisar antara [1, 5] atau 50: nilai dalam [1, 5] mendefinisikan hotwords biasa, di mana nilai yang lebih tinggi berarti preferensi yang lebih kuat; 50 mendefinisikan super hotword, yang sangat meningkatkan recall. Anda dapat memiliki maksimal 50 super hotwords. Untuk penyetelan bobot, lihat Sesuaikan bobot hotword.

Penyetelan dan aturan hotword

Aturan teks hotword dan tips penyetelan berikut berlaku untuk hotwords precompiled maupun instan.

Aturan teks hotword

Hotword harus berupa kata nyata. Batasan panjang berikut berlaku:
  • Dengan karakter non-ASCII: Jumlah total karakter (jumlah karakter non-ASCII seperti aksara Tionghoa, kana Jepang, hangul Korea, dan huruf Cyrillic, ditambah karakter ASCII apa pun) tidak boleh melebihi 15. Contoh:
    • ✅ "厄洛替尼盐酸盐" (7 karakter)
    • ✅ "EGFR抑制剂" (7 karakter, di mana EGFR dihitung sebagai 4 karakter ASCII)
    • ✅ "こんにちは" (5 karakter)
    • ✅ "Фенибут Белфарм" (15 karakter, termasuk spasi di tengah)
    • ❌ "Клофелин Белмедпрепараты" (24 karakter)
  • Hanya dengan karakter ASCII: Setelah dipisahkan berdasarkan spasi, jumlah segmen tidak boleh melebihi 7. Contoh:
    • ✅ "Exothermic reaction" → 2 segmen
    • ✅ "Human immunodeficiency virus type 1" → 5 segmen
    • ❌ "The effect of temperature variations on enzyme activity in biochemical reactions" → 11 segmen

Sesuaikan bobot hotword

Bobot mengontrol seberapa kuat model memprioritaskan hotword. Menetapkannya secara tepat meningkatkan akurasi pengenalan kata target sekaligus menghindari salah pengenalan.

Bobot

Efek

Kapan digunakan

1–2

Preferensi ringan

Hotword terdengar mirip dengan kata umum, dan Anda perlu menghindari koreksi berlebihan.

3–4

Preferensi jelas (direkomendasikan)

Nilai awal terbaik untuk sebagian besar skenario.

5

Preferensi paksa

Kata muncul sering dalam audio dan tidak mungkin dikacaukan dengan kata lain. Bobot yang terlalu tinggi dapat menyebabkan kata yang terdengar mirip salah dikenali sebagai hotword.

Mulai pengujian dengan weight=4 dan sesuaikan berdasarkan hasilnya. Super hotwords (weight=50): Baik hotwords precompiled maupun instan mendukung super hotwords, tetapi hanya seri model Qwen-Audio-3.0-ASR-Flash-Streaming, Qwen-Audio-3.0-ASR-Flash-Filetrans, dan Qwen-Audio-3.0-ASR-Flash yang mendukungnya. Bobot 50 sangat meningkatkan recall. Anda dapat memiliki maksimal 50 super hotwords.

Rekomendasi desain

  • Kelompokkan berdasarkan skenario: Kelola hotwords secara terpisah untuk skenario bisnis yang berbeda (misalnya, satu kelompok untuk istilah medis dan kelompok lain untuk nama produk) untuk menyederhanakan pemeliharaan dan penggunaan ulang. Untuk hotwords precompiled, buat daftar hotword terpisah untuk setiap skenario.
  • Campur bahasa (hotwords precompiled): Satu daftar hotword dapat mencampur hotwords dalam bahasa yang berbeda, dibedakan oleh bidang lang. Saat Anda menentukan language_hints selama pengenalan, hanya hotwords dalam bahasa tersebut yang berlaku.
  • Bersihkan secara berkala (hotwords precompiled): Hapus daftar hotword yang tidak lagi digunakan untuk membebaskan kuota Anda (maksimal 10 per akun).

Batasan dan penagihan hotword

Batas

Deskripsi

Jumlah daftar hotword (hotwords precompiled)

Daftar hotword adalah daftar kata persisten yang dibuat sebelumnya untuk hotwords precompiled (setiap daftar sesuai dengan satu vocabulary_id). Anda dapat memiliki hingga 10 daftar per akun, dibagi di semua model.

Jumlah maksimum hotwords (hotwords precompiled / instan)

Jumlah maksimum hotwords bergantung pada model yang digunakan untuk pengenalan:

  • Seri Qwen-Audio-3.0-ASR-Flash-Streaming, Qwen-Audio-3.0-ASR-Flash-Filetrans, dan Qwen-Audio-3.0-ASR-Flash: hingga 2.000.

  • Model versi utama seri Fun-ASR-Realtime, Fun-ASR-Flash, dan Fun-ASR: hingga 2.000.

  • Model lain dalam seri Fun-ASR-Realtime, Fun-ASR-Flash, dan Fun-ASR, serta seri Paraformer: hingga 500.

Untuk hotwords precompiled, jumlah dihitung per daftar hotword. Untuk hotwords instan, jumlah dihitung per permintaan.

Jumlah super hotwords (hotwords precompiled / instan)

Anda dapat memiliki hingga 50 super hotwords (bobot 50).

Penagihan

Baik hotwords precompiled maupun instan gratis.

Context enhancement

Model dan wilayah yang didukung

  • Singapura
  • Tiongkok (Beijing)
Untuk memanggil model berikut, gunakan Kunci API di wilayah Singapura:
  • Pengenalan ucapan real-time:
    • Qwen-Audio-3.0-ASR-Flash-Streaming: qwen-audio-3.0-asr-flash-streaming
    • Fun-ASR-Realtime: fun-asr-realtime, fun-asr-realtime-2025-11-07
  • Pengenalan ucapan non-real-time:
    • Qwen-Audio-3.0-ASR-Flash-Filetrans: qwen-audio-3.0-asr-flash-filetrans
    • Qwen-Audio-3.0-ASR-Flash: qwen-audio-3.0-asr-flash
    • Fun-ASR-Flash: fun-asr-flash-2026-06-15

Panduan cepat

Context enhancement tidak memerlukan sumber daya yang telah dibuat sebelumnya. Kirimkan parameter konteks langsung dalam permintaan pengenalan:
  • Pengenalan ucapan non-real-time: Kirimkan pesan konteks dalam input.messages permintaan HTTP, ditempatkan sebelum pesan audio.
  • Pengenalan ucapan real-time: Kirimkan pesan konteks dalam input.context event run-task WebSocket. Untuk memperbarui konteks selama tugas berjalan, kirimkan event continue-task. SDK DashScope membungkus protokol ini, sehingga Anda dapat mengirimkan konteks langsung melalui parameter.
Kasus penggunaan: Mengirimkan riwayat percakapan atau istilah domain sebagai konteks secara signifikan meningkatkan akurasi transkripsi kata benda khusus seperti nama orang, nama tempat, dan istilah produk. Konteks dapat berupa riwayat percakapan multi-putaran (hasil pengenalan dan balasan model dari putaran sebelumnya) atau hanya berupa himpunan istilah domain atau daftar kata.
  • Batas jumlah pesan: Mesin menyimpan paling banyak 5 putaran konteks terbaru. Saat Anda hanya mengirimkan istilah domain atau daftar kata, biasanya Anda hanya memerlukan 1 pesan dan tidak terpengaruh oleh batasan ini. Saat batasan terlampaui, pesan paling awal diabaikan secara otomatis tanpa kesalahan.
  • Batas panjang teks: Panjang teks total per putaran (panjang gabungan bidang text dari semua pesan user dan assistant dalam putaran yang sama) tidak boleh melebihi 400 karakter (dihitung per karakter, di mana setiap karakter—termasuk huruf, aksara Tionghoa, angka, spasi, dan tanda baca—dihitung sebagai 1). Kelebihan dipotong dari akhir tanpa kesalahan. Dalam konteks multi-putaran, setiap putaran dihitung secara independen.
  • Cara kerja konteks: Konteks berlaku terutama melalui pencocokan daftar kata, sehingga bidang text harus berisi kata-kata persis yang akan dikenali dalam audio (misalnya, "Kubernetes" atau "Bulge Bracket"). Mengirimkan hanya deskripsi yang terkait secara semantik tetapi tidak berisi kata persis memiliki efek korektif terbatas.
  • Pengenalan ucapan non-real-time
  • Pengenalan ucapan real-time
Kirimkan konteks melalui input.messages. Peran user dengan tipe input_text mengirimkan hasil pengenalan dari putaran sebelumnya atau daftar kata terkait domain, dan peran assistant mengirimkan balasan model dari putaran sebelumnya (opsional). Tempatkan pesan konteks sebelum pesan audio. Untuk detailnya, lihat Pengenalan ucapan non-real-time (Qwen-Audio-3.0-ASR-Flash/Fun-ASR-Flash).Kirimkan hasil pengenalan dari putaran sebelumnya (user / input_text) dan balasan model (assistant / text). Untuk hanya mengirimkan istilah domain atau daftar kata, abaikan riwayat percakapan (pesan assistant).
{
    "model": "qwen-audio-3.0-asr-flash",
    "input": {
        "messages": [
            {
                "role": "user",
                "content": [
                    {
                        "type": "input_text",
                        "text": "Hasil pengenalan ucapan pengguna di putaran sebelumnya"
                    }
                ]
            },
            {
                "role": "assistant",
                "content": [
                    {
                        "type": "text",
                        "text": "Konten respons model besar di putaran sebelumnya"
                    }
                ]
            },
            {
                "role": "user",
                "content": [
                    {
                        "type": "input_audio",
                        "input_audio": {
                            "data": "URL atau Base64 audio yang akan dikenali di putaran saat ini"
                        }
                    }
                ]
            }
        ]
    },
    "parameters": {}
}

Contoh

Bidang text pada konteks menerima format yang fleksibel—berupa daftar kata, paragraf bahasa alami, atau kombinasi keduanya—dan sangat toleran terhadap teks yang tidak relevan. Hasil pengenalan yang benar untuk klip audio tersebut seharusnya: "How many of the insider jargon terms in the investment banking world do you know? First, the nine major foreign investment banks—Bulge Bracket, BB ...".

Without context enhancement

Tanpa peningkatan konteks, beberapa nama bank investasi dikenali secara salah. Sebagai contoh, "Bird Rock" seharusnya "Bulge Bracket".

Hasil pengenalan: "Berapa banyak istilah jargon internal di dunia perbankan investasi yang Anda ketahui? Pertama, sembilan bank investasi asing utama—Bird Rock, BB …"

With context enhancement

Dengan peningkatan konteks, nama-nama bank investasi dikenali dengan benar.

Hasil pengenalan: "Berapa banyak istilah internal dalam dunia perbankan investasi yang Anda ketahui? Pertama, sembilan bank investasi asing utama—Bulge Bracket (BB) …"

Untuk mencapai peningkatan ini, tambahkan daftar kata atau paragraf bahasa alami yang mencakup istilah khusus seperti "Bulge Bracket" ke bidang text pada konteks.

Referensi API

FAQ

T: Pengenalan tidak membaik setelah mengatur hotwords?

Periksa hal-hal berikut secara berurutan:
  1. Kesesuaian model (hotwords yang telah dikompilasi sebelumnya): target_model yang ditentukan saat Anda membuat daftar hotword harus sesuai dengan model yang digunakan oleh API speech recognition. Jika keduanya tidak sesuai, API tidak mengembalikan error dan pengenalan tetap menghasilkan respons, tetapi hotwords tidak berlaku. Jika hasilnya tidak mencakup hotwords yang diharapkan, periksa hal ini terlebih dahulu.
  2. Dukungan model
  3. Bobot: Naikkan bobot dari 4 ke 5 dan amati efeknya. Jika kata-kata yang terdengar mirip salah dikenali sebagai hotword, kembalikan ke nilai 4.
  4. Status daftar hotword (hotwords yang telah dikompilasi sebelumnya): Gunakan API query untuk memastikan bahwa status bernilai OK.

T: Apakah hotwords yang telah dikompilasi sebelumnya digunakan dengan cara yang sama pada pengenalan suara Real-time dan non-Real-time?

Cara pembuatannya sama, tetapi cara pemanggilannya berbeda:
  • Real-time speech recognition: Sertakan vocabulary_id dalam parameter koneksi Recognition atau WebSocket.
  • Audio file transcription: Sertakan vocabulary_id dalam parameter permintaan Transcription.
Dalam kedua kasus tersebut, target_model harus sesuai dengan model speech recognition yang benar-benar Anda panggil. Hotwords instan tidak memerlukan daftar maupun target_model; cukup sertakan pasangan kunci-nilai vocabulary dalam parameter permintaan. Untuk rangkaian model Qwen-Audio-3.0-ASR-Flash-Streaming, Qwen-Audio-3.0-ASR-Flash-Filetrans, dan Qwen-Audio-3.0-ASR-Flash yang mendukung hotwords instan, sistem akan menggabungkan hotwords yang telah dikompilasi sebelumnya dan hotwords instan jika keduanya dikonfigurasi. Jika himpunan gabungan berisi lebih dari 2.000 hotwords, sistem akan memilih 2.000 hotwords secara acak untuk digunakan.

T: Selain hotwords dan peningkatan konteks, cara lain apa saja yang dapat meningkatkan akurasi pengenalan?

Anda juga dapat mengoptimalkannya dengan cara-cara berikut:
  • Kualitas audio: Sesuaikan laju sampel dengan persyaratan model (16 kHz atau 8 kHz) dan kurangi kebisingan latar belakang.
  • Pilih model yang tepat: Berbagai skenario memerlukan model yang berbeda. Untuk detail selengkapnya, lihat panduan pemilihan Speech-to-text.
  • Tentukan bahasa: Nyatakan bahasa audio melalui language_hints untuk meningkatkan akurasi dalam skenario satu bahasa.
Rencana Token (Team Edition)
Model playground
Statistik dan Pemantauan
Asset Center
Dukungan layanan