Dua event klien WebSocket mengontrol tugas pengenalan ucapan real-time Paraformer: run-task memulai tugas dengan pengaturan model dan audio, sedangkan finish-task mengakhiri tugas setelah aliran audio selesai. Halaman ini menjelaskan struktur pesan dan semantik bidang dari kedua event tersebut.
Panduan pengguna: Untuk detail model dan panduan pemilihan, lihat Speech-to-text.
Alur event: Untuk urutan interaksi event, lihat WebSocket API.
Deskripsi: Memulai tugas pengenalan ucapan dan mengonfigurasi parameter seperti model, format audio, dan laju sampel.
Kapan dikirim: Segera setelah koneksi WebSocket terbentuk.
Event respons: Server harus mengembalikan event task-started sebelum data audio dapat dikirim.
Deskripsi: Memberi tahu server bahwa semua data audio telah dikirim dan meminta agar tugas diakhiri.
Kapan dikirim: Setelah semua data audio dikirim.
Event respons: Server mengembalikan event task-finished.
run-task
Deskripsi: Memulai tugas pengenalan ucapan dan mengonfigurasi parameter seperti model, format audio, dan laju sampel.
Kapan dikirim: Segera setelah koneksi WebSocket terbentuk.
Event respons: Server harus mengembalikan event task-started sebelum data audio dapat dikirim.
headerobject(Wajib)
Properti action string(Wajib)Jenis instruksi. Tetapkan ke run-task.task_idstring(Wajib)ID tugas yang dihasilkan klien dalam format UUID. Digunakan untuk menghubungkan event selanjutnya dengan tugas ini.streamingstring(Wajib)Tetapkan ke duplex.object(Wajib)
Properti task_group string(Wajib)Kelompok tugas. Tetapkan ke audio.taskstring(Wajib)Jenis tugas. Tetapkan ke asr.functionstring(Wajib)Jenis fungsi. Tetapkan ke recognition.modelstring(Wajib)Nama model.inputobject(Wajib)Tetapkan ke {}.parametersobject(Wajib)Parameter pengenalan ucapan.
Properti format string(Wajib)Format audio.Nilai yang valid:
integer(Wajib)Laju sampel, dalam Hz.Nilai yang valid:
string(Opsional)ID kosakata hotword.disfluency_removal_enabledboolean(Opsional)Apakah akan menyaring kata-kata pengisi (filler words).Default: false.language_hintsarray[string](Opsional)Bahasa audio yang akan dikenali. Tidak ada nilai default. Jika tidak ditetapkan, model akan mendeteksi bahasa secara otomatis.Nilai yang valid:
boolean(Opsional)Apakah akan mengaktifkan segmentasi kalimat berbasis semantik.Default: false.
integer(Opsional)Ambang batas kesenyapan untuk segmentasi kalimat berbasis VAD, dalam milidetik. Sistem mengakhiri kalimat saat ini jika kesenyapan setelah segmen ucapan melebihi ambang batas ini.Default: 1300.Rentang valid: [200, 6000].multi_threshold_mode_enabledboolean(Opsional)Apakah akan mengaktifkan mode multi-ambang batas. Saat diaktifkan, mode ini mencegah segmentasi berbasis VAD menghasilkan segmen yang terlalu panjang.Default: false.punctuation_prediction_enabledboolean(Opsional)Apakah akan menambahkan tanda baca pada hasil pengenalan.Default: true.heartbeatboolean(Opsional)Apakah akan mengaktifkan paket heartbeat.Default: false.
boolean(Opsional)Apakah akan mengaktifkan Inverse Text Normalization (ITN). Saat diaktifkan, angka Tiongkok akan dikonversi menjadi angka Arab.Default: true. |
finish-task
Deskripsi: Memberi tahu server bahwa semua data audio telah dikirim dan meminta agar tugas diakhiri.
Kapan dikirim: Setelah semua data audio dikirim.
Event respons: Server mengembalikan event task-finished.
headerobject(Wajib)
Properti action string(Wajib)Jenis instruksi. Tetapkan ke finish-task.task_idstring(Wajib)ID tugas yang dihasilkan klien dalam format UUID. Harus sesuai dengan task_id yang digunakan dalam event run-task.streamingstring(Wajib)Tetapkan ke duplex.object(Wajib)
Properti input object(Wajib)Tetapkan ke {}. |