Topik ini menjelaskan parameter dan detail antarmuka API HTTP untuk pengenalan ucapan non-real-time Qwen-Audio-3.0-ASR-Flash/Fun-ASR-Flash.
Titik akhir layanan
- Singapura
- Tiongkok (Beijing)
POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generationGanti {WorkspaceId} dengan Workspace ID Anda yang sebenarnya.Header permintaan
Parameter | Tipe | Wajib | Deskripsi |
|---|---|---|---|
Authorization | string | Ya | Token otentikasi, dalam format |
Content-Type | string | Ya | Tipe media dari badan permintaan. Tetapkan ke |
X-DashScope-SSE | string | Ya | Mengontrol apakah hasil dikembalikan sebagai aliran SSE. Tetapkan ke |
Badan permintaanmodelstring(Wajib)Nama model. Seri model Qwen-Audio-3.0-ASR-Flash dan Fun-ASR-Flash didukung. Untuk detailnya, lihat Model dan wilayah yang didukung.inputobject(Wajib)Informasi input.
Properti messages array(object)(Wajib)Daftar pesan. Berisi audio yang akan dikenali dan, secara opsional, konteks percakapan yang meningkatkan akurasi pengenalan.
Properti role string(Wajib)Peran pesan. Nilai yang valid:
array(object)(Wajib)Daftar isi pesan.
Properti type string(Wajib)Tipe konten. Setiap permintaan memerlukan minimal satu pesan bertipe input_audio. Nilai yang valid:
object(Wajib bersyarat)Wajib saat type bernilai input_audio.
Properti data string(Wajib)Data audio yang akan dikenali. Untuk persyaratan input seperti format audio yang didukung, batas ukuran file, dan batas durasi, lihat Spesifikasi audio. Dua metode didukung:
https://example.com/audio/sample.wavContoh (Base64): data:audio/wav;base64,{BASE64_ENCODED_DATA}string(Wajib bersyarat)Saat type bernilai input_text, masukkan hasil pengenalan ucapan pengguna dari giliran sebelumnya atau daftar kata spesifik domain. Saat type bernilai text, masukkan balasan model bahasa besar dari giliran sebelumnya. Panjang teks diukur dalam karakter, dengan setiap karakter dihitung sebagai 1. Panjang gabungan bidang text di semua pesan dalam satu giliran konteks tidak boleh melebihi 400 karakter. Kelebihan akan dipotong dari bagian akhir.object(Wajib)Parameter model.Text Polishing dinonaktifkan secara default dan belum tersedia.Text Polishing: Saat mentranskripsikan ucapan, model secara otomatis menghapus kata pengisi yang tidak bermakna dan pengulangan akibat gagap, menangani koreksi diri selama berbicara, menghaluskan ekspresi percakapan, serta menstandarkan tanda baca dan format teks. Hasilnya adalah output yang lebih ringkas, lancar, dan mudah dibaca, sekaligus mempertahankan maksud asli pengguna dan informasi penting sebanyak mungkin.
Properti format string(Wajib)Format audio. Atur sesuai dengan format audio Anda yang sebenarnya. Nilai yang didukung termasuk wav, mp3, dan opus. Untuk detailnya, lihat Spesifikasi audio.sample_ratestring(Opsional)Laju sampel audio, dalam Hz. Misalnya, 16000 berarti laju sampel 16 kHz. Untuk detailnya, lihat Spesifikasi audio.vocabulary_idstring(Opsional)ID daftar hot word yang telah dikompilasi sebelumnya.Hasilkan ID ini terlebih dahulu dengan memanggil API pembuatan daftar hot word. Teruskan ID tersebut selama pengenalan untuk menggunakan hot word dalam daftar.Cocok untuk skenario di mana kosakata sudah diketahui dan relatif stabil, serta Anda perlu menggunakan kembali daftar kata yang sama di berbagai permintaan.Untuk detail penggunaan, lihat Hotword yang telah dikompilasi.vocabularyobject(Opsional)Hot word instan.Diteruskan sebagai pasangan kunci-nilai, dengan kunci berupa teks hot word (string) dan nilai berupa bobot hot word (integer). Tidak perlu membuat daftar hot word terlebih dahulu. Bobot berkisar antara [1, 5] atau diatur ke 50: nilai dalam [1, 5] membuat model lebih cenderung mengeluarkan kata tersebut seiring peningkatan nilainya; nilai 50 menunjukkan hot word super, yang sangat meningkatkan recall, tetapi jumlah hot word super tidak boleh melebihi 50.Cocok untuk optimasi hot word sementara tingkat sesi.Jika dikonfigurasi bersama hot word yang telah dikompilasi, hanya hot word instan yang berlaku. Untuk detail penggunaan, lihat Hotword instan.language_hints array[string](Opsional)Kode bahasa yang akan dikenali. Jika Anda tidak dapat menentukan bahasa sebelumnya, biarkan tidak diatur dan model akan mendeteksi bahasa secara otomatis.Untuk model seri Qwen-Audio-3.0-ASR-Flash, Anda dapat mengatur hingga 4 nilai; jika lebih dari 4, hanya 4 nilai pertama yang berlaku. Untuk model seri Fun-ASR-Flash, Anda hanya dapat mengatur 1 nilai; jika lebih dari satu, hanya nilai pertama yang berlaku.
Klik untuk melihat kode bahasa yang didukung
| Contoh berikut menggunakan konfigurasi untuk wilayah Singapura. Ganti "{WorkspaceId}" dengan Workspace ID Anda yang sebenarnya. Konfigurasi berbeda di tiap wilayah, dan Kunci API untuk wilayah Singapura berbeda dari wilayah Beijing.
|
Isi responsrequest_idstringPengidentifikasi unik untuk permintaan ini.outputobjectHasil output.
Properti text stringTeks lengkap yang telah dikenali hingga saat ini.sentenceobjectDetail kalimat saat ini.
Properti sentence_id integerNomor kalimat, dimulai dari 1.sentence_endbooleanApakah ini hasil akhir untuk kalimat tersebut. true menunjukkan bahwa pengenalan kalimat telah selesai.begin_timeintegerWaktu mulai kalimat, dalam milidetik.end_timeintegerWaktu akhir kalimat, dalam milidetik. Dikembalikan hanya saat sentence_end bernilai true.textstringTeks yang dikenali dari kalimat saat ini.channel_idintegerNomor saluran, dimulai dari 0.wordsarrayDaftar timestamp tingkat kata.
Properti text stringKata teks.begin_timeintegerWaktu mulai kata, dalam milidetik.end_timeintegerWaktu akhir kata, dalam milidetik.punctuationstringTanda baca setelah kata. String kosong jika tidak ada tanda baca.fixedbooleanApakah kata tersebut telah distabilkan. false menunjukkan bahwa timestamp kata tersebut mungkin disesuaikan dalam event berikutnya.objectInformasi penggunaan. Dikembalikan hanya saat sentence_end bernilai true.
Properti duration integerDurasi audio yang diproses, dalam detik. |
|
Logika pemrosesan hasil streaming SSE
Dalam mode streaming, klien perlu menangani hal berikut:
- Untuk tiap event SSE yang diterima, uraikan JSON dalam bidang
data. - Gunakan
output.sentence.sentence_enduntuk menentukan apakah kalimat saat ini telah selesai. Saat nilai initrue, pengenalan kalimat telah selesai, timestamp tingkat kata telah distabilkan, dan hasilnya dapat digunakan sebagai hasil akhir. Saat nilai inifalse, pengenalan masih berlangsung, dan teks serta timestamp mungkin diperbarui dalam event berikutnya. - Informasi
usagehanya dikembalikan dalam event akhir kalimat, dan Anda dapat menggunakannya untuk mengukur durasi audio yang diproses.