Parameter input dan output untuk model Qwen-ASR. Panggil API menggunakan protokol OpenAI-compatible atau DashScope.
Jenis koneksi model
Model yang berbeda mendukung jenis koneksi yang berbeda.
Model | Jenis koneksi |
|---|---|
Qwen3-ASR-Flash-Filetrans | Hanya pemanggilan asinkron DashScope yang didukung |
Qwen3-ASR-Flash |
OpenAI compatible
URL
- Singapura
- AS (Virginia)
- China (Beijing)
Alamat permintaan HTTP:
POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/compatible-mode/v1/chat/completionsbase_url untuk panggilan SDK: https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/compatible-mode/v1Ganti {WorkspaceId} dengan ID ruang kerja Anda yang sebenarnya.Ganti {WorkspaceId} dengan ID ruang kerja Anda yang sebenarnya.Body permintaanmodelstring(Wajib)Nama model. Parameter ini hanya berlaku untuk model Qwen3-ASR-Flash.messagesarray(Wajib)Daftar pesan.
Jenis pesan System Message object (Opsional)Digunakan untuk menyediakan konteks bagi pengenalan ucapan, seperti teks latar belakang dan glosarium entitas. Tidak mendukung pengaturan peran model atau prompt sistem tradisional lainnya. Jika Anda menggunakan pesan sistem, pesan tersebut harus menjadi pesan pertama dalam daftar messages.
Properti role string(Wajib)Diatur ke system.object(Wajib)Pesan yang dikirim pengguna ke model.
Properti content array(Wajib)Konten pesan pengguna. Hanya satu pesan yang diizinkan dalam array.
Properti type string(Wajib)Diatur ke input_audio, yang menunjukkan bahwa input berupa audio.input_audiostring(Wajib)Audio yang akan dikenali. Untuk informasi lebih lanjut tentang cara menggunakan parameter ini, lihat Contoh permintaan.Dalam mode OpenAI-compatible, model Qwen3-ASR-Flash mendukung dua format input: file yang dikodekan Base64 dan URL file audio yang dapat diakses melalui jaringan publik.Saat Anda menggunakan SDK, jika file audio disimpan di OSS, URL sementara yang dimulai dengan oss:// tidak didukung.Saat Anda menggunakan RESTful API, jika file audio disimpan di OSS, URL sementara yang dimulai dengan oss:// didukung. Catatan:string(Wajib)Peran pesan pengguna. Diatur ke user.object(Opsional)Menentukan apakah akan mengaktifkan fitur tertentu.
Properti language string (Opsional) Tidak ada nilai defaultJika bahasa audio diketahui, Anda dapat menentukannya menggunakan parameter ini untuk meningkatkan akurasi pengenalan.Anda hanya dapat menentukan satu bahasa.Jika bahasa audio tidak pasti atau mencakup beberapa bahasa (seperti campuran bahasa Mandarin, Inggris, Jepang, dan Korea), jangan tentukan parameter ini.
Nilai yang valid
boolean (Opsional) Default: falseMenentukan apakah akan mengaktifkan Inverse Text Normalization (ITN). Fitur ini hanya berlaku untuk audio bahasa Tionghoa dan Inggris.
boolean(Opsional) Default: falseMenentukan apakah akan menggunakan keluaran streaming. Lihat Keluaran streaming.Nilai yang valid:
true untuk mengurangi risiko timeout permintaan.stream_optionsobject(Opsional)Item konfigurasi untuk keluaran streaming. Parameter ini hanya berlaku ketika stream diatur ke true.
Properti include_usage boolean(Opsional) Default: falseMenentukan apakah akan menyertakan informasi konsumsi token dalam blok data terakhir respons.Nilai yang valid:
Selama keluaran streaming, informasi konsumsi token hanya muncul dalam blok data terakhir respons. | Contoh permintaan
|
Body responsidstringPengidentifikasi unik untuk pemanggilan ini.choicesarrayInformasi keluaran dari model.
Properti finish_reason stringNilai yang valid:
integerIndeks objek saat ini dalam array choices.messageobjectObjek pesan yang dikeluarkan oleh model.
Properti role stringPeran pesan keluaran. Diatur ke assistant.contentarrayHasil pengenalan ucapan.annotationsarrayInformasi anotasi keluaran, seperti bahasa.
Properti language stringBahasa audio yang dikenali. Jika parameter permintaan language ditentukan, nilai ini sama dengan parameter yang ditentukan.
Nilai yang valid
stringDiatur ke audio_info, yang menunjukkan informasi audio.emotionstringEmosi audio yang dikenali. Emosi berikut didukung:
integerStempel waktu UNIX (dalam detik) saat permintaan dibuat.modelstringModel yang digunakan untuk permintaan ini.objectstringSelalu chat.completion.usageobjectInformasi konsumsi token untuk permintaan ini.
Properti completion_tokens integerJumlah token dalam keluaran model.completion_tokens_details objectRincian detail halus token dalam keluaran model.
Properti text_tokens integerJumlah token dalam teks keluaran model.objectJumlah token dalam input.prompt_tokens_details objectRincian detail halus token dalam input.
Properti audio_tokens integerPanjang audio input dalam token. Aturan konversi audio ke token: Setiap detik audio dikonversi menjadi 25 token. Durasi kurang dari 1 detik dihitung sebagai 1 detik.text_tokens integerAnda dapat mengabaikan parameter ini.integerDurasi audio dalam detik.total_tokens integerTotal jumlah token input dan output (total_tokens = completion_tokens + prompt_tokens). |
DashScope synchronous
URL
- Singapura
- AS (Virginia)
- China (Beijing)
Alamat permintaan HTTP:
POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generationbase_url untuk panggilan SDK: https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1Ganti {WorkspaceId} dengan ID ruang kerja Anda yang sebenarnya.Ganti {WorkspaceId} dengan ID ruang kerja Anda yang sebenarnya.Body permintaanmodelstring(Wajib)Nama model. Parameter ini hanya berlaku untuk model Qwen3-ASR-Flash.messagesarray(Wajib)Daftar pesan.Saat melakukan panggilan HTTP, letakkan messages dalam objek input.
Jenis pesan System Message object (Opsional)Digunakan untuk menyediakan konteks bagi pengenalan ucapan, seperti teks latar belakang dan glosarium entitas. Tidak mendukung pengaturan peran model atau prompt sistem tradisional lainnya. Jika Anda menetapkan pesan sistem, letakkan di awal daftar messages.Hanya Qwen3-ASR-Flash yang mendukung parameter ini.
Properti role string(Wajib)Diatur ke system.object(Wajib)Pesan yang dikirim pengguna ke model.
Properti content array(Wajib)Konten pesan pengguna. Hanya satu pesan yang diizinkan dalam array.
Properti audio string(Wajib)Audio yang akan dikenali. Untuk informasi lebih lanjut tentang cara menggunakan parameter ini, lihat Contoh permintaan.Saat Anda menggunakan DashScope, model Qwen3-ASR-Flash mendukung tiga format input: file yang dikodekan Base64, jalur absolut file lokal, dan URL file audio yang dapat diakses melalui jaringan publik.Saat Anda menggunakan SDK, jika file audio disimpan di OSS, URL sementara yang dimulai dengan oss:// tidak didukung.Saat Anda menggunakan RESTful API, jika file audio disimpan di OSS, URL sementara yang dimulai dengan oss:// didukung. Catatan:string(Wajib)Peran pesan pengguna. Diatur ke user.object(Opsional)Menentukan apakah akan mengaktifkan fitur tertentu.Parameter ini hanya didukung oleh model Qwen3-ASR-Flash.
Properti language string (Opsional) Tidak ada nilai defaultJika bahasa audio diketahui, Anda dapat menentukannya menggunakan parameter ini untuk meningkatkan akurasi pengenalan.Anda hanya dapat menentukan satu bahasa.Jika bahasa audio tidak pasti atau mencakup beberapa bahasa (seperti campuran bahasa Mandarin, Inggris, Jepang, dan Korea), jangan tentukan parameter ini.
Nilai yang valid
boolean (Opsional) Default: falseMenentukan apakah akan mengaktifkan Inverse Text Normalization (ITN). Fitur ini hanya berlaku untuk audio bahasa Tionghoa dan Inggris.
| Contoh permintaanQwen3-ASR-Flash mendukung rekaman hingga durasi 5 menit, menerima URL file audio publik atau unggahan file lokal sebagai input, dan dapat mengembalikan hasil pengenalan dalam mode streaming.
|
Body responsrequest_idstringPengidentifikasi unik untuk pemanggilan ini.Parameter yang dikembalikan oleh SDK Java adalah requestIdoutput objectInformasi hasil pemanggilan.
Properti choices arrayKeluaran model. Dikembalikan saat result_format adalah message.
Properti finish_reason stringNilai yang valid:
objectObjek pesan yang dikeluarkan oleh model.
Properti role stringPeran pesan keluaran. Diatur ke assistant.contentarrayKonten pesan keluaran.
Properti text stringHasil pengenalan ucapan.arrayInformasi anotasi keluaran, seperti bahasa.
Properti language stringBahasa audio yang dikenali. Jika parameter permintaan language ditentukan, nilai ini sama dengan parameter yang ditentukan.
Nilai yang valid
stringDiatur ke audio_info, yang menunjukkan informasi audio.emotionstringEmosi audio yang dikenali. Emosi berikut didukung:
objectInformasi konsumsi token untuk permintaan ini.
Properti input_tokens_details objectPanjang konten input untuk Qwen3-ASR-Flash dalam token.
Properti text_tokens integerAnda dapat mengabaikan parameter ini.objectPanjang konten keluaran dari Qwen3-ASR-Flash dalam token.
Properti text_tokens integerPanjang teks yang dikenali yang dikeluarkan oleh Qwen3-ASR-Flash dalam token.integerDurasi audio untuk Qwen3-ASR-Flash dalam detik. |
Pemanggilan asinkron DashScope
Deskripsi proses
Pemanggilan asinkron dirancang untuk file audio panjang atau tugas yang memakan waktu. Proses ini menggunakan proses "submit-poll" dua langkah untuk mencegah timeout permintaan:
-
Langkah 1: Kirim tugas
- Klien memulai permintaan pemrosesan asinkron.
- Setelah memvalidasi permintaan, server tidak langsung mengeksekusi tugas. Sebaliknya, server mengembalikan
task_idunik, yang menunjukkan bahwa tugas telah berhasil dibuat.
-
Langkah 2: Dapatkan hasil
- Klien menggunakan
task_iduntuk melakukan polling API kueri hasil. - Saat tugas selesai, API kueri hasil mengembalikan hasil pengenalan akhir.
- Klien menggunakan
-
Gunakan SDK. Untuk contoh kode, lihat Contoh permintaan. Untuk parameter permintaan, lihat Body permintaan operasi Kirim tugas. Untuk informasi respons, lihat Deskripsi hasil pemanggilan asinkron.
SDK menangani detail pemanggilan API dasar secara otomatis.
- Kirim tugas: Panggil metode
async_call()(Python) atauasyncCall()(Java) untuk mengirim tugas. Metode ini mengembalikan objek tugas yang berisitask_id. - Dapatkan hasil: Gunakan objek tugas yang dikembalikan pada langkah sebelumnya atau
task_iduntuk memanggil metodefetch()guna mengambil hasil. SDK secara otomatis menangani logika polling internal hingga tugas selesai atau timeout.
- Kirim tugas: Panggil metode
-
Gunakan RESTful API
Memanggil RESTful API secara langsung memberikan fleksibilitas maksimum.
- Kirim tugas. Jika permintaan berhasil, body respons akan berisi
task_id. - Gunakan
task_iddari langkah sebelumnya untuk mengambil hasil eksekusi tugas.
- Kirim tugas. Jika permintaan berhasil, body respons akan berisi
Contoh lengkap
- HTTP
- Java SDK
- Python SDK
- Unduh hasil pengenalan
Java
Kirim tugas
URL
- Singapura
- China (Beijing)
Alamat permintaan HTTP:
POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/audio/asr/transcriptionbase_url untuk panggilan SDK: https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1Ganti {WorkspaceId} dengan ID ruang kerja Anda yang sebenarnya.Ganti {WorkspaceId} dengan ID ruang kerja Anda yang sebenarnya.Body permintaanmodelstring(Wajib)Nama model. Parameter ini hanya berlaku untuk model Qwen3-ASR-Flash-Filetrans.inputobject(Wajib)
Properti file_url string(Wajib)URL file audio yang akan dikenali. URL harus dapat diakses melalui jaringan publik.Saat Anda menggunakan SDK, jika file audio disimpan di OSS, URL sementara yang dimulai dengan oss:// tidak didukung.Saat Anda menggunakan RESTful API, jika file audio disimpan di OSS, URL sementara yang dimulai dengan oss:// didukung. Catatan:object(Opsional)
Properti language string (Opsional) Tidak ada nilai defaultJika bahasa audio diketahui, Anda dapat menentukannya menggunakan parameter ini untuk meningkatkan akurasi pengenalan.Anda hanya dapat menentukan satu bahasa.Jika bahasa audio tidak pasti atau mencakup beberapa bahasa (seperti campuran bahasa Mandarin, Inggris, Jepang, dan Korea), jangan tentukan parameter ini.
Nilai yang valid
boolean (Opsional) Default: falseMenentukan apakah akan mengaktifkan Inverse Text Normalization (ITN). Fitur ini hanya berlaku untuk audio bahasa Tionghoa dan Inggris.
boolean(Opsional) Default: falseMenentukan apakah akan mengembalikan timestamp tingkat kata:
array(Opsional) Default: [0]Menentukan indeks trek audio yang akan dikenali dalam file audio multi-trek. Indeks dimulai dari 0. Misalnya, [0] menunjukkan bahwa trek audio pertama dikenali, dan [0, 1] menunjukkan bahwa trek audio pertama dan kedua dikenali secara simultan. Jika parameter ini dihilangkan, trek audio pertama diproses secara default. |
|
Body responsrequest_idstringPengidentifikasi unik untuk pemanggilan ini.outputobjectInformasi hasil pemanggilan.
Properti task_id stringID tugas. ID ini diteruskan sebagai parameter permintaan dalam API untuk mengkueri tugas pengenalan ucapan.task_statusstringStatus tugas:
|
Dapatkan hasil eksekusi tugas
URL
- Singapura
- China (Beijing)
Alamat permintaan HTTP:
GET https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/tasks/{task_id}base_url untuk panggilan SDK: https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1Ganti {WorkspaceId} dengan ID ruang kerja Anda yang sebenarnya.Ganti {WorkspaceId} dengan ID ruang kerja Anda yang sebenarnya.Body permintaantask_idstring(Wajib)ID tugas. Teruskan task_id dari respons operasi Kirim tugas untuk mengkueri hasil pengenalan ucapan. |
|
Body responsrequest_idstringPengidentifikasi unik untuk pemanggilan ini.outputobjectInformasi hasil pemanggilan.
Properti task_id stringID tugas. ID ini diteruskan sebagai parameter permintaan dalam API untuk mengkueri tugas pengenalan ucapan.task_statusstringStatus tugas:
objectHasil pengenalan ucapan.
Properti transcription_url stringURL unduhan untuk file hasil pengenalan. Tautan ini berlaku selama 24 jam. Setelah tautan kedaluwarsa, Anda tidak dapat mengkueri tugas atau mengunduh hasil menggunakan URL sebelumnya.Hasil pengenalan disimpan sebagai file JSON. Anda dapat mengunduh file dari tautan ini atau membaca konten file secara langsung menggunakan permintaan HTTP. Untuk informasi lebih lanjut, lihat Deskripsi hasil pemanggilan asinkron. stringWaktu saat tugas dikirim.schedule_time stringWaktu saat tugas dijadwalkan, yaitu waktu mulai eksekusi.end_timestringWaktu saat tugas berakhir.task_metricsobjectMetrik tugas, yang mencakup statistik status subtugas.
Properti TOTAL integerJumlah total subtugas.SUCCEEDEDintegerJumlah subtugas yang berhasil.FAILEDintegerJumlah subtugas yang gagal.stringKode kesalahan. Ini dikembalikan hanya saat tugas gagal.messagestringPesan kesalahan. Ini dikembalikan hanya saat tugas gagal.usageobjectInformasi konsumsi token untuk permintaan ini.
Properti seconds integerDurasi audio untuk Qwen3-ASR-Flash dalam detik. |
Deskripsi hasil pemanggilan asinkronfile_urlstringURL file audio yang dikenali.audio_infoobjectInformasi tentang file audio yang dikenali.
Properti format stringFormat audio.sample_rate integerLaju pengambilan sampel audio.arrayDaftar hasil pengenalan lengkap. Setiap elemen sesuai dengan konten yang dikenali dari satu trek audio.
Properti channel_id integerIndeks trek audio, dimulai dari 0.textstringTeks yang dikenali.sentencesobjectDaftar hasil pengenalan tingkat kalimat.
Properti begin_time integerStempel waktu mulai kalimat dalam milidetik.end_time integerStempel waktu akhir kalimat dalam milidetik.textstringTeks yang dikenali.sentence_idintegerIndeks kalimat, dimulai dari 0.languagestringBahasa audio yang dikenali. Jika parameter permintaan language ditentukan, nilai ini sama dengan parameter yang ditentukan.
Nilai yang valid
stringEmosi audio yang dikenali. Emosi berikut didukung:
objectDaftar hasil pengenalan tingkat kata. Hasil ini ditampilkan saat parameter permintaan enable_words diatur ke true.
Properti begin_time integerStempel waktu mulai dalam milidetik.end_time integerStempel waktu akhir dalam milidetik.textstringTeks yang dikenali.punctuationstringTanda baca. |