Event sisi server untuk API qwen3.5-livetranslate-flash-realtime.
Referensi: Terjemahan audio dan video real-time – Qwen
error
Pesan error yang dikembalikan oleh server.
event_idstringIdentifier unik untuk event ini.typestringJenis event. Nilainya selalu error.errorobjectInformasi detail mengenai error.
Properties type stringJenis error.codestringKode kesalahan.messagestringPesan error.paramstringParameter yang terkait dengan error, seperti session.modalities. |
session.created
Saat klien terhubung, server mengembalikan event ini terlebih dahulu dengan konfigurasi sesi default.
event_idstringIdentifier unik untuk event ini.typestringJenis event. Nilainya selalu session.created.sessionobjectKonfigurasi sesi.
Properties id stringIdentifier unik untuk sesi.objectstringNilainya selalu realtime.session.modelstringModel yang sedang digunakan.modalitiesarrayPengaturan modalitas output untuk model.voicestringVoice untuk audio yang dihasilkan oleh model.input_audio_formatstringFormat audio input. Default-nya adalah pcm.sample_rateintegerLaju sampel audio input, dalam Hz.output_audio_formatstringFormat audio output. Default-nya adalah pcm.turn_detectionobjectKonfigurasi VAD (Voice Activity Detection).translationobject (Opsional)Konfigurasi terjemahan.
Properties language string (Opsional)Bahasa target untuk terjemahan.corpusobject (Opsional)Konfigurasi terminologi khusus untuk meningkatkan akurasi terjemahan istilah domain-spesifik.
Properties corpus.phrases object (Opsional)Pemetaan istilah bahasa sumber ke terjemahan bahasa target. Untuk detailnya, lihat Bahasa yang didukung. |
session.updated
Dikembalikan setelah permintaan session.update berhasil. Jika permintaan gagal, event error akan dikembalikan sebagai gantinya.
event_idstringIdentifier unik untuk event ini.typestringJenis event. Nilainya selalu session.updated.sessionobjectKonfigurasi sesi.
Properties id stringIdentifier unik untuk sesi.objectstringNilainya selalu realtime.session.modelstringModel yang sedang digunakan.modalitiesarrayPengaturan modalitas output untuk model.voicestringVoice untuk audio yang dihasilkan oleh model.sample_rateinteger (Opsional)Laju sampel audio input, dalam Hz.input_audio_formatstringFormat audio input. Nilainya selalu pcm.output_audio_formatstringFormat audio output. Nilainya selalu pcm.input_audio_transcriptionobjectKonfigurasi transkripsi audio input. Hanya dikembalikan ketika parameter input_audio_transcription.model dikonfigurasi dalam sesi.
Properties model stringModel pengenalan suara.languagestringBahasa pengenalan suara yang dikonfigurasi.objectKonfigurasi VAD (Voice Activity Detection). Bidang ini tidak dikembalikan dalam mode Manual (ketika klien mengatur parameter ini ke null dalam session.update).
Properties type stringJenis VAD. Nilainya selalu server_vad.thresholdfloatSensitivitas deteksi VAD.prefix_padding_msintegerDurasi audio (dalam milidetik) yang disimpan sebelum ucapan dimulai, untuk menghindari kehilangan awal ucapan.silence_duration_msintegerDurasi minimum keheningan (dalam milidetik) yang diperlukan setelah ucapan berakhir untuk menentukan bahwa ucapan telah selesai.create_responsebooleanApakah secara otomatis memicu respons terjemahan setelah VAD mendeteksi bahwa ucapan telah berakhir.interrupt_responsebooleanApakah menginterupsi respons terjemahan yang sedang dihasilkan saat VAD mendeteksi giliran ucapan baru.object (Opsional)Konfigurasi terjemahan.
Properties language string (Opsional)Bahasa target untuk terjemahan.corpusobject (Opsional)Konfigurasi terminologi khusus untuk meningkatkan akurasi terjemahan istilah domain-spesifik.
Properties corpus.phrases object (Opsional)Pemetaan istilah bahasa sumber ke terjemahan bahasa target.booleanApakah mengaktifkan kloning suara.voice_clone_optionsobjectParameter kontrol kloning suara. Hanya dikembalikan ketika enable_voice_clone bernilai true.
Properties frequency stringFrekuensi kloning suara. |
session.finished
Sesi telah selesai dan semua terjemahan audio telah lengkap.
Hanya dikirim setelah klien mengirim permintaan session.finish. Klien kemudian dapat memutuskan koneksi.
event_idstringIdentifier unik untuk event ini.typestringJenis event. Nilainya selalu session.finished. |
response.created
Dikembalikan saat server menghasilkan respons model baru.
event_idstringIdentifier unik untuk event ini.typestringJenis event. Nilainya selalu response.created.responseobjectObjek respons.
Properties id stringIdentifier unik untuk respons.conversation_id stringIdentifier unik untuk sesi saat ini.object stringJenis objek. Untuk event ini, nilainya selalu realtime.response.status stringStatus respons. Nilai yang valid:
arrayModalitas respons.voice stringVoice dari audio yang dihasilkan.output_audio_format stringFormat audio output.output arrayEvent ini saat ini kosong. |
response.done
Dikembalikan setelah pembuatan respons selesai. Berisi semua item output kecuali raw audio data.
event_id stringIdentifier unik untuk event ini.type stringJenis event. Nilainya selalu response.done.response objectObjek respons.
Properties id stringIdentifier unik untuk respons.conversation_id stringIdentifier unik untuk sesi saat ini.object stringJenis objek. Untuk event ini, nilainya selalu realtime.response.status stringStatus respons.modalities arrayModalitas respons.voice stringVoice yang digunakan untuk audio yang dihasilkan oleh model.output_audio_format stringFormat audio output.output objectOutput dari respons.
Properties id stringIdentifier unik untuk output respons.type stringJenis item output. Nilainya saat ini selalu message.object stringJenis objek item output. Nilainya saat ini selalu realtime.item.status stringStatus item output.role stringPeran item output.content arrayKonten item output.
Properties type stringJenis konten output. Nilainya adalah text untuk output teks biasa dan audio ketika output mencakup audio.text stringKonten teks dari output.transcript stringTranskripsi teks dari konten audio.objectInformasi konsumsi token untuk respons ini. |
response.text.text
Dikembalikan untuk output teks saja saat model menghasilkan teks secara inkremental.
event_idstringIdentifier unik untuk event ini.typestringJenis event. Nilainya selalu response.text.text.textstringTeks inkremental yang dikembalikan.response_idstringID respons.item_idstringIdentifier unik untuk item pesan.output_indexintegerSaat ini, nilainya selalu 0.content_indexintegerSaat ini, nilainya selalu 0.stashstringTeks sementara yang dihasilkan oleh model. Gabungkan stash dengan text saat ini untuk membentuk hasil sementara. Sistem memperbarui text dan stash secara terus-menerus menggunakan event response.text.text hingga menerima event response.text.done. Teks lengkap akhir kemudian tersedia di bidang text. |
response.text.done
Dikembalikan saat generasi teks selesai untuk output teks saja, atau jika respons diinterupsi, tidak lengkap, atau dibatalkan.
event_idstringIdentifier unik untuk event ini.typestringJenis event. Nilainya selalu response.text.done.response_idstringIdentifier unik untuk respons.item_idstringIdentifier unik untuk item pesan.output_indexintegerSaat ini, nilainya selalu 0.content_indexintegerSaat ini, nilainya selalu 0.text stringOutput teks lengkap dari model. |
response.audio.delta
Dikembalikan saat output audio diaktifkan dan model menghasilkan audio secara inkremental.
event_idstringIdentifier unik untuk event ini.typestringJenis event. Nilainya selalu response.audio.delta.response_idstringIdentifier unik untuk respons.item_idstringIdentifier unik untuk item pesan.output_index integerNilainya selalu 0.content_index integerNilainya selalu 0.delta stringData audio inkremental yang dioutput oleh model. Data ini dienkode Base64. |
response.audio.done
Dikembalikan saat generasi audio selesai. Juga dikembalikan jika respons diinterupsi, tidak lengkap, atau dibatalkan. Tidak berisi data audio lengkap.
event_idstringIdentifier unik untuk event ini.typestringJenis event. Nilainya selalu response.audio.done.response_idstringIdentifier unik untuk respons.item_idstringIdentifier unik untuk item pesan.output_indexintegerNilainya selalu 0.content_indexintegerNilainya selalu 0. |
input_audio_buffer.speech_started
Dikembalikan saat VAD sisi server (Voice Activity Detection) mendeteksi bahwa pengguna mulai berbicara.
event_idstringIdentifier unik untuk event ini.typestringJenis event. Nilainya selalu input_audio_buffer.speech_started.audio_start_msintegerTitik waktu (dalam milidetik) saat ucapan terdeteksi mulai, sebagai offset dari awal aliran audio.item_idstringIdentifier unik untuk item pesan terkait. |
input_audio_buffer.speech_stopped
Dikembalikan saat VAD sisi server mendeteksi bahwa pengguna berhenti berbicara, menandakan akhir giliran input ucapan saat ini. Karena respons terjemahan dihasilkan secara sinkron dengan input ucapan streaming, respons terjemahan aktual mungkin sudah dimulai selama proses input ucapan, tanpa perlu menunggu event ini.
event_idstringIdentifier unik untuk event ini.typestringJenis event. Nilainya selalu input_audio_buffer.speech_stopped.audio_end_msintegerTitik waktu (dalam milidetik) saat ucapan terdeteksi berakhir, sebagai offset dari awal aliran audio.item_idstringIdentifier unik untuk item pesan terkait. |
input_audio_buffer.committed
Dalam mode Manual (turn_detection bernilai null), setelah klien mengirim event input_audio_buffer.commit, server mengembalikan event ini sebagai konfirmasi dan secara otomatis mulai menghasilkan respons terjemahan.
event_idstringIdentifier unik untuk event ini.typestringJenis event. Nilainya selalu input_audio_buffer.committed. |
input_audio_buffer.cleared
Setelah klien mengirim event input_audio_buffer.clear, server mengembalikan event ini sebagai konfirmasi bahwa data audio yang belum dikomit dalam buffer telah dihapus.
event_idstringPengidentifikasi unik untuk event ini.typestringJenis event. Nilainya selalu input_audio_buffer.cleared. |
conversation.item.created
Dikembalikan saat item pesan baru dibuat dalam percakapan. Event ini dipicu dalam skenario berikut:
- Saat server mulai menghasilkan respons terjemahan, server membuat item pesan asisten terkait (pada titik ini,
contentadalah array kosong, dan konten diisi secara progresif dengan respons streaming). - Dalam mode Manual, setelah klien mengirim event
input_audio_buffer.commit, server juga membuat item pesan yang sesuai dengan input audio pengguna (contentberisi{"type": "input_audio"}).
item.id dari hasil pengenalan ucapan cocok dengan previous_item_id dalam event hasil terjemahan. Gunakan nilai-nilai ini untuk mengasosiasikan dan menampilkan teks sumber dengan terjemahannya.
event_idstringIdentifier unik untuk event ini.typestringJenis event. Nilainya selalu conversation.item.created.previous_item_idstringIdentifier unik item pesan sebelumnya. Untuk event hasil terjemahan, nilai ini cocok dengan item.id dari hasil pengenalan ucapan untuk segmen VAD yang sama.itemobjectInformasi item pesan.
Properties id stringIdentifier unik untuk item pesan.typestringNilainya selalu message.objectstringNilainya selalu realtime.item.statusstringStatus item pesan.rolestringPeran pesan. Nilai yang valid: assistant atau user.contentarrayKonten pesan. Saat respons pertama kali dibuat, ini adalah array kosong yang diisi secara progresif dengan respons streaming. Untuk item pesan pengguna yang dibuat melalui commit dalam mode Manual, berisi {"type": "input_audio"}. |
conversation.item.input_audio_transcription.text
Saat input_audio_transcription.model dikonfigurasi, server melakukan streaming hasil pengenalan ucapan dalam bahasa sumber asli.
event_idstringIdentifier unik untuk event ini.typestringJenis event. Nilainya selalu conversation.item.input_audio_transcription.text.item_idstringIdentifier unik untuk item pesan.content_indexintegerSaat ini, nilainya selalu 0.textstringTeks pengenalan yang telah dikonfirmasi.stashstringTeks pengenalan yang menunggu konfirmasi. Teks ini mungkin dikoreksi oleh event berikutnya.languagestringBahasa sumber yang terdeteksi.emotionstringEmosi yang terdeteksi dari audio yang dikenali. Emosi yang didukung sebagai berikut:
|
conversation.item.input_audio_transcription.completed
Saat input_audio_transcription.model dikonfigurasi, mengembalikan hasil pengenalan akhir setelah pengenalan ucapan selesai.
event_idstringIdentifier unik untuk event ini.typestringJenis event. Nilainya selalu conversation.item.input_audio_transcription.completed.item_idstringIdentifier unik untuk item pesan.content_indexintegerSaat ini, nilainya selalu 0.transcriptstringHasil pengenalan ucapan lengkap dalam bahasa sumber asli.languagestringBahasa sumber yang terdeteksi.emotionstringEmosi yang terdeteksi dari audio yang dikenali. Emosi yang didukung:
|
conversation.item.input_audio_transcription.failed
Dikembalikan saat input audio diterima tetapi pengenalan ucapan gagal. Event ini ditangani secara terpisah dari event error lainnya, sehingga memudahkan klien untuk mengidentifikasi item terkait secara spesifik.
typestringJenis event. Nilainya selalu conversation.item.input_audio_transcription.failed.item_idstringID item percakapan terkait.content_indexintegerIndeks bagian konten yang berisi audio.error.codestringKode kesalahan.error.messagestringPesan error. |
response.audio_transcript.text
Dikembalikan untuk output audio guna menampilkan terjemahan real-time.
event_idstringIdentifier unik untuk event ini.typestringJenis event. Nilainya selalu response.audio_transcript.text.response_idstringIdentifier unik untuk respons.item_idstringIdentifier unik untuk item pesan.output_index integerSaat ini, nilainya selalu 0.content_index integerSaat ini, nilainya selalu 0.textstringSegmen teks terjemahan yang telah dikonfirmasi.stashstringTeks terjemahan sementara, digabungkan dengan text untuk membentuk hasil sementara. Sistem memperbarui text dan stash secara terus-menerus melalui event response.audio_transcript.text hingga menerima event response.audio_transcript.done. Kemudian ambil terjemahan akhir dari transcript. |
response.audio_transcript.done
Dikembalikan saat output audio diaktifkan dan generasi teks selesai.
event_idstringIdentifier unik untuk event ini.typestringJenis event. Nilainya selalu response.audio_transcript.done.response_idstringIdentifier unik untuk respons.item_idstringIdentifier unik untuk item pesan.output_index integerSaat ini, nilainya selalu 0.content_index integerSaat ini, nilainya selalu 0.transcriptstringTeks lengkap. |
response.output_item.added
Dikembalikan saat item output baru ditambahkan selama pembuatan respons.
event_idstringIdentifier unik untuk event ini.typestringJenis event. Nilainya selalu response.output_item.added.response_idstringIdentifier unik untuk respons.output_index integerSaat ini, nilainya selalu 0.item objectInformasi mengenai item output.
Properties id stringIdentifier unik untuk item output.typestringNilainya selalu message.objectstringNilainya selalu realtime.item.statusstringStatus item output.rolestringPeran pesan.contentstringKonten pesan. |
response.output_item.done
Dikembalikan saat item output selesai.
event_idstringIdentifier unik untuk event ini.typestringJenis event. Nilainya selalu response.output_item.done.response_idstringIdentifier unik untuk respons.output_indexintegerSaat ini, nilainya selalu 0.itemobjectInformasi mengenai item output.
Properties id stringIdentifier unik untuk item output.objectstringNilainya selalu realtime.item.typestringNilainya selalu message.statusstringStatus item output.rolestringPeran pengirim pesan.contentstringKonten pesan. |
response.content_part.added
Dikembalikan saat bagian konten baru ditambahkan.
event_id stringID unik event ini.type stringJenis event. Nilainya selalu response.content_part.added.response_id stringID unik respons.item_id stringID unik item pesan.output_index integerNilainya selalu 0.content_index integerNilainya selalu 0.part objectMenampilkan informasi item.
Properties type stringJenis bagian konten.text stringTeks bagian konten. |
response.content_part.done
Dikembalikan saat bagian konten selesai.
event_idstringIdentifier unik untuk event ini.typestringJenis event. Nilainya selalu response.content_part.done.response_idstringIdentifier unik untuk respons.item_idstringIdentifier unik untuk item pesan.output_index integerNilainya selalu 0.content_index integerNilainya selalu 0.part objectInformasi mengenai bagian konten.
Properties type stringJenis bagian konten.textstringTeks bagian konten. |