Ini adalah event pertama yang dikirim server setelah klien berhasil terhubung. Event ini berisi konfigurasi default yang ditetapkan server untuk sesi tersebut.
Parameter konfigurasi untuk pengenalan ucapan. Untuk informasi selengkapnya, lihat parameter input_audio_transcription pada event session.update dari client.
session.turn_detection
object
Konfigurasi Voice Activity Detection (VAD).
session.turn_detection.type
string
Nilainya tetap server_vad.
session.turn_detection.threshold
float
Ambang batas deteksi VAD.
session.turn_detection.silence_duration_ms
integer
Durasi jeda yang digunakan sebagai ambang deteksi VAD, dalam milidetik (ms).
Server mengirim event ini setelah berhasil memproses event session.update dari klien. Jika terjadi error selama pemrosesan, server akan mengirim event error sebagai gantinya.
Event ini hanya dikirim dalam mode VAD. Server mengirimnya ketika mendeteksi awal ucapan dalam buffer audio.Event ini dapat terjadi setiap kali audio ditambahkan ke buffer, kecuali jika awal ucapan telah terdeteksi sebelumnya.
Parameter
Type
Description
type
string
Jenis event. Nilainya tetap input_audio_buffer.speech_started.
event_id
string
ID event.
audio_start_ms
integer
Waktu dalam milidetik sejak audio mulai ditulis ke buffer hingga ucapan pertama kali terdeteksi selama sesi.
Event ini hanya dikirim dalam mode VAD. Server mengirimnya ketika mendeteksi akhir ucapan dalam buffer audio.Setelah event ini dipicu, server segera mengirim event conversation.item.created, yang berisi item pesan pengguna yang dibuat dari buffer audio.
Parameter
Type
Description
type
string
Jenis event. Nilainya tetap input_audio_buffer.speech_stopped.
event_id
string
ID event.
audio_end_ms
integer
Waktu yang berlalu dalam milidetik sejak awal sesi hingga ucapan berhenti.
item_id
string
ID item pesan pengguna yang dibuat saat ucapan berhenti.
Event ini dikirim secara berkala untuk memberikan hasil pengenalan secara real-time.
Parameter
Type
Description
type
string
Jenis event. Nilainya tetap conversation.item.input_audio_transcription.text.
event_id
string
ID event.
item_id
string
ID item percakapan terkait.
content_index
integer
Indeks bagian konten yang berisi audio.
language
string
Bahasa audio yang dikenali. Jika bahasa ditentukan dalam parameter permintaan language, nilai ini akan sesuai dengan bahasa yang ditentukan.
Nilai yang mungkin:
zh: Tiongkok (Mandarin, Sichuan, Minnan, dan Wu)
yue: Kanton
en: Inggris
ja: Jepang
de: Jerman
ko: Korea
ru: Rusia
fr: Prancis
pt: Portugis
ar: Arab
it: Italia
es: Spanyol
hi: Hindi
id: Bahasa Indonesia
th: Bahasa Thai
tr: Turki
uk: Ukraina
vi: Bahasa Vietnam
emotion
string
Emosi yang terdeteksi dalam audio. Emosi berikut didukung:
surprised
neutral
happy
sad
disgusted
angry
fearful
text
string
Awalan teks yang telah dikonfirmasi. Ini adalah bagian dari kalimat saat ini yang telah dikonfirmasi oleh model dan tidak akan berubah.
stash
string
Akhiran teks yang telah dikenali sebagian. Ini adalah draf sementara yang mengikuti bagian yang telah dikonfirmasi. Model masih memproses draf ini dan mungkin melakukan koreksi.
Kapan saja, Anda dapat memperoleh pratinjau kalimat paling lengkap dengan menggabungkan kedua bidang ini: pratinjau kalimat real-time = text + stash.
Klik untuk melihat contoh
Misalnya, asumsikan pengguna mengucapkan, "Cuacanya bagus hari ini, cerah dan terang."Tabel berikut menunjukkan aliran acara yang mungkin Anda terima dan menjelaskan cara menafsirkannya:
Timestamp
Progres ucapan pengguna
Tanggapan API (text dan stash)
Tampilan UI (text + stash)
T1
“Tersebut...”
text: ""
stash: "The"
Cuaca
T2
"...cuaca adalah..."
text: ""
stash: "Cuacanya adalah"
Cuaca adalah
T3
"...hari ini bagus"
text: "Cuaca"
stash: "cuaca hari ini bagus"
Cuacanya bagus hari ini
(Catatan: “The” telah dikonfirmasi dan dipindahkan ke bidang teks.)
Server mengirim event ini jika pengenalan gagal untuk audio input. Event ini ditangani secara terpisah dari event error lainnya untuk membantu klien mengidentifikasi item spesifik yang gagal.
Parameter
Type
Description
type
string
Jenis event. Nilainya tetap conversation.item.input_audio_transcription.failed.
Sesi telah selesai dan semua pengenalan audio dalam sesi saat ini telah lengkap.Event ini hanya dikirim setelah klien mengirimkan event session.finish. Klien dapat memutuskan koneksi setelah menerima event ini.