本文介紹 Qwen-Audio-3.0-ASR-Flash-Streaming/Fun-ASR-Realtime 即時語音辨識服務中用戶端通過 WebSocket 發送給服務端的用戶端事件,包括 run-task(啟動任務)、finish-task(結束任務)等指令的資料結構與欄位含義。
使用者指南:關於模型介紹和選型建議請參見語音辨識。
事件互動流程:如需瞭解事件互動時序,請參見WebSocket API。
說明:啟動語音辨識任務,設定模型、音頻格式、採樣率等參數。
發送時機:建立 WebSocket 串連後立即發送。
響應事件:服務端返回
說明:在任務執行過程中更新對話上下文資訊,用於輔助識別。
發送時機:任務運行中,需要更新對話上下文時發送。
說明:通知服務端音頻發送完畢,請求結束任務。
發送時機:所有音頻資料發送完畢後。
響應事件:服務端返回
run-task
說明:啟動語音辨識任務,設定模型、音頻格式、採樣率等參數。
發送時機:建立 WebSocket 串連後立即發送。
響應事件:服務端返回 task-started 事件後才能發送音頻。
headerobject(必選)
屬性 action string(必選)指令類型,固定為 run-task。task_idstring(必選)用戶端產生的任務 ID(UUID 格式),用於關聯後續事件。streamingstring(必選)固定為 duplex。object(必選)
屬性 task_group string(必選)工作群組,固定為 audio。taskstring(必選)任務類型,固定為 asr。functionstring(必選)功能類型。固定為recognition。modelstring(必選)指定模型名。支援Qwen-Audio-3.0-ASR-Flash-Streaming和Fun-ASR-Realtime系列模型,詳情請參見支援的模型與地區。inputobject(必選)輸入對象。不攜帶上下文時傳入{}。
屬性 context array(object)(可選)對話上下文,用於輔助識別、提升專有詞彙的識別準確率。使用方法詳見上下文增強。
屬性 role string(必選)訊息角色。取值範圍:
array(object)(必選)訊息內容列表。
屬性 type string(必選)內容類型。取值範圍:
string(必選)常值內容。當 type 為 input_text 時,填入前幾輪使用者語音的識別結果或領域相關的詞表;當 type 為 text 時,填入前幾輪大語言模型的回複內容。object(必選)語音辨識參數。
屬性 format string(必選)音頻格式。取值範圍:
integer(必選)採樣率(Hz)。取值範圍:8k模型僅支援 8000 Hz,其他模型支援任意採樣率。vocabulary_idstring(可選)先行編譯熱詞列表 ID。需預先調用建立熱詞列表介面產生,識別時傳入該 ID 即可使用列表中的熱詞。適用於詞彙已知且相對穩定、需要跨請求複用同一詞表的情境。使用方法請參見先行編譯熱詞。vocabularyobject(可選)即時熱詞。以索引值對形式傳入,鍵為熱詞文本(string),值為熱詞權重(integer),無需預先建立熱詞列表。權重取值範圍為 [1, 5] 或 50:取 [1, 5] 時值越大模型越傾向輸出該詞;取 50 時為超級熱詞,召回率大幅提升,但超級熱詞數量最多不超過 50 個。適用於臨時性、會話層級的熱詞最佳化。與先行編譯熱詞同時配置時,僅即時熱詞生效。使用方法請參見即時熱詞。language_hintsarray[string](可選)待識別音頻語種。無預設值,不設定時模型自動識別。對於 Qwen-Audio-3.0-ASR-Flash-Streaming 系列模型,最多支援設定 4 個值,即便設定超出 4 個,也僅前 4 個生效;對於 Fun-ASR-Realtime 系列模型,僅支援設定 1 個值,即便設定多個,也僅第一個生效。
點擊查看支援的語言代碼
boolean(可選)是否啟用語義斷句。預設值:false。
integer(可選)VAD 斷句靜音閾值(ms)。當一段語音後的靜音時間長度超過該閾值時,系統會判定該句子已結束。當semantic_punctuation_enabled為true時,不作為sentence_end返回依據,但設定過小可能會影響識別效果。預設值:1300。取值範圍:[200, 6000]。multi_threshold_mode_enabledboolean(可選)是否啟用多閾值模式。啟用後可防止 VAD 斷句切割過長。預設值:false。heartbeatboolean(可選)是否啟用心跳包。預設值:false。
float(可選)語音與噪音的判定閾值,用於調整語音活動檢測(VAD)的靈敏度。取值範圍:[-1.0, 1.0]。取值說明:
string(可選)指定在語音辨識過程中需要處理的敏感詞,並支援對不同敏感詞設定不同的處理方式。詳情請參見敏感詞過濾。 |
continue-task
說明:在任務執行過程中更新對話上下文資訊,用於輔助識別。
發送時機:任務運行中,需要更新對話上下文時發送。
headerobject(必選)
屬性 action string(必選)指令類型,固定為 continue-task。task_idstring(必選)用戶端產生的任務 ID(UUID 格式),需與run-task事件中的 task_id 保持一致。streamingstring(必選)固定為 duplex。object(必選)
屬性 input object(必選)輸入對象。
屬性 context array(object)(可選)對話上下文,用於輔助識別、提升專有詞彙的識別準確率。使用方法詳見上下文增強。
屬性 role string(必選)訊息角色。取值範圍:
array(object)(必選)訊息內容列表。
屬性 type string(必選)內容類型。取值範圍:
string(必選)常值內容。當 type 為 input_text 時,填入前幾輪使用者語音的識別結果或領域相關的詞表;當 type 為 text 時,填入前幾輪大語言模型的回複內容。 |
finish-task
說明:通知服務端音頻發送完畢,請求結束任務。
發送時機:所有音頻資料發送完畢後。
響應事件:服務端返回 task-finished 事件。
headerobject(必選)
屬性 action string(必選)指令類型,固定為 finish-task。task_idstring(必選)用戶端產生的任務 ID(UUID 格式),需與run-task事件中的 task_id 保持一致。streamingstring(必選)固定為 duplex。object(必選)
屬性 input object(必選)固定為{}。 |