本文介紹Qwen-Audio-3.0-ASR-Flash/Fun-ASR-Flash非即時語音辨識HTTP API的參數和介面細節。
使用者指南:非即時語音辨識。關於支援的音頻格式、檔案大小限制、時間長度限制等輸入要求,請參見音頻規格。
在流式模式下,用戶端需關注以下處理要點:
介面地址
- 新加坡
- 華北2(北京)
POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generation調用時請將{WorkspaceId}替換為真實的Workspace ID。要求標頭
參數 | 類型 | 是否必選 | 說明 |
|---|---|---|---|
Authorization | string | 是 | 鑒權令牌,格式為 |
Content-Type | string | 是 | 請求參數的媒體類型,固定為 |
X-DashScope-SSE | string | 是 | 用於控制是否以SSE流式方式返回結果。設定為 |
請求參數modelstring(必選)指定模型名。支援Qwen-Audio-3.0-ASR-Flash和Fun-ASR-Flash系列模型,詳情請參見支援的模型與地區。inputobject(必選)輸入資訊。
屬性 messages array(object)(必選)訊息列表。包含當前待識別的音頻,以及可選的對話上下文(用於提升識別效果)。
屬性 role string(必選)訊息角色。取值範圍:
array(object)(必選)訊息內容列表。
屬性 type string(必選)內容類型。每個請求至少需要一條input_audio類型的訊息。取值範圍:
object(條件必選)當type為input_audio時必填。
屬性 data string(必選)待識別音頻資料。關於支援的音頻格式、檔案大小限制、時間長度限制等輸入要求,請參見音頻規格。支援以下兩種方式:
https://example.com/audio/sample.wav樣本(Base64方式):data:audio/wav;base64,{BASE64_ENCODED_DATA}string(條件必選)當type為input_text時,填入前幾輪使用者語音的識別結果或領域相關的詞表;當type為text時,填入前幾輪大語言模型的回複內容。文本按字元數計算,每個字元計為 1。每輪上下文中所有訊息的 text 欄位長度之和不超過 400 個字元,超出部分從末尾截斷。object(必選)模型參數。潤色順滑功能預設關閉,暫未開放。潤色順滑:模型在識別語音的同時,自動清理無意義語氣詞和口吃重複,處理說話過程中的自我糾正,理順口語表達,並規範標點與文字格式設定。輸出結果更加簡潔、流暢、易讀,同時儘可能保留使用者的最終意圖和關鍵資訊。
屬性 format string(必選)音頻格式。根據實際音頻格式填寫,支援wav、mp3、opus等。詳情請參見音頻規格。sample_ratestring(可選)音頻採樣率,單位Hz。例如16000表示16kHz採樣率。詳情請參見音頻規格。vocabulary_idstring(可選)先行編譯熱詞列表 ID。需預先調用建立熱詞列表介面產生,識別時傳入該 ID 即可使用列表中的熱詞。適用於詞彙已知且相對穩定、需要跨請求複用同一詞表的情境。使用方法請參見先行編譯熱詞。vocabularyobject(可選)即時熱詞。以索引值對形式傳入,鍵為熱詞文本(string),值為熱詞權重(integer),無需預先建立熱詞列表。權重取值範圍為 [1, 5] 或 50:取 [1, 5] 時值越大模型越傾向輸出該詞;取 50 時為超級熱詞,召回率大幅提升,但超級熱詞數量最多不超過 50 個。適用於臨時性、會話層級的熱詞最佳化。與先行編譯熱詞同時配置時,僅即時熱詞生效。使用方法請參見即時熱詞。language_hints array[string](可選)設定待識別語言代碼。如果無法提前確定語種,可不設定,模型會自動識別語種。對於 Qwen-Audio-3.0-ASR-Flash 系列模型,最多支援設定 4 個值,即便設定超出 4 個,也僅前 4 個生效;對於 Fun-ASR-Flash 系列模型,僅支援設定 1 個值,即便設定多個,也僅第一個生效。
點擊查看支援的語言代碼
| 以下為新加坡地區的配置,調用時請將"{WorkspaceId}"替換為真實的業務空間ID,各地區的配置不同。新加坡地區和北京地區的API Key不同。
|
響應參數request_idstring本次請求的唯一標識。outputobject輸出結果。
屬性 text string當前累積的完整識別文本。sentenceobject當前句子的詳細資料。
屬性 sentence_id integer句子編號,從1開始。sentence_endboolean是否為該句的最終結果。為true時表示該句識別完成。begin_timeinteger句子開始時間,單位毫秒。end_timeinteger句子結束時間,單位毫秒。僅在sentence_end為true時返回。textstring當前句子的識別文本。channel_idinteger聲道編號,從0開始。wordsarray詞層級時間戳記列表。
屬性 text string詞文本。begin_timeinteger詞開始時間,單位毫秒。end_timeinteger詞結束時間,單位毫秒。punctuationstring詞後的標點符號。無標點時為空白字串。fixedboolean詞是否已穩定。false表示後續事件中該詞的時間戳記可能調整。object用量資訊。僅在sentence_end為true時返回。
屬性 duration integer已處理的音頻時間長度,單位秒。 |
|
SSE 流式結果處理邏輯
在流式模式下,用戶端需關注以下處理要點:
- 每收到一個SSE事件,解析
data欄位中的JSON。 - 通過
output.sentence.sentence_end判斷當前句子是否結束:當該值為true時,該句識別完成,詞級時間戳記已穩定,可作為最終結果使用;當該值為false時,識別仍在進行中,文本和時間戳記可能在後續事件中更新。 usage資訊僅在句子結束事件中返回,可用於計量音頻處理時間長度。