本文介紹 Qwen-ASR 模型的輸入與輸出參數。可通過OpenAI 相容或DashScope協議調用 API。
使用者指南:模型介紹和選型請參見非即時語音辨識。
不同模型支援的接入方式不同,請根據下表選擇正確的方式進行整合。
與OpenAI相容模式或DashScope同步調用(均為一次請求、立即返回結果)不同,非同步呼叫專為處理長音頻檔案或耗時較長的任務設計,該模式採用“提交-輪詢”的兩步式流程,避免了因長時間等待而導致的請求逾時:
模型接入方式
不同模型支援的接入方式不同,請根據下表選擇正確的方式進行整合。
模型 | 接入方式 |
|---|---|
千問3-ASR-Flash-Filetrans | 僅支援DashScope非同步呼叫方式 |
千問3-ASR-Flash |
OpenAI 相容
URL
- 新加坡
- 美國(維吉尼亞)
- 華北2(北京)
HTTP請求地址:
POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/compatible-mode/v1/chat/completionsSDK調用配置的base_url:https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/compatible-mode/v1調用時請將{WorkspaceId}替換為真實的Workspace ID。請求參數modelstring(必選)模型名稱。僅適用於千問3-ASR-Flash模型。messagesarray(必選)訊息列表。
訊息類型 System Message object(可選)用於為語音辨識提供上下文(Context),如背景文本和實體詞表等參考資訊,不支援設定模型角色等傳統系統提示詞。如果設定系統訊息,請放在messages列表的第一位。
屬性 role string(必選)固定為system。object(必選)使用者發送給模型的訊息。
屬性 content array(必選)使用者訊息的內容。僅允許設定一組訊息。
屬性 string(必選)使用者訊息的角色,固定為user。object(可選)用來指定某些功能是否啟用。
屬性 language string(可選)無預設值若已知音訊語種,可通過該參數指定待識別語種,以提升識別準確率。只能指定一個語種。若音頻語種不確定,或包含多種語種(例如中英日韓混合),請勿指定該參數。
取值範圍
boolean(可選)預設值為false是否啟用ITN(Inverse Text Normalization,逆文本標準化)。該功能僅適用於中文和英文音頻。開啟後,語音辨識結果中的中文數字(如"一百二十三")或英文數字(如"one hundred")將自動轉換為阿拉伯數字(如"123")。參數值:
boolean(可選)預設值為false是否以流式輸出方式回複。相關文檔:流式輸出可選值:
true,可提升閱讀體驗並降低逾時風險。stream_optionsobject(可選)流式輸出的配置項,僅在 stream 為 true 時生效。
屬性 include_usage boolean(可選)預設值為false是否在響應的最後一個資料區塊包含Token消耗資訊。可選值:
流式輸出時,Token 消耗資訊僅可出現在響應的最後一個資料區塊。 |
|
響應參數idstring本次調用的唯一識別碼。choicesarray模型的輸出資訊。
屬性 finish_reason string有三種情況:
integer當前對象在choices數組中的索引。messageobject模型輸出的訊息對象。
屬性 role string輸出訊息的角色,固定為assistant。contentarray語音辨識結果。annotationsarray輸出標註資訊(如語種)
屬性 language string被識別音訊語種。當請求參數language已指定語種時,該值與所指定的參數一致。
取值範圍
string固定為audio_info,表示音頻資訊。emotionstring被識別音訊情感。支援的情感如下:
integer請求建立時的 Unix 時間戳記(秒)。modelstring本次請求使用的模型。objectstring始終為chat.completion。usageobject本次請求的Token消耗資訊。
屬性 completion_tokens integer模型輸出的 Token 數。completion_tokens_details object模型輸出的 Token 細粒度詳情。
屬性 text_tokens integer模型輸出文本的Token數。object輸入的Token數。prompt_tokens_details object輸入的 Token 細粒度詳情。
屬性 audio_tokens integer輸入音頻長度(Token)。音頻轉換Token規則:每秒音頻轉換為25個Token,不足1秒按1秒計算。text_tokens integer無需關注該參數。integer音頻時間長度(秒)。total_tokens integer輸入和輸出總Token數(total_tokens = completion_tokens + prompt_tokens)。 |
DashScope同步調用
URL
- 新加坡
- 美國(維吉尼亞)
- 華北2(北京)
HTTP請求地址:
POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generationSDK調用配置的base_url:https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1調用時請將{WorkspaceId}替換為真實的Workspace ID。請求參數modelstring(必選)模型名稱。僅適用於千問3-ASR-Flash模型。messagesarray(必選)訊息列表。通過HTTP調用時,請將messages放入 input 對象中。
訊息類型 System Message object(可選)用於為語音辨識提供上下文(Context),如背景文本和實體詞表等參考資訊,不支援設定模型角色等傳統系統提示詞。如果設定系統訊息,請放在messages列表的第一位。僅千問3-ASR-Flash支援該參數。
屬性 role string(必選)固定為system。object(必選)使用者發送給模型的訊息。object(可選)用來指定某些功能是否啟用。僅千問3-ASR-Flash支援該參數。
屬性 language string(可選)無預設值若已知音訊語種,可通過該參數指定待識別語種,以提升識別準確率。只能指定一個語種。若音頻語種不確定,或包含多種語種(例如中英日韓混合),請勿指定該參數。
取值範圍
boolean(可選)預設值為false是否啟用ITN(Inverse Text Normalization,逆文本標準化)。該功能僅適用於中文和英文音頻。開啟後,語音辨識結果中的中文數字(如"一百二十三")或英文數字(如"one hundred")將自動轉換為阿拉伯數字(如"123")。參數值:
| 以下樣本為音頻 URL 識別;本地音頻檔案識別樣本請參見快速開始。 |
響應參數request_idstring本次調用的唯一識別碼。Java SDK返回參數為requestId。output object調用結果資訊。
屬性 choices array模型的輸出資訊。當result_format為message時返回choices參數。
屬性 finish_reason string有三種情況:
object模型輸出的訊息對象。
屬性 role string輸出訊息的角色,固定為assistant。contentarray輸出訊息的內容。
屬性 text string語音辨識結果。array輸出標註資訊(如語種)
屬性 language string被識別音訊語種。當請求參數language已指定語種時,該值與所指定的參數一致。
取值範圍
string固定為audio_info,表示音頻資訊。emotionstring被識別音訊情感。支援的情感如下:
object本次請求的Token消耗資訊。
屬性 input_tokens_details object千問3-ASR-Flash輸入內容長度(Token)。
屬性 text_tokens integer無需關注該參數。object千問3-ASR-Flash輸出內容長度(Token)。
屬性 text_tokens integer千問3-ASR-Flash輸出的識別結果文本長度(Token)。integer千問3-ASR-Flash音頻時間長度(秒)。 |
DashScope非同步呼叫
流程說明
與OpenAI相容模式或DashScope同步調用(均為一次請求、立即返回結果)不同,非同步呼叫專為處理長音頻檔案或耗時較長的任務設計,該模式採用“提交-輪詢”的兩步式流程,避免了因長時間等待而導致的請求逾時:
-
第一步:提交任務
- 用戶端發起一個非同步處理請求。
- 伺服器驗證請求後,不會立即執行任務,而是返回一個唯一的
task_id,表示任務已成功建立。
-
第二步:擷取結果
- 用戶端使用擷取到的
task_id,通過輪詢方式反覆調用結果查詢介面。 - 當任務處理完成後,結果查詢介面將返回最終的識別結果。
- 用戶端使用擷取到的
-
使用 SDK(範例程式碼請參見快速開始,請求參數請參見提交任務的請求參數請求參數,返回結果請參見非同步呼叫識別結果說明)
SDK封裝了底層的API調用細節,提供了更便捷的編程體驗。
- 提交任務:調用
async_call()(Python) 或asyncCall()(Java) 方法提交任務。此方法將返回一個包含task_id的任務對象。 - 擷取結果:使用上一步返回的任務對象或
task_id,調用fetch()方法擷取結果。SDK內部會自動處理輪詢邏輯,直到任務完成或逾時。
- 提交任務:調用
-
- 使用 RESTful API
提交任務
URL
- 新加坡
- 華北2(北京)
HTTP請求地址:
POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/audio/asr/transcriptionSDK調用配置的base_url:https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1調用時請將{WorkspaceId}替換為真實的Workspace ID。請求參數modelstring(必選)模型名稱。僅適用於千問3-ASR-Flash-Filetrans模型。inputobject(必選)
屬性 object(可選)
屬性 language string(可選)無預設值若已知音訊語種,可通過該參數指定待識別語種,以提升識別準確率。只能指定一個語種。若音頻語種不確定,或包含多種語種(例如中英日韓混合),請勿指定該參數。
取值範圍
boolean(可選)預設值為false是否啟用ITN(Inverse Text Normalization,逆文本標準化)。該功能僅適用於中文和英文音頻。開啟後,語音辨識結果中的中文數字(如"一百二十三")或英文數字(如"one hundred")將自動轉換為阿拉伯數字(如"123")。參數值:
boolean(可選)預設值為false控制是否返回字層級時間戳記:
array(可選)預設值為[0]指定在多音軌音頻檔案中需要識別的音軌索引,索引從 0 開始。例如,[0] 表示識別第一個音軌,[0, 1] 表示同時識別第一和第二個音軌。如果省略此參數,則預設處理第一個音軌。 |
|
響應參數request_idstring本次調用的唯一識別碼。outputobject調用結果資訊。
屬性 task_id string任務ID。該ID在查詢語音辨識任務介面中作為請求參數傳入。task_statusstring任務狀態:
|
擷取任務執行結果
URL
- 新加坡
- 華北2(北京)
HTTP請求地址:
GET https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/tasks/{task_id}SDK調用配置的base_url:https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1調用時請將{WorkspaceId}替換為真實的Workspace ID。請求參數task_idstring(必選)任務ID。將提交任務返回結果中的task_id作為參數傳入,查詢語音辨識結果。 |
|
響應參數request_idstring本次調用的唯一識別碼。outputobject調用結果資訊。
屬性 task_id string任務ID。該ID在查詢語音辨識任務介面中作為請求參數傳入。task_statusstring任務狀態:
object語音辨識結果。
屬性 transcription_url string識別結果檔案的下載 URL,連結有效期間為 24 小時。到期後無法查詢任務,也無法通過先前的 URL 下載結果。識別結果以 JSON 檔案儲存,可通過該連結下載檔案,或直接使用 HTTP 要求讀取檔案內容。 詳情參見非同步呼叫識別結果說明。 string任務提交時間。schedule_timestring任務調度時間,即開始執行時間。end_timestring任務結束時間。task_metricsobject任務指標,包含子任務狀態的統計資訊。
屬性 TOTAL integer子任務總數。SUCCEEDEDinteger子任務成功數。FAILEDinteger子任務失敗數。string錯誤碼,僅在任務失敗時返回。messagestring錯誤資訊,僅任務失敗時返回。usageobject本次請求的Token消耗資訊。
屬性 seconds integer千問3-ASR-Flash音頻時間長度(秒)。 |
非同步呼叫識別結果說明file_urlstring被識別的音頻檔案URL。audio_infoobject被識別音頻檔案相關資訊。
屬性 format string音頻格式。sample_rate integer音頻採樣率。array完整的識別結果清單,每個元素對應一條音軌的識別內容。
屬性 channel_id integer音軌索引,以0為起始。textstring識別結果文本。sentencesobject句子層級的識別結果清單。
屬性 begin_time integer句子開始時間戳(毫秒)。end_timeinteger句子結束時間戳記(毫秒)。textstring識別結果文本。sentence_idinteger句子索引,以0為起始。languagestring被識別音訊語種。當請求參數language已指定語種時,該值與所指定的參數一致。
取值範圍
string被識別音訊情感。支援的情感如下:
object詞層級的識別結果清單。當請求參數enable_words設為true時展示該結果。
屬性 begin_time integer開始時間戳(毫秒)。end_timeinteger結束時間戳記(毫秒)。textstring識別結果文本。punctuationstring標點符號。 |