資料採礦模型專門針對資訊抽取、內容審核、分類打標和摘要產生任務進行設計。相比通用對話模型,該模型能夠快速且精確地輸出規範的結構化資料(如JSON格式),解決通用對話模型返回不規範回複結構或提取資訊不夠準確的問題。
本文檔僅適用於華北2(北京)地區。如需使用模型,需使用華北2(北京)地區的API Key。
使用方式
Qwen-Doc-Turbo 支援通過以下三種方式從檔案中提取資訊,具體檔案大小與類型限制請參考限制:
特性 | 檔案URL (推薦) | 檔案ID | 純文字 |
|---|---|---|---|
檔案來源 | 公網 URL | 本地檔案 (需先上傳) | 字串傳入 |
輸入長度限制 | 最多10個檔案 | 1個檔案 | 9,000 Token以內 |
SDK 相容性 | 僅限 | 上傳: |
|
核心優點 | 無需上傳至百鍊,支援指定檔案的解析方式 | 避免重複上傳,適合複用 | 無需檔案管理 |
前提條件
- 已擷取API Key,並配置API Key到環境變數。
- 如果通過SDK調用,還需要安裝OpenAI SDK或DashScope SDK。
通過檔案URL傳入
通過檔案URL直接提取結構化資料,支援最多10個檔案同時處理。此處以傳入樣本產品手冊A與樣本產品手冊B檔案並通過提示詞約束模型以JSON格式返回所提取資訊為例。
檔案URL方式當前僅支援DashScope協議,可以選擇使用DashScope Python SDK或者HTTP方式調用(如curl)
響應樣本
響應樣本
模型返回的
response.output.choices[0].message.content 欄位可能包含 Markdown 代碼塊標記(如 ```json 和 ``` 包裹)。在使用 json.loads() 解析前,需先去除 Markdown 標記。樣本處理方式:通過檔案ID傳入
上傳檔案
在運行以下代碼前,請先點擊樣本產品手冊A下載檔案,並將其放置在專案代碼所在的目錄中。通過OpenAI相容介面上傳到阿里雲百鍊平台的安全儲存空間,擷取返回的file-id。有關檔案上傳介面的詳細參數解釋及調用方式,請參考API文檔頁面進行瞭解。
Python
file-id。
通過檔案ID傳入資訊並對話
將擷取的 file-id 嵌入到System Message 中。第一條System Message用於設定角色向模型提問,後續的System Message用於傳入 file-id,User Message包含針對檔案的具體問題。
完整樣本:上傳檔案並調用模型
完整樣本:上傳檔案並調用模型
響應樣本
響應樣本
模型返回的
response.output.choices[0].message.content 欄位可能包含 Markdown 代碼塊標記(如 ```json 和 ``` 包裹)。在使用 json.loads() 解析前,需先去除 Markdown 標記。樣本處理方式:通過純文字傳入
除了通過 file-id 傳入檔案資訊外,您還可以直接使用字串傳入檔案內容。在此方法下,為避免模型混淆角色設定與檔案內容,請確保在 messages 的第一條訊息中添加用於角色設定的資訊。
受限於API調用請求體大小,如果您的常值內容長度超過9,000Token,請通過檔案URL或檔案ID傳入資訊對話。
響應樣本
響應樣本
模型返回的
response.output.choices[0].message.content 欄位可能包含 Markdown 代碼塊標記(如 ```json 和 ``` 包裹)。在使用 json.loads() 解析前,需先去除 Markdown 標記。樣本處理方式:模型定價
模型名稱 | 上下文長度 | 最大輸入 | 最大輸出 | 輸入成本 | 輸出成本 | 免費額度 |
|---|---|---|---|---|---|---|
(Token數) | (每百萬Token) | |||||
qwen-doc-turbo | 262,144 | 253,952 | 32,768 | $0.087 | $0.144 | 無免費額度 |
常見問題
- 通過OpenAI檔案相容介面上傳檔案後,檔案將被儲存在何處? 所有通過OpenAI檔案相容介面上傳的檔案均將被儲存在當前阿里雲帳號下的阿里雲百鍊儲存空間且不會產生任何費用,關於所上傳檔案的資訊查詢與管理請參考OpenAI檔案介面。
- 通過檔案URL方式上傳時,檔案解析策略(file_parsing_strategy)參數有什麼不同? 當解析原則設定為 "auto" 時,系統會根據檔案內容自動進行解析;當解析原則設定為 "text_only" 時,系統將僅解析文字類內容;當解析原則設定為“text_and_images”時,系統將會解析所有圖片與文本類內容,解析所需時間也會相應增加。
-
如何確定檔案已經解析完成?
擷取 file-id 後,您可以直接嘗試使用該ID與模型進行對話。如果檔案仍在解析中,API會返回相應的錯誤提示
File parsing in progress, please try again later.,此時請稍後重試。如果模型調用成功並返回了回複,則表示檔案已解析完成,可以正常使用。 - 檔案上傳後的解析過程是否會產生任何額外費用? 文檔解析並不會產生任何額外費用。
API參考
關於Qwen-Doc-Turbo的輸入與輸出參數,請參考OpenAI 相容API詳情或DashScope API詳情
錯誤碼
如果模型調用失敗並返回報錯資訊,請參見錯誤碼進行解決。
限制
-
SDK 依賴:
- 檔案URL (doc_url): 檔案URL方式當前僅支援DashScope協議,可以選擇使用
DashScope Python SDK或者HTTP方式調用(如curl) - 上傳檔案 (file-id): 檔案上傳與管理操作 必須 使用
OpenAI相容 SDK。
- 檔案URL (doc_url): 檔案URL方式當前僅支援DashScope協議,可以選擇使用
-
檔案上傳與引用:
-
檔案URL (
doc_url): 單次請求最多支援 10 個檔案URL,且傳入的URL需確保公網可訪問。 -
上傳檔案 (
file-id): 單個檔案不超過 150MB。單個阿里雲帳號最多可上傳 1 萬個檔案,總大小不超過 100GB,當前暫無有效期間限制。單次請求最多引用 1 個檔案。使用檔案ID傳入時,當檔案數量或總大小達到任一上限時,新的檔案上傳請求將會失敗。請參考OpenAI相容-File,及時刪除不再需要的檔案以釋放配額,然後才能繼續上傳。
- 支援格式:TXT, DOC, DOCX, PDF, XLS, XLSX, MD, PPT, PPTX, JPG, JPEG, PNG, GIF, BMP。
-
檔案URL (
-
API 輸入:
- 通過
doc_url或file-id引入資訊時,上下文長度上限為 262,144 Token。 - 直接在
user或system訊息中輸入純文字時,單條訊息內容限制在 9,000 Token 以內。
- 通過
-
API 輸出:
- 最大輸出長度為 32,768 Token。
-
檔案分享權限設定:
file-id僅在產生它的阿里雲主帳號內有效,不支援跨帳號或通過 RAM 使用者 API Key 調用。
- 限流:關於模型的限流條件,請參見限流。