知識庫用於為大模型補充私人資料和最新資訊。基於 RAG(檢索增強產生)技術,大模型在產生回答前會先從知識庫中檢索相關內容,從而提升回答的準確性。
無專屬知識庫的應用 無專屬知識庫時,大模型無法準確回答特定領域的問題。 例如,使用者在對話介面中發送"請你幫我挑選一款拍照效果最好的百鍊手機,價格在 3000 元以內",AI 助手因缺乏相關知識庫而無法給出準確的產品推薦。 | 有專屬知識庫的應用 引入專屬知識庫後,大模型可準確回答特定領域的問題。 ![]() |
支援的模型
以下模型支援使用知識庫。配置千問使用知識庫教程
- 千問-Max/Plus/Turbo
- 千問VL-Max/Plus
- 千問-開源版(Qwen2.5等)
上述列表隨時可能更新。請以在 應用管理 頁面建立應用時實際可選的模型為準。
快速開始
本節介紹如何無需編寫代碼,快速構建一個能夠回答特定領域問題(以"阿里雲百鍊手機"為例)的大模型問答應用。
1. 構建知識庫
- 進入知識庫頁面,點擊创建知识库。填寫知识库名称和知识库描述,其餘設定保持預設,點擊下一步。
- 選擇配置類目,上傳阿里雲百鍊系列手機產品介紹.docx檔案。點擊下一步,然後點擊完成。
2. 整合到業務應用
知識庫建立後,可將其關聯至同一業務空間下的阿里雲百鍊應用或外部應用,以處理檢索請求。
- 整合到智能體應用
- 整合到工作流程應用
- 整合到外部應用
- 進入應用管理頁面,找到目標智能體應用,點擊卡片上的配置,並為應用選擇模型。
-
點擊頁面上文檔知識庫右側的 + 按鈕,添加上一步建立的知識庫。相似性閾值和權重可保持預設。
(可選)相似性閾值:篩選檢索結果
知識庫採用語義檢索,可在私人資料或檔案中找出與查詢意圖相關、但關鍵詞可能完全不同的文本。例如,使用者查詢:哪款阿里雲手機適合拍照?實際答案(千問Vivid 7...)中並不包含查詢中的任何關鍵詞。下表中的關鍵詞相似性基於 Jaccard 計算,語義相似性基於
text-embedding-v4模型計算的 Cosine相似性 。
相似性閾值:僅語義相似性高於此閾值的文本才會被召回。閾值設定過高會導致相關文本被過濾丟棄。召迴文本
關鍵詞相似性
語義相似性
千問Vivid 7:智能攝影新體驗
0
0.43
阿里雲百鍊Ace Ultra:遊戲玩家之選
0.17
0.32
阿里雲百鍊Flex Fold+:摺疊屏新紀元
0.25
0.24
(可選)權重:幹預多知識庫召回順序
當智能體應用同時關聯多個知識庫時,可按資訊源的重要程度為各知識庫分配權重。多路召回時,若多個知識庫召回的文本切片相似性相同,系統將優先返回權重更高的知識庫中的文本切片。- 關鍵限制:權重僅在同類型知識庫之間生效。例如,文檔搜尋類知識庫的權重不影響資料查詢類知識庫的召回順序,反之亦然。
- 工作原理:系統先計算使用者問題與各知識庫內容的相關度,篩選出最相關的文本切片,再將相似性分數與對應知識庫的權重相乘,經加權重排後輸出給大模型參考(加權得分越高,被採納的可能性越大)。
-
在頁面右側的輸入框中輸入問題,大模型將基於所構建的知識庫進行回答。
例如:"請幫我挑選一款拍照效果最好的阿里雲百鍊手機,價格在3000元以內。"
3. 最佳化知識庫效果(可選)
若問答過程中出現知識召回不完整或內容不準確的情況,請參見知識庫效果最佳化。
操作指南
在知識庫頁面,可查看和管理當前業務空間下的所有知識庫。
知識庫ID: 即每個知識庫卡片上 ID 欄位的值,用於API調用等情境。
- 建立知識庫
- 更新知識庫
- 編輯知識庫
- 刪除知識庫
- 變更配置
- 點擊測試
- 在知識庫頁面,點擊创建知识库。
-
填寫基礎資訊
根據應用情境選擇合適的知识库类型(單一知識庫不支援同時選擇多個類型)。選擇文檔搜尋類型後,還需選擇使用情境(基礎文檔問答):
- 基礎文檔問答:適用於純文字文檔的語義檢索。
建立後,知識庫類型不可更改。
-
文檔搜尋(檢索情境)
-
適用情境:
- 適用於企業內部文檔、產品手冊等非結構化資料(即未按預定義表結構組織的資料,包含文本、表格和圖片)的檢索。
- 若檔案包含圖片,且需阿里雲百鍊應用在回答中返回,請選擇文檔搜尋。
-
資料來源:支援本地上傳檔案或從阿里雲Object Storage Service匯入。
建立說明(文檔搜尋)
-
選擇資料:為知識庫指定資料來源(檔案或內容)。資料來源內容將匯入知識庫,用於後續檢索。支援本地上傳和雲端匯入(選擇現有類目或檔案)兩種方式。
-
本地上傳:直接從本地電腦上傳檔案。展開下方摺疊面板瞭解如何選擇解析方式。
解析方式(自訂設定)說明
請根據實際需求配置解析策略,如不確定建議保持預設設定。- 电子文档解析:不支援解析檔案中的插圖與圖表。解析速度最快,10~20 頁純文字文檔通常在數秒至 1 分鐘內完成。
- 文檔智能解析:對檔案中的插圖進行文本識別與提取,產生文本摘要。摘要將與其他非圖片內容一同切分並向量化,參與知識庫檢索。解析速度較快,10~20 頁含插圖文檔通常需要 1~5 分鐘。
- 大模型文檔解析:使用千問VL模型的智能體應用支援對檔案中插圖和圖表內容進行提問。如需識別和理解檔案中的插圖與圖表,請選擇大模型文档解析。因需調用大模型進行深度理解,10~20 頁含圖表文檔通常需要 2~10 分鐘。
- Qwen VL解析:專用於圖片檔案。可指定千問VL模型並傳入 Prompt,以指導對圖片版面及元素的識別與提取。單張圖片通常在數秒至 1 分鐘內完成解析。
- 雲端匯入:從Object Storage Service匯入已有檔案。
-
本地上傳:直接從本地電腦上傳檔案。展開下方摺疊面板瞭解如何選擇解析方式。
-
索引配置:定義匯入資料的處理和儲存方式,直接影響檢索效果。
以下配置項中,僅"向量儲存"選用 ADB-PG 時可能產生費用,其餘配置均免費。
- Meta資訊抽取
- Excel檔案表頭拼裝
- 切片方式
- 多輪對話改寫
- 向量模型
- 排序模型
- 相似性閾值
- 最大召回數量
- 向量儲存
metadata(中繼資料)是與非結構化資料關聯的一組附加屬性,以 key-value 索引值對的形式整合到文本切片中。- 作用:中繼資料為文本切片提供重要的上下文資訊,可顯著提升知識庫檢索的準確性。例如,知識庫中包含上千個以產品名稱命名的產品介紹檔案。檢索"A產品的功能概述"時,若所有檔案本文都含有"功能概述"但均未提及"A產品",知識庫可能召回大量無關文本切片。將產品名稱作為中繼資料附加到所有文本切片後,知識庫可精準過濾出與"A產品"相關且包含"功能概述"的切片,從而提高檢索準確性,同時降低模型輸入Token消耗。
- 用法:通過API調用應用時,可在請求參數
metadata_filter中指定metadata。應用檢索知識庫時,將先根據metadata篩選相關檔案。 - 注意:知識庫一旦建立,無法再配置metadata抽取。
如何配置metadata
開啟Meta資訊抽取,然後單擊设置為該知識庫中的所有檔案附加統一或個人化的中繼資料。切分時,每個檔案的中繼資料將整合到各自的文本切片中。建立Meta資訊模板說明
取值方法說明:-
常量:為知識庫中的所有檔案附加固定屬性。
如上方樣本所示,若知識庫中所有檔案的作者相同,可統一設定欄位名為
author的常量。 -
變數:為知識庫中的每個檔案附加可變屬性。目前支援
file_name和cat_name。選擇file_name時,阿里雲百鍊將檔案名稱附加到其中繼資料中,如上方樣本所示。選擇cat_name時,阿里雲百鍊將檔案所在類目的名稱附加到檔案中繼資料中。 -
大模型:系統依據設定的實體描述規則,對知識庫中每個檔案的常值內容進行匹配,自動識別並提取相關資訊,將其作為屬性附加到檔案中繼資料中。
如上方樣本的meta資訊模板所示,如需提取每個檔案中所有出現過的年份資訊作為檔案屬性,可設定名為
在實體描述輸入框中填寫date的大模型欄位,實體描述配置如下:日期資訊,只提取年份,然後單擊確定。 -
正則:系統依據設定的Regex,對知識庫中每個檔案的常值內容進行匹配,提取符合該運算式的內容,並將其作為屬性添加到檔案中繼資料中。
如上方樣本的meta資訊模板所示,如需提取每個檔案中所有出現過的參考資料(假設規律為:以"《"開頭、以"》"結尾),可設定名為
Regex的值設定為reference的正則欄位,Regex配置如下:《.*?》。 -
關鍵詞搜尋:系統在每個檔案中尋找預設的關鍵詞,並將匹配到的關鍵詞作為屬性添加至檔案中繼資料中。
例如,在上述樣本的meta資訊模板中,預設的關鍵詞為:
融資,租賃,產業,汽車,鋼鐵,綠色,環保,資本,排放。由於該檔案中僅出現了"融資、產業、綠色、資本"這四個關鍵詞,系統只提取了這四個關鍵詞作為該檔案
keywords屬性的值。
建立說明(視覺理解)
選擇視覺理解(富文字文件)使用情境後,知識庫將使用多模態向量模型對文檔進行視覺級理解,保留原始版面布局資訊,而非採用傳統的文本切片方式。檔案格式限制
在選擇資料頁簽的檔案上傳地區,滑鼠懸浮查看格式要求查看。索引配置差異
視覺理解情境下的索引配置與基礎文檔問答不同:- 向量模型:自動選擇 qwen3 多模態向量(qwen3-vl-embedding),建立後不可更改。
- 多輪對話改寫:可配置開啟或關閉。
- 相似性閾值:預設 0.20。
- 最終召回最大數量:預設 5。
- 切片方式:視覺理解不使用傳統文本切片(智能切分/自訂切分等),而是基於視覺索引對文檔整頁進行理解。
編輯限制
- Embedding 模型(qwen3 多模態向量)和向量儲存類型(內建)建立後不可更改。
- 知識庫規格變更每天僅支援一次。
-
選擇資料:為知識庫指定資料來源(檔案或內容)。資料來源內容將匯入知識庫,用於後續檢索。支援本地上傳和雲端匯入(選擇現有類目或檔案)兩種方式。
-
適用情境:
-
資料查詢(Chatbot 或 NL2SQL 情境)
-
適用情境:
- 適合構建基於結構化資料(按預定義表結構組織的資料)的問答系統,例如 FAQ、商品資料、人員資訊查詢助手等。
-
若資料為完整的 FAQ 問答對,請選擇資料查詢。例如,Excel 檔案包含兩列,分別為
問題和答案。資料查詢類知識庫支援將問題列用於知識庫檢索,答案列用於大模型回答參考。文檔搜尋類知識庫無法實現此效果。
- 支援匯入單份xlsx、xls格式的文檔,檔案大小限制20MB以內。
-
資料來源接入:支援本地上傳 XLS 或 XLSX 檔案。
建立說明(資料查詢)
-
選擇資料:為知識庫指定資料來源(含檔案或內容)。資料來源內容將匯入知識庫,用於後續檢索。支援本地上傳、雲端匯入兩種方式。
知識庫建立後資料來源不可更改,且單個知識庫不支援同時使用多個資料來源。
- 本地上傳:從本機電腦上傳資料表(XLS 或 XLSX 格式,首行必須為表頭)。
- 雲端匯入(選擇資料表):選擇阿里雲百鍊的現有資料表。
-
索引配置:定義匯入資料的處理和儲存方式,直接影響檢索效果。
以下配置項中,僅"向量儲存"選用 ADB-PG 時可能產生費用,其餘配置均免費。
- 是否參與檢索/參與模型回複
- 多輪對話改寫
- 向量模型
- 排序模型
- 相似性閾值
- 最大召回數量
- 向量儲存
- 是否参与检索:開啟後,知識庫將在該列資料中執行檢索。
- 是否参与模型回复:開啟後,該列的檢索結果將作為大模型產生回答的輸入資訊。樣本配置:對"姓名"、"性別"、"崗位"、"年齡"列開啟是否参与检索,僅對"姓名"和"崗位"列開啟是否参与模型回复後,知識庫將在所有列中執行檢索,但僅將"姓名"和"崗位"兩列的檢索結果提供給大模型作為回答依據。 由於"年齡"列未開啟參與模型回複,關聯該知識庫的大模型仍無法回答"張三的年齡"。
-
選擇資料:為知識庫指定資料來源(含檔案或內容)。資料來源內容將匯入知識庫,用於後續檢索。支援本地上傳、雲端匯入兩種方式。
-
適用情境:
-
圖片問答(圖搜情境)
-
適用情境:
- 適合構建以圖搜圖、以圖搜"圖文"的多模態檢索應用,如商品導購助手、視覺問答助手等。
-
資料來源接入:支援本地上傳 XLS 或 XLSX 檔案。
XLS、XLSX 檔案 中需包含 公開可訪問 的圖片 URL,以便構建圖片索引。詳見下方建立說明。
建立說明(圖片問答)
-
選擇資料:為知識庫指定資料來源(含檔案或內容)。資料來源內容將匯入知識庫,用於後續檢索。支援本地上傳、雲端匯入(選擇資料連線器中已有資料表)兩種方式。
知識庫建立後資料來源不可更改,且單個知識庫不支援同時使用多個資料來源。
-
本地上傳:從本機電腦上傳資料表(XLS 或 XLSX 格式)。
- 欄位要求:資料表中至少需包含一個類型為
image_url的欄位,用於產生圖片索引。 - 構建過程:知識庫將訪問
image_url欄位中的圖片 URL,提取視覺特徵並轉換為向量儲存。 - 檢索過程:知識庫將使用者上傳圖片產生的向量與已儲存的圖片向量進行相似性比對,返回最相關的記錄。
- 欄位要求:資料表中至少需包含一個類型為
- 雲端匯入(選擇資料表):選擇阿里雲百鍊應用資料中的現有資料表。
-
本地上傳:從本機電腦上傳資料表(XLS 或 XLSX 格式)。
-
索引配置:定義匯入資料的處理和儲存方式,直接影響檢索效果。
以下配置項中,僅"向量儲存"選用 ADB-PG 時可能產生費用,其餘配置均免費。
- 是否參與檢索/參與模型回複
- 多輪對話改寫
- 向量模型
- 排序模型
- 相似性閾值
- 最大召回數量
- 向量儲存
- 是否参与检索:開啟後,知識庫將在該列資料中執行檢索。
- 是否参与模型回复:開啟後,該列的檢索結果將作為大模型產生回答的輸入資訊。樣本配置:對"姓名"、"性別"、"崗位"、"年齡"列開啟是否参与检索,僅對"姓名"和"崗位"列開啟是否参与模型回复後,知識庫將在所有列中執行檢索,但僅將"姓名"和"崗位"兩列的檢索結果提供給大模型作為回答依據。 由於"年齡"列未開啟參與模型回複,關聯該知識庫的大模型仍無法回答"張三的年齡"。
-
選擇資料:為知識庫指定資料來源(含檔案或內容)。資料來源內容將匯入知識庫,用於後續檢索。支援本地上傳、雲端匯入(選擇資料連線器中已有資料表)兩種方式。
-
適用情境:
配額與限制
- 關於知識庫支援的資料來源與容量等資訊,請參見知識庫配額與限制。
-
單個阿里雲百鍊應用可關聯的知識庫數量:
- 文檔搜尋類:最多5個
- 資料查詢類:最多5個
- 圖片問答類:最多1個
計費說明
知識庫功能本身免費,但調用引用了知識庫的阿里雲百鍊應用時,可能產生相應費用。
| 步驟 | 計費情況 | |
|---|---|---|
| 構建知識庫 | 不收費。 | |
| 整合到業務應用 | 調用阿里雲百鍊應用時,知識庫召回的文本切片會增加大模型輸入 Token 數量,從而可能增加模型推理(調用)費用。詳情請參見計費項目與定價。注意:若僅通過調用Retrieve 介面在知識庫中檢索,不經過阿里雲百鍊應用產生回答,則不產生費用。 | |
| 管理與營運 | 不收費。 | |
API參考
- 如需擷取最新完整的知識庫API列表及輸入輸出參數,請參見API 目錄(知識庫)。
- 如需瞭解相關API的具體用法和程式碼範例,請參見知識庫API指南。
常見問題
構建知識庫
Q: 資料連線器中已匯入知識庫的檔案/資料表能否刪除?
Q: 資料連線器中已匯入知識庫的檔案/資料表能否刪除?
- 文檔搜尋類知識庫:可以刪除。資料連線器與知識庫中的檔案相互獨立,刪除資料連線器中的源檔案不影響已匯入知識庫的檔案。
- 資料查詢、圖片問答類知識庫:不可刪除,否則會導致資料同步、查看知識庫等功能異常。
Q: 調用知識庫相關API時返回錯誤碼 BailianIndexServiceNotOpen,應如何處理?
Q: 調用知識庫相關API時返回錯誤碼 BailianIndexServiceNotOpen,應如何處理?
處理圖片及多模態內容
Q: 檔案含插圖(需阿里雲百鍊應用在回答時返回),應如何處理?
Q: 檔案含插圖(需阿里雲百鍊應用在回答時返回),應如何處理?
- 使用文檔搜尋類知識庫
- 使用圖片問答類知識庫
方式一(僅適用智能體應用)
方式一(僅適用智能體應用)
-
在構建知識庫時,知識庫類型選擇文檔搜尋,使用情境選擇視覺理解(富文字文件)。
選擇視覺理解(富文字文件)回複後,知識庫將從檔案插圖中提取摘要,大模型根據摘要與問題的相關性自主決定是否插入圖片。
- 建立或編輯智能體應用時,選擇千問-Plus或千問-Plus-Latest模型(經測試,兩款模型效果最佳)。點擊文檔知識庫右側的+按鈕,添加上一步構建的知識庫。
-
實際問答效果:

方式二(適用智能體應用與工作流程應用)
方式二(適用智能體應用與工作流程應用)
- 將圖片上傳至公網可訪問位置並擷取完整 URL。推薦使用 OSS,具體操作請參見將圖片上傳至OSS並使用其檔案URL。
-
在檔案中插入完整 URL(不支援相對路徑)。不支援直接在文檔中內嵌圖片檔案(如通過複製粘貼或菜單插入本地圖片),必須使用公網可訪問的URL連結引用圖片。
若已按說明操作但圖片仍無法顯示,請檢查文本切片中的URL是否完整,確認是否存在多餘空格或特殊字元(可能被系統誤解析),如有問題可直接編輯修正。
檔案正確引用圖片樣本 提示詞模板樣本 實際問答效果 

檔案錯誤引用圖片樣本 提示詞模板樣本 實際問答效果 
在對話測試介面中,輸入提示後,AI 回複僅返回純文字內容,未展示任何圖片。解釋:直接在檔案中內嵌圖片時,阿里雲百鍊應用不會在回答中展示該圖片。
許可權與安全
Q: 操作知識庫時,遇到報錯"缺少該模組的許可權",應如何處理?
Q: 操作知識庫時,遇到報錯"缺少該模組的許可權",應如何處理?
Q: 知識庫是否私人?其他組織或使用者能否訪問?
Q: 知識庫是否私人?其他組織或使用者能否訪問?
Q: 阿里雲是否會使用我帳號下的知識庫回答其他使用者的問題?
Q: 阿里雲是否會使用我帳號下的知識庫回答其他使用者的問題?
遷移與匯出
Q: 如何匯出知識庫到本地?
Q: 如何匯出知識庫到本地?

表徵圖,確認後即可將資料表的最新內容同步至知識庫。