Qwen、Wan 訓練資料摘要
阿里雲百鍊上的 Qwen、Wan 系列模型是自主研發的,使用包含數萬億 token 的文本、映像、視頻和音訊資料集進行訓練。在模型開發過程中,最早使用的資料集早於 2022 年 1 月。
資料來源
訓練資料包括以下四類:
- 互連網公開資料——公眾可訪問的網路內容。
- 第三方夥伴資料——夥伴按協議提供的非公開資料。
- 標註與簽約資料——來自資料標註服務商及付費承包商的資料。
- 合成資料——由阿里雲自有模型產生,用於補充真實世界資料。
合成資料
由自有模型產生的合成資料旨在滿足以下四方面需求:
- 填補真實世界訓練資料有限的缺口
- 應對需要專門訓練樣本的複雜任務
- 提升模型泛化能力與感知能力
- 增強模型安全性與魯棒性
核心能力
訓練資料構建了以下推理服務能力:
- 通用語言理解
- 高階推理
- 多模態互動
- 長上下文處理
- 視覺產生
客戶資料政策
除非客戶明確同意,否則阿里雲百鍊不會使用客戶的業務資料來開發或改進模型。
資料治理
資料治理架構覆蓋從預訓練到後訓練的完整訓練流程,通過資料清洗、處理與結構性最佳化等措施予以保障。
預訓練
原始訓練資料經過清洗與過濾:
- 自動化Alibaba Content Security Service篩查,剔除有害或敏感內容。
- 人工複核作為補充保障,輔助自動化過濾。
- 個人資訊過濾,在預先處理階段減少訓練資料集中的個人資訊。
後訓練
語言大模型資料增強
基於五個維度精細化標註架構篩選高品質資料:維度 | 用途 |
|---|---|
教育價值 | 優先選擇具有強學習訊號的資料 |
領域覆蓋 | 覆蓋各知識領域的廣度 |
語言類型 | 支援多語言理解 |
推理複雜度 | 構建高階推理能力 |
安全等級 | 按Alibaba Content Security Service標準過濾 |
視覺產生類模型處理
多模態資料會進行針對性預先處理:- 高精度 OCR 與文檔結構化解析,用於從映像和文檔中提取文本
- 2D/3D 空間語義標註,用於空間理解
- 視訊框架與文本的顯式時間戳記對齊,用於視頻理解
安全對齊
通過專門的安全資料集進行安全對齊,增強模型內生的安全能力。目標
這些處理旨在提升資料品質與任務對齊度,保障模型安全、合規,並在通用、專業與多模態推理情境下實現預期能力目標。
HappyHorse 訓練資料摘要
HappyHorse 系列模型是阿里雲百鍊自主研發的,使用包含數萬億 token 的文本、映像、視頻和音訊資料集進行訓練。
資料來源
訓練資料包括以下四類:
- 互連網公開資料——公眾可訪問的網路內容。
- 第三方夥伴資料——夥伴按協議提供的非公開資料。
- 標註與簽約資料——來自資料標註服務商及付費承包商的資料。
- 合成資料——由阿里雲自有模型產生,用於補充真實世界資料。
合成資料
由自有模型產生的合成資料旨在滿足以下四方面需求:
- 填補真實世界訓練資料有限的缺口
- 應對需要專門訓練樣本的複雜任務
- 提升模型泛化能力與感知能力
- 增強模型安全性與魯棒性
核心能力
訓練資料構建了以下推理服務能力:
- 通用語言理解
- 高階推理
- 多模態互動
- 長上下文處理
- 視覺產生
客戶資料政策
除非客戶明確同意,否則阿里雲百鍊不會使用客戶的業務資料來開發或改進模型。
資料治理
資料治理架構覆蓋從預訓練到後訓練的完整訓練流程,通過資料清洗、處理與結構性最佳化等措施予以保障。
預訓練
原始訓練資料經過清洗與過濾:
- 自動化Alibaba Content Security Service篩查,剔除有害或敏感內容。
- 人工複核作為補充保障,輔助自動化過濾。
- 個人資訊過濾,在預先處理階段減少訓練資料集中的個人資訊。
後訓練
語言大模型資料增強
基於五個維度精細化標註架構篩選高品質資料:維度 | 用途 |
|---|---|
教育價值 | 優先選擇具有強學習訊號的資料 |
領域覆蓋 | 覆蓋各知識領域的廣度 |
語言類型 | 支援多語言理解 |
推理複雜度 | 構建高階推理能力 |
安全等級 | 按Alibaba Content Security Service標準過濾 |
視覺產生類模型處理
多模態資料會進行針對性預先處理:- 高精度 OCR
- 2D/3D 空間語義標註,用於空間理解
- 視訊框架與文本的顯式時間戳記對齊,用於視頻理解