Skip to main content
安全合規

阿里雲百鍊 - 訓練資料披露摘要

Qwen、Wan 訓練資料摘要

阿里雲百鍊上的 Qwen、Wan 系列模型是自主研發的,使用包含數萬億 token 的文本、映像、視頻和音訊資料集進行訓練。在模型開發過程中,最早使用的資料集早於 2022 年 1 月。

資料來源

訓練資料包括以下四類:
  • 互連網公開資料——公眾可訪問的網路內容。
  • 第三方夥伴資料——夥伴按協議提供的非公開資料。
  • 標註與簽約資料——來自資料標註服務商及付費承包商的資料。
  • 合成資料——由阿里雲自有模型產生,用於補充真實世界資料。
資料集可能包含受著作權、商標或專利保護的內容,也可能包含公用領域的內容。

合成資料

由自有模型產生的合成資料旨在滿足以下四方面需求:
  • 填補真實世界訓練資料有限的缺口
  • 應對需要專門訓練樣本的複雜任務
  • 提升模型泛化能力與感知能力
  • 增強模型安全性與魯棒性

核心能力

訓練資料構建了以下推理服務能力:
  • 通用語言理解
  • 高階推理
  • 多模態互動
  • 長上下文處理
  • 視覺產生
訓練資料還支撐任務對齊、模態融合與能力強化,確保能夠準確、安全地處理多樣化、專業化、多模態的請求。

客戶資料政策

除非客戶明確同意,否則阿里雲百鍊不會使用客戶的業務資料來開發或改進模型。

資料治理

資料治理架構覆蓋從預訓練到後訓練的完整訓練流程,通過資料清洗、處理與結構性最佳化等措施予以保障。

預訓練

原始訓練資料經過清洗與過濾:
  • 自動化Alibaba Content Security Service篩查,剔除有害或敏感內容。
  • 人工複核作為補充保障,輔助自動化過濾。
  • 個人資訊過濾,在預先處理階段減少訓練資料集中的個人資訊。
這些措施有助於模型在推理過程中識別並減少偏見,提升輸出的公平性與公正性。

後訓練

語言大模型資料增強
基於五個維度精細化標註架構篩選高品質資料:

維度

用途

教育價值

優先選擇具有強學習訊號的資料

領域覆蓋

覆蓋各知識領域的廣度

語言類型

支援多語言理解

推理複雜度

構建高階推理能力

安全等級

按Alibaba Content Security Service標準過濾

來自專門模型的合成資料,包括 Qwen-Math 和 Qwen-Coder,進一步提升了多語言理解、複雜推理與長上下文建模的效能。
視覺產生類模型處理
多模態資料會進行針對性預先處理:
  • 高精度 OCR 與文檔結構化解析,用於從映像和文檔中提取文本
  • 2D/3D 空間語義標註,用於空間理解
  • 視訊框架與文本的顯式時間戳記對齊,用於視頻理解
大規模多模態合成資料集強化了視覺與語言之間的跨模態對齊,支援複雜文檔和長視頻理解,並為視覺產生和智能體互動提供訓練基礎。
安全對齊
通過專門的安全資料集進行安全對齊,增強模型內生的安全能力。

目標

這些處理旨在提升資料品質與任務對齊度,保障模型安全、合規,並在通用、專業與多模態推理情境下實現預期能力目標。

HappyHorse 訓練資料摘要

HappyHorse 系列模型是阿里雲百鍊自主研發的,使用包含數萬億 token 的文本、映像、視頻和音訊資料集進行訓練。

資料來源

訓練資料包括以下四類:
  • 互連網公開資料——公眾可訪問的網路內容。
  • 第三方夥伴資料——夥伴按協議提供的非公開資料。
  • 標註與簽約資料——來自資料標註服務商及付費承包商的資料。
  • 合成資料——由阿里雲自有模型產生,用於補充真實世界資料。
資料集可能包含受著作權、商標或專利保護的內容,也可能包含公用領域的內容。

合成資料

由自有模型產生的合成資料旨在滿足以下四方面需求:
  • 填補真實世界訓練資料有限的缺口
  • 應對需要專門訓練樣本的複雜任務
  • 提升模型泛化能力與感知能力
  • 增強模型安全性與魯棒性

核心能力

訓練資料構建了以下推理服務能力:
  • 通用語言理解
  • 高階推理
  • 多模態互動
  • 長上下文處理
  • 視覺產生
訓練資料還支撐任務對齊、模態融合與能力強化,確保能夠準確、安全地處理多樣化、專業化、多模態的請求。

客戶資料政策

除非客戶明確同意,否則阿里雲百鍊不會使用客戶的業務資料來開發或改進模型。

資料治理

資料治理架構覆蓋從預訓練到後訓練的完整訓練流程,通過資料清洗、處理與結構性最佳化等措施予以保障。

預訓練

原始訓練資料經過清洗與過濾:
  • 自動化Alibaba Content Security Service篩查,剔除有害或敏感內容。
  • 人工複核作為補充保障,輔助自動化過濾。
  • 個人資訊過濾,在預先處理階段減少訓練資料集中的個人資訊。
這些措施有助於模型在推理過程中識別並減少偏見,提升輸出的公平性與公正性。

後訓練

語言大模型資料增強
基於五個維度精細化標註架構篩選高品質資料:

維度

用途

教育價值

優先選擇具有強學習訊號的資料

領域覆蓋

覆蓋各知識領域的廣度

語言類型

支援多語言理解

推理複雜度

構建高階推理能力

安全等級

按Alibaba Content Security Service標準過濾

來自專門模型的合成資料進一步提升了多語言理解、複雜推理與長上下文建模的效能。
視覺產生類模型處理
多模態資料會進行針對性預先處理:
  • 高精度 OCR
  • 2D/3D 空間語義標註,用於空間理解
  • 視訊框架與文本的顯式時間戳記對齊,用於視頻理解
大規模多模態合成資料集強化了視覺與語言之間的跨模態對齊,支援長視頻理解,並為視覺產生提供訓練基礎。
安全對齊
通過專門的安全資料集進行安全對齊,增強模型內生的安全能力。

目標

這些處理旨在提升資料品質與任務對齊度,保障模型安全、合規,並在通用、專業與多模態推理情境下實現預期能力目標。
Token Plan
模型體驗
  • 音樂產生
用量統計與效能監控
資產中心
服務支援