Qwen、Wan 训练数据摘要
阿里云百炼上的 Qwen、Wan 系列模型是自主研发的,使用包含数万亿 token 的文本、图像、视频和音频的数据集进行训练。在模型开发过程中,最早使用的数据集早于 2022 年 1 月。
数据来源
训练数据包括以下四类:
- 互联网公开数据——公众可访问的网络内容。
- 第三方合作伙伴数据——合作伙伴按协议提供的非公开数据。
- 标注与签约数据——来自数据标注服务商及付费承包商的数据。
- 合成数据——由阿里云自有模型生成,用于补充真实世界数据。
合成数据
由自有模型生成的合成数据旨在满足以下四方面需求:
- 填补真实世界训练数据有限的缺口
- 应对需要专门训练样本的复杂任务
- 提升模型泛化能力与感知能力
- 增强模型安全性与鲁棒性
核心能力
训练数据构建了以下推理服务能力:
- 通用语言理解
- 高阶推理
- 多模态交互
- 长上下文处理
- 视觉生成
客户数据政策
除非客户明确同意,否则阿里云百炼不会使用客户的业务数据来开发或改进模型。
数据治理
数据治理框架覆盖从预训练到后训练的完整训练流程,通过数据清洗、处理与结构性优化等措施予以保障。
预训练
原始训练数据经过清洗与过滤:
- 自动化内容安全筛查,剔除有害或敏感内容。
- 人工复核作为补充保障,辅助自动化过滤。
- 个人信息过滤,在预处理阶段减少训练数据集中的个人信息。
后训练
语言大模型数据增强
基于五个维度的精细化标注框架筛选高质量数据:维度 | 用途 |
|---|---|
教育价值 | 优先选择具有强学习信号的数据 |
领域覆盖 | 覆盖各知识领域的广度 |
语言类型 | 支持多语言理解 |
推理复杂度 | 构建高阶推理能力 |
安全等级 | 按内容安全标准过滤 |
视觉生成类模型处理
多模态数据会进行针对性预处理:- 高精度 OCR 与文档结构化解析,用于从图像和文档中提取文本
- 2D/3D 空间语义标注,用于空间理解
- 视频帧与文本的显式时间戳对齐,用于视频理解
安全对齐
通过专门的安全数据集进行安全对齐,增强模型内生的安全能力。目标
这些处理旨在提升数据质量与任务对齐度,保障模型安全、合规,并在通用、专业与多模态推理场景下实现预期能力目标。
HappyHorse 训练数据摘要
HappyHorse 系列模型是阿里云百炼自主研发的,使用包含数万亿 token 的文本、图像、视频和音频的数据集进行训练。
数据来源
训练数据包括以下四类:
- 互联网公开数据——公众可访问的网络内容。
- 第三方合作伙伴数据——合作伙伴按协议提供的非公开数据。
- 标注与签约数据——来自数据标注服务商及付费承包商的数据。
- 合成数据——由阿里云自有模型生成,用于补充真实世界数据。
合成数据
由自有模型生成的合成数据旨在满足以下四方面需求:
- 填补真实世界训练数据有限的缺口
- 应对需要专门训练样本的复杂任务
- 提升模型泛化能力与感知能力
- 增强模型安全性与鲁棒性
核心能力
训练数据构建了以下推理服务能力:
- 通用语言理解
- 高阶推理
- 多模态交互
- 长上下文处理
- 视觉生成
客户数据政策
除非客户明确同意,否则阿里云百炼不会使用客户的业务数据来开发或改进模型。
数据治理
数据治理框架覆盖从预训练到后训练的完整训练流程,通过数据清洗、处理与结构性优化等措施予以保障。
预训练
原始训练数据经过清洗与过滤:
- 自动化内容安全筛查,剔除有害或敏感内容。
- 人工复核作为补充保障,辅助自动化过滤。
- 个人信息过滤,在预处理阶段减少训练数据集中的个人信息。
后训练
语言大模型数据增强
基于五个维度的精细化标注框架筛选高质量数据:维度 | 用途 |
|---|---|
教育价值 | 优先选择具有强学习信号的数据 |
领域覆盖 | 覆盖各知识领域的广度 |
语言类型 | 支持多语言理解 |
推理复杂度 | 构建高阶推理能力 |
安全等级 | 按内容安全标准过滤 |
视觉生成类模型处理
多模态数据会进行针对性预处理:- 高精度 OCR
- 2D/3D 空间语义标注,用于空间理解
- 视频帧与文本的显式时间戳对齐,用于视频理解