Skip to main content
安全合规

阿里云百炼 - 训练数据披露摘要

Qwen、Wan 训练数据摘要

阿里云百炼上的 Qwen、Wan 系列模型是自主研发的,使用包含数万亿 token 的文本、图像、视频和音频的数据集进行训练。在模型开发过程中,最早使用的数据集早于 2022 年 1 月。

数据来源

训练数据包括以下四类:
  • 互联网公开数据——公众可访问的网络内容。
  • 第三方合作伙伴数据——合作伙伴按协议提供的非公开数据。
  • 标注与签约数据——来自数据标注服务商及付费承包商的数据。
  • 合成数据——由阿里云自有模型生成,用于补充真实世界数据。
数据集可能包含受版权、商标或专利保护的内容,也可能包含公共领域的内容。

合成数据

由自有模型生成的合成数据旨在满足以下四方面需求:
  • 填补真实世界训练数据有限的缺口
  • 应对需要专门训练样本的复杂任务
  • 提升模型泛化能力与感知能力
  • 增强模型安全性与鲁棒性

核心能力

训练数据构建了以下推理服务能力:
  • 通用语言理解
  • 高阶推理
  • 多模态交互
  • 长上下文处理
  • 视觉生成
训练数据还支撑任务对齐、模态融合与能力强化,确保能够准确、安全地处理多样化、专业化、多模态的请求。

客户数据政策

除非客户明确同意,否则阿里云百炼不会使用客户的业务数据来开发或改进模型。

数据治理

数据治理框架覆盖从预训练到后训练的完整训练流程,通过数据清洗、处理与结构性优化等措施予以保障。

预训练

原始训练数据经过清洗与过滤:
  • 自动化内容安全筛查,剔除有害或敏感内容。
  • 人工复核作为补充保障,辅助自动化过滤。
  • 个人信息过滤,在预处理阶段减少训练数据集中的个人信息。
这些措施有助于模型在推理过程中识别并减少偏见,提升输出的公平性与公正性。

后训练

语言大模型数据增强
基于五个维度的精细化标注框架筛选高质量数据:

维度

用途

教育价值

优先选择具有强学习信号的数据

领域覆盖

覆盖各知识领域的广度

语言类型

支持多语言理解

推理复杂度

构建高阶推理能力

安全等级

按内容安全标准过滤

来自专门模型的合成数据,包括 Qwen-Math 和 Qwen-Coder,进一步提升了多语言理解、复杂推理与长上下文建模的性能。
视觉生成类模型处理
多模态数据会进行针对性预处理:
  • 高精度 OCR 与文档结构化解析,用于从图像和文档中提取文本
  • 2D/3D 空间语义标注,用于空间理解
  • 视频帧与文本的显式时间戳对齐,用于视频理解
大规模多模态合成数据集强化了视觉与语言之间的跨模态对齐,支持复杂文档和长视频理解,并为视觉生成和智能体交互提供训练基础。
安全对齐
通过专门的安全数据集进行安全对齐,增强模型内生的安全能力。

目标

这些处理旨在提升数据质量与任务对齐度,保障模型安全、合规,并在通用、专业与多模态推理场景下实现预期能力目标。

HappyHorse 训练数据摘要

HappyHorse 系列模型是阿里云百炼自主研发的,使用包含数万亿 token 的文本、图像、视频和音频的数据集进行训练。

数据来源

训练数据包括以下四类:
  • 互联网公开数据——公众可访问的网络内容。
  • 第三方合作伙伴数据——合作伙伴按协议提供的非公开数据。
  • 标注与签约数据——来自数据标注服务商及付费承包商的数据。
  • 合成数据——由阿里云自有模型生成,用于补充真实世界数据。
数据集可能包含受版权、商标或专利保护的内容,也可能包含公共领域的内容。

合成数据

由自有模型生成的合成数据旨在满足以下四方面需求:
  • 填补真实世界训练数据有限的缺口
  • 应对需要专门训练样本的复杂任务
  • 提升模型泛化能力与感知能力
  • 增强模型安全性与鲁棒性

核心能力

训练数据构建了以下推理服务能力:
  • 通用语言理解
  • 高阶推理
  • 多模态交互
  • 长上下文处理
  • 视觉生成
训练数据还支撑任务对齐、模态融合与能力强化,确保能够准确、安全地处理多样化、专业化、多模态的请求。

客户数据政策

除非客户明确同意,否则阿里云百炼不会使用客户的业务数据来开发或改进模型。

数据治理

数据治理框架覆盖从预训练到后训练的完整训练流程,通过数据清洗、处理与结构性优化等措施予以保障。

预训练

原始训练数据经过清洗与过滤:
  • 自动化内容安全筛查,剔除有害或敏感内容。
  • 人工复核作为补充保障,辅助自动化过滤。
  • 个人信息过滤,在预处理阶段减少训练数据集中的个人信息。
这些措施有助于模型在推理过程中识别并减少偏见,提升输出的公平性与公正性。

后训练

语言大模型数据增强
基于五个维度的精细化标注框架筛选高质量数据:

维度

用途

教育价值

优先选择具有强学习信号的数据

领域覆盖

覆盖各知识领域的广度

语言类型

支持多语言理解

推理复杂度

构建高阶推理能力

安全等级

按内容安全标准过滤

来自专门模型的合成数据进一步提升了多语言理解、复杂推理与长上下文建模的性能。
视觉生成类模型处理
多模态数据会进行针对性预处理:
  • 高精度 OCR
  • 2D/3D 空间语义标注,用于空间理解
  • 视频帧与文本的显式时间戳对齐,用于视频理解
大规模多模态合成数据集强化了视觉与语言之间的跨模态对齐,支持长视频理解,并为视觉生成提供训练基础。
安全对齐
通过专门的安全数据集进行安全对齐,增强模型内生的安全能力。

目标

这些处理旨在提升数据质量与任务对齐度,保障模型安全、合规,并在通用、专业与多模态推理场景下实现预期能力目标。
Token Plan
模型体验
  • 音乐生成
用量统计与性能监控
资产中心
服务支持