As séries de modelos Qwen e Wan no Alibaba Cloud Model Studio são desenvolvidas internamente e treinadas com conjuntos de dados que contêm trilhões de tokens em texto, imagem, vídeo e áudio. O conjunto de dados mais antigo usado no desenvolvimento é anterior a janeiro de 2022.
Fontes de dados
Os dados de treinamento abrangem quatro categorias:
- Dados públicos da internet -- conteúdo web acessível ao público geral.
- Dados de parceiros terceiros -- informações não públicas fornecidas por parceiros mediante contrato.
- Dados rotulados e contratados -- informações provenientes de serviços de rotulagem de dados e prestadores remunerados.
- Dados sintéticos -- dados gerados por modelos proprietários da Alibaba Cloud para complementar informações do mundo real.
Dados sintéticos
A geração de dados sintéticos por modelos proprietários atende a quatro necessidades:
- Preencher lacunas onde os dados de treinamento do mundo real são limitados
- Lidar com tarefas complexas que exigem exemplos de treinamento especializados
- Aprimorar a generalização e o desempenho perceptivo do modelo
- Fortalecer a segurança e a robustez do modelo
Capacidades principais
Os dados de treinamento fundamentam as seguintes capacidades do serviço de inferência:
- Compreensão geral de linguagem
- Raciocínio avançado
- Interação multimodal
- Processamento de contexto longo
- Geração visual
Política de dados do cliente
O Alibaba Cloud Model Studio não utiliza dados comerciais dos clientes para desenvolver ou aprimorar modelos sem consentimento explícito.
Governança de dados
Um framework de governança de dados abrange todo o pipeline de treinamento (do pré-treinamento ao pós-treinamento), com medidas para limpeza, processamento e otimização estrutural dos dados.
Pré-treinamento
Os dados brutos de treinamento passam por processos de limpeza e filtragem:
- Triagem automatizada de segurança de conteúdo remove conteúdos nocivos ou sensíveis.
- Revisão humana complementa os filtros automatizados como camada adicional de proteção.
- Filtragem de informações pessoais reduz a presença de dados pessoais nos conjuntos de treinamento durante o pré-processamento.
Pós-treinamento
Aumento de dados para modelos de linguagem
A seleção de dados de alta qualidade ocorre por meio de um framework de anotação granular em cinco dimensões:
Dimensão | Objetivo |
|---|---|
Valor educacional | Priorizar dados com sinais fortes de aprendizado |
Cobertura de domínio | Abranger ampla variedade de áreas de conhecimento |
Tipos de linguagem | Dar suporte à compreensão multilíngue |
Complexidade de raciocínio | Desenvolver capacidades avançadas de raciocínio |
Níveis de segurança | Filtrar com base em critérios de segurança de conteúdo |
Processamento de modelos generativos visuais
Os dados multimodais passam por pré-processamento direcionado:
- OCR de alta precisão e análise estrutural de documentos para extração de texto de imagens e arquivos
- Anotação semântica espacial 2D/3D para compreensão espacial
- Alinhamento temporal explícito entre quadros de vídeo e texto para compreensão de vídeo