Skip to main content

Training set and evaluation set

Os datasets são a base para o treinamento e a avaliação de modelos. O recurso Data Management do Alibaba Cloud Model Studio ajuda você a criar e gerenciar datasets com eficiência.

Visão geral dos datasets

O recurso Data Management do Alibaba Cloud Model Studio gerencia centralmente todos os datasets relacionados a grandes modelos no seu workspace de negócios. Os datasets dividem-se em Training Set (usado para model fine-tuning, com suporte a SFT/DPO/CPT) e Evaluation Set (usado para Model evaluation). Os conjuntos de treinamento abrangem quatro cenários: geração de texto, compreensão multimodal, imagem para vídeo (primeiro quadro) e imagem para vídeo (primeiro e último quadro). Já os conjuntos de avaliação suportam apenas o cenário de geração de texto. Não é possível alterar o tipo de dataset após a criação; portanto, escolha com cuidado conforme o uso pretendido. Os nomes dos datasets podem ter até 50 caracteres (são aceitos caracteres chineses, ingleses, dígitos, sublinhados, hifens e pontos), e as descrições até 200 caracteres. O sistema não permite criar ou publicar datasets vazios. Não há limite para a quantidade de datasets que você pode criar nem para o volume de dados importados. Os métodos de treinamento DPO/CPT e a montagem de armazenamento em cloud estão disponíveis apenas na região Beijing.

Métodos e cenários de treinamento

Os conjuntos de treinamento oferecem três métodos distintos, cada um com cenários específicos e requisitos mínimos de dados:
  • SFT (supervised fine-tuning): ajuste fino supervisionado por instruções que capacita o modelo a resolver tarefas específicas. Recomenda-se pelo menos mil entradas. Disponível em todos os sites.
  • DPO (direct preference optimization): treinamento de alinhamento de preferências. Recomenda-se pelo menos cem entradas.
  • CPT (continual pre-training): injeção de conhecimento de domínio. Recomenda-se pelo menos 50 milhões de tokens de dados. Não há suporte para status de rascunho nem herança de dados.
Conjuntos de treinamento CPT e imagem para vídeo não admitem status de rascunho; eles só podem ser publicados imediatamente durante a criação. Conjuntos de treinamento de geração de texto SFT e DPO permitem salvar como rascunho antes da publicação.

Método de treinamento

Finalidade

Volume de dados recomendado

Disponibilidade por site

Suporte a rascunho

SFT

Ajuste fino supervisionado (ajuste por instruções)

Mais de 1.000 entradas

Todos os sites

Suportado

DPO

Otimização direta de preferência (alinhamento de preferência)

Mais de 100 entradas

Região Beijing

Suportado

CPT

Pré-treinamento contínuo (conhecimento de domínio)

50 milhões de tokens

Região Beijing

Não suportado

Métodos de importação

Existem três formas de importar datasets, cada uma adequada a diferentes cenários e pré-requisitos:
  • Upload Local File: sem pré-requisitos; faça upload direto de arquivos locais, ideal para pequenos lotes de dados.
  • OSS Import: adicione a tag bailian-datahub-access=read ao bucket de destino; indicado para grandes volumes de dados. Não compatível com conjuntos de avaliação.
  • Log Backflow: extrai automaticamente dados de treinamento dos logs de inferência do SLS; exige autorização de uma função vinculada a service, criando um ciclo de melhoria: inferência → dados → ajuste fino.
O fluxo de retorno de logs abrange apenas registros dos últimos 30 dias, com limite de 100.000 entradas por importação única, e requer a especificação de uma API Key e condições de filtro de modelo. Os dados importados são criptografados automaticamente com criptografia do lado do servidor OSS (SSE-OSS, AES256). O fluxo de retorno de logs está disponível. Para a lista completa de restrições, consulte a Visão geral dos datasets.

Método de importação

Pré-requisitos

Cenário aplicável

Compatível com conjunto de avaliação

Upload local

Nenhum

Pequenos lotes de dados

Suportado

Importação OSS

Tag do bucket bailian-datahub-access=read

Grandes lotes de dados

Não suportado

Fluxo de retorno de logs

Autorização + Filtro de API Key/modelo

Criar dados de treinamento a partir de logs de inferência

Suportado

O fluxo de retorno de logs exige a autorização prévia de uma função vinculada a service, aceita apenas logs dos últimos 30 dias e possui um limite de 100.000 entradas por importação única.

Data Preparation

A preparação de dados de alta qualidade é fundamental para os resultados do ajuste fino do modelo. Para os volumes de dados recomendados para cada método de treinamento (geração de texto SFT/DPO/CPT), consulte Tuning data upload rules. Não existem volumes oficiais recomendados para conjuntos de treinamento de compreensão multimodal e imagem para vídeo; prepare amostras suficientes conforme seu cenário real.

Formato de dados e modelos

Para as especificações de formato de arquivo de dados de cada cenário de treinamento (texto SFT/compreensão multimodal (imagem/vídeo → texto), DPO, CPT, conjuntos de avaliação), consulte Tuning data upload rules. Na página de criação de dataset do Data Management, baixe o modelo de dados correspondente ao cenário desejado; preparar os dados seguindo essa estrutura evita falhas na importação. Para estratégias de diversidade e aumento de dados, consulte a documentação model fine-tuning. No caso de conjuntos de avaliação, prepare um conjunto independente e sem sobreposição de dados para avaliar objetivamente a capacidade de generalização do modelo.

Criar um dataset

Antes de criar um dataset, certifique-se de atender aos seguintes pré-requisitos: o service Model Studio deve estar ativado; para importação via OSS, adicione a tag bailian-datahub-access=read ao bucket de destino; para fluxo de retorno de logs, autorize uma função vinculada a service. Na página de lista Data ManagementData Management > Dataset, clique em Add Dataset e siga estas etapas:
  1. Insira um nome para o dataset (até 50 caracteres) e uma descrição (até 200 caracteres, opcional).
  2. Selecione o tipo de dataset: Training Set ou Evaluation Set (não é possível alterar após a criação).
  3. Escolha o cenário de treinamento: geração de texto, compreensão multimodal, imagem para vídeo (primeiro quadro) ou imagem para vídeo (primeiro e último quadro). Conjuntos de avaliação aceitam apenas geração de texto.
  4. Defina o método de treinamento: SFT, DPO ou CPT.
  5. Especifique o local de armazenamento: Platform OSS storage (gratuito, sem limite de volume de dados) ou Mount Cloud Storage (indisponível para conjuntos de avaliação).
  6. Escolha o método de importação e carregue os dados: upload local, importação OSS ou fluxo de retorno de logs (consulte as descrições nas abas abaixo).
  7. Configure as opções de publicação: Draft ou Publish. Conjuntos de treinamento CPT e imagem para vídeo não aceitam rascunhos e devem ser publicados imediatamente.
  8. Clique em Submit para concluir a criação do dataset.
Os três métodos de importação funcionam em abas distintas, cada uma com campos e operações específicos. Conjuntos de treinamento de geração de texto SFT e DPO permitem o upload simultâneo de vários arquivos.

Parâmetro

Descrição

Obrigatório

Descrição do valor

Nome do dataset

Identificador do dataset

true

Até 50 caracteres; chinês/inglês/dígitos/sublinhado/hífen/ponto

Descrição do dataset

Descrição do dataset

Até 200 caracteres

Tipo de dataset

Conjunto de treinamento ou avaliação; imutável após criação

true

Training Set/Evaluation Set

Cenário de treinamento

Cenário de treinamento aplicável aos dados

true

Geração de texto/Compreensão multimodal/Imagem para vídeo (primeiro quadro)/Imagem para vídeo (primeiro e último quadro)

Método de treinamento

Tipo de algoritmo de treinamento

true

SFT/DPO/CPT

Local de armazenamento

Método de armazenamento do dataset

true

Platform OSS storage/Montagem de armazenamento em cloud

Método de importação

Fonte de importação de dados

true

Upload local/Importação OSS/Fluxo de retorno de logs

Configuração de publicação

Rascunho ou publicação imediata

true

Rascunho/Publicar imediatamente (CPT e imagem para vídeo não aceitam rascunhos)

Conjuntos de treinamento CPT e imagem para vídeo não aceitam status de rascunho; eles só podem ser publicados imediatamente durante a criação.
image
  • Upload local
  • Importação OSS
  • Fluxo de retorno de logs
Clique em Upload File para selecionar os arquivos de dados locais. A geração de texto SFT e DPO suporta upload de múltiplos arquivos. O formato do arquivo deve atender aos requisitos do cenário (consulte a seção Data preparation), e os dados importados são criptografados automaticamente com SSE-OSS.

Gerenciamento de versões

Um dataset pode ter várias versões independentes, com numeração incremental automática. Na página de detalhes do dataset, clique em Add Version para criar uma nova versão. Ao adicionar uma versão, escolha a estratégia de herança de dados:
  • Inheritance Mode: modifica os dados incrementalmente com base na versão anterior; adequado para iterações menores.
  • Create Mode: reimporta todos os dados; indicado para atualizações em grande escala.
Conjuntos de treinamento CPT não suportam herança de dados; cada nova versão exige novos dados. Versões de dataset em rascunho podem passar por Data Processing (limpeza e aumento de dados) para melhorar a qualidade antes da publicação.
Conjuntos de treinamento CPT não suportam herança de dados; cada nova versão exige novos dados.

Gerenciamento de datasets

Na página de lista Data ManagementData Management > Dataset, visualize todos os datasets, filtre por tipo (conjunto de treinamento/avaliação) e pesquise por nome. Datasets em processo de importação atualizam o status automaticamente a cada 5 segundos, sem necessidade de atualização manual.

Publicar e excluir

A ação Publish é irreversível; versões publicadas não podem ser editadas. A opção Delete em uma versão publicada também é irreversível; apenas versões em rascunho podem ser excluídas. Excluir um dataset inteiro remove todas as suas versões. Todas essas operações são irreversíveis; proceda com cautela.

Editar e exportar

Somente versões em rascunho podem ser editadas online (o conteúdo Prompt/Completion é editável); a edição não está disponível para versões publicadas. Ao exportar datasets, cada tipo possui um formato diferente: conjuntos de treinamento SFT são exportados como .jsonl, conjuntos multimodais como .zip e conjuntos de avaliação como .xlsx. Não é possível exportar datasets vazios.
image
As operações de publicação e exclusão são irreversíveis. Versões publicadas não podem ser editadas; apenas versões em rascunho podem ser excluídas. Proceda com cautela.

Faturamento

O recurso Data Management é gratuito, mas o armazenamento de datasets e recursos downstream geram custos; consulte a página de faturamento do Model Studio para detalhes.
  • Platform OSS storage: as taxas seguem a tabela de faturamento do Model Studio.
  • Mount Cloud Storage: os custos são faturados na própria conta OSS do usuário.
  • Log Backflow: as taxas do SLS incorridas são cobradas na conta do product SLS.
Consulte a documentação de faturamento do Model Studio para verificar os preços mais recentes antes de usar.

Próximas etapas

Depois que um dataset é criado e publicado, ele pode ser utilizado nos seguintes cenários downstream:
  • Após a publicação, o conjunto de treinamento serve para model fine-tuning (SFT/DPO/CPT).
  • Uma vez publicado, o conjunto de avaliação é usado para Model evaluation.
Para conhecer todos os detalhes operacionais de Log backflow (fluxo de autorização, lógica de filtro), consulte o tópico dedicado ao fluxo de retorno de logs. Atualmente, as operações CRUD de dataset são suportadas apenas no console; a API de ajuste fino de modelo pode referenciar IDs de conjuntos de treinamento publicados por meio do parâmetro training_file_ids.
Plano de Tokens
Playground de Modelos
  • Music generation
Inferência do Modelo
Avaliação
Compressão de Modelos
Estatísticas e Monitoramento
Suporte
Training set and evaluation set - Alibaba Cloud Model Studio