Os datasets são a base para o treinamento e a avaliação de modelos. O recurso Data Management do Alibaba Cloud Model Studio ajuda você a criar e gerenciar datasets com eficiência.
Visão geral dos datasets
O recurso Data Management do Alibaba Cloud Model Studio gerencia centralmente todos os datasets relacionados a grandes modelos no seu workspace de negócios. Os datasets dividem-se em Training Set (usado para model fine-tuning, com suporte a SFT/DPO/CPT) e Evaluation Set (usado para Model evaluation).
Os conjuntos de treinamento abrangem quatro cenários: geração de texto, compreensão multimodal, imagem para vídeo (primeiro quadro) e imagem para vídeo (primeiro e último quadro). Já os conjuntos de avaliação suportam apenas o cenário de geração de texto. Não é possível alterar o tipo de dataset após a criação; portanto, escolha com cuidado conforme o uso pretendido.
Os nomes dos datasets podem ter até 50 caracteres (são aceitos caracteres chineses, ingleses, dígitos, sublinhados, hifens e pontos), e as descrições até 200 caracteres. O sistema não permite criar ou publicar datasets vazios. Não há limite para a quantidade de datasets que você pode criar nem para o volume de dados importados.
Os métodos de treinamento DPO/CPT e a montagem de armazenamento em cloud estão disponíveis apenas na região Beijing.
Métodos e cenários de treinamento
Os conjuntos de treinamento oferecem três métodos distintos, cada um com cenários específicos e requisitos mínimos de dados:
- SFT (supervised fine-tuning): ajuste fino supervisionado por instruções que capacita o modelo a resolver tarefas específicas. Recomenda-se pelo menos mil entradas. Disponível em todos os sites.
- DPO (direct preference optimization): treinamento de alinhamento de preferências. Recomenda-se pelo menos cem entradas.
- CPT (continual pre-training): injeção de conhecimento de domínio. Recomenda-se pelo menos 50 milhões de tokens de dados. Não há suporte para status de rascunho nem herança de dados.
Método de treinamento | Finalidade | Volume de dados recomendado | Disponibilidade por site | Suporte a rascunho |
|---|---|---|---|---|
SFT | Ajuste fino supervisionado (ajuste por instruções) | Mais de 1.000 entradas | Todos os sites | Suportado |
DPO | Otimização direta de preferência (alinhamento de preferência) | Mais de 100 entradas | Região Beijing | Suportado |
CPT | Pré-treinamento contínuo (conhecimento de domínio) | 50 milhões de tokens | Região Beijing | Não suportado |
Métodos de importação
Existem três formas de importar datasets, cada uma adequada a diferentes cenários e pré-requisitos:
- Upload Local File: sem pré-requisitos; faça upload direto de arquivos locais, ideal para pequenos lotes de dados.
- OSS Import: adicione a tag
bailian-datahub-access=readao bucket de destino; indicado para grandes volumes de dados. Não compatível com conjuntos de avaliação. - Log Backflow: extrai automaticamente dados de treinamento dos logs de inferência do SLS; exige autorização de uma função vinculada a service, criando um ciclo de melhoria: inferência → dados → ajuste fino.
Método de importação | Pré-requisitos | Cenário aplicável | Compatível com conjunto de avaliação |
|---|---|---|---|
Upload local | Nenhum | Pequenos lotes de dados | Suportado |
Importação OSS | Tag do bucket bailian-datahub-access=read | Grandes lotes de dados | Não suportado |
Fluxo de retorno de logs | Autorização + Filtro de API Key/modelo | Criar dados de treinamento a partir de logs de inferência | Suportado |
Data Preparation
A preparação de dados de alta qualidade é fundamental para os resultados do ajuste fino do modelo. Para os volumes de dados recomendados para cada método de treinamento (geração de texto SFT/DPO/CPT), consulte Tuning data upload rules.
Não existem volumes oficiais recomendados para conjuntos de treinamento de compreensão multimodal e imagem para vídeo; prepare amostras suficientes conforme seu cenário real.
Formato de dados e modelos
Para as especificações de formato de arquivo de dados de cada cenário de treinamento (texto SFT/compreensão multimodal (imagem/vídeo → texto), DPO, CPT, conjuntos de avaliação), consulte Tuning data upload rules.
Na página de criação de dataset do Data Management, baixe o modelo de dados correspondente ao cenário desejado; preparar os dados seguindo essa estrutura evita falhas na importação.
Para estratégias de diversidade e aumento de dados, consulte a documentação model fine-tuning. No caso de conjuntos de avaliação, prepare um conjunto independente e sem sobreposição de dados para avaliar objetivamente a capacidade de generalização do modelo.
Criar um dataset
Antes de criar um dataset, certifique-se de atender aos seguintes pré-requisitos: o service Model Studio deve estar ativado; para importação via OSS, adicione a tag bailian-datahub-access=read ao bucket de destino; para fluxo de retorno de logs, autorize uma função vinculada a service.
Na página de lista Data ManagementData Management > Dataset, clique em Add Dataset e siga estas etapas:
- Insira um nome para o dataset (até 50 caracteres) e uma descrição (até 200 caracteres, opcional).
- Selecione o tipo de dataset: Training Set ou Evaluation Set (não é possível alterar após a criação).
- Escolha o cenário de treinamento: geração de texto, compreensão multimodal, imagem para vídeo (primeiro quadro) ou imagem para vídeo (primeiro e último quadro). Conjuntos de avaliação aceitam apenas geração de texto.
- Defina o método de treinamento: SFT, DPO ou CPT.
- Especifique o local de armazenamento: Platform OSS storage (gratuito, sem limite de volume de dados) ou Mount Cloud Storage (indisponível para conjuntos de avaliação).
- Escolha o método de importação e carregue os dados: upload local, importação OSS ou fluxo de retorno de logs (consulte as descrições nas abas abaixo).
- Configure as opções de publicação: Draft ou Publish. Conjuntos de treinamento CPT e imagem para vídeo não aceitam rascunhos e devem ser publicados imediatamente.
- Clique em Submit para concluir a criação do dataset.
Parâmetro | Descrição | Obrigatório | Descrição do valor |
|---|---|---|---|
Nome do dataset | Identificador do dataset | true | Até 50 caracteres; chinês/inglês/dígitos/sublinhado/hífen/ponto |
Descrição do dataset | Descrição do dataset | Até 200 caracteres | |
Tipo de dataset | Conjunto de treinamento ou avaliação; imutável após criação | true | Training Set/Evaluation Set |
Cenário de treinamento | Cenário de treinamento aplicável aos dados | true | Geração de texto/Compreensão multimodal/Imagem para vídeo (primeiro quadro)/Imagem para vídeo (primeiro e último quadro) |
Método de treinamento | Tipo de algoritmo de treinamento | true | SFT/DPO/CPT |
Local de armazenamento | Método de armazenamento do dataset | true | Platform OSS storage/Montagem de armazenamento em cloud |
Método de importação | Fonte de importação de dados | true | Upload local/Importação OSS/Fluxo de retorno de logs |
Configuração de publicação | Rascunho ou publicação imediata | true | Rascunho/Publicar imediatamente (CPT e imagem para vídeo não aceitam rascunhos) |

- Upload local
- Importação OSS
- Fluxo de retorno de logs
Gerenciamento de versões
Um dataset pode ter várias versões independentes, com numeração incremental automática. Na página de detalhes do dataset, clique em Add Version para criar uma nova versão.
Ao adicionar uma versão, escolha a estratégia de herança de dados:
- Inheritance Mode: modifica os dados incrementalmente com base na versão anterior; adequado para iterações menores.
- Create Mode: reimporta todos os dados; indicado para atualizações em grande escala.
Gerenciamento de datasets
Na página de lista Data ManagementData Management > Dataset, visualize todos os datasets, filtre por tipo (conjunto de treinamento/avaliação) e pesquise por nome. Datasets em processo de importação atualizam o status automaticamente a cada 5 segundos, sem necessidade de atualização manual.
Publicar e excluir
A ação Publish é irreversível; versões publicadas não podem ser editadas. A opção Delete em uma versão publicada também é irreversível; apenas versões em rascunho podem ser excluídas. Excluir um dataset inteiro remove todas as suas versões. Todas essas operações são irreversíveis; proceda com cautela.
Editar e exportar
Somente versões em rascunho podem ser editadas online (o conteúdo Prompt/Completion é editável); a edição não está disponível para versões publicadas. Ao exportar datasets, cada tipo possui um formato diferente: conjuntos de treinamento SFT são exportados como .jsonl, conjuntos multimodais como .zip e conjuntos de avaliação como .xlsx. Não é possível exportar datasets vazios.

Faturamento
O recurso Data Management é gratuito, mas o armazenamento de datasets e recursos downstream geram custos; consulte a página de faturamento do Model Studio para detalhes.
- Platform OSS storage: as taxas seguem a tabela de faturamento do Model Studio.
- Mount Cloud Storage: os custos são faturados na própria conta OSS do usuário.
- Log Backflow: as taxas do SLS incorridas são cobradas na conta do product SLS.
Próximas etapas
Depois que um dataset é criado e publicado, ele pode ser utilizado nos seguintes cenários downstream:
- Após a publicação, o conjunto de treinamento serve para model fine-tuning (SFT/DPO/CPT).
- Uma vez publicado, o conjunto de avaliação é usado para Model evaluation.