Se o desempenho de um modelo não atender às suas expectativas após a aplicação de métodos de otimização, como engenharia de prompt e chamadas de plugin, utilize o ajuste fino de modelos no Alibaba Cloud Model Studio. Essa estratégia central para melhorar o desempenho aprimora significativamente as capacidades do modelo em setores ou cenários de negócios específicos, alinha os resultados às preferências humanas e reduz a latência de saída. O ajuste fino de modelos abrange três métodos de treinamento: ajuste fino supervisionado (SFT), pré-treinamento contínuo (CPT) e otimização direta de preferência (DPO).
Introdução ao ajuste fino de modelos
O ajuste fino de modelos é uma técnica essencial para otimizar o desempenho. Esse processo permite:
- Aprimorar o desempenho do modelo em setores específicos ou para necessidades de negócios particulares
- Reduzir a latência de saída do modelo
- Minimizar alucinações do modelo
- Alinhar o modelo aos valores ou preferências humanas
- Substituir modelos maiores por versões leves ajustadas
Processo de ajuste fino de modelos
Modelos suportados
Modelos suportados
Modelos suportados
- Singapore
- North China 2 (Beijing)
- Geração de texto
- Compreensão visual (Qwen-VL)
Nome do modelo | Código do modelo | Treinamento SFT com parâmetros completos (sft) | Treinamento SFT eficiente (efficient_sft) |
|---|---|---|---|
Qwen3-14B | qwen3-14b | × | Suportado |
Comparação dos métodos de ajuste fino
Recurso | CPT (Pré-treinamento Contínuo) | SFT (Ajuste Fino Supervisionado) | DPO (Otimização Direta de Preferência) |
|---|---|---|---|
Resumo | Complementa conhecimento (Injeta conhecimento de domínio) | Aprende a executar tarefas (Segue instruções) | Executa tarefas com maior qualidade (Alinha-se às preferências humanas) |
Dados de entrada | Mais de 10 milhões de tokens Texto de domínio não rotulado | Mais de 1.000 entradas Pares "pergunta-resposta" de alta qualidade | Mais de 100 conjuntos Pares de respostas "melhor-pior" para a mesma instrução |
Objetivo principal | Adaptação de domínio. Aprende vocabulário especializado e fatos. | Ensina ao modelo formatos de conversa e capacidades de execução de tarefas. | Faz com que as saídas do modelo se alinhem melhor aos valores e preferências humanas. |
Método de aprendizado | Aprendizado auto-supervisionado (Prevê a próxima palavra) | Aprendizado supervisionado (Imita o ground truth) | Aprendizado direto de preferência (Aumenta a probabilidade de boas respostas e diminui a probabilidade de respostas ruins) |
Estágio do modelo | Geralmente antes do SFT | Após o CPT e antes do DPO | Geralmente após o SFT, como etapa final de alinhamento. |
Comparação dos padrões de treinamento
Treinamento com parâmetros completos | Treinamento eficiente (LoRA, recomendado) | |
|---|---|---|
Cenários | • O modelo precisa adquirir novas capacidades • Obtenção de desempenho global ideal. | • Otimização do desempenho do modelo para cenários específicos. • Cenários sensíveis a custos e tempo. |
Tempo de treinamento | Mais longo, com convergência mais lenta. | Mais curto, com convergência mais rápida. |
Faturamento
| Método de faturamento | Pagamento conforme o uso com base na quantidade de dados de treinamento |
| Fórmula de faturamento | Taxa de treinamento do modelo = (Total de tokens nos dados de treinamento + Total de tokens nos dados de treinamento mistos) × Número de épocas × Preço unitário de treinamento (Unidade mínima de faturamento: 1 token)Visualize a taxa estimada de treinamento na parte inferior do Model Fine-tuning console e clique em Billing Details para visualizar o número total de tokens de treinamento, o número de épocas e o preço unitário de treinamento. |
Preço unitário de treinamento
Preço unitário de treinamento
- Singapore
- North China 2 (Beijing)
- Qwen
- Qwen-VL
Model service | Model code | Price |
|---|---|---|
Qwen3-14B | qwen3-14b | $0.0016/1,000 tokens |
Antes de ajustar um modelo
-
Embora o ajuste fino de modelos de geração de texto possa alcançar resultados excelentes em cenários de negócios específicos, ele apresenta as seguintes limitações:
- Consome muito tempo: Isso inclui a criação de um conjunto de dados CPT em grande escala (pelo menos 50 milhões de tokens), a construção de um conjunto de dados SFT eficaz (mais de 1.000 entradas), a coleta de casos negativos suficientes (mais de 100) para montar um conjunto de dados DPO eficiente e a lentidão das iterações de otimização do modelo.
- Custo elevado: Um modelo ajustado só pode ser utilizado após a implantação, e o model deployment billing é alto.
-
O Alibaba Cloud Model Studio recomenda que você tente primeiro usar Prompt Engineering ou Function Calling para personalizar sua aplicação. O ajuste fino de modelo geralmente é o "último recurso" para melhorar o desempenho. Os motivos são:
- Em muitas tarefas, o modelo pode apresentar um desempenho inicial ruim, mas a aplicação de técnicas adequadas de prompt melhora os resultados sem exigir o ajuste fino do modelo.
- A otimização iterativa de prompts e plugins é mais ágil e econômica do que as iterações de ajuste fino do modelo, pois o ajuste fino pode exigir nova coleta, limpeza e otimização de dados, além da análise de casos negativos e pesquisas com clientes.
- Mesmo que você decida realizar o ajuste fino do modelo, o trabalho inicial de engenharia de prompt e otimização de plugins não será desperdiçado. Esse trabalho preliminar pode ser totalmente reutilizado na construção do conjunto de dados de ajuste fino.
Primeiros passos
Ajustar um modelo pelo console
Etapas de ajuste fino | Captura de tela do console |
|---|---|
Etapa 1: Na página Model Fine-tuning, clique em Create Training Task. | Na página Create Training Task, conclua as seguintes configurações:
|
Etapa 2: Configurar o treinamento
Essa combinação oferece tempo de treinamento curto e baixos requisitos de dados. | |
Etapa 3: Configurar os dados
| |
Etapa 4: Configurar os parâmetros de salvamento de snapshot de parâmetros do modelo (checkpoint)
Após a conclusão do ajuste fino do modelo, exporte um snapshot de parâmetros na plataforma Model Studio. Em seguida, implante o modelo no Model Studio com base nesse snapshot de parâmetros. Os snapshots de parâmetros exportados são salvos no armazenamento em nuvem e não podem ser acessados ou baixados. | |
Etapa 5: Clique em "Start Training" e aguarde a conclusão do treinamento do modelo. | |
Etapa 6: Utilize o recurso Deployments do Alibaba Cloud Model Studio para implantar o modelo personalizado treinado. Após a implantação, avalie o modelo ajustado. Para obter mais informações, consulte Model deployment. | |
Processo típico de ajuste fino
Os três métodos de ajuste fino fornecidos pelo Model Studio não são excludentes, mas sim progressivos e complementares.
CPT (opcional) → SFT → DPO (opcional)
-
CPT (pré-treinamento contínuo) - Complementa o conhecimento (modelos gerais possuem conhecimento amplo, porém superficial, o que pode não atender aos requisitos de profundidade e precisão de campos profissionais)
- Modelo financeiro:
Aprende termos financeiros - Modelo médico:
Memoriza patologia de medicamentos - Modelo jurídico:
Compreende artigos legais e precedentes
- Modelo financeiro:
-
SFT (ajuste fino supervisionado) - Aprende a executar tarefas
- Bot de atendimento ao cliente:
Aprende procedimentos de atendimento - Assistente de código:
Aprende paradigmas de programação - Chamada de ferramentas (Agente):
Aprende a usar MCP
- Bot de atendimento ao cliente:
-
DPO (otimização direta de preferência) - Executa tarefas com maior qualidade
- Segurança e responsabilidade:
Rejeita sugestões nocivas - Concisão e eficácia:
Fornece respostas concisas - Objetividade e neutralidade:
Avalia de forma justa e objetiva
- Segurança e responsabilidade:
Formato de dados de ajuste fino
- Conjunto de treinamento SFT
Os parâmetrosnameeweightda OpenAI não são suportados. Todas as saídas do assistente serão treinadas.
"loss_weight", que define a importância relativa dessa linha durante o treinamento. (Intervalo: de 0.0 a 1.0. Um valor maior indica maior importância.)Este parâmetro está disponível em preview por convite. Para utilizá-lo, entre em contato com seu gerente de conta.
Dicas para construção de conjuntos de dados
Requisitos de tamanho do conjunto de dados
Para CPT, o conjunto de dados requer pelo menos 50 milhões de tokens de dados de pré-treinamento de alta qualidade. Para SFT, são necessárias no mínimo 1.000 entradas de dados de ajuste fino de alta qualidade. Para DPO, geralmente são necessárias centenas de entradas de dados de preferência humana. Se os resultados da avaliação do modelo após o ajuste fino dos dados não forem satisfatórios, a maneira mais simples de melhorar é coletar mais dados para treinamento.
Caso não tenha dados suficientes, recomendamos criar uma agent application e usar um índice de base de conhecimento para aprimorar as capacidades do modelo. Em muitos cenários de negócios complexos, também é possível usar uma combinação de ajuste fino de modelo e recuperação de base de conhecimento.
Por exemplo, em um cenário de atendimento ao cliente, utilize o ajuste fino do modelo para resolver questões relacionadas ao tom do agente de atendimento, estilos de expressão e autoconsciência. O conhecimento profissional relacionado ao cenário pode ser introduzido dinamicamente no contexto do modelo por meio de uma base de conhecimento.
O Alibaba Cloud Model Studio recomenda que você primeiro construa e teste uma aplicação de geração aumentada por recuperação (RAG). Após coletar dados suficientes da aplicação, utilize o ajuste fino do modelo para melhorar ainda mais o desempenho.
Também é possível adotar as seguintes estratégias para expandir seu conjunto de dados:
- Utilize um modelo de linguagem grande (LLM) para simular a geração de conteúdo para cenários de negócios específicos, ajudando a gerar mais dados para ajuste fino. (Recomendamos selecionar um modelo maior e de alto desempenho para a geração.)
- Adquira mais dados por diversos meios, como coleta em cenários de aplicação, web scraping, mídias sociais e fóruns online, conjuntos de dados públicos, parceiros e recursos do setor, além de contribuições de usuários.
Diversidade e equilíbrio dos dados
Os requisitos para ajuste fino de modelo variam conforme o cenário. Por exemplo, o profissionalismo é crítico para cenários de negócios específicos, enquanto a versatilidade é mais importante para cenários de perguntas e respostas. Projete os casos de uso de dados com base nos módulos de negócios ou cenários de uso pelos quais o modelo é responsável. Portanto, a eficácia do treinamento depende não apenas do volume de dados, mas também do profissionalismo e da diversidade dos dados para o cenário específico.
Por exemplo, em um cenário de conversa inteligente com IA, um conjunto de dados profissional e diversificado deve incluir os seguintes cenários de negócios:
Negócio específico | Cenários/negócios diversos |
|---|---|
Atendimento ao cliente de e-commerce | Envio de promoções, consulta pré-venda, orientação durante a venda, serviço pós-venda, acompanhamento pós-venda, tratamento de reclamações, etc. |
Serviços financeiros | Consulta de empréstimos, consultoria de investimentos e gestão de patrimônio, serviços de cartão de crédito, gestão de contas bancárias, etc. |
Saúde online | Consulta de sintomas, agendamento de consultas, instruções de visita, consulta de informações sobre medicamentos, dicas de saúde, etc. |
Secretário de IA | Informações de TI, informações administrativas, informações de RH, consultas sobre benefícios aos funcionários, consultas ao calendário da empresa, etc. |
Assistente de viagem | Planejamento de viagens, guias de entrada e saída, consulta sobre seguros de viagem, apresentações sobre costumes e cultura do destino, etc. |
Consultor jurídico corporativo | Revisão de contratos, proteção de propriedade intelectual, verificações de conformidade, perguntas e respostas sobre legislação trabalhista, consultoria para transações internacionais, análise jurídica de casos individuais, etc. |
Divisão dos conjuntos de treinamento e validação
O ajuste fino de modelos está disponível no console.
- Divida automaticamente um conjunto de dados de treinamento completo e amostragem aleatória de uma pequena quantidade de dados para formar um conjunto de validação.
- Escolha fazer upload de um conjunto de dados separado.