Ajuste modelos Qwen no Model Studio por meio da API (HTTP) ou CLI (shell). Três métodos de ajuste são suportados: ajuste fino supervisionado (SFT), pré-treinamento contínuo (CPT) e otimização direta de preferência (DPO).
Pré-requisitos
- Revise Introduction to model fine-tuning para compreender seus conceitos, processo e requisitos de dados.
- Ative o service e obtenha uma chave de API. Get an API key.
- Conceda ao RAM user (RAM user) as permissions necessárias de invocação, treinamento e implantação.
Envie arquivos de ajuste
Preparação de arquivos de ajuste fino
- Conjunto de treinamento SFT
Os parâmetrosnameeweightdo OpenAI não são suportados. Todas as saídas do assistente serão treinadas.
"loss_weight", que define a importância relativa dessa linha durante o treinamento. (Intervalo: 0.0 a 1.0. Um valor maior indica maior importância.)Este parâmetro está disponível para visualização por convite. Para usá-lo, entre em contato com seu gerente de conta.
Você também pode baixar um modelo de dados no console do Model Studio. | Abaixo da área de upload de arquivo na página Create Dataset, você encontra o link para download do data template. |
Faça upload do arquivo de ajuste fino para o Model Studio
- OpenAI-compatible Files API
- O tamanho máximo de um único arquivo é de 300 MB.
- O tamanho total de todos os arquivos não excluídos é limitado a 5 GB.
- É possível armazenar no máximo 100 arquivos não excluídos.
- Os arquivos são armazenados indefinidamente.
Ajuste fino de modelo
Crie uma tarefa de ajuste fino
- HTTP
No Windows CMD, substitua${DASHSCOPE_API_KEY}por%DASHSCOPE_API_KEY%. No PowerShell, use$env:DASHSCOPE_API_KEY.
Parâmetros
Parâmetro | Obrigatório | Tipo | Localização | Descrição |
|---|---|---|---|---|
training_file_ids | Sim | Array | Body | Lista de IDs de arquivo para o conjunto de treinamento. |
validation_file_ids | Não | Array | Body | Lista de IDs de arquivo para o conjunto de validação. |
model | Sim | String | Body | ID do modelo base ou ID de um modelo previamente ajustado. |
hyper_parameters | Não | Map | Body | Hiperparâmetros da tarefa de ajuste fino. Os valores padrão variam conforme o modelo; consulte o console para detalhes específicos. Os parâmetros a seguir são obrigatórios, pois afetam o custo do treinamento: |
training_type | Não | String | Body | Método de ajuste fino. Valores válidos:
|
job_name | Não | String | Body | Nome da tarefa de ajuste fino. |
model_name | Não | String | Body | Nome do modelo ajustado (diferente do ID gerado pelo sistema). |
Resposta
Modelos base (model) e tipos de treinamento (training_type)
Modelos base (model) e tipos de treinamento (training_type)
Modelos suportados
- Singapore
- North China 2 (Beijing)
- Geração de texto
- Compreensão visual (Qwen-VL)
Nome do modelo | Código do modelo | Treinamento SFT com parâmetros completos (sft) | Treinamento SFT eficiente (efficient_sft) |
|---|---|---|---|
Qwen3-14B | qwen3-14b | × | Suportado |
Comparação dos métodos de ajuste fino
Recurso | CPT (Pré-treinamento Contínuo) | SFT (Ajuste Fino Supervisionado) | DPO (Otimização Direta de Preferência) |
|---|---|---|---|
Resumo | Complementa conhecimento (Injeta conhecimento de domínio) | Aprende a executar tarefas (Segue instruções) | Executa tarefas com maior qualidade (Alinha-se às preferências humanas) |
Dados de entrada | Mais de 10 milhões de tokens Texto de domínio não rotulado | Mais de 1.000 entradas Pares "pergunta-resposta" de alta qualidade | Mais de 100 conjuntos Pares de respostas "melhor-pior" para a mesma instrução |
Objetivo principal | Adaptação ao domínio. Aprende vocabulário especializado e fatos. | Ensina ao modelo formatos de conversa e capacidades de execução de tarefas. | Faz com que as saídas do modelo se alinhem melhor aos valores e preferências humanos. |
Método de aprendizado | Aprendizado auto-supervisionado (Prevê a próxima palavra) | Aprendizado supervisionado (Imita o ground truth) | Aprendizado direto de preferência (Aumenta a probabilidade de boas respostas e diminui a de respostas ruins) |
Estágio do modelo | Geralmente antes do SFT | Após o CPT e antes do DPO | Geralmente após o SFT, como etapa final de alinhamento. |
Comparação dos padrões de treinamento
Treinamento com parâmetros completos | Treinamento eficiente (LoRA, recomendado) | |
|---|---|---|
Cenários | • O modelo precisa adquirir novas capacidades • Busca de desempenho global ideal. | • Otimização do desempenho do modelo para cenários específicos. • Cenários sensíveis a custo e tempo. |
Tempo de treinamento | Mais longo, com convergência mais lenta. | Mais curto, com convergência mais rápida. |
hyper_parameters : Configurações suportadas
hyper_parameters : Configurações suportadas
Os parâmetros suportados e seus valores padrão variam conforme o modelo. Para visualizar os valores padrão específicos, acesse o console e selecione o modelo e o método de treinamento .
| Parâmetro | Configuração recomendada | Tipo | Descrição |
|---|---|---|---|
n_epochs(Número de épocas) [Obrigatório] | Tamanho dos dados < 10.000: 3–5Tamanho dos dados > 10.000: 1–2 | Integer | Quantas vezes o modelo itera sobre todo o conjunto de treinamento.Mais épocas aumentam o tempo e o custo do treinamento. |
learning_rate(Taxa de aprendizado) | Use o valor padrão recomendado pelo Model Studio. | Float | Controla o tamanho do passo para atualizações de peso durante o treinamento.
|
freeze_vit(Congelar backbone visual) | Ajuste conforme necessário | Boolean | Congela o backbone visual para que seus pesos não sejam atualizados durante o treinamento. Aplica-se apenas aos modelos Qwen-VL. |
batch_size(Tamanho do lote) [Obrigatório] | Use o valor padrão recomendado pelo Model Studio. | Integer | Número de exemplos de treinamento por iteração. Valores pequenos aumentam significativamente o tempo de treinamento. Os padrões variam conforme o modelo. |
eval_steps(Passos de avaliação) | Ajuste conforme necessário | Integer | Intervalo de passos para avaliar a precisão e a perda do treinamento.Controla a frequência com que Validation Loss e Validation Token Accuracy são reportados. |
logging_steps(Passos de log) | Ajuste conforme necessário | Integer | Intervalo de passos para registrar o progresso do treinamento em log. |
lr_scheduler_type(Agendador de taxa de aprendizado) | Recomendado linear/Inverse_sqrt | String | Estratégia para ajustar a taxa de aprendizado durante o treinamento.Cada estratégia é descrita em Fine-tune a model in the console. |
max_length(Comprimento da sequência) [Obrigatório] | 8192 | Integer | Comprimento máximo da sequência (em tokens) por exemplo de treinamento. Exemplos mais longos são descartados.How to convert between tokens and characters. |
max_split_val_dataset_sample(Amostras máximas do conjunto de validação) | Use o valor padrão recomendado pelo Model Studio. | Integer | Quando "validation_file_ids" não está definido, o conjunto de validação dividido automaticamente pelo Model Studio contém no máximo 1.000 entradas.Este parâmetro não tem efeito quando "validation_file_ids" está definido. |
split(Proporção do conjunto de treinamento) | Use o valor padrão recomendado pelo Model Studio. | Float | Se "validation_file_ids" não estiver definido, o Model Studio divide o arquivo de treinamento: 80% para treinamento, 20% para validação.Quando "validation_file_ids" está definido, este parâmetro não tem efeito. |
warmup_ratio(Proporção de aquecimento) | Use o valor padrão recomendado pelo Model Studio. | Float | Fração dos passos de treinamento usada para aquecimento da taxa de aprendizado (aumento linear de quase zero até a taxa alvo).Estabiliza o início do treinamento limitando grandes atualizações de peso.Muito alta: assemelha-se a uma taxa de aprendizado baixa com mudança mínima de desempenho.Muito baixa: assemelha-se a uma taxa de aprendizado alta e pode degradar o desempenho.
Este parâmetro não tem efeito se o agendador de taxa de aprendizado estiver definido como |
weight_decay(Decaimento de peso) | Use o valor padrão recomendado pelo Model Studio. | Float | Força da regularização L2. Ajuda a preservar a generalização, mas valores excessivamente altos reduzem a eficácia do ajuste fino. |
Parâmetros para ajuste fino eficiente (suportaefficient_sft e dpo_lora)Ao realizar uma segunda rodada de ajuste fino eficiente em um modelo que já passou por esse processo, os parâmetros lora_rank, lora_alpha e lora_dropout devem permanecer consistentes. | |||
lora_rank(Rank LoRA) | 64 | Integer | Rank das matrizes de baixo rank do LoRA. Ranks mais altos podem melhorar os resultados, mas aumentam ligeiramente o tempo de treinamento. |
lora_alpha(Alpha LoRA) | Use o valor padrão recomendado pelo Model Studio. | Integer | Fator de escala para combinar os pesos do modelo base com a correção LoRA.Alpha maior: mais peso para as atualizações LoRA específicas da tarefa.Alpha menor: maior retenção do conhecimento do modelo base. |
lora_dropout(Dropout LoRA) | Use o valor padrão recomendado pelo Model Studio. | Float | Taxa de dropout para as matrizes de baixo rank do LoRA. O padrão equilibra a generalização; valores excessivamente grandes diminuem a eficácia do ajuste fino. |
Parâmetros para publicação de snapshots de parâmetros do modelo (apenas paraefficient_sft e sft) | |||
save_strategy(Estratégia de salvamento de snapshot) | Pode ser definido como epoch ou steps.
| String | Estratégia para salvar snapshots de parâmetros do modelo (checkpoints): epoch (após cada época) ou steps (em um intervalo de passos especificado). |
save_steps(Passos de salvamento) | Se precisar modificar manualmente, defina como um múltiplo inteiro do parâmetro eval_steps. | Integer | Intervalo, em passos de treinamento, entre os salvamentos de snapshot. |
save_total_limit(Limite de salvamento de snapshots) | 10 | Integer | Número máximo de snapshots a serem retidos. Snapshots mais antigos são excluídos automaticamente quando o limite é atingido. |
Consultar um job de fine-tuning
Utilize o job_id retornado na resposta de criação para obter os detalhes do job.
- HTTP
Parâmetros da requisição
Parâmetro | Tipo | Localização | Obrigatório | Descrição |
|---|---|---|---|---|
job_id | String | Path | Sim | ID do job de fine-tuning. |
Resposta de sucesso
Status do job | Descrição |
|---|---|
PENDING | O job aguarda início. |
QUEUING | Job em fila de espera. Apenas um job de fine-tuning executa por vez. |
RUNNING | Execução em andamento. |
CANCELING | Cancelamento em processo. |
SUCCEEDED | Job concluído com sucesso. |
FAILED | Falha na execução do job. |
CANCELED | Job cancelado pelo usuário. |
finetuned_output conterá o ID do modelo pronto para implantação.Obter logs do job de fine-tuning
- HTTP
UtilizeExemplo de resposta:offset(linha inicial) eline(quantidade máxima de linhas retornadas) para paginar a saída de log.
Consultar e publicar checkpoints do modelo
Somente o fine-tuning SFT (efficient_sftesft) permite salvar e publicar checkpoints a partir de estados intermediários de treinamento.
Listar checkpoints de um job de fine-tuning
Parâmetro | Tipo | Localização do parâmetro | Obrigatório | Descrição |
|---|---|---|---|---|
job_id | String | Path Parameter | Sim | ID do job de fine-tuning. |
checkpoint contém o ID do checkpoint, que especifica qual checkpoint publicar na API Model publishing (optional). O campo model_name armazena o ID do modelo usado para implantação. Já o campo finetuned_output na resposta original do job de fine-tuning corresponde ao model_name do checkpoint final.Status | Descrição |
|---|---|
PENDING | Checkpoint pendente de publicação. É necessário publicá-lo pela API Model publishing antes de usá-lo para model deployment and invocation. |
PROCESSING | Publicação do checkpoint em andamento. |
SUCCEEDED | Checkpoint publicado com êxito. Agora está disponível para model deployment and invocation. |
FAILED | Falha ao publicar o checkpoint. |
Publicação do modelo (opcional)
Parâmetro | Tipo | Localização do parâmetro | Obrigatório | Descrição |
|---|---|---|---|---|
job_id | String | Path Parameter | Sim | ID do job de fine-tuning. |
checkpoint_id | String | Path Parameter | Sim | ID do checkpoint a ser publicado. |
model_name | String | Path Parameter | Sim | ID personalizado a ser atribuído ao modelo publicado. |
Outras operações de fine-tuning
Listar jobs de fine-tuning
Cancelar um job de fine-tuning
Cancela um job de fine-tuning em execução.
Excluir um job de fine-tuning
Não é possível excluir um job de fine-tuning enquanto ele estiver em execução.
Implantação e invocação do modelo
Implantação do modelo
Para implantar o modelo, acesse o console de implantação de modelos.
Invocação do modelo
Quando o status da implantação for RUNNING, invoque o modelo ajustado como qualquer outro modelo.
Também é possível obter o Model Code no console de implantação de modelos.
Uso e parâmetros: DashScope API Reference.