Skip to main content
Geração de Vídeo

Video Generation - Create a Tuning Job

Crie um job de treinamento para ajuste fino de modelos de geração de vídeo. É possível enviar datasets via api ou montá-los a partir do OSS.

Pré-requisitos

  • Regiões suportadas: Os recursos descritos neste tópico estão disponíveis apenas na região Singapore. Utilize uma API Key desta região.
  • Permissões da conta: Se você utiliza uma Alibaba Cloud sub-account (RAM user), conceda à subconta as permissões necessárias para invocação, treinamento e implantação de modelos.
  • Configuração de variáveis de ambiente: Você já obteve uma API Key e a configurou como variável de ambiente.
  • Preparação: Leia o tópico Fine-tuning video generation models para compreender os modelos suportados para ajuste fino, as etapas do processo, os formatos de dados e o faturamento.

Criar um job de ajuste fino

China (Beijing)

POST https://dashscope.aliyuncs.com/api/v1/fine-tunes
  • Singapore
POST https://dashscope-intl.aliyuncs.com/api/v1/fine-tunes
No Windows CMD, substitua $DASHSCOPE_API_KEY por %DASHSCOPE_API_KEY% . No PowerShell, utilize $env:DASHSCOPE_API_KEY

Parâmetros da Requisição

curl --location 'https://dashscope-intl.aliyuncs.com/api/v1/fine-tunes' \
    --header "Authorization: Bearer $DASHSCOPE_API_KEY" \
    --header 'Content-Type: application/json' \
    --data '{
        "model": "wan2.7-i2v",
        "training_file_ids": [
            "<Replace with training dataset file ID>"
        ],
        "training_type": "efficient_sft",
        "hyper_parameters": {
            "n_epochs": 50,
            "batch_size": 1,
            "learning_rate": 2e-5,
            "split": 0.9,
            "max_split_val_dataset_sample": 5,
            "eval_epochs": 20,
            "max_pixels": 102400,
            "save_total_limit": 10,
            "lora_rank": 32,
            "lora_alpha": 32
        }
    }'
Cabeçalhos
Content-Type string (Obrigatório)Valor fixo: application/json
Authorization string (Obrigatório)Autenticação via API Key, formato: Bearer sk-xxxx.
Corpo da Requisição
model string (Obrigatório)Define o modelo base para o ajuste fino.Geração de vídeo a partir de imagem baseada no primeiro quadro:
  • wan2.7-i2v: Recomendado para ajuste fino de primeiro quadro para vídeo; não recomendado para cenários de primeiro e último quadro ou continuação de vídeo.
  • wan2.6-i2v
  • wan2.5-i2v-preview
  • wan2.2-i2v-flash
Geração de vídeo a partir de imagem baseada no primeiro e último quadros:
  • wan2.2-kf2v-flash
training_file_ids array[string] (Condicionalmente obrigatório)Array de IDs de arquivos do dataset de treinamento, com suporte a múltiplos IDs. Utilize este parâmetro ou training_datasets. Caso utilize training_datasets, este parâmetro torna-se desnecessário. Obtenha os IDs dos arquivos através da Upload File api.
validation_file_ids array[string] (Opcional)Array de IDs de arquivos do dataset de validação, com suporte a múltiplos IDs. Utilize este parâmetro ou validation_datasets. Caso utilize validation_datasets, este parâmetro torna-se desnecessário. Se nenhum for fornecido, o sistema dividirá automaticamente o conjunto de treinamento. Obtenha os IDs dos arquivos através da Upload File api.
training_type string (Obrigatório)Tipo de ajuste fino. Atualmente suporta apenas efficient_sft (ajuste fino eficiente LoRA).
hyper_parameters object (Opcional)Configuração de hiperparâmetros. Para treinamentos iniciais, recomenda-se o uso dos hiperparâmetros padrão. Se o desempenho do modelo for insatisfatório ou se o treinamento não convergir, tente ajustar parâmetros como n_epochs ou learning_rate.

Propriedades dos hiperparâmetros

batch_size int (Obrigatório)Tamanho do lote. Quantidade de amostras de dados enviadas ao modelo para treinamento simultâneo.Este parâmetro é uma configuração por instância. Recomendamos manter o valor padrão para cada modelo. Evite ajustes sem necessidade.
  • wan2.7-i2v: Valor recomendado: 1.
  • wan2.6-i2v: Valor recomendado: 1.
  • wan2.5-i2v-preview: Valor recomendado: 4.
  • wan2.2-i2v-flash: Valor recomendado: 4.
  • wan2.2-kf2v-flash: Valor recomendado: 4.
O número real de instâncias executando um job de treinamento depende do agendamento da plataforma. A saída Global Step nos logs de treinamento pode divergir das estimativas, mas isso não altera o volume total de dados de treinamento nem afeta o desempenho final do modelo.
n_epochs int (Obrigatório)Número de épocas de treinamento. Valor recomendado: 50.steps = n_epochs × ⌈dataset_size / batch_size⌉. Recomenda-se que o total de steps seja >= 800.Exemplo: Com 5 amostras de dados e batch_size=4, os steps por época serão ceil(5/4) = 2, resultando em um n_epochs mínimo de 800/2 = 400.
  • A quantidade recomendada de épocas de treinamento se ajusta automaticamente conforme o volume de dados. Menos dados exigem mais épocas para aprendizado adequado; volumes maiores contêm mais amostras por época, reduzindo a necessidade de repetições.
  • 50 épocas são indicadas principalmente para pequenos datasets com cerca de 2 amostras; quando o volume atinge 50-60 vídeos, geralmente recomenda-se treinar por aproximadamente 3000-5000 steps.
Este parâmetro impacta o faturamento do treinamento. Defina-o adequadamente.
learning_rate float (Obrigatório)Taxa de aprendizado. Valor recomendado: 2e-5. Controla a magnitude das atualizações dos pesos do modelo. Valores muito altos podem degradar o modelo, enquanto valores muito baixos podem resultar em alterações mínimas.eval_epochs int (Obrigatório)Intervalo de validação. Valor recomendado: 20. Deve ser >= n_epochs/10. Define quantas épocas devem ocorrer entre cada avaliação de validação durante o treinamento.max_pixels int (Obrigatório)Resolução máxima para vídeos de treinamento. Estabelece o limite total de pixels (largura x altura) para a resolução do vídeo. O sistema redimensiona apenas os vídeos que excederem este valor.
  • wan2.7-i2v: Recomendado: 102400. Faixa de valores: 36864 (192x192) a 123904 (352x352).
  • wan2.6-i2v: Recomendado: 36864. Faixa de valores: 16384 (128x128) a 36864 (192x192).
  • wan2.5-i2v-preview: Recomendado: 36864. Faixa de valores: 16384 (128x128) a 36864 (192x192).
  • wan2.2-i2v-flash: Recomendado: 262144. Faixa de valores: 65536 (256x256) a 262144 (512x512).
  • wan2.2-kf2v-flash: Recomendado: 262144. Faixa de valores: 65536 (256x256) a 262144 (512x512).
split float (Opcional)Proporção de divisão do conjunto de treinamento. Valor recomendado: 0,9. Faixa de valores: (0, 1).Efetivo apenas quando validation_file_ids não estiver definido. Este parâmetro divide automaticamente um conjunto de validação a partir do conjunto de treinamento proporcionalmente. Por exemplo, 0,9 significa 90% para treinamento e 10% para validação.max_split_val_dataset_sample int (Opcional)Número máximo de amostras a serem divididas automaticamente do conjunto de treinamento para validação. Valor recomendado: 5. Deve ser >= 1.Efetivo apenas quando validation_file_ids não for especificado. Este parâmetro estabelece um limite superior para o tamanho do conjunto de validação: validation_count = min(total_dataset × (1 - split), max_split_val_dataset_sample)save_total_limit int (Opcional)Limite de salvamento de checkpoints. Valor recomendado: 10. Restringe o número máximo de modelos salvos; o sistema mantém apenas os últimos N checkpoints.lora_rank int (Opcional)Dimensão da matriz de baixa classificação LoRA. Valor recomendado: 32. Este valor determina o tamanho dos parâmetros de ajuste fino; valores maiores oferecem maior capacidade de ajuste, mas reduzem a velocidade de treinamento. Deve ser uma potência de 2n (ex: 16, 32, 64).lora_alpha int (Opcional)Fator de escala de peso LoRA. Valor recomendado: 32. Utilizado para ajustar a influência dos parâmetros ajustados sobre os pesos originais do modelo. Deve ser uma potência de 2n (ex: 16, 32, 64).
training_datasets Array of Dataset (Condicionalmente obrigatório)Lista de arquivos do dataset de treinamento. Utilize este parâmetro ou training_file_ids. Caso utilize training_file_ids, este parâmetro torna-se desnecessário.

Estrutura do Dataset

data_source_type string (Obrigatório)Tipo de source de dados. Valores disponíveis:
  • oss_mount (Montar arquivo OSS)
  • file_id (Arquivo enviado via api de Gerenciamento de Arquivos)
mount_storage object (Condicionalmente obrigatório)Necessário quando o tipo de source de dados é oss_mount. Informações de montagem do OSS.

Propriedades

region string (Obrigatório)Região do Bucket OSS a ser montado. Suporta Beijing (cn-beijing) e Singapore (ap-southeast-1).bucket string (Obrigatório)Nome do Bucket OSS a ser montado.file_path string (Obrigatório)Caminho do arquivo OSS (chave do objeto) a ser montado. Para datasets com múltiplos arquivos, utilize o caminho para data.jsonl. Diferentemente do método file_id, é necessário enviar a pasta descompactada do dataset para o OSS. Arquivos Zip não são suportados.
file_id string (Condicionalmente obrigatório)Necessário quando o tipo de source de dados é file_id. id do arquivo, gerado pela Upload File api.
validation_datasets Array of Dataset (Opcional)Lista de arquivos do dataset de validação. Mesma estrutura de training_datasets.Utilize este parâmetro ou validation_file_ids. Se nenhum for fornecido, o sistema dividirá automaticamente o conjunto de treinamento.
job_name string (Opcional)Nome do job de ajuste fino.
model_name string (Opcional)Nome do modelo após a conclusão do ajuste fino.

Parâmetros da Resposta

  • Exemplo de Resposta de Sucesso
  • Exemplo de Resposta de Erro
Campos principais: output.job_id (id do Job), output.finetuned_output (Nome do novo modelo gerado após o ajuste fino).
{
        "request_id": "0eb05b0c-02ba-414a-9d0c-xxxxxxxxx",
        "output": {
            "job_id": "ft-202511111122-xxxx",
            "job_name": "ft-202511111122-xxxx",
            "status": "PENDING",
            "finetuned_output": "wan2.5-i2v-preview-ft-202511111122-xxxx",
            "model": "wan2.5-i2v-preview",
            "base_model": "wan2.5-i2v-preview",
            "training_file_ids": [],
            "training_datasets": [
                {
                    "data_source_type": "file_id",
                    "file_id": "xxxxxxxxxxxx"
                }
            ],
            "validation_file_ids": [],
            "validation_datasets": [],
            "hyper_parameters": {
                "n_epochs": 50,
                "batch_size": 2,
                "learning_rate": 2.0E-5,
                "split": 0.9,
                "eval_epochs": 20
            },
            "training_type": "efficient_sft",
            "create_time": "2025-11-11 11:22:22"
        }
    }
request_id stringIdentificador único da requisição.
output objectDetalhes do job.

Propriedades

job_id stringIdentificador único do job de ajuste fino, utilizado para consultar detalhes, logs, cancelar ou excluir o job. Regra de geração: ft-{yyyyMMddHHmm}-{4 char uuid}.job_name stringNome do job de ajuste fino.status stringstatus do job de ajuste fino:
  • PENDING: Treinamento pendente.
  • QUEUING: Treinamento em fila (apenas um job de ajuste fino pode ser executado por vez).
  • RUNNING: Treinamento em andamento.
  • SUCCEEDED: Treinamento concluído com sucesso.
  • FAILED: Falha no treinamento.
  • CANCELED: Treinamento cancelado.
  • CANCELING: Cancelamento do treinamento em processo.
finetuned_output stringNovo id do modelo gerado após o ajuste fino, necessário para implantação e invocação. Retornado quando o status do job é SUCCEEDED.model stringModelo base utilizado.base_model stringModelo base utilizado.training_file_ids arrayCampo legado para compatibilidade retroativa, sempre retorna um array vazio para novos jobs. Utilize training_datasets.training_datasets Array of DatasetLista de datasets de treinamento.validation_file_ids arrayCampo legado para compatibilidade retroativa, sempre retorna um array vazio para novos jobs. Utilize validation_datasets.validation_datasets Array of DatasetLista de datasets de validação. Array vazio caso nenhum conjunto de validação seja especificado.hyper_parameters objectHiperparâmetros efetivamente utilizados.training_type stringMétodo de treinamento para ajuste fino do modelo.create_time stringHorário de criação do job.end_time stringHorário de término do job. Retornado quando o status do job é SUCCEEDED, FAILED ou CANCELED.usage integerConsumo de tokens do job de ajuste fino. Retornado quando o status do job é SUCCEEDED ou CANCELED.workspace_id stringid do workspace associado à API Key do Alibaba Cloud Model Studio. Consulte Get the Workspace id.user_identity stringIdentidade do usuário, id da conta Alibaba Cloud.creator stringid da conta Alibaba Cloud do criador.modifier stringid da conta Alibaba Cloud do modificador.group stringGrupo do job de ajuste fino.max_output_cnt integerNúmero máximo de checkpoints salvos durante o treinamento. Equivalente ao valor do hiperparâmetro save_total_limit.
code stringCódigo de erro. Retornado quando a chamada falha. Consulte a tabela de códigos de erro abaixo.
message stringDescrição detalhada do erro. Retornado quando a chamada falha.

Códigos de Erro

Se a chamada falhar e retornar uma mensagem de erro, consulte a tabela abaixo para solução de problemas.

Código de status HTTP

Códigos de Erro

Solução

400

InvalidParameter

Erro de parâmetro: parâmetros ausentes ou problemas de formato. Corrija seus parâmetros com base na mensagem de erro.

400

UnsupportedOperation

O recurso não pode ser operado neste estado específico. Aguarde até que o recurso atinja um estado operável antes de executar a operação.

404

NotFound

O recurso a ser consultado/operado não existe. Verifique se o id do recurso está incorreto.

409

Conflict

Já existe uma instância de implantação com o mesmo nome. Especifique um sufixo para diferenciar.

429

Throttling

A criação de recursos atingiu os limites da plataforma. Exclua modelos que não estão mais em uso.

500

InternalError

Erro interno. Registre o request_id e contate os engenheiros da Alibaba Cloud via ticket para solução de problemas.

Próximo Passo

O ajuste fino é uma operação assíncrona. Após chamar esta api, utilize a api Query and Manage Tuning Jobs para verificar o status do job de ajuste fino.
Referência da API de Geração de Texto
Geração de Imagens
  • FAQ
Geração de Vídeo
Áudio
API em tempo real
Incorporação de Texto
Produção de Modelos