O modelo de imagem para vídeo Wan gera um vídeo fluido a partir de uma imagem do primeiro quadro e de um prompt de texto .
Documentos relacionados: Guia do usuário
O modelo, a URL do endpoint e a chave de API devem estar na mesma região. Chamadas entre regiões falham.
As tarefas de imagem para vídeo usam invocação assíncrona (geralmente de 1 a 5 minutos): criar tarefa -> consultar resultados.
Os nomes dos parâmetros do SDK são amplamente consistentes com a API HTTP, seguindo as convenções de cada linguagem.
As tarefas de imagem para vídeo geralmente levam de 1 a 5 minutos. O SDK encapsula o processo de chamada HTTP assíncrona e suporta chamadas síncronas e assíncronas.
Defina o base_http_api_url de acordo com a região do modelo:
Defina o baseHttpApiUrl de acordo com a região do modelo:
Se uma chamada de modelo retornar uma mensagem de erro, consulte Códigos de erro.
R: A imagem do primeiro quadro de entrada (img_url) determina a proporção do vídeo de saída. No entanto, uma proporção exata como 3:4 não é garantida, pois podem ocorrer pequenos desvios.
R: Os vídeos gerados pelos modelos são armazenados no OSS. A API retorna uma URL pública temporária. Para configurar uma lista de permissões de firewall para esta URL de download, observe o seguinte: O armazenamento subjacente pode mudar dinamicamente. Este tópico não fornece uma lista fixa de nomes de domínio do OSS para evitar problemas de acesso causados por informações desatualizadas. Se você tiver requisitos de controle de segurança, entre em contato com seu gerente de conta para obter a lista mais recente de nomes de domínio do OSS.
O Wan 2.7 - imagem para vídeo oferece suporte a conversão do primeiro quadro para vídeo, do primeiro e último quadros para vídeo e continuação de vídeo. Recomendamos esta versão.O recurso de imagem para vídeo (baseado no primeiro quadro) para modelos Wan 2,6 e anteriores suporta apenas a conversão do primeiro quadro para vídeo.
Disponibilidade
O modelo, a URL do endpoint e a chave de API devem estar na mesma região. Chamadas entre regiões falham.
- Selecione um modelo: Confirme a região onde o modelo está disponível.
- Selecione uma URL: Escolha a URL do endpoint correspondente à região. Há suporte para URLs HTTP e do DashScope SDK.
- Configure uma chave de API: Obtenha uma chave de API para a região e, em seguida, configure a chave de API nas variáveis de ambiente.
- Instale o SDK: Para fazer chamadas com o SDK, instale o DashScope SDK.
O código de exemplo neste tópico destina-se à região de Singapura.
Chamada HTTP
As tarefas de imagem para vídeo usam invocação assíncrona (geralmente de 1 a 5 minutos): criar tarefa -> consultar resultados.
Etapa 1: Criar uma tarefa
- Pequim
- Singapura
- Virgínia
- Frankfurt
POST https://dashscope.aliyuncs.com/api/v1/services/aigc/video-generation/video-synthesis- Singapura
- Virgínia
- Pequim
- Frankfurt
POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/video-generation/video-synthesisSubstitua WorkspaceId pelo seu ID do Workspace real.- Após criar a tarefa, use o
task_idretornado para consultar o resultado. Otask_idé válido por 24 horas. Não crie tarefas duplicadas. Em vez disso, use consultas periódicas (polling) para recuperar o resultado. - Para orientações destinadas a iniciantes, consulte Chamar APIs com Postman ou cURL.
Parâmetros da solicitação |
Este recurso é suportado apenas pelos modelos da série Wan2,6.Você pode ativá-lo definindo "prompt_extend": true e "shot_type":"multi". |
Cabeçalhos | |
Content-Type string (Obrigatório)O tipo de conteúdo da solicitação. Deve ser application/json. | |
Authorization string (Obrigatório)Autentica a solicitação com uma chave de API do Model Studio. Exemplo: Bearer sk-xxxx. | |
X-DashScope-Async string (Obrigatório)Ativa o processamento assíncrono. Solicitações HTTP suportam apenas chamadas assíncronas. Deve ser enable. | |
Corpo da solicitação | |
model string (Obrigatório)Nome do modelo. Modelos disponíveis e preços: preços dos modelos.Exemplo: wan2.6-i2v-flash. | |
input object (Obrigatório)Campos de entrada, incluindo o prompt.
Propriedades prompt string (Opcional)Descreve os elementos visuais e características desejados para o vídeo gerado.Suporta chinês e inglês. Cada caractere conta como um. O texto que exceder o limite será truncado. Limites de comprimento por modelo:
string (Opcional)Descreve o que excluir do vídeo, restringindo a saída.Suporta chinês e inglês. Máximo de 500 caracteres; textos mais longos são truncados.Exemplo: baixa resolução, erros, melhor qualidade, baixa qualidade, desfigurado, dedos extras, proporções ruins, etc.img_url string (Obrigatório)A URL ou dados codificados em Base64 da imagem inicial.Restrições de imagem:
string (Opcional)Modelos suportados: Séries Wan2,6 e Wan2,5.A URL do arquivo de áudio. O modelo gera o vídeo usando este áudio.Formatos de entrada suportados:
| |
parameters object (Opcional)Controles para resolução, duração, reescrita inteligente de prompt e marcas d'água.
Propriedades resolution string (Opcional)Especifica a faixa de resolução do vídeo de saída. O modelo dimensiona a saída para uma contagem total de pixels semelhante com base na faixa selecionada. O modelo mantém a proporção da saída o mais próxima possível da imagem de entrada emimg_url. Para detalhes, consulte as Perguntas frequentes.O valor padrão e os valores de enumeração disponíveis para este parâmetro dependem do parâmetro model, conforme abaixo:
integer (Opcional)A duração do vídeo de saída, em segundos. Os valores válidos dependem do parâmetro model:
boolean (Opcional)Indica se a reescrita de prompt deve ser ativada. Quando ativado, um LLM reescreve o prompt de entrada. Isso melhora a qualidade da geração para prompts mais curtos, mas aumenta o tempo de processamento.
string (Opcional)Modelos suportados: Série Wan2,6.Especifica o tipo de tomada do vídeo gerado: uma única tomada contínua ou uma sequência de múltiplas tomadas.Este parâmetro só tem efeito quando "prompt_extend": true.Prioridade do parâmetro: shot_type > prompt. Por exemplo, se shot_type estiver definido como "single", mesmo que o prompt contenha "gerar um vídeo multi-tomada", o modelo ainda produzirá um vídeo de tomada única.Valores válidos:
Use este parâmetro quando precisar de controle estrito sobre a estrutura narrativa, como uma única tomada para demonstrações de produtos ou múltiplas tomadas para curtas-metragens. boolean (Opcional)Modelo suportado: wan2.6-i2v-flash.Especifica se deve gerar um vídeo com som.Prioridade do parâmetro: audio > audio_url. Quando audio=false, a saída ainda será um vídeo silencioso mesmo se uma audio_url for fornecida, e o faturamento será baseado em vídeo silencioso.Valores válidos:
boolean (Opcional)Especifica se deve adicionar uma marca d'água "AI Generated" no canto inferior direito do vídeo.
integer(Opcional)A semente de número aleatório. Faixa de valores: [0, 2147483647].Se não especificado, o sistema gera uma. Para melhor reprodutibilidade, use uma semente fixa.A geração é probabilística. Mesmo com a mesma semente, os resultados podem diferir.Exemplo: 12345. |
Parâmetros de resposta |
Salve o task_id para consultar o status e o resultado da tarefa. |
output objectInformações sobre a saída da tarefa.
Propriedades task_id stringO ID da tarefa. Válido para consultas por 24 horas.task_status stringO status da tarefa.
Valores de enumeração
| |
request_id stringIdentificador único da solicitação para rastreamento e solução de problemas. | |
code stringCódigo de erro. Retornado apenas para solicitações com falha. Consulte Códigos de erro. | |
message stringMensagem de erro detalhada. Retornada apenas para solicitações com falha. Consulte Códigos de erro. |
Etapa 2: Consultar o resultado da tarefa
- China (Pequim)
- Singapura
- Virgínia
- Frankfurt
GET https://dashscope.aliyuncs.com/api/v1/tasks/{task_id}- Singapura
- Virgínia
- China (Pequim)
- Frankfurt
GET https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/tasks/{task_id}Substitua WorkspaceId pelo seu ID do Workspace real.- Recomendação de polling: A geração de vídeo leva vários minutos. Use um mecanismo de consulta periódica com um intervalo razoável, como 15 segundos.
- Transição de estado da tarefa: PENDING → RUNNING → SUCCEEDED ou FAILED.
- Link do resultado: Após o sucesso da tarefa, uma URL de vídeo válida por 24 horas é retornada. Baixe e salve o vídeo em armazenamento permanente, como o OSS.
- Validade do task_id: 24 horas. Após esse período, as consultas retornam o status da tarefa como
UNKNOWN.
Parâmetros da solicitação |
Substitua {task_id} pelo valor task_id retornado pela chamada de API anterior. O task_id é válido para consultas por 24 horas. |
Cabeçalhos | |
Authorization string (Obrigatório)Autentica a solicitação com uma chave de API do Model Studio. Exemplo: Bearer sk-xxxx. | |
Parâmetros de caminho | |
task_id string (Obrigatório)O ID da tarefa. |
Parâmetros de resposta |
As URLs de vídeo são válidas apenas por 24 horas e depois são removidas automaticamente. Salve os vídeos gerados prontamente. |
outputobjectOs detalhes de saída da tarefa.
Propriedades task_id stringO ID da tarefa. Válido para consultas por 24 horas.task_status stringO status da tarefa.
Valores de enumeração
stringO horário em que a tarefa foi enviada. O horário está em UTC+8 e o formato é YYYY-MM-DD HH:mm:ss.SSS.scheduled_time stringO horário em que a tarefa foi executada. O horário está em UTC+8 e o formato é YYYY-MM-DD HH:mm:ss.SSS.end_time stringO horário em que a tarefa foi concluída. O horário está em UTC+8 e o formato é YYYY-MM-DD HH:mm:ss.SSS.video_url stringURL do vídeo gerado. Retornada apenas quando task_status é SUCCEEDED.Válida por 24 horas. O vídeo está no formato MP4 com codificação H.264.orig_prompt stringO prompt de entrada original, correspondente ao parâmetro de solicitação prompt.actual_prompt stringSe prompt_extend for true, o sistema reescreve o prompt e este campo contém a versão otimizada.
stringCódigo de erro. Retornado apenas para solicitações com falha. Consulte Códigos de erro.message stringMensagem de erro detalhada. Retornada apenas para solicitações com falha. Consulte Códigos de erro. | |
usage objectEstatísticas de uso da tarefa, contabilizadas apenas para tarefas bem-sucedidas.
Propriedades
Parâmetros retornados pelos modelos da série wan2,6 input_video_duration integerA duração do vídeo de entrada em segundos. É sempre 0, pois a entrada de vídeo não é suportada atualmente.output_video_duration integerRetornado apenas ao usar modelos wan2.6.A duração do vídeo de saída em segundos. Este valor corresponde a input.duration.duration integerA duração total do vídeo, usada para faturamento.Fórmula de faturamento: duration=input_video_duration+output_video_duration.SR integerRetornado apenas ao usar modelos wan2.6. A faixa de resolução do vídeo gerado. Exemplo: 720.video_count integerO número de vídeos gerados. Fixo em 1.audiobooleanRetornado apenas ao usar o modelo wan2.6-i2v-flash. Indica se a saída é um vídeo com áudio.
Parâmetros retornados pelos modelos das séries wan2,2 e wan2,5 duration integerA duração do vídeo gerado em segundos. Valores possíveis: 5, 10.Fórmula de faturamento: Custo = Duração do vídeo em segundos × Preço unitário.SR integerA resolução do vídeo gerado. Valores possíveis: 480, 720, 1080.video_count integerO número de vídeos gerados. Fixo em 1.
Parâmetros retornados pelos modelos da série wan2,1 video_duration integerA duração do vídeo gerado em segundos. Valores possíveis: 3, 4, 5.Fórmula de faturamento: Custo = Duração do vídeo em segundos × Preço unitário.video_ratio stringA proporção do vídeo gerado. Este valor é sempre "standard".video_count integerO número de vídeos gerados. Fixo em 1. | |
request_id stringIdentificador único da solicitação para rastreamento e solução de problemas. |
Chamadas do DashScope SDK
Os nomes dos parâmetros do SDK são amplamente consistentes com a API HTTP, seguindo as convenções de cada linguagem.
As tarefas de imagem para vídeo geralmente levam de 1 a 5 minutos. O SDK encapsula o processo de chamada HTTP assíncrona e suporta chamadas síncronas e assíncronas.
O tempo de processamento depende da fila de tarefas e do status do serviço.
Python SDK
Defina o base_http_api_url de acordo com a região do modelo:
- Pequim
- Singapura
- Virgínia
- Frankfurt
dashscope.base_http_api_url = 'https://dashscope.aliyuncs.com/api/v1'- Singapura
- Virgínia
- Pequim
- Frankfurt
dashscope.base_http_api_url = 'https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1'Substitua WorkspaceId pelo seu ID do Workspace real.Código de exemplo
- Chamada síncrona
- Chamada assíncrona
Uma chamada síncrona bloqueia até que a geração do vídeo seja concluída. Este exemplo demonstra três métodos de entrada de imagem: URL pública, codificação Base64 e caminho de arquivo local.
Exemplo de solicitação
Exemplo de resposta
A video_url é válida por 24 horas. Baixe o vídeo antes que expire.
Java SDK
Defina o baseHttpApiUrl de acordo com a região do modelo:
- Pequim
- Singapura
- Virgínia
- Frankfurt
Constants.baseHttpApiUrl = "https://dashscope.aliyuncs.com/api/v1";- Singapura
- Virgínia
- Pequim
- Frankfurt
Constants.baseHttpApiUrl = "https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1";Substitua WorkspaceId pelo seu ID do Workspace real.Código de exemplo
- Chamada síncrona
- Chamada assíncrona
Uma chamada síncrona bloqueia até que a geração do vídeo seja concluída. Este exemplo demonstra três métodos de entrada de imagem: URL pública, codificação Base64 e caminho de arquivo local.
Exemplo de solicitação
Exemplo de resposta
A video_url é válida por 24 horas. Baixe o vídeo antes que expire.
Limitações
- Retenção de dados: O
task_ide a URL do vídeo são retidos por 24 horas. Após esse período, não é possível consultá-los ou baixá-los. - Moderação de conteúdo: Todas as entradas (prompts, imagens) e vídeos de saída estão sujeitos à moderação de conteúdo. Violações resultam em um erro
IPInfringementSuspectouDataInspectionFailed. Códigos de erro.
Códigos de erro
Se uma chamada de modelo retornar uma mensagem de erro, consulte Códigos de erro.
Perguntas frequentes
P: Como gerar um vídeo com uma proporção específica?
R: A imagem do primeiro quadro de entrada (img_url) determina a proporção do vídeo de saída. No entanto, uma proporção exata como 3:4 não é garantida, pois podem ocorrer pequenos desvios.
-
Por que ocorrem desvios?
O modelo usa a proporção da imagem de entrada como base e a combina com a contagem total de pixels da faixa de resolução selecionada (
resolution) para calcular a resolução válida mais próxima. Como a largura e a altura de um vídeo devem ser múltiplos de 16, o modelo ajusta a resolução final adequadamente. Consequentemente, a proporção de saída não é garantida como exatamente 3:4, mas estará muito próxima.- Por exemplo, uma imagem de entrada de 750×1000 (proporção 3:4 = 0,75) com
resolutiondefinida como "720P" (um alvo de aproximadamente 920.000 pixels totais) produz uma saída de 816×1104 (proporção ≈ 0,739, aproximadamente 900.000 pixels totais).
- Por exemplo, uma imagem de entrada de 750×1000 (proporção 3:4 = 0,75) com
-
Recomendações:
- Controle a entrada: Para melhores resultados, use uma imagem de primeiro quadro que já tenha a proporção desejada.
- Pós-processamento: Se precisar de uma proporção estrita, corte o vídeo ou adicione barras pretas usando uma ferramenta de edição após a geração.