Skip to main content

Vídeo de Canto e Atuação a Partir de Imagem – EMO

O EMO gera vídeos dinâmicos de retratos a partir de uma imagem de retrato e um arquivo de áudio com fala humana. Ele é composto por dois modelos: o EMO-detect verifique se a imagem de entrada atende aos requisitos, e o EMO gera o vídeo.

Este documento aplica-se apenas à região China Continental (Beijing). Para utilizar o modelo, é necessário usar a chave de API da região China Continental (Beijing).

Visão geral do modelo

Sobre os modelos

  • O EMO-detect é um modelo de detecção de imagens que verifique se as imagens de entrada atendem aos requisitos de retrato do EMO.
  • O EMO é um modelo de geração de vídeos de retratos que cria vídeos dinâmicos a partir de uma imagem de retrato e um arquivo de áudio com fala humana.

Exemplos de saída

Entrada: imagem de retrato + arquivo de áudioSaída: vídeo dinâmico de retrato
Retrato:Sample audio: Spring Mountain songÁudio: Consulte o vídeo à direitaVídeo:Intensidade do estilo: Ativo ("style_level": "active")
Retrato:Sample 15 - Original imageÁudio: Consulte o vídeo à direitaVídeo:Intensidade do estilo: Normal ("style_level": "normal")
Retrato:WahahaÁudio: Consulte o vídeo à direitaVídeo:Intensidade do estilo: Calmo ("style_level": "calm")
Os exemplos acima foram gerados pelo aplicativo Qwen, que integra o EMO.

Preços e limites de taxa

Modo

Nome do modelo

Preço unitário

Limite de QPS para envio de tarefas

Máximo de tarefas simultâneas

Chamada de modelo

emo-detect-v1

Pagamento conforme o uso:

USD 0,000574 por imagem

5

Sem limite para chamadas síncronas

emo-v1

Pagamento conforme o uso:

  • Vídeo com proporção 1:1: USD 0,011469 por segundo

  • Vídeo com proporção 3:4: USD 0,022937 por segundo

1

Apenas uma tarefa é executada por vez. As demais aguardam na fila.

Pré-requisitos

Ative o serviço e obtenha sua chave de API: Obter sua chave de API e host de API.

Chamar os modelos

  • Para chamar os modelos (pagamento conforme o uso):
    1. Chame o EMO-detect para verifique se sua imagem de entrada atende aos requisitos. Consulte Detecção de imagem EMO para obter detalhes.
    2. Chame o EMO com a imagem original, os parâmetros de região do EMO-detect e um arquivo de áudio com fala humana clara para gerar o vídeo. Consulte Geração de vídeo EMO para obter detalhes.
Referência da API de Geração de Texto
Geração de Imagens
  • FAQ
Geração de Vídeo
Áudio
API em tempo real
Incorporação de Texto
Produção de Modelos
Vídeo de Canto e Atuação a Partir de Imagem – EMO - Alibaba Cloud Model Studio