Skip to main content

Pembuatan video

Alibaba Cloud Model Studio menyediakan model pembuatan video untuk pembuatan umum (text-to-video, image-to-video, reference-to-video, pengeditan video) dan skenario vertikal (sinkronisasi bibir manusia digital, image-to-action, penukaran karakter video, pembuatan emoji).

Video yang dihasilkan pada halaman Pengalaman Online di konsol Model Studio selalu dilengkapi watermark berupa teks "AI generated" di pojok kanan bawah. Karena persyaratan kepatuhan hukum, watermark ini tidak dapat dinonaktifkan melalui antarmuka konsol. Untuk mendapatkan video tanpa watermark, panggil model pembuatan video Wan melalui API DashScope dengan parameter watermark yang secara default bernilai false (tanpa watermark). Untuk informasi lebih lanjut, lihat Referensi API text-to-video Wan 2.7 dan Referensi API image-to-video Wan 2.7.

Ikhtisar model

Cakupan penerapan layanan
Bandingkan cakupan
Global
Sumber daya komputasi untuk inferensi model dijadwalkan secara global.
Internasional
Sumber daya komputasi untuk inferensi model dijadwalkan secara global, kecuali Tiongkok daratan.
AS
Sumber daya komputasi untuk inferensi model dibatasi hanya untuk AS.
Tiongkok daratan
Sumber daya komputasi untuk inferensi model dibatasi hanya untuk Tiongkok daratan.
WilayahVirginiaSingapuraVirginiaBeijing
Model yang didukungWan - text-to-videoWan - image-to-video - frame pertamaWan - reference-to-videoWan - text-to-videoWan - image-to-videoWan - image-to-video - frame pertamaWan - image-to-video - frame pertama dan terakhirWan - reference-to-videoWan - pengeditan video umumWan - image-to-actionWan - penukaran karakter videoWan - text-to-videoWan - image-to-video - frame pertamaWan - text-to-videoWan - image-to-videoWan - image-to-video - frame pertamaWan - image-to-video - frame pertama dan terakhirWan - reference-to-videoWan - pengeditan video umumWan - manusia digitalWan - image-to-actionWan - penukaran karakter videoAnimateAnyoneEMOLivePortraitEmojiVideoRetalkTransformasi gaya video

Pemilihan model

  • Pembuatan video umum
  • Sinkronisasi bibir manusia digital: Menganimasikan foto statis agar berbicara, bernyanyi, atau bercerita — latar belakang tetap diam sementara wajah, kepala, dan tubuh bergerak.
    • Untuk hasil paling alami, termasuk ekspresi wajah, gerakan kepala, dan tubuh, gunakan Wan - manusia digital. Model ini menggantikan EMO.
    • Untuk video lebih dari 20 detik dengan gerakan kepala sederhana, seperti laporan berita, gunakan LivePortrait.
  • Transfer gerakan video: Fitur ini menjaga latar belakang foto tetap statis dan menganimasikan orang tersebut menggunakan gerakan dari video referensi. Gunakan Wan - image-to-action.
  • Penukaran karakter video: Fitur ini mengganti orang dalam video dengan orang dari gambar sambil mempertahankan latar belakang aslinya. Gunakan Wan - penukaran karakter video.
  • Penggantian tarian: Mengganti penari dalam video dengan orang dari gambar. Untuk kualitas terbaik, gunakan Wan - image-to-action dan Wan - penukaran karakter video. Jika anggaran terbatas, gunakan AnimateAnyone.
  • Penggantian gerakan bibir video: Fitur ini mengganti gerakan bibir dalam video yang ada agar sesuai dengan audio baru. Gunakan VideoRetalk.
  • Pembuatan emoji: Fitur ini membuat emoji menggunakan templat bergaya tetap. Gunakan Emoji.
  • Penggambaran ulang video: Untuk menggunakan templat bergaya tetap, gunakan Transformasi gaya video. Untuk menggambarkan gaya secara bebas menggunakan prompt, gunakan Wan - pengeditan video.
  • Pengeditan video: Untuk semua tugas berikut, gunakan Wan - pengeditan video umum.
    • Pengeditan video lokal: Ganti elemen seperti subjek atau pakaian, atau hapus orang yang tidak terlibat.
    • Ekstensi video: Perpanjang video pendek, misalnya dari 1 detik menjadi 5 detik.
    • Ekspansi bingkai video: Ubah video landscape menjadi mode portrait atau isi batas yang hilang.
    • Pembuatan referensi multi-gambar: Gabungkan gambar latar belakang dan subjek untuk membuat video.

Model yang didukung

Wan - text-to-video

Menghasilkan video dari prompt teks. Mendukung input teks dan audio untuk membuat video multi-shot sinematik. Referensi API | Harga model | Coba online: Singapura, Virginia, Beijing
  • Global
  • Internasional
  • AS
  • Tiongkok daratan
Jika Anda memilih cakupan penerapan Global, sumber daya komputasi inferensi model dijadwalkan secara dinamis di seluruh dunia. Data statis disimpan di wilayah yang Anda pilih. Wilayah yang didukung: AS (Virginia), Jerman (Frankfurt), Tiongkok (Hong Kong).

Model

Fitur

Modalitas input

Spesifikasi video output

wan2.6-t2v Direkomendasikan

Video dengan audio

Narasi multi-shot, sinkronisasi audio-video

Teks, audio

Opsi resolusi: 720P, 1080P

Durasi video: 5 s, 10 s, 15 s

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

Input promptVideo output (wan2.6, video multi-shot)
Direkam dari sudut rendah, dalam close-up medium, dengan nada hangat, pencahayaan campuran (cahaya praktis dari lampu meja menyatu dengan cahaya mendung dari jendela), pencahayaan samping, dan komposisi sentral. Di kantor detektif klasik, rak buku kayu dipenuhi berkas kasus lama dan asbak. Lampu meja hijau menerangi berkas kasus yang tersebar di tengah meja. Seekor rubah, mengenakan mantel trench coklat tua dan fedora abu-abu muda, duduk di kursi kulit, bulunya merah, ekornya bertumpu ringan di tepi, jarinya perlahan membalik halaman kuning. Di luar, hujan rintik-rintik turun di bawah langit biru, menggores kaca dengan alur berkelok-kelok. Perlahan ia mengangkat kepalanya, telinganya bergerak sedikit, matanya yang kuning menatap langsung ke kamera, mulutnya bergerak jelas saat berbicara dengan suara halus dan sinis: 'Kasus itu dingin, lebih dingin dari ikan di musim dingin. Tapi setiap ayam punya rahasia, dan aku, untuk satu hal, berniat menemukannya.'

Wan - image-to-video

Model image-to-video Wan ditingkatkan dengan input multimodal (teks/gambar/audio/video) dan mendukung tiga tugas: frame-pertama-ke-video, frame-pertama-dan-terakhir-ke-video, dan kelanjutan video. Referensi API | Harga model | Panduan prompt
  • Internasional
  • Tiongkok Daratan
Jika Anda memilih cakupan penerapan Internasional, sumber daya komputasi inferensi model dijadwalkan secara dinamis di seluruh dunia, kecuali Tiongkok daratan. Data statis disimpan di wilayah yang Anda pilih. Wilayah yang didukung: Singapura.

Model

Features

Input modality

Output video specifications

wan2.7-i2v-2026-04-25 Recommended

Video with audio

First-frame-to-video, first-and-last-frame-to-video, video continuation, video continuation with last frame control

Multi-shot narrative, audio-video synchronization

Text, image, audio, video

Pilihan resolusi: 720P, 1080P

Durasi video: [2s, 15s] (bilangan bulat)

Spesifikasi tetap: 30 fps, MP4 (H.264 encoding)

wan2.7-i2v

Video with audio

First-frame-to-video, first-and-last-frame-to-video, video continuation, video continuation with last frame control

Multi-shot narrative, audio-video synchronization

Text, image, audio, video

Pilihan resolusi: 720P, 1080P

Durasi video: [2s, 15s] (bilangan bulat)

Spesifikasi tetap: 30 fps, MP4 (H.264 encoding)

Wan - image-to-video - frame pertama

Menghasilkan video dari gambar frame pertama yang ditentukan. Model ini menerima teks, gambar frame pertama, dan audio sebagai input untuk menghasilkan video multi-shot sinematik. Referensi API | Harga model | Coba online: Singapura, Virginia, Beijing
  • Global
  • Internasional
  • AS
  • Tiongkok Daratan
Jika Anda memilih cakupan penerapan Global, sumber daya komputasi inferensi model dijadwalkan secara dinamis di seluruh dunia. Data statis disimpan di wilayah yang Anda pilih. Wilayah yang didukung: AS (Virginia), Jerman (Frankfurt), Tiongkok (Hong Kong).

Model

Fitur

Modalitas input

Spesifikasi video output

wan2.6-i2v Direkomendasikan

Video dengan audio

Narasi multi-shot, sinkronisasi audio-video

Teks, gambar, audio

Opsi resolusi: 720P, 1080P

Durasi video: 5 s, 10 s, 15 s

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

Prompt inputGambar frame pertama input dan audioVideo hasil (WAN2.6, video multi-bidikan)
Sebuah adegan seni fantasi urban. Karakter seni grafiti yang dinamis. Seorang remaja yang terbuat dari cat semprot hidup dari dinding beton. Ia melakukan rap bahasa Inggris dengan kecepatan tinggi sambil mengambil pose rapper klasik yang energetik. Adegan ini berlatar di bawah jembatan kereta api perkotaan pada malam hari. Pencahayaan berasal dari satu lampu jalan, menciptakan suasana sinematik dengan energi tinggi dan detail luar biasa. Audio video sepenuhnya terdiri dari rap-nya, tanpa dialog atau kebisingan lainnya.rap-转换自-pngAudio input:

Wan - image-to-video - frame pertama dan terakhir

Menghasilkan video yang secara mulus bertransisi antara gambar frame pertama dan frame terakhir yang ditentukan. Model ini menerima teks, gambar frame pertama dan terakhir, serta audio sebagai input untuk menghasilkan video multi-shot sinematik. Referensi API | Harga model | Coba online
  • Internasional
  • Tiongkok Daratan
Jika Anda memilih cakupan penerapan Internasional, sumber daya komputasi inferensi model dijadwalkan secara dinamis di seluruh dunia, kecuali Tiongkok daratan. Data statis disimpan di wilayah yang Anda pilih. Wilayah yang didukung: Singapura.
ModelFiturModalitas inputSpesifikasi video output
wan2.2-kf2v-flash DirekomendasikanVideo tanpa suara
Stabilitas dan tingkat keberhasilan lebih baik dibandingkan model 2.1.
Teks, gambarOpsi resolusi: 480P, 720P, 1080PDurasi video: 5 detikSpesifikasi tetap: 30 fps, MP4 (encoding H.264)
wan2.1-kf2v-plusVideo tanpa suaraTeks, gambarOpsi resolusi: 720PDurasi video: 5 detikSpesifikasi tetap: 30 fps, MP4 (encoding H.264)
Gambar frame pertama inputInput gambar bingkai terakhirInput promptVideo output
first_frame
last_frame
Gaya realistis. Seekor kucing hitam kecil menatap langit dengan rasa ingin tahu. Kamera mulai dari ketinggian mata, secara bertahap naik, dan berakhir dengan bidikan dari atas ke bawah terhadap tatapan ingin tahu kucing tersebut.

Wan - reference-to-video

Memainkan aksi karakter dari video yang ditentukan. Input video dan prompt teks untuk menghasilkan video output yang mempertahankan konsistensi karakter. Referensi API | Harga model
  • Global
  • Internasional
  • Tiongkok daratan
Jika Anda memilih cakupan penerapan Global, sumber daya komputasi inferensi model dijadwalkan secara dinamis di seluruh dunia. Data statis disimpan di wilayah yang Anda pilih. Wilayah yang didukung: AS (Virginia), Jerman (Frankfurt), Tiongkok (Hong Kong).

Model

Fitur

Modalitas input

Spesifikasi video output

wan2.6-r2v Direkomendasikan

Video dengan audio

Generasi video peran tunggal/multi-peran

Narasi multi-shot, sinkronisasi audio-video

Teks, video

Opsi resolusi: 720P, 1080P

Durasi video: 5 s, 10 s

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

Video referensi input 1 (peran: gadis kecil)Video referensi input 2 (peran: jam alarm)Prompt inputVideo keluaran (dialog multi-peran)
character1 berkata kepada character2: “Aku akan mengandalkanmu besok pagi!” character2 menjawab: “Kamu bisa mengandalkanku!”

Wan - pengeditan video

Model pengeditan video. Menerima input multimodal teks, gambar, dan video untuk melakukan berbagai tugas pembuatan dan pengeditan video. Referensi API pengeditan video 2.7 | Referensi API pengeditan video 2.1 | Harga model
  • Internasional
  • Tiongkok Daratan
Jika Anda memilih cakupan penerapan Internasional, sumber daya komputasi inferensi model dijadwalkan secara dinamis di seluruh dunia, kecuali Tiongkok daratan. Data statis disimpan di wilayah yang Anda pilih. Wilayah yang didukung: Singapura.

Model

Fitur

Modalitas input

Spesifikasi video output

wan2.7-videoedit Direkomendasikan

Video dengan audio, video tanpa suara (tergantung video input)

Pengeditan berbasis instruksi, migrasi video

Teks, gambar, video

Opsi resolusi: 720P, 1080P

Durasi video: [2 s, 10 s] (integer)

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

wan2.1-vace-plus

Video tanpa suara

Referensi multi-gambar, penggambaran ulang video, pengeditan lokal, ekstensi video, ekspansi bingkai video

Teks, gambar, video

Opsi resolusi: 720P

Durasi video: Hingga 5 detik

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

  • Fitur 1: Referensi multi-gambar
    Gambar referensi input 1 (entitas referensi)Gambar referensi input 2 (latar belakang referensi)Input promptVideo output
    image
    image
    Video menunjukkan seorang gadis berjalan anggun keluar dari kedalaman hutan berkabut kuno. Langkahnya ringan, dan kamera menangkap setiap momen lincahnya. Saat ia berhenti dan melihat sekeliling hutan yang rimbun, senyum kejutan dan sukacita mekar di wajahnya. Momen ini, membeku dalam interaksi cahaya dan bayangan, merekam pertemuannya yang indah dengan alam.
  • Fitur 2: Penggambaran ulang video
    Video inputMasukkan promptVideo output
    Video menunjukkan sebuah mobil hitam bergaya steampunk, dikendarai seorang pria, dihiasi roda gigi dan pipa tembaga. Latar belakangnya adalah pabrik permen berbasis uap dengan elemen retro, menciptakan adegan vintage dan menyenangkan.
  • Fitur 3: Pengeditan video lokal
    Video inputGambar mask input (area putih menunjukkan area pengeditan)Input promptVideo output
    mask
    Video menunjukkan kafe Prancis bergaya Paris di mana seekor singa berjas dengan elegan menyesap kopi. Ia memegang cangkir kopi di satu tangan, menyesap dengan lembut dengan ekspresi puas. Kafenya didekorasi dengan selera tinggi, dengan warna lembut dan pencahayaan hangat menerangi area tempat singa tersebut berada.
  • Fitur 4: Ekstensi video
    Input first video segment (1s)Input promptOutput video (extended video is 5s)
    Seekor dog wearing sunglasses skateboards on a street, 3D cartoon.
  • Fitur 5: Ekspansi bingkai video
    Video inputPrompt inputVideo output
    Seorang wanita elegan bermain biola dengan penuh semangat, dengan orkestra simfoni lengkap di belakangnya.

Wan - manusia digital

Hanya cakupan penerapan layanan Tiongkok daratan yang didukung. Penyimpanan data berada di wilayah akses Beijing. Sumber daya komputasi inferensi model dibatasi hanya untuk Tiongkok daratan.
Sinkronisasi bibir manusia digital menganimasikan seseorang atau karakter kartun dalam gambar agar berbicara, bernyanyi, bercerita, atau tampil. Anda memberikan gambar dan file audio, dan model secara otomatis menghasilkan video dengan gerakan bibir, ekspresi wajah, serta gerakan kepala dan tubuh yang tersinkronisasi. Referensi API deteksi gambar | Referensi API generasi video | Harga model

Model

Features

Input modality

Output description

wan2.2-s2v-detect

Image detection

Image

Status deteksi output: Pass atau Fail

wan2.2-s2v

Video generation

Video with audio

Image, audio

Opsi resolusi: 480P, 720P

Durasi video: Hingga 20 detik (mengikuti durasi audio)

Spesifikasi yang ditentukan:

  • 480P: 16 fps, MP4 (H.264 encoding)

  • 720P: 30 fps, MP4 (H.264 encoding)

Contoh input (gambar karakter + audio)Video output (sinkronisasi bibir)
mix_input_image
Audio input:

Wan - image to action

Menganimasikan seseorang dari gambar menggunakan gerakan dari video referensi. Anda memberikan gambar dan video, dan model menghasilkan video yang menerapkan gerakan dari video referensi ke orang tersebut, sementara latar belakang gambar asli tetap statis. Referensi API | Harga model
  • Internasional
  • Tiongkok daratan
Jika Anda memilih cakupan penerapan Internasional, sumber daya komputasi inferensi model dijadwalkan secara dinamis di seluruh dunia, kecuali Tiongkok daratan. Data statis disimpan di wilayah yang Anda pilih. Wilayah yang didukung: Singapura.

Model

Fitur

Modalitas input

Spesifikasi video output

wan2.2-animate-move

Video dengan audio, video tanpa suara (tergantung pada video input)

  • Mode Standard wan-std: Generasi cepat, hemat biaya.

  • Mode Professional wan-pro: Hasil lebih realistis.

Image, video

Opsi resolusi: 720P

Durasi video: 2s < duration < 30s

Spesifikasi yang ditetapkan:

  • Mode Standard wan-std: 15 fps, MP4 (H.264 encoding)

  • Mode Professional wan-pro: 25 fps, MP4 (H.264 encoding)

Gambar karakter inputVideo referensi inputVideo output (mode standarwan-std)Video output (mode profesionalwan-pro)
move_input_image

Wan - penukaran karakter video

Mengganti karakter dalam video dengan karakter dari gambar referensi. Anda memberikan video sumber dan gambar referensi, dan model menghasilkan video output yang mempertahankan latar belakang asli. Fitur ini ideal untuk kasus penggunaan seperti penukaran wajah dan penggantian karakter penuh. Referensi API | Harga model
  • Internasional
  • Tiongkok daratan
Jika Anda memilih cakupan penerapan Internasional, sumber daya komputasi inferensi model dijadwalkan secara dinamis di seluruh dunia, kecuali Tiongkok daratan. Data statis disimpan di wilayah yang Anda pilih. Wilayah yang didukung: Singapura.

Model

Fitur

Modalitas input

Spesifikasi video output

wan2.2-animate-mix

Video dengan audio, video tanpa suara (tergantung video input)

  • Mode standar wan-std: Generasi cepat, hemat biaya.

  • Mode profesional wan-pro: Hasil lebih realistis.

Gambar, video

Opsi resolusi: 720P

Durasi video: 2 s < Durasi < 30 s

Spesifikasi yang ditentukan:

  • Mode standar wan-std: 15 fps, MP4 (encoding H.264)

  • Mode profesional wan-pro: 25 fps, MP4 (encoding H.264)

Video inputGambar karakter input untuk penggantianVideo output (mode standarwan-std)Video output (mode profesionalwan-pro)
mix_input_image

AnimateAnyone

  • Hanya cakupan penerapan layanan Tiongkok daratan yang didukung. Penyimpanan data berada di wilayah akses Beijing. Sumber daya komputasi inferensi model dibatasi hanya untuk Tiongkok daratan.
  • Kami merekomendasikan menggunakan Wan - image-to-action dan Wan - penukaran karakter video sebagai ganti AnimateAnyone. Model-model ini menawarkan kualitas lebih baik, sedangkan AnimateAnyone adalah opsi yang lebih hemat biaya.
Dirancang khusus untuk menari, model ini mengganti penari dalam video dengan seseorang dari gambar. Anda memberikan gambar dan video untuk menghasilkan video output dengan dua cara: 1. Mempertahankan latar belakang gambar. 2. Mempertahankan latar belakang video. Referensi API deteksi gambar | Referensi API generasi templat aksi | Referensi API generasi video | Harga model
ModelFiturModalitas inputDeskripsi output
animate-anyone-detect-gen2Deteksi gambarGambarStatus deteksi output: Lulus atau Gagal
animate-anyone-template-gen2Generasi templat video tari
Menyaring templat aksi dari video tari.
VideoMenghasilkan ID templat aksi tari.
animate-anyone-gen2Generasi videoVideo tanpa suaraGambar, video, ID templat aksi tariOpsi resolusi video: 720PDurasi video: 2 s ≤ durasi ≤ 60 sSpesifikasi tetap: 15 fps, MP4 (encoding H.264)
Gambar karakter inputMasukkan Video TarianVideo output (dihasilkan dengan latar belakang gambar)Video output (dihasilkan dengan latar belakang video)
05-9_16

EMO

  • Hanya cakupan penerapan layanan Tiongkok daratan yang didukung. Penyimpanan data berada di wilayah akses Beijing. Sumber daya komputasi inferensi model dibatasi hanya untuk Tiongkok daratan.
  • Pertimbangkan untuk menggunakan Wan - manusia digital sebagai alternatif untuk EMO. Wan - manusia digital memberikan hasil yang lebih baik, sedangkan EMO adalah opsi yang lebih hemat biaya.
Menghasilkan video bernyanyi dan pertunjukan dari gambar. Anda memberikan gambar dan file audio, dan model secara otomatis menghasilkan video dengan gerakan bibir, ekspresi wajah, dan gerakan kepala yang tersinkronisasi. Referensi API deteksi gambar | Referensi API generasi video | Harga model

Model

Fitur

Modalitas input

Deskripsi output

emo-detect-v1

Deteksi gambar

Gambar

Status deteksi output: Lulus atau Gagal

emo-v1

Generasi video

Video dengan audio

Gambar, audio

Resolusi video:

  • Rasio aspek 1:1: Tetap pada 512 × 512

  • Rasio aspek 3:4: Tetap pada 512 × 704

Durasi video: hingga 60 detik

Spesifikasi tetap: 15 fps, MP4 (encoding H.264)

Contoh input (gambar potret + audio)Video Output (Lip-Sync Bernyanyi)
15_原图Audio input:

LivePortrait

  • Hanya cakupan penerapan layanan Tiongkok daratan yang didukung. Penyimpanan data berada di wilayah akses Beijing. Sumber daya komputasi inferensi model dibatasi hanya untuk Tiongkok daratan.
  • Pertimbangkan untuk menggunakan Wan - manusia digital sebagai alternatif untuk LivePortrait. Wan - manusia digital memberikan hasil kualitas lebih tinggi, sedangkan LivePortrait adalah opsi yang lebih hemat biaya. Perhatikan bahwa LivePortrait cocok untuk menghasilkan video panjang (lebih dari 20 detik).
Menghasilkan video narasi dari gambar dengan menganimasikan orang dalam gambar untuk menyampaikan berita atau bercerita. Anda memberikan Gambar dan file Audio, dan model secara otomatis menghasilkan video dengan gerakan bibir, ekspresi wajah, dan gerakan kepala ringan yang tersinkronisasi. Referensi API deteksi gambar | Referensi API generasi video | Harga model

Model

Features

Input modality

Output description

liveportrait-detect

Image detection

Image

Status deteksi output: Pass atau Fail

liveportrait

Video generation

Video with audio

Image, audio

Resolusi video: Mengikuti gambar input, hingga hampir 4K (4096 × 4096).

Durasi video: 1s < durasi < 180s

Laju frame video: 15 fps ≤ laju frame ≤ 30 fps

Format video: MP4 (H.264 encoding)

Contoh input (gambar potret + audio)Video output (pengisi suara sinkronisasi bibir)
Emoji男孩Audio input:

Emoji

Hanya cakupan penerapan layanan Tiongkok daratan yang didukung. Penyimpanan data berada di wilayah akses Beijing. Sumber daya komputasi inferensi model dibatasi hanya untuk Tiongkok daratan.
Membuat emoji menggunakan templat emoji tetap. Anda memberikan gambar dan ID templat emoji untuk menghasilkan video emoji. Referensi API deteksi gambar |  Referensi API generasi video |  Harga model

Model

Fitur

Modalitas input

Deskripsi output

emoji-detect-v1

Deteksi gambar

Gambar

Status deteksi output: Lulus atau Gagal

emoji-v1

Generasi video

Video tanpa suara

Gambar, ID templat emoji

Resolusi video: Tetap pada 512 × 512

Durasi video: Hingga 5 detik (mengikuti durasi templat)

Spesifikasi tetap: 15 fps, MP4 (encoding H.264)

Masukkan gambar potretVideo output (emoji "jijik")
image.png

VideoRetalk

Hanya cakupan penerapan layanan Tiongkok daratan yang didukung. Penyimpanan data berada di wilayah akses Beijing. Sumber daya komputasi inferensi model dibatasi hanya untuk Tiongkok daratan.
Sinkronisasi bibir: Mengganti gerakan bibir dalam video agar sesuai dengan trek audio baru. Anda memberikan video dan file audio, dan model menghasilkan video output dengan gerakan bibir yang tersinkronisasi. Referensi API |  Harga model

Model

Fitur

Modalitas input

Spesifikasi video output

videoretalk

Video dengan audio

Video, audio

Resolusi video: Mengikuti video input, hingga hampir 2K (2048 × 2048).

Durasi video: 2 s < Durasi < 120 s

Laju frame video: 15 fps ≤ laju frame ≤ 60 fps

Format video: MP4 (encoding H.264)

Contoh input (video siaran karakter + audio)Video output (penggantian sinkronisasi bibir)
Audio input:

Transformasi gaya video

Hanya cakupan penerapan layanan Tiongkok daratan yang didukung. Penyimpanan data berada di wilayah akses Beijing. Sumber daya komputasi inferensi model dibatasi hanya untuk Tiongkok daratan.
Memberikan gaya artistik baru pada video berdasarkan templat gaya yang telah ditentukan. Anda memberikan video dan ID transfer gaya untuk menghasilkan video bergaya ulang. Referensi API |  Harga model
ModelFiturModalitas inputSpesifikasi video output
video-style-transformVideo dengan audio, video tanpa suara
Tergantung pada video input.
ID gaya penggambaran ulang videoResolusi video: Mengikuti video input, hingga hampir 4K (4096 × 4096).Durasi video: Hingga 30 detikLaju frame video: 15 fps ≤ laju frame ≤ 25 fpsFormat video: MP4 (encoding H.264)
Video inputVideo output (transfer gaya: "manga Jepang")
Rencana Token (Team Edition)
Model playground
  • Pembuatan audio
  • Pembuatan musik
Statistik dan Pemantauan
Asset Center
Dukungan layanan
Pembuatan video - Alibaba Cloud Model Studio