Wan-R2V menerima input multimodal (teks, gambar, video, dan audio) untuk menghasilkan video performa. Gunakan prompt untuk menjadikan orang atau objek sebagai karakter utama.
Tautan cepat: Referensi API | Panduan prompt
Sebelum memulai, dapatkan Kunci API dan tetapkan sebagai Variabel lingkungan. Untuk menggunakan SDK, instal SDK DashScope.
Model yang didukung:
Model yang didukung:
Model yang didukung:
Referensi API referensi-ke-video
J: Metode referensi tergantung pada model dan fitur yang digunakan:
J: Hal ini tidak disarankan. Gunakan
Mulai
| Prompt input: Video 1 masuk dari sisi kiri jauh frame. Lalu shot berpindah ke close-up Gambar 1. Video 1 bersandar pada dinding berkarat di sisi kanan dari Gambar 2. Mendengar langkah kaki, ia perlahan memutar kepalanya. Setelah melihat Gambar 1, Video 1 berkata, "Mengapa kamu masih datang?" Gambar 1 menjawab, "Mari kita bicara." | |||
Video masukan (Video 1)Personas | Gambar input (Gambar 1)Karakter referensi | Gambar input (Gambar 2)Latar belakang referensi | Video output (multi-shot, dengan audio) |
| Suara referensi input: | ![]() | ![]() | |
- SDK Python
- SDK Java
- curl
Ketersediaan
- Model yang didukung berbeda-beda tergantung wilayah. Sumber daya diisolasi antar-wilayah. Untuk model yang didukung di setiap wilayah, lihat Konsol Model Studio.
- Saat melakukan panggilan, pastikan model, URL titik akhir, dan Kunci API Anda semuanya berasal dari wilayah yang sama. Panggilan lintas-wilayah akan gagal.
Kode contoh dalam topik ini berlaku untuk wilayah Singapura. Jika Anda menggunakan wilayah lain, lihat Referensi API.
Kemampuan inti (wan2.7)
Referensi gambar tunggal (gambar multi-panel)
Model yang didukung: seri wan2.7.
Deskripsi: Anda dapat menginput gambar multi-panel (storyboard). Model secara otomatis mendeteksi tata letak multi-panel dan menghasilkan video dengan karakter, adegan, dan shot yang konsisten. Anda hanya dapat menginput satu gambar multi-panel dalam satu waktu.
Parameter:
media.type: Atur kereference_image.media.url: URL atau string yang dienkripsi Base64 dari gambar multi-panel.prompt: Jika Anda hanya menyediakan satu gambar atau video referensi, gunakan "reference image" atau "reference video".
| Prompt input: Reference image, gaya film animasi petualangan 3D, karakter chibi dengan tekstur detail, gerakan halus, dan warna cerah. Pertahankan konsistensi karakter dan adegan hutan. Jangan tambahkan teks. Suasana: Petualang, riang, misterius, imajinatif. Karakter: Penjelajah laki-laki: topi bulat, ransel, jubah pendek. Teman: robot kecil terbang berbodi bulat dengan mata bercahaya biru. Adegan: Hutan fantasi dengan akar pohon raksasa, jamur, tanaman merambat, pintu masuk gua harta karun, dan sinar matahari. Storyboard: 1. Wide shot: Pohon tinggi dan sinar cahaya bersilangan di hutan fantasi misterius dan terang. 2. Medium shot: Anak laki-laki mendorong tanaman merambat untuk menjelajah. 3. Medium shot: Robot kecil terbang di sampingnya, memindai ke depan dengan cahaya biru. 4. Close-up: Peta harta karun tua terbuka di tangan anak laki-laki. 5. Close-up: Ia menunjukkan ekspresi bersemangat, matanya berbinar. 6. Action shot: Keduanya melompati akar pohon dan sungai, melanjutkan lebih dalam ke hutan. 7. Medium shot: Peti harta karun berlumut terungkap di balik tanaman merambat. 8. Close-up: Cahaya emas bersinar dari tepi peti harta karun. 9. Final shot: Anak laki-laki dan robot kecil berdiri di depan peti harta karun, saling memandang dengan terkejut, penuh petualangan. | |
| Gambar multi-panel input | Video output |
![]() | |
- SDK Python
- SDK Java
- curl
Pastikan SDK Python DashScope Anda menggunakan versi 1.25.16 atau yang lebih baru. Lihat Instal SDK.
Referensi multi-entitas dan kustomisasi suara
Model yang didukung: seri wan2.7.
Deskripsi: Anda dapat menginput beberapa gambar dan video referensi sebagai materi entitas. Anda juga dapat menentukan suara unik untuk setiap entitas guna mengaktifkan interaksi multi-karakter dan diferensiasi suara.
Parameter:
-
media: Array materi referensi.-
media.type: Mendukungreference_imagedanreference_video. Jumlah total gambar dan video referensi tidak boleh melebihi 5. -
media.url: URL materi. Gambar juga mendukung string yang dienkripsi Base64. -
media.reference_voice(opsional): URL audio untuk menentukan suara entitas. Gunakan ini bersamareference_imageataureference_video. Logika audio: Jikareference_videoberisi audio danreference_voicetidak ditentukan, audio video asli digunakan secara default. Jika keduanya disediakan,reference_voicemenggantikan audio video asli.
-
-
prompt: Rujuk materi referensi dalam prompt sesuai aturan berikut:- Gunakan pengenal seperti Gambar 1, Gambar 2 untuk aset
reference_imagedan Video 1, Video 2 untuk asetreference_video. - Urutan referensi materi ditentukan oleh array
media. Gambar dan video dihitung secara terpisah.
- Gunakan pengenal seperti Gambar 1, Gambar 2 untuk aset
| Prompt input: Video 1 masuk dari sisi kiri jauh frame. Lalu shot berpindah ke close-up Gambar 1. Video 1 bersandar pada dinding berkarat di sisi kanan dari Gambar 2. Mendengar langkah kaki, ia perlahan memutar kepalanya. Setelah melihat Gambar 1, Video 1 berkata, "Mengapa kamu masih datang?" Gambar 1 menjawab, "Mari kita bicara." | |||
Video masukan (Video 1)Karakter referensi | Gambar input (Gambar 1)Personas | Gambar input (Gambar 2)Latar belakang referensi | Video output (multi-shot, dengan audio) |
| Suara referensi input: | ![]() | ![]() | |
- SDK Python
- SDK Java
- curl
Pastikan SDK Python DashScope Anda menggunakan versi 1.25.16 atau yang lebih baru. Lihat Instal SDK.
Referensi multi-entitas dan kontrol frame pertama
Model yang didukung: seri wan2.7.
Deskripsi: Fitur ini menambahkan kontrol frame pertama ke fitur referensi entitas, sehingga memberi Anda lebih banyak kendali atas pencampuran aliran dan konten video.
Parameter:
-
media: Array materi referensi.-
media.type: Mendukungfirst_frame,reference_image, danreference_video. Anda dapat menyediakan maksimal satu gambar frame pertama. Anda harus menyediakan minimal satu gambar atau video referensi. Jumlah total gambar dan video referensi tidak boleh melebihi 5. -
media.url: URL materi. Gambar juga mendukung string yang dienkripsi Base64.
-
-
prompt: Rujuk materi referensi dalam prompt sesuai aturan berikut:- Gunakan "Gambar 1, Gambar 2" untuk merujuk aset
reference_imagedan "Video 1, Video 2" untuk merujuk asetreference_video. - Urutan referensi materi ditentukan oleh array
media. Gambar dan video dihitung secara terpisah. - Anda tidak perlu merujuk frame pertama dalam prompt.
- Gunakan "Gambar 1, Gambar 2" untuk merujuk aset
| Prompt input: Shot overhead planet biru. Kamera secara bertahap memperbesar ke close-up Gambar 1 di planet tersebut. Ia memegang Gambar 2 dan memakannya, sambil berkata, "Mengapa tidak ada yang datang bermain denganku?" | |||
Masukkan frame pertamaFrame pertama referensi | Gambar input (Gambar 1)Entitas referensi | Gambar input (Gambar 2)Objek referensi | Video outputVideo dihasilkan dengan rasio aspek frame pertama |
![]() | ![]() | ![]() | |
- SDK Python
- SDK Java
- curl
Pastikan SDK Python DashScope Anda berada pada versi 1.25.16 atau yang lebih baru. Lihat Instal SDK.
Berikan referensi
- seri wan2.7
Teruskan gambar, video, dan audio referensi ke array
media.Gambar input
-
Jumlah frame pertama: Maksimal satu frame pertama (
media.type=first_frame) diperbolehkan. -
Jumlah gambar referensi: Maksimal lima gambar referensi (
media.type=reference_image) diperbolehkan. Jumlah total gambar dan video referensi tidak boleh melebihi 5. -
Metode input:
- URL publik: Mendukung protokol HTTP atau HTTPS. Contoh: https://xxxx/xxx.png.
-
String yang dienkripsi Base64: Gunakan format
data:{MIME_type};base64,{base64_data}, di mana:- {base64_data}: String yang dienkripsi Base64 dari file gambar.
-
{MIME_type}: Ekstensi MIME (Multipurpose Internet Mail Extensions) dari gambar. Jenis harus sesuai dengan format file.
Format gambar
Jenis MIME
JPEG
image/jpeg
JPG
image/jpeg
PNG
image/png
BMP
image/bmp
WEBP
image/webp
Video input
-
Jumlah video referensi: Maksimal lima video referensi (
media.type=reference_video) diperbolehkan. Jumlah total gambar dan video referensi tidak boleh melebihi 5. -
Metode input:
- URL publik: Mendukung protokol HTTP atau HTTPS. Contoh: https://xxxx/xxx.mp4.
Audio input
-
Batasan: Suara referensi (
media.reference_voice) hanya dapat digunakan denganreference_imageataureference_videountuk menentukan suara bagi peran entitas yang sesuai. -
Metode input:
- URL publik: Mendukung protokol HTTP atau HTTPS. Contoh: https://xxxx/xxx.mp3.
Video output
- Jumlah video: 1.
- Spesifikasi video: Formatnya MP4. Untuk spesifikasi detail, lihat Model yang didukung.
- Periode validitas URL video: 24 jam.
-
Dimensi video:
-
seri wan2.7: Parameter
resolutionmengontrol tingkat resolusi (720p atau 1080p), dan parameterratiomengontrol rasio aspek (16:9, 9:16, 1:1, 4:3, atau 3:4).- Jika gambar frame pertama disediakan, parameter
ratiodiabaikan. Rasio aspek video output mendekati rasio aspek gambar frame pertama. - Jika gambar frame pertama tidak disediakan, rasio aspek ditentukan oleh parameter
ratio. Default-nya 16:9.
- Jika gambar frame pertama disediakan, parameter
-
seri wan2.7: Parameter
Penagihan dan pembatasan laju
- Untuk kuota gratis dan harga satuan, lihat Referensi-ke-video Wan.
- Untuk pembatasan laju model, lihat Wan.
-
Rincian penagihan:
- Gambar input tidak dikenai biaya. Video input dan output ditagih berdasarkan durasi dalam detik.
- Panggilan model yang gagal atau kesalahan pemrosesan tidak dikenai biaya atau mengurangi kuota gratis pengguna baru.
-
Rumus penagihan:
Total durasi yang ditagih (detik) = Durasi yang ditagih video input (detik) + Durasi video output (detik).- Model Seri Wan 2.7
- Model Seri Wan 2.6
Durasi yang ditagih video input: Maksimum 5 detik.Batas pemotongan per video = 5 detik ÷ Jumlah video referensi input (gambar referensi dan gambar frame pertama tidak dihitung). Setiap video ditagih berdasarkanmin(durasi aktual, batas pemotongan). Durasi yang ditagih untuk beberapa video dijumlahkan.- 1 video referensi: Batas pemotongan per video adalah 5 detik.
- 2 video referensi: Batas pemotongan per video adalah 2,5 detik.
- 3 video referensi: Batas pemotongan per video adalah 1,65 detik.
- 4 video referensi: Batas pemotongan per video adalah 1,25 detik.
- 5 video referensi: Batas pemotongan per video adalah 1 detik.
- Contoh: Jika input berupa 2 video referensi + 1 gambar, gambar tidak dihitung. Batas pemotongan dihitung berdasarkan 2 video referensi, yaitu 2,5 detik per video.
Durasi input yang ditagih = min(durasi video 1, 2,5 detik) + min(durasi video 2, 2,5 detik).
Referensi API
Referensi API referensi-ke-video
FAQ
T: Bagaimana cara merujuk materi dalam prompt?
J: Metode referensi tergantung pada model dan fitur yang digunakan:
- seri wan2.7
- Gambar referensi diidentifikasi sebagai Gambar 1, Gambar 2, dan seterusnya. Video referensi diidentifikasi dengan cara serupa. Untuk prompt bahasa Inggris, gunakan pengenal seperti Image 1 dan Video 1.
- Gambar dan video dihitung secara terpisah. Urutannya sesuai dengan urutan materi jenis yang sama dalam array
media. - Jika Anda hanya memiliki satu gambar atau video referensi, Anda dapat menyederhanakan pengenal menjadi "reference image" atau "reference video".
- Umumnya, Anda tidak perlu merujuk gambar frame pertama dalam prompt.
T: Apakah reference_voice dapat digunakan dengan gambar frame pertama?
J: Hal ini tidak disarankan. Gunakan media.reference_voice dengan reference_image atau reference_video untuk menentukan timbre bagi entitas yang sesuai.




