Hasilkan ucapan, efek suara, dan suara latar secara bersamaan dari deskripsi teks dan audio referensi untuk menciptakan adegan audio yang utuh. Jelajahi contoh dan teknik prompt untuk dialog dan podcast.
Kasus penggunaan
Generasi audio melampaui sekadar mengubah teks menjadi ucapan. Fitur ini dapat menghasilkan ucapan, efek suara, dan suara latar secara bersamaan untuk menciptakan adegan audio yang utuh:
- Ucapan dan dialog: narasi, dialog multi-pembicara, podcast, buku audio, dan drama audio.
- Adegan audio: dialog yang disertai dengan hujan, ombak laut, atau efek suara game.
Contoh
Jelajahi prompt dan audio yang dihasilkan untuk berbagai skenario. Hasil dapat bervariasi antar permintaan dengan prompt yang sama.
| Skenario | Prompt | Audio |
|---|---|---|
| Sulih suara game | ||
| Dialog film |
Menulis prompt
Deskripsikan suara yang diperlukan dalam satu prompt, membedakan dialog dari arahan adegan.
| Elemen | Contoh |
|---|---|
| Tugas | “Pertukaran pembuka antara dua pembawa acara podcast” atau “Adegan drama audio dengan dialog di tengah hujan” |
| Karakter dan suara | “Karakter A memiliki suara pria yang rendah; karakter B memiliki suara wanita yang cerah” |
| Dialog | Letakkan baris ucapan dalam tanda kutip dan identifikasi pembicaranya |
| Penyampaian | “Berbisik”, “terdengar terkejut”, atau “jeda sejenak sebelum melanjutkan” |
| Latar belakang dan efek | “Hujan di luar jendela dengan suara membalik halaman yang pelan di dalam ruangan” |
| Transisi suara | “Langkah kaki mendekat sebelum karakter mulai berbicara” |
Menggunakan audio referensi
Berikan URL audio yang dapat diakses publik atau audio yang dienkode Base64. Gunakan @voice1, @voice2, dan @voice3 dalam prompt untuk merujuk pada klip sesuai urutan yang diberikan.
Sebagai contoh, dengan dua klip referensi:
qwen-audio-3.1-tts-next menerima hingga tiga klip, masing-masing berdurasi tidak lebih dari 30 detik dan berukuran tidak lebih dari 10 MB. Format referensi yang didukung adalah WAV, MP3, dan OGG Opus; PCM mentah tidak didukung. Untuk setiap klip, berikan URL atau data Base64. Layanan harus dapat mengakses URL apa pun yang Anda berikan.
Model yang didukung
| Model | Bahasa | Panjang input maksimum | Durasi output maksimum per permintaan |
|---|---|---|---|
| qwen-audio-3.1-tts-next | Cina dan Inggris | 3,000 karakter | Podcast: 240 detik (4 menit); skenario lain: 120 detik |
Integrasi dan penagihan
- Untuk autentikasi, parameter, dan permintaan audio referensi, lihat Referensi API generasi audio.
- Penagihan menggunakan durasi audio asli yang dihasilkan. Mengubah kecepatan bicara tidak mengubah durasi yang dapat ditagihkan. Lihat Harga model.