Skip to main content
Model playground

Pembuatan audio

Hasilkan ucapan, efek suara, dan suara latar secara bersamaan dari deskripsi teks dan audio referensi untuk menciptakan adegan audio yang utuh. Jelajahi contoh dan teknik prompt untuk dialog dan podcast.

Kasus penggunaan

Generasi audio melampaui sekadar mengubah teks menjadi ucapan. Fitur ini dapat menghasilkan ucapan, efek suara, dan suara latar secara bersamaan untuk menciptakan adegan audio yang utuh:
  • Ucapan dan dialog: narasi, dialog multi-pembicara, podcast, buku audio, dan drama audio.
  • Adegan audio: dialog yang disertai dengan hujan, ombak laut, atau efek suara game.
Untuk mengonversi naskah tetap menjadi ucapan, Anda juga dapat menggunakan Text-to-speech. Gunakan generasi audio ketika Anda perlu mendeskripsikan pembicara dan suara lainnya dalam sebuah adegan.

Contoh

Jelajahi prompt dan audio yang dihasilkan untuk berbagai skenario. Hasil dapat bervariasi antar permintaan dengan prompt yang sama.
SkenarioPromptAudio
Sulih suara game
NPC dialogue for a battle scene in a game. At a temporary aid station on the edge of a battlefield, a medic treats wounded soldiers and calls out over the chaos. Background sounds include distant battle cries, wounded soldiers groaning, and fabric tearing. The medic is a thirty-five-year-old woman with an urgent, resolute voice, full of anxiety and concern, speaking quickly. She shouts in English: "Quick! Get the wounded down here! There's another one! Stay with me. Don't close your eyes! A stretcher! Where's the stretcher? Keep pressure on the wound! A medic is on the way! All of you, hang in there!"
Dialog film
An English-language film scene on an almost empty railway platform at night. Rain ticks against a metal roof, and an idling train rumbles in the distance. Owen, a man around thirty with a tired, low voice, speaks to his older sister Ruth, whose voice is firm but trembling underneath. Owen says quietly, "You didn't have to come." Ruth replies, "You left your scarf." A brief rustle of fabric. Owen gives a faint, breathy laugh. "It's summer." Ruth says, "It gets cold where you're going." A departure whistle sounds far away. Owen's voice softens: "I'll call when I get there." Ruth takes a breath and answers, "Call before that." Footsteps move toward the train; keep the rain audible as the dialogue ends. No narrator and no background score.
Deskripsikan suara yang diperlukan dalam satu prompt, membedakan dialog dari arahan adegan.
ElemenContoh
Tugas“Pertukaran pembuka antara dua pembawa acara podcast” atau “Adegan drama audio dengan dialog di tengah hujan”
Karakter dan suara“Karakter A memiliki suara pria yang rendah; karakter B memiliki suara wanita yang cerah”
DialogLetakkan baris ucapan dalam tanda kutip dan identifikasi pembicaranya
Penyampaian“Berbisik”, “terdengar terkejut”, atau “jeda sejenak sebelum melanjutkan”
Latar belakang dan efek“Hujan di luar jendela dengan suara membalik halaman yang pelan di dalam ruangan”
Transisi suara“Langkah kaki mendekat sebelum karakter mulai berbicara”
Mulailah dengan dialog dan suara inti, lalu tambahkan instruksi gaya yang diperlukan. Gunakan nama karakter yang konsisten dan hindari instruksi suara atau emosi yang bertentangan. Gunakan instruksi pengurutan untuk mendeskripsikan transisi antar suara.

Menggunakan audio referensi

Berikan URL audio yang dapat diakses publik atau audio yang dienkode Base64. Gunakan @voice1, @voice2, dan @voice3 dalam prompt untuk merujuk pada klip sesuai urutan yang diberikan. Sebagai contoh, dengan dua klip referensi:
@voice1 cheerfully says: "What a lovely day." @voice2 laughs nearby.
qwen-audio-3.1-tts-next menerima hingga tiga klip, masing-masing berdurasi tidak lebih dari 30 detik dan berukuran tidak lebih dari 10 MB. Format referensi yang didukung adalah WAV, MP3, dan OGG Opus; PCM mentah tidak didukung. Untuk setiap klip, berikan URL atau data Base64. Layanan harus dapat mengakses URL apa pun yang Anda berikan.

Model yang didukung

ModelBahasaPanjang input maksimumDurasi output maksimum per permintaan
qwen-audio-3.1-tts-nextCina dan Inggris3,000 karakterPodcast: 240 detik (4 menit); skenario lain: 120 detik
Untuk harga dan batasan, lihat detail model.

Integrasi dan penagihan

  • Untuk autentikasi, parameter, dan permintaan audio referensi, lihat Referensi API generasi audio.
  • Penagihan menggunakan durasi audio asli yang dihasilkan. Mengubah kecepatan bicara tidak mengubah durasi yang dapat ditagihkan. Lihat Harga model.
Rencana Token (Team Edition)
Model playground
  • Pembuatan audio
  • Pembuatan musik
Statistik dan Pemantauan
Asset Center
Dukungan layanan
Pembuatan audio - Alibaba Cloud Model Studio