Qwen-Audio-3.1-TTS-Next adalah model AudioGen yang dirancang untuk generasi audio terpadu. Melampaui sistem TTS konvensional yang hanya berfokus pada sintesis ucapan, model ini dapat menghasilkan konten audio lengkap dalam satu kali proses dari input seperti teks, stempel waktu, dan audio referensi, menggabungkan ucapan, efek suara, suara latar, dan lainnya secara mulus. Model ini mendukung berbagai tugas, termasuk TTS multibahasa, ucapan pembicara tunggal, dialog multi-pembicara, podcast, lanskap suara sinematik, audio latar, dan efek suara. Keunggulan utamanya meliputi ucapan yang lebih alami dan ekspresif, identitas suara yang konsisten, kontrol waktu yang fleksibel, dan generasi lanskap suara berkualitas tinggi. Kemampuan ini menjadikannya sangat cocok untuk pembuatan konten, video pendek, podcast, produksi film dan televisi, audio game, dan skenario pembuatan audio profesional lainnya.
Penyedia layanan inferensi
Alibaba Cloud Model Studio menyediakan layanan inferensi untuk model ini.
Kemampuan model
| Kemampuan | Dukungan | Kemampuan | Dukungan |
|---|---|---|---|
| Modalitas input | Teks dan audio referensi | Modalitas output | Audio |
| Bahasa | Cina dan Inggris | Mode output | Non-streaming |
| Format output | WAV, MP3, dan PCM | Audio referensi | URL atau Base64 |
Batas konteks
| Parameter | Nilai |
|---|---|
| Panjang input maksimum | 3,000 karakter |
| Durasi output maksimum per permintaan | Podcast: 240 detik (4 menit); skenario lain: 120 detik |
| Jumlah audio referensi | Hingga 3 klip |
| Durasi per klip referensi | Hingga 30 detik |
| Ukuran per klip referensi | Hingga 10 MB |
| Format audio referensi | WAV, MP3, dan OGG Opus. PCM mentah tidak didukung. |
Harga model
Daftar harga berikut tidak termasuk promosi. Untuk penawaran promosi, lihat konsol Model Studio.
- Tiongkok (Beijing)
| Item penagihan | Harga satuan (USD/juta token) |
|---|---|
| Input | 0.848 |
| Output | 1.696 |
Batas laju
- Tiongkok (Beijing)
| Metrik | Nilai |
|---|---|
| Permintaan per detik (RPS) | 3 |