Voice Design memungkinkan Anda membuat voice kustom hanya dari deskripsi bahasa alami, tanpa memerlukan sampel audio.
Voice Design cocok untuk prototipe cepat, produksi konten kreatif, dan pengisi suara karakter game. Alibaba Cloud Model Studio menyediakan Voice Design melalui keluarga model berikut:
Voice Design mengikuti alur kerja tiga langkah: deskripsikan, buat, dan gunakan.
Contoh berikut menunjukkan cara membuat voice CosyVoice dari deskripsi teks dan menggunakannya untuk sintesis suara.
Langkah 1: Buat voice dari deskripsi
Panggil API dengan dua parameter:
Langkah 2: Mensintesis Ucapan dengan Suara yang Didesain
Pada permintaan berikut, gunakan nilai
Contoh berikut menunjukkan cara membuat voice dan menggunakannya untuk sintesis suara.
Deskripsi voice (
Gabungkan dimensi berikut untuk mendeskripsikan voice. Semakin banyak dimensi yang Anda sertakan, semakin akurat hasilnya.
Voice Design mendukung pencantuman daftar voice, melihat detail voice, dan menghapus voice. Untuk titik akhir API dan detail parameter, lihat Referensi API.
Batas total voice: Setiap akun Alibaba Cloud Model Studio memiliki batas terpisah sebanyak 1.000 voice kustom untuk CosyVoice dan 1.000 untuk Qwen-TTS. Kedua kuota dihitung secara independen.
Pembersihan otomatis: Jika voice tidak digunakan dalam permintaan sintesis suara apa pun selama satu tahun, sistem akan menghapusnya secara otomatis.
Referensi API Voice Design
Tidak selalu. Voice Design melibatkan unsur acak, sehingga deskripsi yang sama dapat menghasilkan voice yang sedikit berbeda setiap kali. Hasilkan beberapa voice, dengarkan, lalu pilih yang terbaik.
Saat ini, deskripsi voice (
Voice Design membuat voice dari awal menggunakan deskripsi teks, tanpa memerlukan sampel audio. Fitur ini cocok untuk merancang identitas voice yang benar-benar baru. Voice Cloning mereplikasi voice berdasarkan sampel audio nyata dan cocok untuk mereproduksi voice orang tertentu. Untuk detailnya, lihat Voice cloning.
Ikhtisar
Voice Design cocok untuk prototipe cepat, produksi konten kreatif, dan pengisi suara karakter game. Alibaba Cloud Model Studio menyediakan Voice Design melalui keluarga model berikut:
- CosyVoice: Mendukung sintesis suara dan non-real-time. Tersedia di wilayah Beijing (seri v3.5 dan seri v3).
- Qwen-TTS: Mendukung sintesis suara real-time dan non-real-time dengan batas deskripsi voice yang lebih tinggi (2.048 karakter). Tersedia di wilayah Beijing dan Singapura.
Prasyarat
- Konfigurasikan Kunci API dan tetapkan sebagai Variabel lingkungan.
- Untuk memanggil API melalui SDK DashScope, instal SDK terbaru.
Panduan Cepat Mulai
Voice Design mengikuti alur kerja tiga langkah: deskripsikan, buat, dan gunakan.
- Tulis deskripsi voice: Jelaskan karakteristik voice yang diinginkan dalam bahasa alami. Untuk panduan detail, lihat Tulis deskripsi voice.
- Buat voice: Panggil API Voice Design. Sistem menghasilkan voice berdasarkan deskripsi Anda dan mengembalikan klip audio pratinjau. Dengarkan audio pratinjau sebelum menggunakan voice tersebut di lingkungan produksi.
- Sintesis suara dengan voice tersebut: Panggil API sintesis suara dengan ID voice untuk menghasilkan ucapan.
CosyVoice Voice Design
Contoh berikut menunjukkan cara membuat voice CosyVoice dari deskripsi teks dan menggunakannya untuk sintesis suara.
Langkah 1: Buat voice dari deskripsi
Panggil API dengan dua parameter: voice_prompt untuk deskripsi voice, dan preview_text untuk teks yang dibacakan dalam audio pratinjau.
voice_id yang dikembalikan pada langkah sebelumnya.
Qwen-TTS Voice Design
Contoh berikut menunjukkan cara membuat voice dan menggunakannya untuk sintesis suara.
Dengarkan audio pratinjau sebelum menggunakan voice untuk sintesis guna memastikan hasilnya dan menghindari biaya API yang tidak perlu.
- Python
- cURL
Menulis deskripsi suara
Deskripsi voice (voice_prompt) menentukan kualitas voice yang dihasilkan. Semakin spesifik dan detail deskripsi Anda, semakin sesuai hasilnya dengan ekspektasi Anda.
Persyaratan dan batasan
- Batas panjang: Panjang maksimum
voice_promptbervariasi berdasarkan model: hingga 500 karakter untuk CosyVoice dan hingga 2.048 karakter untuk Qwen-TTS. - Bahasa yang didukung: Deskripsi voice hanya mendukung bahasa Mandarin dan Inggris.
Prinsip utama
- Bersifat spesifik, bukan samar: Gunakan kata-kata yang menggambarkan kualitas suara, seperti "deep," "crisp," atau "fast-paced." Hindari istilah subjektif atau ambigu seperti "nice" atau "normal."
- Bersifat multidimensi, bukan satu dimensi: Deskripsi yang baik mencakup beberapa dimensi (seperti jenis kelamin, usia, dan emosi). Hanya mendeskripsikan "female voice" terlalu luas untuk menghasilkan voice yang khas.
- Bersifat objektif, bukan subjektif: Fokus pada karakteristik fisik dan perseptual suara. Misalnya, gunakan "high-pitched with an energetic tone" daripada "my favorite voice."
- Bersifat orisinal, bukan imitatif: Jelaskan kualitas suara alih-alih meminta peniruan individu tertentu (seperti selebriti atau aktor). Model tidak mendukung peniruan, dan permintaan semacam itu dapat menimbulkan masalah hak cipta.
- Bersifat ringkas, bukan redundan: Hindari pengulangan sinonim atau penambahan pengubah yang tidak berarti. Pastikan setiap kata memiliki tujuan yang jelas.
Dimensi deskripsi
Gabungkan dimensi berikut untuk mendeskripsikan voice. Semakin banyak dimensi yang Anda sertakan, semakin akurat hasilnya.
Dimensi | Contoh |
|---|---|
Gender | Male, female, neutral |
Usia | Child (5-12), teenager (13-18), young adult (19-35), middle-aged (36-55), senior (55+) |
Pitch | High, medium, low, slightly high, slightly low |
Kecepatan | Fast, medium, slow, slightly fast, slightly slow |
Emosi | Cheerful, calm, gentle, serious, lively, composed, soothing |
Karakteristik | Resonant, crisp, husky, mellow, sweet, deep, powerful |
Kasus penggunaan | News broadcast, advertising, audiobook, animation character, voice assistant, documentary narration |
Contoh
- Gaya siaran standar: artikulasi jelas dan tepat dengan pelafalan sempurna
- Voice perempuan muda dan hidup, berkecepatan cepat dengan intonasi naik yang jelas, cocok untuk presentasi produk fesyen
- Voice pria paruh baya tenang dan berkecepatan lambat, dalam dan resonan, cocok untuk membaca berita atau narasi dokumenter
- Perempuan lembut dan bijaksana, sekitar 30 tahun, nada merata, cocok untuk membaca buku audio
- Voice anak lucu, sekitar anak perempuan berusia 8 tahun, ucapan sedikit kekanak-kanakan, cocok untuk pengisi suara karakter animasi
Kelola voice kustom
Voice Design mendukung pencantuman daftar voice, melihat detail voice, dan menghapus voice. Untuk titik akhir API dan detail parameter, lihat Referensi API.
Kuota dan penagihan
Kuota voice dan pembersihan otomatis
Batas total voice: Setiap akun Alibaba Cloud Model Studio memiliki batas terpisah sebanyak 1.000 voice kustom untuk CosyVoice dan 1.000 untuk Qwen-TTS. Kedua kuota dihitung secara independen.
Pembersihan otomatis: Jika voice tidak digunakan dalam permintaan sintesis suara apa pun selama satu tahun, sistem akan menghapusnya secara otomatis.
Aturan penagihan
- CosyVoice: Pembuatan voice gratis.
-
Qwen-TTS: Setiap pembuatan voice dikenai biaya USD 0,2. Pembuatan yang gagal tidak dikenai biaya.
Kuota gratis (Singapura saja):
- Anda mendapatkan 10 pembuatan voice gratis selama 90 hari pertama setelah mengaktifkan Alibaba Cloud Model Studio.
- Pembuatan yang gagal tidak mengurangi kuota gratis.
- Menghapus voice tidak mengembalikan kuota gratis.
- Setelah kuota gratis habis atau periode 90 hari berakhir, pembuatan voice ditagih sebesar USD 0,2 per voice.
Model dan wilayah yang didukung
- Singapura
- China (Beijing)
Untuk memanggil model berikut, pilih Kunci API dari wilayah Singapura:
-
Qwen-TTS:
- Qwen3-TTS-VD-Realtime: qwen3-tts-vd-realtime-2026-01-15 (latest snapshot), qwen3-tts-vd-realtime-2025-12-16 (snapshot)
- Qwen3-TTS-VD: qwen3-tts-vd-2026-01-26 (latest snapshot)
- CosyVoice Voice Design didukung oleh model FunAudioGen-VD.
- Teks deskripsi (prompt) yang sama dapat menghasilkan voice yang sedikit berbeda setiap kali. Hasilkan beberapa voice dan pilih yang terbaik.
Referensi API
Referensi API Voice Design
FAQ
Apakah deskripsi voice yang sama selalu menghasilkan voice yang sama?
Tidak selalu. Voice Design melibatkan unsur acak, sehingga deskripsi yang sama dapat menghasilkan voice yang sedikit berbeda setiap kali. Hasilkan beberapa voice, dengarkan, lalu pilih yang terbaik.
Bahasa apa saja yang didukung untuk deskripsi voice?
Saat ini, deskripsi voice (voice_prompt) hanya mendukung bahasa Mandarin dan Inggris. Namun, voice yang dihasilkan dapat mensintesis ucapan dalam berbagai bahasa.