Kloning suara hanya memerlukan sampel audio berdurasi 10–20 detik untuk menghasilkan suara kustom yang sangat mirip tanpa perlu pelatihan model.
Ikhtisar
Kloning suara dirancang untuk skenario seperti asisten suara personalisasi, siaran eksklusif merek, dan konten audio kustom.
Alibaba Cloud Model Studio menyediakan kemampuan kloning suara melalui rangkaian model berikut:
- Qwen-Audio-TTS / CosyVoice: Buat suara melalui SDK DashScope atau HTTP API. Mendukung sintesis suara . Tersedia di wilayah Beijing dan Singapura.
- Qwen-Audio-Realtime: Qwen-Audio-Realtime adalah model dialog suara real-time (bukan model sintesis suara). Kloning suara digunakan untuk menyesuaikan suara TTS pada respons model dialog. Buat suara melalui SDK DashScope atau HTTP API. Hanya tersedia di wilayah China (Beijing).
- Qwen-TTS: Buat suara melalui HTTP API. Mendukung sintesis suara real-time dan non-real-time. Tersedia di wilayah Beijing dan Singapura.
Prasyarat
- Konfigurasikan Kunci API dan tetapkan sebagai variabel lingkungan.
- Jika Anda memanggil API melalui SDK DashScope, instal SDK terbaru.
- Siapkan file audio: Audio harus memenuhi Persyaratan audio.
Memulai dengan cepat
Kloning suara melibatkan tiga langkah:
- Siapkan audio: Siapkan file audio yang memenuhi Persyaratan audio.
- Buat suara: Panggil API kloning suara untuk mengunggah audio dan membuat suara. Gunakan parameter
target_modeluntuk menentukan model sintesis suara yang akan di-bind. - Sintesis suara dengan suara hasil kloning: Panggil API sintesis suara dengan ID suara yang dikembalikan pada langkah sebelumnya.
Kloning suara Qwen-Audio-TTS
Langkah 1: Buat suara
Panggil API kloning suara untuk mengunggah audio dan membuat suara. Parameter url menentukan URL file audio yang dapat diakses, dan parameter prefix berfungsi sebagai awalan nama suara.
Konfigurasi berikut untuk wilayah Singapura. Untuk menggunakan model di wilayah China (Beijing), ganti domain dengan https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/audio/tts/customization. Ganti {WorkspaceId} dengan ID Ruang Kerja Anda yang sebenarnya.
voice_id yang dikembalikan pada langkah sebelumnya dalam permintaan berikut.
Kloning suara Qwen-Audio-Realtime
Langkah 1: Buat suara
Gunakan SDK DashScope atau HTTP API untuk memanggil API kloning suara, mengunggah audio, dan membuat suara. Parameter target_model menentukan nama model dialog real-time, dan parameter prefix berfungsi sebagai awalan nama suara.
- Python
- cURL
voice_id yang dikembalikan pada langkah sebelumnya ke parameter voice dalam event session.update. Untuk detailnya, lihat Konfigurasi suara.
Kloning suara CosyVoice
Langkah 1: Buat suara
Panggil API kloning suara untuk mengunggah audio dan membuat suara. Parameter url menentukan URL file audio yang dapat diakses, dan parameter prefix berfungsi sebagai awalan nama suara.
Konfigurasi berikut untuk wilayah Singapura. Untuk menggunakan model di wilayah China (Beijing), ganti domain dengan https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/audio/tts/customization. Ganti {WorkspaceId} dengan ID Ruang Kerja Anda yang sebenarnya.
voice_id yang dikembalikan pada langkah sebelumnya dalam permintaan berikut.
Kloning suara Qwen-TTS
Contoh berikut menggunakan file audio lokal voice.mp3. Ganti dengan path file Anda yang sebenarnya saat menjalankan kode.
- Python
- cURL
Persyaratan audio
Kualitas audio input secara langsung menentukan hasil kloning. Rangkaian model yang berbeda memiliki persyaratan audio yang berbeda. Siapkan sampel audio Anda sesuai dengan persyaratan model target Anda.
- Qwen-Audio-TTS / Qwen-Audio-Realtime
- CosyVoice
- Qwen-TTS
Item | Persyaratan |
|---|---|
Format yang didukung | WAV (16-bit), MP3, M4A |
Durasi audio | Disarankan 10–20 detik, maksimal 60 detik |
Ukuran file | ≤ 10 MB |
Laju sampel | ≥ 16 kHz |
Saluran | Mono atau stereo. Untuk audio stereo, hanya saluran pertama yang diproses. Pastikan saluran pertama berisi ucapan yang valid. |
Konten | Audio harus berisi minimal 5 detik ucapan jelas dan berkelanjutan (tanpa suara latar). Bagian sisanya hanya boleh berisi jeda singkat (≤ 2 detik). Hindari musik latar, kebisingan ambient, atau suara lain di seluruh rekaman. Gunakan audio yang direkam dengan kecepatan berbicara normal — jangan unggah rekaman lagu atau bernyanyi. |
Bahasa yang didukung | Bahasa Tionghoa (Mandarin, Kanton, Chongqing, Timur Laut, Gansu, Guizhou, Zhejiang, Hebei, Henan, Hubei, Hunan, Jiangxi, Ningbo, Ningxia, Qingdao, Shaanxi, Shanxi, Shandong, Shanghai, Sichuan, dan dialek Yunnan), Inggris, Jepang, Korea, Rusia, Prancis, Jerman, Portugis, Thailand, Indonesia, Vietnam, Spanyol, Italia, Malaysia, Filipina, dan Arab |
Tips perekaman
Audio input berkualitas tinggi merupakan fondasi untuk mencapai hasil kloning optimal.
Perangkat perekaman
Anda dapat menggunakan smartphone, perekam suara digital, atau perangkat perekaman profesional. Kami merekomendasikan perangkat yang mendukung perekaman laju sampel tinggi (≥ 24 kHz) untuk memenuhi persyaratan audio.
Lingkungan perekaman
Lokasi
- Rekam di ruang kecil tertutup seluas 10 meter persegi atau kurang.
- Utamakan ruangan dengan material penyerap suara seperti busa akustik, karpet, atau gorden.
- Hindari aula terbuka, ruang konferensi, ruang kelas, dan ruang lain dengan gema tinggi.
- Kebisingan eksternal: Tutup pintu dan jendela untuk menghindari gangguan lalu lintas, konstruksi, dan lainnya.
- Kebisingan internal: Matikan AC, kipas angin, ballast lampu neon, dan peralatan lainnya. Anda dapat merekam suara ambient dengan ponsel dan memutarnya dengan volume tinggi untuk mengidentifikasi sumber kebisingan potensial.
- Gema menyebabkan suara menjadi buram dan mengurangi kejelasan.
- Kurangi pantulan dari permukaan halus: tutup gorden, buka pintu lemari pakaian, dan letakkan pakaian atau selimut di atas meja dan lemari.
- Gunakan benda tidak beraturan (seperti rak buku dan furnitur berlapis kain) untuk menciptakan pantulan difus.
Naskah perekaman
- Tidak ada batasan konten khusus. Kami merekomendasikan agar konten disesuaikan dengan kasus penggunaan target Anda.
- Hindari frasa pendek (seperti "halo" atau "ya"). Gunakan kalimat lengkap.
- Pertahankan koherensi semantik dan hindari jeda berulang saat membaca (disarankan minimal 3 detik berkelanjutan tanpa gangguan).
- Pertahankan kecepatan berbicara yang konsisten sepanjang rekaman. Hindari berbicara terlalu cepat di awal atau akhir, yang dapat menyebabkan tersendat selama sintesis.
- Sertakan ekspresi emosional yang sesuai (seperti kehangatan, keramahan, atau keseriusan). Hindari membaca secara mekanis.
- Jangan sertakan konten sensitif (seperti materi politik, pornografi, atau kekerasan). Hal ini akan menyebabkan kloning gagal.
Praktik terbaik
Menggunakan kamar tidur tipikal sebagai contoh, setelah menyelesaikan kontrol kebisingan dan gema:
- Pahami naskah terlebih dahulu, tetapkan nada karakter, dan sampaikan secara alami.
- Pertahankan jarak sekitar 10 cm dari perangkat perekaman untuk menghindari distorsi plosif atau sinyal lemah.
Manage custom voices
Setelah membuat suara, Anda dapat mengkueri dan mengelola suara yang ada melalui API (didukung oleh Qwen-Audio-TTS, Qwen-Audio-Realtime, Qwen-TTS, dan CosyVoice).
- Daftar suara: Ambil daftar semua suara kustom di bawah akun saat ini.
- Dapatkan detail suara (Qwen-Audio-TTS / Qwen-Audio-Realtime / CosyVoice saja): Lihat informasi detail tentang suara tertentu, seperti waktu pembuatan dan model sintesis suara yang di-bind.
- Hapus suara: Hapus suara kustom yang tidak lagi diperlukan untuk mengosongkan kuota.
Kuota dan penagihan
Kuota suara dan pembersihan otomatis
- Batas suara: Setiap akun Alibaba Cloud Model Studio dapat membuat hingga 1.000 suara kustom untuk Qwen-Audio-TTS / Qwen-Audio-Realtime / CosyVoice dan hingga 1.000 untuk Qwen-TTS (kedua kuota dihitung secara independen). Setelah mencapai batas, permintaan pembuatan baru akan gagal dan mengembalikan error. Sistem tidak secara otomatis menghapus suara yang dibuat paling awal. Untuk membuat suara baru, hapus suara yang tidak diperlukan untuk mengosongkan kuota, atau tunggu suara yang tidak digunakan secara otomatis dibersihkan (lihat aturan pembersihan otomatis di bawah).
- Perilaku setelah mencapai batas: Setelah mencapai batas 1.000 suara, panggilan berikutnya ke API pembuatan suara akan mengembalikan error kegagalan. Sistem tidak secara otomatis menghapus suara yang dibuat paling awal untuk memberi ruang. Anda harus secara manual menghapus suara yang tidak diperlukan untuk mengosongkan kuota sebelum dapat terus membuat suara.
- Aturan pembersihan otomatis: Jika suara tidak digunakan untuk permintaan sintesis suara apa pun dalam satu tahun terakhir, sistem akan secara otomatis menghapusnya.
Aturan penagihan
- Qwen-Audio-TTS / Qwen-Audio-Realtime / CosyVoice: Pembuatan suara gratis.
-
Qwen-TTS: Ditagih sebesar $0,01/suara. Pembuatan yang gagal tidak ditagih.
Kuota gratis (hanya tersedia di wilayah Singapura):
- Dalam 90 hari setelah mengaktifkan Alibaba Cloud Model Studio, Anda dapat membuat hingga 1.000 suara secara gratis.
- Pembuatan yang gagal tidak mengurangi kuota gratis.
- Menghapus suara tidak mengembalikan kuota gratis.
- Setelah kuota gratis habis atau periode 90 hari berakhir, pembuatan suara ditagih sebesar $0,01/suara.
Model dan wilayah yang didukung
- Singapura
- China (Beijing)
- Qwen-Audio-TTS: qwen-audio-3.0-tts-plus, qwen-audio-3.0-tts-flash
-
CosyVoice: cosyvoice-v3-plus (
cosyvoice-v3-flashsaat ini tidak mendukung sintesis suara dengan suara hasil kloning di wilayah Singapura. Gunakanqwen-audio-3.0-tts-flashsebagai gantinya.) -
Qwen-TTS:
- Qwen3-TTS-VC-Realtime: qwen3-tts-vc-realtime-2026-01-15 (snapshot terbaru), qwen3-tts-vc-realtime-2025-11-27 (snapshot)
- Qwen3-TTS-VC: qwen3-tts-vc-2026-01-22 (snapshot terbaru)
Referensi API
Referensi API kloning suara
FAQ
T: Dapatkah saya menggunakan suara yang telah dibuat dengan model sintesis suara yang berbeda?
Tidak. Suara di-bind ke model sintesis suara tertentu melalui parameter target_model saat pembuatan dan tidak dapat digunakan lintas model. Jika Anda perlu menggunakan suara dari audio yang sama dengan beberapa model, buat suara terpisah untuk setiap model.