Kloning suara dari rekaman audio berdurasi 10–20 detik tanpa pelatihan. Dokumen ini mencakup parameter dan penggunaan API kloning suara. Untuk pemanggilan model, lihat Qwen-Omni-Realtime atau Non-real-time (Qwen-Omni) .
Persyaratan audio
Input audio berkualitas tinggi menghasilkan kloning yang lebih baik.
Item | Requirement |
|---|---|
Supported formats | WAV (16-bit), MP3, M4A |
Duration | Direkomendasikan 10 hingga 20 detik. Maksimum: 60 detik. |
File size | < 10 MB |
Sample rate | >= 24 kHz |
Channels | Mono |
Content | Audio harus berisi minimal 3 detik ucapan jelas yang berkelanjutan tanpa suara latar. Sisa durasi boleh mencakup jeda singkat (<=2 detik). Hindari musik latar, kebisingan, atau suara lain sepanjang rekaman. Gunakan audio ucapan normal sebagai input. Jangan unggah lagu atau rekaman bernyanyi. |
Languages | Chinese (zh), English (en), German (de), Italian (it), Portuguese (pt), Spanish (es), Japanese (ja), Korean (ko), French (fr), Russian (ru), Thai (th), Indonesian (id), Arabic (ar), Czech (cs), Danish (da), Dutch (nl), Finnish (fi), Hebrew (he), Hindi (hi), Icelandic (is), Malay (ms), Norwegian (no), Persian (fa), Polish (pl), Swedish (sv), Tagalog (tl), Turkish (tr), Urdu (ur), Vietnamese (vi) Dialek Tiongkok: Dongbei, Shannxi, Sichuan, Henan, Changsha, Tianjin, Hangzhou, Liaoning, Shenyang, Anshan |
Memulai dengan cepat
1. Alur kerja
Kloning suara mengikuti alur kerja "buat terlebih dahulu, lalu gunakan":
-
Buat suara
Panggil API Create a voice dan unggah klip audio. Sistem menganalisis audio dan membuat suara kloning kustom. Anda harus menentukan
target_modelpada langkah ini untuk mendeklarasikan model omni mana yang akan menggerakkan suara tersebut. Jika Anda sudah memiliki suara yang dibuat (panggil API List voices untuk memeriksa), lewati langkah ini dan lanjutkan ke langkah berikutnya. -
Gunakan suara dalam percakapan
Panggil API Omni (realtime atau non-realtime) dan masukkan suara yang diperoleh pada langkah sebelumnya. Model omni yang ditentukan pada langkah ini harus sesuai dengan
target_modeldari langkah sebelumnya.
2. Konfigurasi model dan prasyarat
Pilih model dan lengkapi prasyarat sebelum memulai.
Konfigurasi model
Kloning suara memerlukan dua model:
- Model kloning suara: qwen-voice-enrollment
-
Model omni yang menggerakkan suara:
- qwen3.8-omni-flash-realtime
- qwen3.5-omni-plus-realtime
- qwen3.5-omni-flash-realtime
- qwen3.5-omni-plus
- qwen3.5-omni-flash
Prasyarat
- Dapatkan Kunci API: Dapatkan Kunci API. Untuk keamanan, konfigurasikan Kunci API sebagai Variabel lingkungan.
- Instal SDK: Pastikan Anda telah menginstal SDK DashScope terbaru.
- Siapkan audio untuk kloning: Audio harus memenuhi Persyaratan audio.
3. Contoh end-to-end
Contoh ini melakukan kloning suara dan menggunakannya dalam percakapan.
Prinsip utama: target_model yang ditentukan selama kloning harus sesuai dengan model dalam pemanggilan API Omni berikutnya. Jika tidak, sintesis gagal. Ganti file contoh voice.mp3 dengan audio Anda sendiri.
- Realtime
- Non-realtime
Referensi API
Gunakan akun yang sama untuk semua API.
Create a voice
Unggah audio untuk kloning suara dan buat suara kustom.
- URL North China 2 (Beijing):
-
Request headers
Parameter
Type
Required
Description
Authorization
string
Supported
Token otentikasi dalam format
Bearer <your_api_key>. Ganti<your_api_key>dengan Kunci API Anda yang sebenarnya.Content-Type
string
Supported
Jenis media badan permintaan. Atur ke
application/json. - Badan permintaan mencakup semua parameter. Abaikan bidang opsional sesuai kebutuhan. Perhatikan perbedaan antara:
-
Request parameters
Parameter Type Default Required Description model string Supported Model kloning suara. Atur ke qwen-voice-enrollment.action string Supported Jenis aksi. Atur ke create.target_model string Supported Model omni yang menggerakkan suara: - qwen3.8-omni-flash-realtime
- qwen3.5-omni-plus-realtime
- qwen3.5-omni-flash-realtime
- qwen3.5-omni-plus
- qwen3.5-omni-flash
preferred_name string Supported Nama yang mudah dibaca untuk suara. Karakter yang diizinkan: angka, huruf, garis bawah. Maksimum: 16 karakter. Kata kunci ini muncul dalam nama suara akhir. Misalnya, jika kata kunci adalah "guanyu", nama suara yang dihasilkan adalah "qwen-omni-vc-guanyu-voice-20250812105009984-838b".
audio.data string Supported Audio untuk kloning (ikuti Panduan perekaman saat merekam, dan pastikan audio memenuhi Persyaratan audio).Kirimkan data audio dengan salah satu cara berikut: -
Data URL
Format:
data:<mediatype>;base64,<data>-
<mediatype>: Jenis MIME- WAV:
audio/wav - MP3:
audio/mpeg - M4A:
audio/mp4
- WAV:
-
<data>: String yang dienkripsi Base64 dari audio Pengodean Base64 memperbesar ukuran file. Pastikan hasil pengodeannya tidak melebihi 10 MB. -
Contoh:
data:audio/wav;base64,SUQzBAAAAAAAI1RTU0UAAAAPAAADTGF2ZjU4LjI5LjEwMAAAAAAAAAAAAAAA//PAxABQ/BXRbMPe4IQAhl9Lihat contoh kode
-
-
URL audio (kami merekomendasikan mengunggah audio Anda ke OSS)
- Ukuran file tidak boleh melebihi 10 MB.
- URL harus dapat diakses publik tanpa otentikasi.
text string Unsupported Transkrip yang sesuai dengan audio dalam audio.data.Jika disediakan, server memvalidasi audio terhadap teks. Jika ketidaksesuaian terlalu besar, akan dikembalikan Audio.PreprocessError.language string Unsupported Bahasa audio dalam audio.data.Nilai yang didukung:zh(Tiongkok),en(Inggris),de(Jerman),it(Italia),pt(Portugis),es(Spanyol),ja(Jepang),ko(Korea),fr(Prancis),ru(Rusia),th(Thailand),id(Indonesia),ar(Arab),cs(Ceko),da(Denmark),nl(Belanda),fi(Finlandia),he(Ibrani),hi(Hindi),is(Islandia),ms(Melayu),no(Norwegia),fa(Persia),pl(Polandia),sv(Swedia),tl(Tagalog),tr(Turki),ur(Urdu),vi(Vietnam).Dialek Tiongkok:Dongbei,Shannxi,Sichuan,Henan,Changsha,Tianjin,Hangzhou,Liaoning,Shenyang,Anshan.Atur ini ke bahasa sebenarnya dari audio yang digunakan untuk kloning. -
Response parameters
Parameter respons utama:
Lihat contoh respons
Parameter
Type
Description
voice
string
Nama suara. Gunakan nilai ini langsung sebagai parameter
voicedalam API multimodal real-time.target_model
string
Model omni yang menggerakkan suara:
qwen3.8-omni-flash-realtime
qwen3.5-omni-plus-realtime
qwen3.5-omni-flash-realtime
Ini harus sesuai dengan model yang digunakan dalam pemanggilan API multimodal real-time berikutnya. Jika tidak, sintesis gagal.
request_id
string
ID Permintaan.
count
integer
Jumlah operasi "buat suara" yang ditagih untuk permintaan ini. Biayanya adalah $ count × 0.01.
Saat membuat suara, count selalu 1.
-
Sample code
- curl
- python
- java
Jika Anda belum mengatur Kunci API sebagai variabel lingkungan, ganti$DASHSCOPE_API_KEYdalam contoh dengan Kunci API Anda yang sebenarnya.
List voices
Kueri suara yang telah Anda buat dengan pagination.
- URL North China 2 (Beijing):
-
Request headers
Parameter
Type
Required
Description
Authorization
string
Supported
Token otentikasi dalam format
Bearer <your_api_key>. Ganti<your_api_key>dengan Kunci API Anda yang sebenarnya.Content-Type
string
Supported
Jenis media badan permintaan. Atur ke
application/json. -
Request parameters
Parameter
Type
Default
Required
Description
model
string
-
Supported
Model kloning suara. Atur ke
qwen-voice-enrollment.action
string
-
Supported
Jenis aksi. Atur ke
list.page_index
integer
0
Unsupported
Indeks nomor halaman. Nilai valid: 0 hingga 1.000.000.
page_size
integer
10
Unsupported
Jumlah item per halaman. Nilai valid: 0 hingga 1.000.000.
-
Response parameters
Parameter respons utama:
Lihat contoh respons
Parameter
Type
Description
voice
string
Nama suara. Gunakan nilai ini langsung dalam parameter
voiceAPI multimodal real-time.gmt_create
string
Waktu saat suara dibuat.
target_model
string
Model omni yang menggerakkan suara:
qwen3.8-omni-flash-realtime
qwen3.5-omni-plus-realtime
qwen3.5-omni-flash-realtime
qwen3.5-omni-plus
qwen3.5-omni-flash
Ini harus sesuai dengan model omni yang digunakan dalam pemanggilan API berikutnya. Jika tidak, sintesis gagal.
request_id
string
ID Permintaan.
count
integer
Permintaan ini dikenai biaya berdasarkan jumlah aktual operasi 'Buat Suara'. Biaya untuk permintaan ini adalah $ count × 0.01 .
Menampilkan daftar suara gratis.
countselalu 0. -
Sample code
- cURL
- Python
- Java
Jika Anda belum mengatur Kunci API sebagai variabel lingkungan, ganti$DASHSCOPE_API_KEYdalam contoh dengan Kunci API Anda yang sebenarnya.
Delete a voice
Hapus suara tertentu dan bebaskan kuota yang terkait.
- URL North China 2 (Beijing):
-
Request headers
Parameter
Type
Required
Description
Authorization
string
Supported
Token otentikasi dalam format
Bearer <your_api_key>. Ganti<your_api_key>dengan Kunci API Anda yang sebenarnya.Content-Type
string
Supported
Jenis media badan permintaan. Atur ke
application/json. - Request body Abaikan bidang opsional sesuai kebutuhan.
-
Request parameters
Parameter
Type
Default
Required
Description
model
string
-
Supported
Model kloning suara. Atur ke
qwen-voice-enrollment.action
string
-
Supported
Jenis aksi. Atur ke
delete.voice
string
-
Supported
Suara yang akan dihapus.
-
Response parameters
Parameter respons utama:
Lihat contoh respons
Parameter
Type
Description
request_id
string
ID Permintaan.
count
integer
Permintaan ini dikenai biaya berdasarkan jumlah aktual operasi 'Buat Suara'. Biaya untuk permintaan ini adalah $ count × 0.01 .
Menghapus suara gratis.
countselalu 0. -
Sample code
- cURL
- Python
- Java
Jika Anda belum mengatur Kunci API sebagai variabel lingkungan, ganti$DASHSCOPE_API_KEYdalam contoh dengan Kunci API Anda yang sebenarnya.
Use in conversation
Untuk menggunakan suara hasil kloning dalam percakapan, lihat Memulai dengan cepat.
Kuota suara dan pembersihan otomatis
Batas total: 1.000 suara per akun.
Tidak tersedia endpoint khusus untuk penghitungan. Gunakan API List voices untuk menghitung jumlah suara Anda.Pembersihan otomatis: Suara yang tidak digunakan selama satu tahun akan dihapus secara otomatis.
Penagihan
Kloning suara dan pemanggilan model ditagih secara terpisah:
-
Kloning suara: dikenai biaya sebesar $0,01/suara. Pembuatan yang gagal tidak dikenai biaya.
Kuota gratis (hanya berlaku untuk wilayah China Beijing dan wilayah Internasional Singapura):
- 1.000 pembuatan suara gratis dalam 90 hari setelah mengaktifkan Model Studio.
- Pembuatan yang gagal tidak mengurangi kuota gratis.
- Menghapus suara tidak mengembalikan kuota gratis.
- Setelah kuota gratis habis atau periode 90 hari berakhir, pembuatan suara dikenai biaya sebesar $0,01/suara.
- Percakapan menggunakan suara hasil kloning: ditagih berdasarkan penggunaan token untuk pemanggilan model. Untuk detail selengkapnya, lihat Harga inferensi model.
Hak cipta dan kepatuhan hukum
Anda bertanggung jawab atas kepemilikan dan penggunaan legal suara yang Anda unggah. Baca Perjanjian Layanan.
Panduan perekaman
Peralatan perekaman
Gunakan mikrofon peredam kebisingan atau rekam dengan ponsel dari jarak dekat di lingkungan yang tenang.
Lingkungan perekaman
Lokasi
- Rekam di ruang tertutup kecil berukuran 10 meter persegi atau kurang.
- Pilih ruangan dengan bahan penyerap suara, seperti busa akustik, karpet, atau gorden.
- Hindari ruang besar terbuka, ruang konferensi, atau ruang kelas yang memiliki gema tinggi.
Kontrol kebisingan
- Kebisingan luar ruangan: Tutup pintu dan jendela untuk menghalangi suara lalu lintas, konstruksi, dan suara eksternal lainnya.
- Kebisingan dalam ruangan: Matikan AC, kipas, dan ballast lampu neon.
- Rekam suara latar dengan ponsel Anda, lalu putar kembali dengan volume tinggi untuk mengidentifikasi sumber kebisingan tersembunyi.
Kontrol gema
- Gema menyebabkan audio terdengar sumbang dan mengurangi kejelasan.
- Kurangi pantulan dari permukaan halus dengan menutup gorden, membuka pintu lemari pakaian, serta menutupi meja dan rak menggunakan pakaian atau selimut.
- Gunakan benda tidak beraturan, seperti rak buku dan furnitur berlapis, untuk menciptakan pantulan difus.
Penyusunan naskah
- Sesuaikan naskah dengan skenario penggunaan target—misalnya, gunakan gaya dialog layanan pelanggan untuk skenario layanan pelanggan.
- Pastikan naskah tidak mengandung konten sensitif atau ilegal (seperti materi politik, pornografi, atau kekerasan), karena hal tersebut dapat menyebabkan kegagalan kloning.
- Hindari frasa pendek (seperti "halo" atau "ya"); gunakan kalimat lengkap.
- Pertahankan koherensi semantik dan hindari jeda yang sering saat membaca. Disarankan untuk berbicara minimal 3 detik berturut-turut tanpa gangguan.
- Anda dapat menyampaikan emosi target (seperti ramah atau serius), tetapi hindari penyampaian yang terlalu dramatis atau teatrikal. Pertahankan nada yang alami.
Langkah-langkah yang direkomendasikan
Berikut contoh penerapan menggunakan kamar tidur biasa:
- Tutup pintu dan jendela untuk menghalangi kebisingan eksternal.
- Matikan AC, kipas, dan peralatan lainnya.
- Tutup gorden untuk mengurangi pantulan dari kaca.
- Tutup permukaan meja dengan kain atau selimut untuk mengurangi pantulan.
- Pahami naskah, tentukan nada karakter, dan sampaikan secara alami.
- Pertahankan jarak sekitar 10 cm dari perangkat perekam untuk menghindari distorsi plosif atau sinyal lemah.