Sintesis suara non-real-time mengonversi teks menjadi suara melalui API HTTP. Fitur ini dirancang untuk skenario yang toleran terhadap latensi, seperti produksi buku audio, narasi pembelajaran daring, dan pembuatan konten, serta mendukung berbagai suara, beberapa bahasa, kloning suara, dan desain suara.
Fitur ini mengonversi teks lengkap menjadi file audio melalui API HTTP dengan dua mode output: non-streaming dan streaming.
Sebelum memulai, lakukan persiapan berikut:
Contoh berikut menyintesis ucapan menggunakan qwen-audio-3.0-tts-flash dan suara sistem
Spesifikasi instruksi berdasarkan model:
Bagian ini menjelaskan cara menghasilkan suara dalam dialek Bahasa Tionghoa (seperti dialek Henan dan Sichuan). Metode konfigurasi berbeda berdasarkan model dan jenis suara.
Model yang berbeda mendukung suara yang berbeda. Atur parameter permintaan
J: URL file audio berlaku selama 24 jam setelah dihasilkan. Setelah URL kedaluwarsa, panggil API lagi untuk mendapatkan URL baru.
Ikhtisar
Fitur ini mengonversi teks lengkap menjadi file audio melalui API HTTP dengan dua mode output: non-streaming dan streaming.
- Non-streaming mengembalikan URL file audio yang berlaku selama 24 jam; streaming mengembalikan data audio dalam bentuk chunk.
- Mendukung beberapa bahasa, termasuk dialek Bahasa Tionghoa.
- Mendukung kloning suara dan Desain Suara untuk membuat suara kustom.
- Mendukung kontrol instruksi untuk mengatur ekspresivitas suara melalui instruksi dalam bahasa alami.
Prasyarat
Sebelum memulai, lakukan persiapan berikut:
- Konfigurasikan Kunci API dan tetapkan sebagai variabel lingkungan
- (Opsional) Jika Anda memanggil API melalui SDK DashScope, instal SDK versi terbaru
Memulai dengan cepat
Contoh berikut menyintesis ucapan menggunakan qwen-audio-3.0-tts-flash dan suara sistem longanhuan_v3.6. Untuk suara lain yang tersedia, lihat daftar suara.
Contoh ini menggunakan wilayah Singapura. Ganti {WorkspaceId} dengan ID ruang kerja Anda di wilayah ini, lalu atur variabel lingkungan DASHSCOPE_API_KEY ke kunci API dari wilayah yang sama.
- Output non-streaming
- Output streaming
Dalam mode non-streaming,
output.audio.url berisi URL unduhan audio yang disintesis.Fitur lanjutan
Kontrol instruksi
Spesifikasi instruksi berdasarkan model:
- Qwen-TTS
Model yang didukung: Hanya model seri Qwen3-TTS-Instruct-Flash yang didukung.Penggunaan: Kirim konten instruksi melalui parameter
instructions.Bahasa yang didukung untuk teks instruksi: Hanya Bahasa Tionghoa dan Inggris yang didukung.Batas panjang teks instruksi: Hingga 1.600 token.Dialek
Bagian ini menjelaskan cara menghasilkan suara dalam dialek Bahasa Tionghoa (seperti dialek Henan dan Sichuan). Metode konfigurasi berbeda berdasarkan model dan jenis suara.
- Qwen-TTS
- Suara sistem: Gunakan suara sistem yang mendukung dialek. Lihat Daftar Suara Qwen-TTS.
- Suara hasil kloning: Dialek tidak didukung.
- Suara hasil desain: Dialek tidak didukung.
Model dan wilayah yang didukung
- Singapura
- Tiongkok (Beijing)
Untuk memanggil model berikut, gunakan Kunci API untuk wilayah Singapura:
-
Qwen-TTS:
- Qwen3-TTS-Instruct-Flash: qwen3-tts-instruct-flash (versi stabil, saat ini setara dengan qwen3-tts-instruct-flash-2026-01-26), qwen3-tts-instruct-flash-2026-01-26 (snapshot terbaru)
- Qwen3-TTS-VD: qwen3-tts-vd-2026-01-26 (snapshot terbaru)
- Qwen3-TTS-VC: qwen3-tts-vc-2026-01-22 (snapshot terbaru)
- Qwen3-TTS-Flash: qwen3-tts-flash (versi stabil, saat ini setara dengan qwen3-tts-flash-2025-11-27), qwen3-tts-flash-2025-11-27, qwen3-tts-flash-2025-09-18
Suara sistem yang didukung
Model yang berbeda mendukung suara yang berbeda. Atur parameter permintaan voice ke nilai dari kolom parameter suara pada tabel berikut.