qwen-audio-3.0-tts-flash adalah model sintesis suara berkinerja tinggi yang dioptimalkan untuk skenario interaktif real-time. Dibandingkan versi sebelumnya, model ini mendukung lebih banyak bahasa ber-sumber daya rendah dan dialek Tiongkok, meningkatkan keaslian dialek, serta memperkuat kemampuan mengikuti instruksi gaya bebas dan kontrol tag detail halus untuk pengaturan yang lebih fleksibel terhadap emosi, nada, karakter, laju bicara, volume, dan gaya ekspresif. Model ini juga lebih tangguh dalam kondisi akustik bising dan bergema, dengan peningkatan kualitas audio, kejelasan, dan ekspresivitas secara keseluruhan. Versi Flash difokuskan pada sintesis real-time, dengan latensi paket pertama di bawah 200 ms, sehingga cocok untuk asisten suara, dialog real-time, layanan pelanggan cerdas, dan aplikasi interaktif ber-latensi rendah lainnya.
Penyedia Layanan Inferensi
Penyedia layanan inferensi untuk qwen-audio-3.0-tts-flash adalah Alibaba Cloud Model Studio.
Kemampuan Model
| Kemampuan | Dukungan | Kemampuan | Dukungan |
|---|---|---|---|
Modalitas Input | Text | Modalitas Output | Audio |
Pengalaman Model | Unsupported | Function Calling | Unsupported |
Structured Outputs | Unsupported | Web Search | Unsupported |
Prefix Completion | Unsupported | Context Caching | Unsupported |
Batch Inference | Unsupported | Fine-tuning | Unsupported |
Batas Konteks
| Parameter | Nilai | Parameter | Nilai |
|---|---|---|---|
Max Input Length | — | Max Output Length | — |
Context Window | — |
Harga
Laman ini hanya menampilkan harga dasar untuk panggilan API model, tidak termasuk promosi berbatas waktu apa pun. Kunjungi Konsol Model Studio untuk penawaran promosi.
- Tiongkok (Beijing)
- Singapura
| Item Penagihan | Harga (USD) | Unit |
|---|---|---|
TTS | 0,137521 | Per 10.000 karakter |
Batas Laju
- Tiongkok (Beijing)
- Singapura
| Parameter | Nilai |
|---|---|
RPM (Requests Per Minute) | 180 |