Skip to main content
Sintesis suara

qwen-audio-3.0-tts-flash

qwen-audio-3.0-tts-flash adalah model sintesis suara berkinerja tinggi yang dioptimalkan untuk skenario interaktif real-time. Dibandingkan versi sebelumnya, model ini mendukung lebih banyak bahasa ber-sumber daya rendah dan dialek Tiongkok, meningkatkan keaslian dialek, serta memperkuat kemampuan mengikuti instruksi gaya bebas dan kontrol tag detail halus untuk pengaturan yang lebih fleksibel terhadap emosi, nada, karakter, laju bicara, volume, dan gaya ekspresif. Model ini juga lebih tangguh dalam kondisi akustik bising dan bergema, dengan peningkatan kualitas audio, kejelasan, dan ekspresivitas secara keseluruhan. Versi Flash difokuskan pada sintesis real-time, dengan latensi paket pertama di bawah 200 ms, sehingga cocok untuk asisten suara, dialog real-time, layanan pelanggan cerdas, dan aplikasi interaktif ber-latensi rendah lainnya.

Penyedia Layanan Inferensi

Penyedia layanan inferensi untuk qwen-audio-3.0-tts-flash adalah Alibaba Cloud Model Studio.

Kemampuan Model

KemampuanDukunganKemampuanDukungan

Modalitas Input

Text

Modalitas Output

Audio

Pengalaman Model

Unsupported

Function Calling

Unsupported

Structured Outputs

Unsupported

Web Search

Unsupported

Prefix Completion

Unsupported

Context Caching

Unsupported

Batch Inference

Unsupported

Fine-tuning

Unsupported

Batas Konteks

ParameterNilaiParameterNilai

Max Input Length

—

Max Output Length

—

Context Window

—

Harga

Laman ini hanya menampilkan harga dasar untuk panggilan API model, tidak termasuk promosi berbatas waktu apa pun. Kunjungi Konsol Model Studio untuk penawaran promosi.
  • Tiongkok (Beijing)
  • Singapura
Item PenagihanHarga (USD)Unit

TTS

0,137521

Per 10.000 karakter

Batas Laju

  • Tiongkok (Beijing)
  • Singapura
ParameterNilai

RPM (Requests Per Minute)

180

Rencana Token (Team Edition)
Model playground
  • Pembuatan audio
  • Pembuatan musik
Statistik dan Pemantauan
Asset Center