qwen3-livetranslate-flash menerjemahkan file audio dan video ke dalam 18 bahasa. Model ini menerima input audio atau video dan mengembalikan teks terjemahan, audio tersintesis, atau keduanya melalui API streaming. Untuk input video, konteks visual meningkatkan akurasi terjemahan (misalnya, membedakan antara "medical mask" dan "masquerade mask" berdasarkan frame video).
Sebelum memulai
- Buat Kunci API.
- Konfigurasikan Kunci API sebagai Variabel lingkungan.
- (Opsional) Jika Anda menggunakan OpenAI SDK, instal SDK.
Memulai dengan cepat
Semua contoh menggunakan API streaming yang kompatibel dengan OpenAI. Tetapkan bahasa sumber dan target melalui translation_options. Input default adalah audio; hapus komentar pada blok input video di setiap contoh untuk menerjemahkan file video.
Menentukan source_lang meningkatkan akurasi. Abaikan parameter ini untuk mengaktifkan deteksi bahasa otomatis.
Parameter permintaan
Input
Array messages harus berisi tepat satu pesan dengan role diatur ke user. Bidang content berisi audio atau video yang akan diterjemahkan:
- Audio: Atur
typekeinput_audio. Berikan URL file atau data yang dikodekan Base64 diinput_audio.data, dan tentukan formatnya (misalnya,wav) diinput_audio.format. - Video: Atur
typekevideo_url. Berikan URL file divideo_url.url.
Opsi terjemahan
Tentukan bahasa sumber dan target dalam parameter translation_options:
translation_options bukan parameter standar OpenAI. Lewatkan melalui extra_body:
Modalitas output
Kendalikan format output dengan parameter modalities:
modalities | Output |
|---|---|
["text"] | Hanya teks terjemahan |
["text", "audio"] | Teks terjemahan dan audio tersintesis yang dikodekan Base64 |
audio. Lihat Suara yang didukung untuk opsi yang tersedia.
Batasan
- Hanya satu giliran: Model menangani satu terjemahan per permintaan. Percakapan multi-giliran tidak didukung.
- Tidak ada pesan sistem: Peran
systemtidak didukung. - Hanya streaming: Hanya output streaming yang kompatibel dengan OpenAI yang didukung.
Uraikan respons
Setiap objek chunk streaming berisi:
- Teks:
chunk.choices[0].delta.content - Audio:
chunk.choices[0].delta.audio["data"](dikodekan Base64, laju sampel 24 kHz)
Simpan audio ke file
Gabungkan semua fragmen audio Base64 dari aliran, lalu dekode dan simpan hasilnya setelah aliran selesai.
Python
Node.js
Pemutaran real-time
Dekode setiap fragmen Base64 saat tiba dan putar langsung. Pendekatan ini memerlukan pustaka audio khusus platform.
Python
Instal pyaudio terlebih dahulu:
| Platform | Instalasi |
|---|---|
| macOS | brew install portaudio && pip install pyaudio |
| Ubuntu / Debian | sudo apt-get install python-pyaudio python3-pyaudio atau pip install pyaudio |
| CentOS | sudo yum install -y portaudio portaudio-devel && pip install pyaudio |
| Windows | python -m pip install pyaudio |
Node.js
Instal dependensi terlebih dahulu:
| Platform | Instalasi |
|---|---|
| macOS | brew install portaudio && npm install speaker |
| Ubuntu / Debian | sudo apt-get install libasound2-dev && npm install speaker |
| Windows | npm install speaker |
Penagihan
- Audio
- Video
Setiap detik audio input atau output mengonsumsi 12,5 token. Audio yang durasinya kurang dari 1 detik ditagih sebagai 1 detik.
Detail model
| Model | Versi | Jendela konteks | Input maksimum | Output maksimum |
|---|---|---|---|---|
| qwen3-livetranslate-flash | Stable | 53.248 token | 49.152 token | 4.096 token |
| qwen3-livetranslate-flash-2025-12-01 | Snapshot | 53.248 token | 49.152 token | 4.096 token |
qwen3-livetranslate-flash saat ini memiliki kemampuan yang sama dengan qwen3-livetranslate-flash-2025-12-01.
Bahasa yang didukung
Gunakan kode bahasa ini untuk source_lang dan target_lang. Beberapa bahasa target hanya mendukung output teks.
| Kode bahasa | Bahasa | Output yang didukung |
|---|---|---|
| en | Inggris | Audio, teks |
| zh | Tiongkok | Audio, teks |
| ru | Rusia | Audio, teks |
| fr | Prancis | Audio, teks |
| de | Jerman | Audio, teks |
| pt | Portugis | Audio, teks |
| es | Spanyol | Audio, teks |
| it | Italia | Audio, teks |
| id | Bahasa Indonesia | Teks |
| ko | Korea | Audio, teks |
| ja | Jepang | Audio, teks |
| vi | Vietnam | Teks |
| th | Thai | Teks |
| ar | Arab | Teks |
| yue | Kanton | Audio, teks |
| hi | Hindi | Teks |
| el | Yunani | Teks |
| tr | Turki | Teks |
Suara yang didukung
Atur parameter voice dalam audio ketika output mencakup audio tersintesis.
| Nama suara | voice parameter | Deskripsi | Bahasa yang didukung |
|---|---|---|---|
| Cherry | Cherry | Wanita muda yang ceria, ramah, dan tulus. | Tiongkok, Inggris, Prancis, Jerman, Rusia, Italia, Spanyol, Portugis, Jepang, Korea |
| Nofish | Nofish | Seorang desainer yang kesulitan mengucapkan konsonan retrofleks. | Tiongkok, Inggris, Prancis, Jerman, Rusia, Italia, Spanyol, Portugis, Jepang, Korea |
| Shanghai-Jada | Jada | Wanita energik dan riuh dari Shanghai. | Tiongkok |
| Beijing-Dylan | Dylan | Pria muda yang tumbuh di hutong Beijing. | Tiongkok |
| Sichuan-Sunny | Sunny | Gadis manis dari Sichuan. | Tiongkok |
| Tianjin-Peter | Peter | Suara bergaya pelawak crosstalk Tianjin (peran pendukung). | Tiongkok |
| Cantonese-Kiki | Kiki | Sahabat baik manis dari Hong Kong. | Kanton |
| Sichuan-Eric | Eric | Pria dari Chengdu, Sichuan, yang tidak konvensional dan menonjol dari keramaian. | Tiongkok |
FAQ
Saat saya memasukkan file video, konten apa yang diterjemahkan?
Model menerjemahkan trek audio video tersebut. Informasi visual meningkatkan akurasi terjemahan.
Misalnya, jika audionya mengatakan "This is a mask":
- Jika video menampilkan masker medis, model menerjemahkannya sebagai "This is a medical mask."
- Saat video menampilkan topeng masquerade, model menerjemahkannya menjadi "Ini adalah topeng masquerade."