Model Qwen-Omni menerima input multimodal dan menghasilkan respons berupa teks atau ucapan. Model ini menghasilkan suara yang menyerupai manusia serta mendukung output ucapan dalam berbagai bahasa dan dialek. Kasus penggunaan mencakup moderasi konten, pembuatan teks, pengenalan visual, dan interaksi audio-video.
Wilayah yang didukung:Singapura, Beijing. Gunakan Kunci API untuk wilayah Anda.
Prasyarat
Semua permintaan ke Qwen-Omni harus mengatur
Konfigurasikan parameter, prompt, dan durasi media untuk menyeimbangkan biaya, kecepatan, dan kualitas.
Contoh berikut menunjukkan cara memberikan gambar dan audio dalam satu permintaan untuk analisis multimodal.
Setiap permintaan berisi teks dan satu modalitas lain (video, audio, atau gambar). Semua model Qwen-Omni mendukung ini.
Seri Qwen3.5-Omni mendukung pencarian web untuk mengambil informasi real-time dan melakukan penalaran.
Dalam seri Qwen-Omni, hanya model Qwen3-Omni-Flash yang merupakan model berpikir hibrida. Anda dapat menggunakan parameter
Saat menggunakan model Qwen-Omni untuk percakapan multi-putaran, perhatikan hal berikut:
Model Qwen-Omni menghasilkan audio sebagai data streaming yang dikodekan Base64. Selama generasi, pertahankan variabel string dan tambahkan data Base64 dari setiap potongan yang dikembalikan. Setelah generasi selesai, dekode Base64 dari string lengkap untuk mendapatkan file audio. Atau, dekode dan putar setiap potongan secara real time.
Untuk parameter input dan output, lihat Kompatibel dengan OpenAI - Chat.
Aturan penagihan
Qwen-Omni ditagih berdasarkan token yang dikonsumsi di berbagai modalitas (audio, gambar, dan video). Periksa detail penagihan di konsol.
Kuota gratis
Untuk mengklaim, menanyakan, atau menggunakan kuota gratis Anda, lihat Kuota gratis untuk pengguna baru.
Batasan laju
Untuk aturan pembatasan laju dan FAQ, lihat Pembatasan laju.
Jika pemanggilan model gagal dan mengembalikan pesan error, lihat Kode error untuk resolusi.
Untuk daftar suara model Qwen-Omni, lihat Daftar suara.
Mulai
Prasyarat
- Dapatkan Kunci API dan atur kunci API sebagai Variabel lingkungan.
- Model Qwen-Omni hanya mendukung pemanggilan yang kompatibel dengan OpenAI. Anda harus menginstal SDK terbaru. Versi minimum yang diperlukan adalah 1.52.0 untuk OpenAI Python SDK dan 4.68.0 untuk Node.js SDK.
Respons
Respons
Setelah menjalankan kode Menjalankan kode
Python atau Node.js, respons teks akan muncul di konsol dan file audio bernama audio_assistant.wav akan disimpan di direktori yang sama dengan file kode Anda.HTTP akan mengembalikan teks dan data audio yang dikodekan Base64 secara langsung di bidang audio.Pemilihan model
-
Seri Qwen3.5-Omni: Paling cocok untuk analisis video panjang, ringkasan rapat, pembuatan keterangan, moderasi konten, dan interaksi audio-video.
- Batas input: Hingga 3 jam audio atau 1 jam video
- Kontrol audio: Mendukung penyesuaian volume, laju bicara, dan emosi melalui instruksi
- Kemampuan visual: Setara dengan Qwen3.5. Memahami gambar, ucapan, efek suara, dan input multimodal lainnya
- Input multimodal gabungan: Mendukung kombinasi apa pun antara teks dengan gambar, audio, dan video dalam satu permintaan
- Input multimodal gabungan hanya didukung oleh seri Qwen3.5-Omni. Anda dapat menyertakan data dalam berbagai modalitas—seperti kombinasi gambar, audio, dan teks atau video, gambar, dan teks—dalam satu permintaan yang sama.
-
Seri Qwen3-Omni-Flash: Paling cocok untuk analisis video pendek dan skenario yang sensitif terhadap biaya.
- Batas input: Input audio dan video hingga 150 detik
- Mode berpikir: Satu-satunya model seri Qwen-Omni yang mendukung mode berpikir
- Modalitas input: Hanya mendukung kombinasi teks dengan satu modalitas lain (gambar, audio, atau video).
- Seri Qwen-Omni-Turbo Seri ini tidak lagi diperbarui dan memiliki fitur terbatas. Kami merekomendasikan migrasi ke seri Qwen3.5-Omni atau Qwen3-Omni-Flash.
| Seri | Deskripsi audio-video | Berpikir mendalam | Pencarian web | Bahasa input audio | Bahasa output audio | Suara yang didukung |
| Qwen3.5-OmniModel omni-modal generasi terbaru | Kuat | Tidak didukung | Didukung | 113
74 bahasa dan 39 dialek Bahasa: Chinese, English, German, French, Italian, Czech, Indonesian, Thai, Korean, Polish, Japanese, Vietnamese, Finnish, Portuguese, Spanish, Dutch, Russian, Malay, Catalan, Swedish, Turkish, Ukrainian, Romanian, Slovak, Danish, Icelandic, Norwegian (Bokmål), Macedonian, Greek, Hungarian, Galician, Filipino, Croatian, Bosnian, Slovenian, Bulgarian, Kazakh, Belarusian, Latvian, Estonian, Azerbaijani, Uyghur, Swahili, Hindi, Esperanto, Kyrgyz, Tajik, Cebuano, Afrikaans, Arabic, Lithuanian, Javanese, Bengali, Persian, Hebrew, Punjabi, Gujarati, Mongolian, Asturian, Kannada, Marathi, Interlingua, Malayalam, Maltese, Norwegian Nynorsk, Telugu, Urdu, Georgian, Basque, Tamil, Odia, Serbian, MaoriDialek: Northeastern Mandarin, dialek Guizhou, bahasa Kanton, dialek Henan, bahasa Kanton Hong Kong, bahasa Shanghainese, dialek Shaanxi, dialek Tianjin, bahasa Hokkien Taiwan, dialek Yunnan, dialek Anhui, dialek Fujian, dialek Gansu, dialek Guangdong, dialek Hubei, dialek Hunan, dialek Jiangxi, dialek Shandong, dialek Shanxi, dialek Sichuan, dialek Guangxi, dialek Hainan, dialek Chongqing, dialek Changsha, dialek Hangzhou, dialek Hefei, dialek Yinchuan, dialek Zhengzhou, dialek Shenyang, dialek Wenzhou, dialek Wuhan, dialek Kunming, dialek Taiyuan, dialek Nanchang, dialek Jinan, dialek Lanzhou, dialek Nanjing, bahasa Hakka, Southern Min | 36
29 bahasa dan 7 dialek Bahasa:Chinese, English, German, Italian, Portuguese, Spanish, Japanese, Korean, French, Russian, Thai, Indonesian, Arabic, Vietnamese, Turkish, Finnish, Polish, Hindi, Dutch, Czech, Urdu, Tagalog, Swedish, Danish, Hebrew, Icelandic, Malay, Norwegian, Persian Dialek:Sichuan dialect, Beijing dialect, Tianjin dialect, Nanjing dialect, Shaanxi dialect, Cantonese, Southern Min | 55 |
| Qwen3-Omni-FlashModel berpikir hibrida | Lebih lemah | Didukung | Tidak didukung | 19
11 bahasa dan 8 dialek Bahasa:Chinese, English, German, French, Italian, Thai, Korean, Japanese, Russian, Spanish, PortugueseDialek:Sichuan dialect, Shanghainese, Cantonese, Southern Min, Shaanxi dialect, Nanjing dialect, Tianjin dialect, Beijing dialect | 19
11 bahasa dan 8 dialek Bahasa:Chinese, English, German, French, Italian, Thai, Korean, Japanese, Russian, Spanish, PortugueseDialek:Sichuanese, Shanghainese, Cantonese, Hokkien, Shaanxi dialect, Nanjing dialect, Tianjin dialect, Beijing dialect | 17 hingga 49Bervariasi berdasarkan versi |
| Qwen-Omni-TurboTidak lagi diperbarui | Tidak ada | Tidak didukung | Tidak didukung | Chinese, English | Chinese, English | 4 |
Untuk nama model, ukuran jendela konteks, harga, dan versi snapshot, periksa di Konsol Studio Model. Untuk batasan laju, lihat Pembatasan laju.
Kinerja model
Analisis konten audio dan video
Buat deskripsi lengkap dengan cap waktu untuk video ini. | 00:00.000 – 00:02.500Jalan kota yang basah oleh hujan memenuhi bingkai layar lebar. Fotografi eksposur panjang menciptakan garis-garis lampu mobil merah dan biru di atas trotoar basah. Seorang pria sendirian mengenakan mantel panjang gelap dan kemeja terang dengan dasi berjalan menuju kamera di sepanjang trotoar kanan. Tetesan hujan menempel di bahunya dan rambutnya. Setiap langkah menghasilkan suara "plop" yang diredam di atas beton basah. Dengungan elektronik rendah yang mengancam menyertai suara sekitar, sementara hujan yang stabil berderak di sekelilingnya. Grafiti berwarna-warni menutupi dinding bata di sampingnya, dan papan reklame neon bersinar di kejauhan—satu dengan jelas menampilkan tulisan miring oranye-merah bertuliskan "Nice", sedangkan papan vertikal lainnya menunjukkan huruf "AT" di bagian bawahnya.......00:12.300 – 00:14.533Kamera dimiringkan ke bawah. Di dalam sorotan senter, selembar kertas tunggal yang menguning dan tua tergeletak di genangan dangkal, ujung-ujungnya hangus dan sudut-sudutnya melengkung. Paragraf-paragraf bertinta menutupi sebagian besar permukaannya, tetapi kelembapan dan bekas hangus membuat teksnya tidak terbaca. Pria itu berlutut, menjulurkan jari-jari yang mengenakan sarung tangan ke arah dokumen tersebut. Riak-riak menyebar ke luar saat tangannya mendekat. Suara sirene mencapai puncaknya lalu mulai sedikit mereda, sementara dengungan sekitar tetap stabil. Adegan membeku tepat sebelum kertas yang bergetar disentuh, mengakhiri klip.Hanya sebagian cap waktu yang ditampilkan. |
Pemahaman multidialek
Jelaskan karakteristik vokal, keadaan emosional, dan lirik lengkap untuk penyanyi dalam berbagai dialek Tiongkok. | Audio ini menampilkan pertunjukan rap oleh penyanyi dari berbagai wilayah Tiongkok, menampilkan keberagaman dialek yang kaya. Berikut adalah deskripsi detail tentang ciri vokal, keadaan emosional, dan lirik masing-masing penyanyi:Dialek Hangzhou (Wu)Ciri vokal:Suara penyanyi pria ini lembut dan halus, dengan kehalusan dan kehangatan khas dialek Wu. Intonasinya naik dan turun dengan lembut, dan ritmenya ringan dan cepat, menciptakan efek bercerita yang santai.Keadaan emosional:Santai, nyaman, dan penuh kehidupan sehari-hari. Ia menggambarkan gaya hidup Hangzhou yang lambat dan perubahan perkotaan, mengekspresikan kasih sayang terhadap kampung halamannya dan refleksi terhadap perkembangan modern. Secara keseluruhan, ia merasa nyaman dan akrab.Lirik:> Dialek Hangzhou, dengarkan baik-baik! Budaya kami termasuk pelafalan lokal erhua.> Seperti bunga yang mekar di Danau Barat, tidak perlu survei budaya—kami memahaminya paling baik.> Tidak seorang pun dari kalian memahami. 'San bu da men', 'ge'r', 'lao'r', 'fen'r', 'ya'r'... bagaimana orang luar bisa membedakan semua ini?> Ayo pergi! Transportasi cepat—kereta bawah tanah ada di mana-mana. Kita akan memeriksanya.> Menyambut Asia Tenggara dan Thailand, menonton acara "Thirteen Ta". Bangga dengan kota kami, langsung dalam kepribadian.> Jadi kamu hanya datang untuk pengalaman "menyeberangi jembatan", dan karena rasanya berbeda, kamu tidak kembali?Hanya sebagian hasil yang ditampilkan. |
Pembuatan keterangan lirik
Transkripsikan lirik lagu dan berikan cap waktu untuk setiap baris dalam format ini:[00:00:15,020 --> 00:00:28,085] : When you walk through a storm, hold your head up high.[00:00:28,085 --> 00:00:40,200] And don't be afraid of the dark. ...... | [00:00:12,680 --> 00:00:16,960] Benang kucing bergoyang melewati cahaya bulan di pepohonan.[00:00:18,400 --> 00:00:22,800] Radiator mendengung lagu-lagu populer tahun 1998.[00:00:24.160 → 00:00:28.080] Waktu memisahkan gelombang panas seperti kabut.[00:00:28,920 --> 00:00:33,000] Neon dari layar bersinar di pangkal hidungku.......[00:03:16,720 --> 00:03:21,680] Kami bersarang di cincin paling lembut dari batang pohon.[00:03:22,400 --> 00:03:27,000] Pernapasan mengubah kehangatan sisa menjadi madu-gula.[00:03:28,160 --> 00:03:33,200] Sofa tenggelam ke bentuk awan-lembut.[00:03:34,000 --> 00:03:38,800] Setiap pori menyerap sinar matahari.[00:04:09,000 --> 00:04:10,020] (Akhir)Hanya sebagian hasil yang ditampilkan. |
Pemrograman audio-video
Penggunaan
Keluaran streaming
Semua permintaan ke Qwen-Omni harus mengatur stream=True.
Konfigurasi model
Konfigurasikan parameter, prompt, dan durasi media untuk menyeimbangkan biaya, kecepatan, dan kualitas.
- Pemahaman audio-video
- Pemahaman audio
| Kasus penggunaan | Durasi video yang direkomendasikan | Prompt yang direkomendasikan | max_pixels maksimum yang direkomendasikan |
| Tinjauan cepat, biaya rendah | ≤60 menit | Prompt sederhana dalam 50 kata | 230.400 |
| Ekstraksi konten (segmentasi video panjang) | ≤60 menit | 921.600~2.073.600 | |
| Analisis standar (penandaan video pendek) | ≤4 menit | Gunakan prompt terstruktur di bawah ini
Prompt yang direkomendasikan | 921.600~2.073.600 |
| Analisis detail halus (beberapa pembicara/scene kompleks) | ≤2 menit | 2.073.600 |
Anda dapat melakukan segmentasi video panjang terlebih dahulu untuk mendapatkan deskripsi detail halus.
Input multimodal gabungan
Input multimodal gabungan hanya didukung oleh seri Qwen3.5-Omni. Anda dapat memberikan data dalam beberapa modalitas, seperti kombinasi apa pun antara gambar, audio, dan teks, atau video, gambar, dan teks, dalam satu permintaan yang sama.
- Kompatibel dengan OpenAI
Input modalitas tunggal
Setiap permintaan berisi teks dan satu modalitas lain (video, audio, atau gambar). Semua model Qwen-Omni mendukung ini.
- Input video dan teks
- Input audio dan teks
- Input gambar dan teks
Berikan video sebagai daftar gambar atau file video (dengan dukungan audio).
- File video (mendukung audio dalam video)
- Format daftar gambar
-
Jumlah file:
- Seri Qwen3.5-Omni: Hingga 512 file menggunakan URL publik dan hingga 250 file menggunakan encoding Base64.
- Seri Qwen3-Omni-Flash dan Qwen-Omni-Turbo: Hanya satu file yang diizinkan.
-
Ukuran file:
-
Menggunakan URL publik:
- Seri Qwen3.5-Omni: Hingga 2 GB
- Qwen3-Omni-Flash: Hingga 256 MB
- Qwen-Omni-Turbo: Hingga 150 MB
- Menggunakan encoding Base64: String Base64 yang dikodekan harus lebih kecil dari 10 MB
-
Menggunakan URL publik:
-
Batas durasi:
- Seri Qwen3.5-Omni: 1 jam
- Qwen3-Omni-Flash: 150 detik
- Qwen-Omni-Turbo: 40 detik
- Format file: MP4, AVI, MKV, MOV, FLV, dan WMV.
- Informasi visual dan audio dalam file video ditagih secara terpisah.
- Kompatibel dengan OpenAI
Pencarian web
Seri Qwen3.5-Omni mendukung pencarian web untuk mengambil informasi real-time dan melakukan penalaran.
- Pencarian web hanya didukung dalam seri Qwen3.5-Omni. Parameter
search_strategyhanya menerimaagent. - Untuk penagihan, lihat kebijakan
agentdi Penagihan.
enable_search dan search_strategy ke agent:
- Kompatibel dengan OpenAI
Aktifkan/nonaktifkan mode berpikir
Dalam seri Qwen-Omni, hanya model Qwen3-Omni-Flash yang merupakan model berpikir hibrida. Anda dapat menggunakan parameter enable_thinking untuk mengaktifkan atau menonaktifkan mode berpikir:
truefalse(default)
Dalam mode berpikir, output audio tidak didukung.
- Kompatibel dengan OpenAI
Respons
Respons
Percakapan multi-putaran
Saat menggunakan model Qwen-Omni untuk percakapan multi-putaran, perhatikan hal berikut:
- Pesan Asisten Pesan asisten dalam array pesan hanya dapat berisi data teks.
- Pesan Pengguna Pesan pengguna dapat berisi teks dan satu modalitas lain. Dalam percakapan multi-putaran, Anda dapat memasukkan modalitas berbeda dalam pesan pengguna yang berbeda.
- Kompatibel dengan OpenAI
Mengurai data audio yang dikodekan Base64
Model Qwen-Omni menghasilkan audio sebagai data streaming yang dikodekan Base64. Selama generasi, pertahankan variabel string dan tambahkan data Base64 dari setiap potongan yang dikembalikan. Setelah generasi selesai, dekode Base64 dari string lengkap untuk mendapatkan file audio. Atau, dekode dan putar setiap potongan secara real time.
Input file lokal terenkode Base64
Saat menggunakan encoding Base64 untuk mengirim file, string Base64 yang dikodekan harus lebih kecil dari 10 MB.
- Gambar
- Audio
- Video
Contoh ini menggunakan file yang disimpan lokal eagle.png.
Referensi API
Untuk parameter input dan output, lihat Kompatibel dengan OpenAI - Chat.
Penagihan dan batasan laju
Aturan penagihan
Qwen-Omni ditagih berdasarkan token yang dikonsumsi di berbagai modalitas (audio, gambar, dan video). Periksa detail penagihan di konsol.
Aturan konversi token untuk audio, gambar, dan video
Aturan konversi token untuk audio, gambar, dan video
- Audio
- Gambar
- Video
-
Seri Qwen3.5-Omni:- Rumus audio input:
Total token = Durasi audio (detik) × 7 - Rumus audio output:
Total token = Durasi audio (detik) × 12,5
- Rumus audio input:
-
Qwen3-Omni-Flash: Untuk audio input dan output,Total token = Durasi audio (detik) × 12,5 -
Qwen-Omni-Turbo: Untuk audio input dan output,Total token = Durasi audio (detik) × 25