Model pemahaman visual dapat menjawab pertanyaan berdasarkan gambar atau video yang Anda berikan. Model ini mendukung input gambar tunggal maupun ganda, serta cocok untuk berbagai tugas seperti pembuatan keterangan gambar (image captioning), menjawab pertanyaan visual, dan pelokalan objek.
Mulai
Prasyarat
- Dapatkan Kunci API dan konfigurasikan sebagai Variabel lingkungan.
- Untuk melakukan panggilan menggunakan SDK, instal SDK. SDK DashScope Python harus versi 1.24.6 atau lebih baru, dan SDK DashScope Java harus versi 2.21.10 atau lebih baru.
- Kompatibel dengan OpenAI
- DashScope
- Python
- Node.js
- Java
- curl
Tanggapan
Kinerja model
Tanya Jawab Gambar
Jelaskan konten gambar atau klasifikasikan dan beri label, seperti mengidentifikasi orang, tempat, hewan, dan tumbuhan.
![]() Item apa dalam gambar ini yang harus saya gunakan jika matahari terlalu terang? | Jika matahari terlalu terang, Anda harus menggunakan kacamata hitam merah muda dalam gambar tersebut. Kacamata hitam dapat secara efektif menghalangi cahaya kuat, mengurangi kerusakan UV pada mata Anda, dan membantu melindungi penglihatan serta meningkatkan kenyamanan visual dalam sinar matahari yang terang. |
|---|
Penulisan kreatif
Hasilkan deskripsi teks yang hidup berdasarkan konten gambar atau video, cocok untuk skenario kreatif seperti penulisan cerita, copywriting, dan skrip video pendek.
![]() Tulis posting media sosial yang menarik berdasarkan konten gambar tersebut. | Tentu. Gambar ini dipenuhi suasana Festival Pertengahan Musim Gugur yang kaya, menggabungkan elemen klasik dan modern secara cerdas. Berdasarkan elemen utama dalam gambar, saya telah menyiapkan beberapa posting media sosial dalam gaya berbeda untuk Anda pilih. Gaya puitis dan indah Malam ini, bulan bersinar terang untuk semua orang, tetapi siapa yang tahu ke mana pikiran musim gugur akan jatuh? Chang'e terbang ke bulan, dan Kelinci Giok menumbuk obat. Romantisme para leluhur dinyalakan malam ini. Semoga bulan yang terang ini menerangi jalan pulang Anda dan membawa pikiran terdalam saya. Selamat Hari Raya Pertengahan Musim Gugur! Gaya harapan hangat Bulan penuh, dan orang-orang berkumpul kembali. Malam Pertengahan Musim Gugur adalah yang paling lembut. Saksikan kembang api mekar, kagumi bulan penuh di langit, ambil sepotong kue bulan, dan berharap untuk kesehatan yang baik. Semoga semua yang Anda dan saya inginkan menjadi kenyataan. Selamat Hari Raya Pertengahan Musim Gugur untuk semua orang, dan semoga keluarga Anda bahagia! |
Pengenalan teks dan ekstraksi informasi
Kenali teks dan rumus dalam gambar, atau ekstrak informasi dari kwitansi, sertifikat, dan formulir. Mendukung output teks terformat.
![]() Ekstrak hal berikut dari gambar: ['Kode Faktur', 'Nomor Faktur', 'Tujuan', 'Biaya Bahan Bakar', 'Tarif', 'Tanggal', 'Waktu Keberangkatan', 'Nomor Kereta', 'Nomor Kursi']. Harap output dalam format JSON. | { "Kode Faktur": "221021325353", "Nomor Faktur": "10283819", "Tujuan": "Zona Pengembangan", "Biaya Bahan Bakar": "2,0", "Tarif": "8,00<Full>", "Tanggal": "2013-06-29", "Waktu Keberangkatan": "Rolling", "Nomor Kereta": "040", "Nomor Kursi": "371" } |
Pemecahan masalah multidisiplin
Selesaikan masalah matematika, fisika, kimia, dan lainnya dalam gambar. Cocok untuk pendidikan SD-SMA, perguruan tinggi, dan dewasa.
![]() Selesaikan soal matematika dalam grafik langkah demi langkah. | ![]() |
|---|
Pemrograman visual
Hasilkan kode dari gambar atau video. Anda dapat menggunakan fitur ini untuk menghasilkan kode HTML, CSS, dan JS dari rancangan desain, tangkapan layar situs web, dan lainnya.
Buat halaman web menggunakan HTML dan CSS berdasarkan sketsa saya. Warna utamanya harus hitam. |
Pratinjau halaman web |
|---|
Pelokalan objek
Mendukung pelokalan 2D dan 3D. Anda dapat menggunakan fitur ini untuk menentukan orientasi objek, perubahan perspektif, dan hubungan oklusi. Pelokalan 3D adalah kemampuan baru yang ditambahkan ke model Qwen3-VL.
Kinerja pelokalan objek model Qwen2.5-VL kuat dalam rentang resolusi 480 × 480 hingga 2560 × 2560. Di luar rentang ini, akurasi deteksi dapat menurun, dengan kadang-kadang terjadi deviasi bingkai deteksi.
Untuk informasi tentang cara menggambar hasil pelokalan pada gambar asli, lihat FAQ.
Pelokalan 2D![]()
| Visualisasi hasil pelokalan 2D![]() |
Pelokalan 3D ![]() [{"bbox_3d": [x_center, y_center, z_center, x_size, y_size, z_size, roll, pitch, yaw], "label": "kategori"}]. |
Visualisasi hasil pelokalan 3D ![]() |
Penguraian dokumen
Uraikan dokumen berbasis gambar (seperti salinan hasil pindaian atau PDF gambar) ke dalam format HTML QwenVL atau Markdown QwenVL. Format ini tidak hanya mengenali teks secara akurat tetapi juga mendapatkan informasi posisi elemen seperti gambar dan tabel. Model Qwen3-VL menambahkan kemampuan untuk menguraikan ke dalam format Markdown.
Prompt yang direkomendasikan adalah sebagai berikut:qwenvl html(untuk menguraikan ke format HTML) atauqwenvl markdown(untuk menguraikan ke format Markdown).
qwenvl markdown. |
Visualisasi hasil |
|---|
Pemahaman video
Analisis konten video, seperti melokalisasi kejadian spesifik dan mendapatkan stempel waktu, atau menghasilkan ringkasan periode waktu kunci.
| Harap jelaskan rangkaian tindakan orang dalam video tersebut. Output Waktu mulai (start_time), Waktu selesai (end_time), dan event (event) dalam format JSON. Gunakan HH:mm:ss untuk stempel waktu. | {"events": [{"start_time": "00:00:00","end_time": "00:00:05","event": "Orang tersebut berjalan menuju meja sambil memegang kotak kardus dan meletakkannya di atas meja."},{"start_time": "00:00:05","end_time": "00:00:15","event": "Orang tersebut mengambil pemindai dan memindai label pada kotak kardus tersebut."},{"start_time": "00:00:15","end_time": "00:00:21","event": "Orang tersebut meletakkan kembali pemindai ke tempatnya dan kemudian mengambil pena untuk mencatat informasi dalam buku catatan."}]} |
Fitur inti
Aktifkan atau nonaktifkan mode berpikir
-
Model seri
qwen3.8,qwen3.7,qwen3.6,qwen3.5,qwen3-vl-plus, danqwen3-vl-flashadalah model berpikir hibrid. Model ini dapat berpikir sebelum merespons atau merespons langsung. Gunakan parameterenable_thinkinguntuk mengontrol apakah akan mengaktifkan mode berpikir:true: Mengaktifkan mode berpikir. Nilai default untuk model seriqwen3.8,qwen3.7,qwen3.6, danqwen3.5adalahtrue.false: Menonaktifkan mode berpikir. Nilai default untuk model seriqwen3-vl-plusdanqwen3-vl-flashadalahfalse.
-
Model dengan akhiran
thinking, sepertiqwen3-vl-235b-a22b-thinking, adalah model berpikir saja. Model ini selalu berpikir sebelum merespons, dan fitur ini tidak dapat dinonaktifkan.
- Kompatibel dengan OpenAI
- DashScope
enable_thinking bukan parameter standar OpenAI. Jika Anda menggunakan SDK Python OpenAI, lewatkan melalui extra_body.Input beberapa gambar
Model pemahaman visual mendukung pengiriman beberapa gambar dalam satu permintaan, yang dapat digunakan untuk tugas-tugas seperti perbandingan Produk dan pemrosesan dokumen multi-halaman. Untuk melakukannya, cukup sertakan beberapa objek gambar di dalam array content dari user message.
- Kompatibel dengan OpenAI
- DashScope
- Python
- Node.js
- curl
Tanggapan
Pemahaman video
Model pemahaman visual dapat memahami konten video yang disediakan sebagai daftar gambar (frame video) atau file video. Contoh berikut menunjukkan cara memahami video online atau daftar gambar yang ditentukan oleh URL. Untuk informasi lebih lanjut tentang batasan video atau jumlah gambar yang dapat dikirim dalam daftar gambar, lihat Batasan video.
Untuk kinerja yang lebih baik saat memahami file video, gunakan versi snapshot terbaru atau terkini dari model.
- File video
- Daftar gambar
-
fps: Mengontrol frekuensi ekstraksi frame. Satu frame diekstraksi setiap 1/fps detik. Rentang nilai adalah [0,1, 10], dan nilai default adalah 2,0.
- Untuk adegan dengan gerakan cepat, atur nilai fps lebih tinggi untuk menangkap lebih banyak detail.
- Untuk adegan statis atau video panjang, atur nilai fps lebih rendah untuk meningkatkan kinerja.
- max_frames: Jumlah maksimum frame yang diekstraksi dari video. Sistem menghitung total frame berdasarkan fps video. Jika jumlah total frame melebihi batas ini, sistem secara otomatis mengambil sampel frame secara merata untuk memenuhi batas tersebut. Parameter ini hanya tersedia saat menggunakan SDK DashScope.
- Kompatibel dengan OpenAI
- DashScope
Saat Anda mengirim file video langsung ke model pemahaman visual menggunakan SDK OpenAI atau HTTP, atur parameter"type"dalam pesan pengguna ke"video_url".
Kirim file lokal (encoding Base64 atau jalur file)
Model pemahaman visual mendukung dua metode untuk mengunggah file lokal: encoding Base64 dan pengunggahan jalur file langsung. Anda dapat memilih metode unggah berdasarkan ukuran file dan jenis SDK. Untuk rekomendasi, lihat Cara memilih metode unggah file. Kedua metode harus memenuhi persyaratan file yang dijelaskan dalam Batasan gambar.
- Unggah menggunakan encoding Base64
- Unggah menggunakan jalur file
Langkah-langkah untuk mengirim string yang diencode Base64 (contoh gambar)
Langkah-langkah untuk mengirim string yang diencode Base64 (contoh gambar)
-
Encode file: Konversi gambar lokal ke encoding Base64.
Kode contoh untuk mengonversi gambar ke encoding Base64
-
Buat URL Data dalam format berikut:
data:[MIME_type];base64,{base64_image}.- Ganti
MIME_typedengan jenis media aktual. Pastikan sesuai dengan nilaiMIME Typedalam tabel Format gambar yang didukung, sepertiimage/jpegatauimage/png. base64_imageadalah string Base64 yang dihasilkan pada langkah sebelumnya.
- Ganti
-
Panggil model: Kirimkan
URL Datamenggunakan parameterimageatauimage_url.
- Gambar
- File video
- Daftar gambar
- Melewatkan melalui jalur file
- Input yang diencode Base64
Proses gambar beresolusi tinggi
API model pemahaman visual memiliki batas jumlah token visual untuk satu gambar yang dikodekan. Dengan konfigurasi default, gambar beresolusi tinggi dikompresi, yang dapat menyebabkan hilangnya detail dan memengaruhi akurasi pemahaman. Aktifkan vl_high_resolution_images atau sesuaikan max_pixels untuk meningkatkan jumlah token visual. Hal ini mempertahankan lebih banyak detail gambar dan meningkatkan pemahaman.
Lihat jumlah piksel per token visual, batas token, dan batas piksel untuk setiap model
Lihat jumlah piksel per token visual, batas token, dan batas piksel untuk setiap model
Jika jumlah piksel gambar input melebihi batas piksel model, gambar tersebut akan di-downscale agar sesuai dalam batas tersebut.
Model | Piksel per token | vl_high_resolution_images | max_pixels | Batas token | Batas piksel |
|
|
|
|
|
|
| Dapat dikustomisasi. Nilai default-nya adalah | Ditentukan oleh |
| ||
|
|
|
|
|
|
| Dapat dikustomisasi. Nilai default-nya adalah | Ditentukan oleh |
| ||
Model lain dari |
|
|
|
|
|
| Dapat dikustomisasi. Nilai default-nya adalah | Ditentukan oleh |
|
-
Saat
vl_high_resolution_images=true, API menggunakan kebijakan resolusi tetap dan mengabaikan pengaturanmax_pixels. Ini cocok untuk mengenali teks halus, objek kecil, atau detail kaya dalam gambar. -
Saat
vl_high_resolution_images=false, batas piksel akhir bergantung pada nilai parametermax_pixels.- Untuk skenario yang sensitif terhadap biaya dan Anda ingin mengurangi konsumsi token visual: Gunakan nilai default
max_pixelsatau atur ke nilai yang lebih kecil.max_pixelsterutama memengaruhi jumlah token visual dan biaya pemanggilan. Dalam pengujian kami, menurunkannya tidak berdampak signifikan terhadap waktu respons end-to-end. Untuk mengurangi latensi, lihat Kecepatan respons dan pemilihan model. - Jika Anda ingin fokus pada detail tertentu dan dapat menerima kecepatan pemrosesan yang lebih rendah, tingkatkan nilai
max_pixelssesuai kebutuhan.
- Untuk skenario yang sensitif terhadap biaya dan Anda ingin mengurangi konsumsi token visual: Gunakan nilai default
Kecepatan respons dan pemilihan model
Dalam skenario yang sensitif terhadap latensi, waktu respons terutama ditentukan oleh model yang Anda pilih, bukan oleh max_pixels. Tabel berikut membandingkan waktu respons qwen-vl-max dan qwen-vl-plus dalam kondisi input yang sama:
Model | Rata-rata waktu respons | Karakteristik |
|---|---|---|
| Sekitar 12 detik | Pengenalan akurasi tinggi. Cocok untuk gambar dengan detail kaya dan toleransi kesalahan rendah. |
| Sekitar 8 detik | Kecepatan dan akurasi seimbang. Sekitar 39% lebih cepat daripada |
qwen-vl-max: 12,75 detik dan 11,84 detik, rata-rata 12,29 detik; qwen-vl-plus: 8,29 detik dan 6,75 detik, rata-rata 7,52 detik). Latensi aktual bervariasi tergantung ukuran gambar, panjang output, dan kondisi jaringan. Nilai-nilai ini hanya sebagai referensi dan bukan komitmen kinerja.
- Mengaktifkan keluaran streaming (
stream=True) secara signifikan mengurangi waktu hingga token pertama: untuk permintaan yang sama, token pertama dikembalikan dalam waktu sekitar 0,95 detik, sedangkan waktu total respons lengkap tetap tidak berubah. Ini cocok untuk skenario interaktif yang perlu menampilkan umpan balik sedini mungkin. - Untuk skenario pengenalan gambar yang sensitif terhadap latensi seperti alur kerja: Gunakan
qwen-vl-plusdenganstream=Trueuntuk mendapatkan token pertama dalam waktu sekitar 1 detik. Beralihlah keqwen-vl-maxhanya jika akurasi pengenalanqwen-vl-plustidak memenuhi kebutuhan Anda. Menyesuaikanmax_pixelsbukan cara untuk meningkatkan kecepatan.
- Kompatibel dengan OpenAI
- DashScope
vl_high_resolution_images bukan parameter standar OpenAI. Cara meneruskannya berbeda-beda di berbagai SDK bahasa:- Python SDK: Harus diteruskan melalui kamus
extra_body. - Node.js SDK: Dapat diteruskan langsung sebagai parameter tingkat atas.
Penggunaan lainnya
Batasan
Batasan file input
- Batasan gambar
- Batasan video
-
Resolusi gambar:
-
Ukuran minimum: Lebar dan tinggi gambar harus masing-masing lebih besar dari
10piksel. -
Rasio aspek: Rasio sisi panjang terhadap sisi pendek, baik untuk gambar asli maupun gambar yang telah diubah ukurannya, tidak boleh melebihi
200:1.Untuk informasi mengenai logika pengubahan ukuran gambar, lihat fungsi
smart_resizedalam Menghitung token gambar -
Piksel maksimum:
- Pertahankan resolusi gambar dalam batas
8K (7680x4320). Gambar dengan resolusi lebih tinggi dapat menyebabkan timeout panggilan API karena ukuran file yang besar dan waktu transmisi jaringan yang lama. - Pengubahan ukuran otomatis: Model dapat menyesuaikan ukuran gambar menggunakan parameter
max_pixelsdanmin_pixels. Memberikan gambar beresolusi tinggi tidak meningkatkan akurasi deteksi. Sebaliknya, hal ini meningkatkan risiko kegagalan panggilan. Ubah ukuran gambar ke ukuran yang wajar di sisi client sebelum mengunggah.
- Pertahankan resolusi gambar dalam batas
-
Ukuran minimum: Lebar dan tinggi gambar harus masing-masing lebih besar dari
-
Format gambar yang didukung
-
Untuk resolusi di bawah 4K
(3840x2160), format gambar berikut didukung:Format gambar
Ekstensi umum
Jenis MIME
BMP
.bmp
image/bmp
JPEG
.jpe, .jpeg, .jpg
image/jpeg
PNG
.png
image/png
TIFF
.tif, .tiff
image/tiff
WEBP
.webp
image/webp
HEIC
.heic
image/heic
-
Untuk resolusi antara
4K (3840x2160)dan8K (7680x4320), hanya format JPEG, JPG, dan PNG yang didukung.
-
Untuk resolusi di bawah 4K
-
Ukuran gambar:
Batasan berikut berlaku untuk setiap gambar individual. Untuk input multi-gambar, setiap gambar dievaluasi secara independen dan ukurannya tidak diakumulasi.
- Jika dikirim sebagai URL publik: Satu gambar tidak boleh melebihi
20 MBuntuk model seri Qwen3.8, Qwen3.7, Qwen3.6, Qwen3.5, dan Qwen3-VL. Untuk model lainnya, satu gambar tidak boleh melebihi10 MB. - Jika dikirim sebagai path lokal: Satu gambar tidak boleh melebihi
10 MB. - Jika dikirim sebagai encoding Base64 (API kompatibel OpenAI): Untuk model seri Qwen3.8, Qwen3.7, Qwen3.6, Qwen3.5, dan Qwen3-VL, file gambar asli sebelum encoding tidak boleh melebihi
20 MB. Untuk model lainnya, tidak boleh melebihi10 MB. Dalam kedua kasus tersebut, string Data URI hasil encoding tidak boleh melebihi20 MB. - Jika dikirim sebagai encoding Base64 (API kompatibel Anthropic): Total badan permintaan tidak boleh melebihi
6 MB. Jika mengirimkan beberapa gambar, kuota ini dibagi bersama.
Untuk mengompresi file, lihat Cara mengompresi gambar atau video ke ukuran yang diperlukan.
- Jika dikirim sebagai URL publik: Satu gambar tidak boleh melebihi
-
Batasan jumlah gambar: Jumlah maksimum gambar yang didukung untuk input multi-gambar bervariasi berdasarkan metode input:
-
Jika dikirim sebagai URL publik atau path lokal:
- Seri Qwen3.8-Max, Qwen3.8-Flash, Qwen3.7-Plus: Hingga 2.048 gambar
- Seri Qwen3.7-Flash, Qwen3.6-Plus, Qwen3.6-Flash, Qwen3.5-Plus, Qwen3.5-Flash, Qwen3-VL, Qwen-VL, seri QVQ: Hingga 256 gambar
- Untuk seri Qwen-Omni, lihat Omni-modal.
- Jika dikirim sebagai string terenkripsi Base64: Hingga 250 gambar
-
Jika dikirim sebagai URL publik atau path lokal:
Jumlah total token untuk semua gambar juga dibatasi oleh batas maksimum token input model. Total jumlah token untuk semua gambar dan teks tidak boleh melebihi batas maksimum input model.
Metode input file
-
URL publik: Berikan alamat file yang dapat diakses publik dan mendukung protokol HTTP atau HTTPS. Untuk stabilitas dan performa optimal, unggah file ke OSS guna memperoleh URL publik. Model Studio tidak dapat mengakses titik akhir internal OSS, yang alamatnya mengandung
-internal, sepertihttps://<bucket>.oss-cn-hangzhou-internal.aliyuncs.com/image.jpg. Jika Anda memberikan alamat internal, unduhan file akan gagal dan kode errorInvalidParameterakan dikembalikan dengan pesanFailed to download multimodal content. Gunakan titik akhir publik OSS, sepertihttps://<bucket>.oss-cn-hangzhou.aliyuncs.com/image.jpg, atau URL OSS yang telah ditandatangani (presigned). - Encoding Base64: Konversi file menjadi string terenkripsi Base64, lalu kirimkan.
- Path file lokal (hanya untuk SDK DashScope): Kirimkan path file lokal.
Untuk rekomendasi cara memilih metode input file, lihat Bagaimana cara memilih metode unggah file?
Menggunakan di lingkungan produksi
- Pra-pemrosesan gambar dan video: Model pemahaman visual memiliki batas ukuran untuk file input. Untuk mengompresi file, lihat Metode kompresi gambar atau video.
-
Pemrosesan file teks: Model pemahaman visual hanya mendukung file gambar dan video. Model ini tidak mendukung pemrosesan file berbasis teks seperti TXT, Word (.doc/.docx), PDF, atau format lainnya. Gunakan salah satu solusi berikut:
- Konversi file teks ke format gambar. Gunakan pustaka pemrosesan gambar, seperti pdf2image untuk Python, untuk mengonversi file tersebut per halaman menjadi beberapa gambar berkualitas tinggi. Kemudian, kirimkan gambar-gambar tersebut ke model menggunakan metode input multi-gambar.
- Gunakan Qwen-Long, yang mendukung pengunggahan dokumen dan melakukan percakapan dengan meneruskan informasi melalui
file-id.
-
Toleransi kesalahan dan stabilitas
- Penanganan timeout: Pada panggilan non-streaming, terjadi error timeout jika model tidak selesai menghasilkan output dalam waktu 300 detik. Saat timeout terjadi, konten yang telah dihasilkan dikembalikan dalam badan respons. Header respons yang berisi
x-dashscope-partialresponse: truemenunjukkan bahwa respons mengalami timeout. Gunakan fitur mode sebagian, yang didukung oleh beberapa model. Tambahkan konten yang telah dihasilkan ke dalam arraymessagesdan kirim ulang permintaan tersebut. Hal ini memungkinkan Large Language Model (LLM) melanjutkan proses generasi konten. Untuk informasi lebih lanjut, lihat Lanjutkan generasi dari output yang belum lengkap. - Konfigurasi timeout sisi client: Timeout yang disebutkan sebelumnya adalah timeout sisi server yang terjadi ketika model tidak selesai menghasilkan output dalam waktu 300 detik. Ini berbeda dari timeout sisi client bawaan SDK. Saat Anda memproses gambar berukuran besar, seperti gambar beresolusi 4000 x 4000 piksel, permintaan mungkin memerlukan waktu lebih lama daripada timeout sisi client bawaan SDK dan terputus dengan error
APITimeoutError, meskipun batas 300 detik sisi server belum tercapai. Untuk menghindarinya, gunakanwith_optionspada OpenAI Python SDK untuk memperpanjang timeout sisi client:
- Penanganan timeout: Pada panggilan non-streaming, terjadi error timeout jika model tidak selesai menghasilkan output dalam waktu 300 detik. Saat timeout terjadi, konten yang telah dihasilkan dikembalikan dalam badan respons. Header respons yang berisi
- Output streaming: Atur
stream=Trueagar model mengembalikan konten secara bertahap, bukan menunggu respons lengkap sekaligus. Hal ini mencegah terjadinya timeout sisi client akibat panggilan non-streaming berdurasi panjang saat memproses gambar besar:
- Mekanisme retry: Rancang logika retry panggilan API yang masuk akal, seperti exponential backoff, untuk menangani fluktuasi jaringan atau ketidaktersediaan layanan sementara.
Penagihan dan pembatasan laju
-
Penagihan:Total biaya dihitung berdasarkan jumlah total token input dan output. Harga token input dan output tersedia di Konsol Model Studio.
- Komposisi token:Token input terdiri dari token teks dan token yang dikonversi dari gambar atau video. Token output adalah teks yang dihasilkan oleh model. Dalam mode thinking, proses berpikir model juga dihitung sebagai token output. Jika proses berpikir tidak ditampilkan dalam mode thinking, penagihan mengikuti harga untuk mode non-thinking.
-
Hitung token untuk gambar dan video:Gunakan kode berikut untuk menghitung konsumsi token gambar atau video. Hasil perkiraan hanya untuk referensi. Penggunaan aktual didasarkan pada respons API.
Hitung token untuk gambar dan video
- Gambar
- Video
Rumus:Image Tokens = h_bar * w_bar / token_pixels + 2-
h_bar, w_bar: Tinggi dan lebar gambar yang telah diskalakan. Sebelum memproses gambar, model melakukan pra-pemrosesan untuk mengecilkan ukurannya hingga batas piksel tertentu. Batas ini bergantung pada nilai parametermax_pixelsdanvl_high_resolution_images. Untuk informasi lebih lanjut, lihat Process high-resolution images. -
token_pixels: Nilai piksel yang sesuai dengan setiaptokenvisual. Nilai ini bervariasi tergantung model:qwen3.8-series,qwen3.7-series,qwen3.6-series,qwen3.5-series,Qwen3-VL,qwen-vl-max, danqwen-vl-plus:Setiaptokensesuai dengan32x32piksel.QVQdan modelQwen2.5-VLlainnya:Setiap token sesuai dengan28x28piksel.
- Lihat tagihan:Lihat tagihan atau isi ulang akun Anda di halaman Biaya dan Pengeluaran di Konsol Manajemen Alibaba Cloud.
- Pembatasan laju:Untuk informasi lebih lanjut tentang kondisi pembatasan laju untuk model pemahaman visual, lihat Pembatasan laju.
- Kuota gratis(Hanya wilayah Singapura): Kuota gratis sebesar 1 juta token disediakan untuk model pemahaman visual. Periode validitas 90 hari dimulai sejak tanggal Anda mengaktifkan Model Studio atau permintaan model Anda disetujui.
Referensi API
Untuk informasi lebih lanjut mengenai parameter input dan output model pemahaman visual, lihat generasi teks.
FAQ
Bagaimana cara memilih metode unggah file?
Bagaimana cara memilih metode unggah file?
Jenis file | Spesifikasi file | DashScope SDK (Python, Java) | Kompatibel dengan OpenAI / DashScope HTTP |
|---|---|---|---|
Image | Lebih dari 7 MB dan kurang dari 10 MB | Gunakan path lokal | Hanya URL jaringan publik yang didukung. Gunakan Alibaba Cloud Object Storage Service |
Kurang dari 7 MB | Gunakan path lokal | Base64 encoding | |
Video | Lebih dari 100 MB | Hanya URL jaringan publik yang didukung. Gunakan Alibaba Cloud Object Storage Service | Hanya URL jaringan publik yang didukung. Gunakan Alibaba Cloud Object Storage Service |
Lebih dari 7 MB dan kurang dari 100 MB | Gunakan path lokal | Hanya URL jaringan publik yang didukung. Gunakan Alibaba Cloud Object Storage Service | |
Kurang dari 7 MB | Gunakan path lokal | Base64 encoding |
Base64 encoding meningkatkan ukuran data. Ukuran file asli harus kurang dari 7 MB.
Gunakan Base64 atau path lokal untuk menghindari timeout unduhan di sisi server dan meningkatkan stabilitas.
Bagaimana cara memampatkan gambar atau video agar sesuai ukuran yang diminta?
Bagaimana cara memampatkan gambar atau video agar sesuai ukuran yang diminta?
Metode kompresi gambar
Metode kompresi gambar
- Alat online: Gunakan alat online seperti CompressJPEG untuk memampatkan gambar.
- Perangkat lunak lokal: Gunakan perangkat lunak seperti Photoshop untuk menyesuaikan kualitas saat mengekspor.
- Implementasi kode:
Metode kompresi video
Metode kompresi video
- Alat online: Gunakan alat online seperti FreeConvert untuk memampatkan video.
- Perangkat lunak lokal: Gunakan perangkat lunak seperti HandBrake.
- Implementasi kode: Gunakan tool FFmpeg. Untuk informasi lebih lanjut, lihat website resmi FFmpeg.
Setelah model menghasilkan hasil lokasi objek, bagaimana cara menggambar bingkai deteksi pada gambar asli?
Setelah model menghasilkan hasil lokasi objek, bagaimana cara menggambar bingkai deteksi pada gambar asli?
- Qwen2.5-VL: Koordinat yang dikembalikan adalah nilai absolut dalam piksel, relatif terhadap pojok kiri atas gambar yang telah diskalakan. Untuk menggambar bingkai deteksi, lihat kode dalam qwen2_5_vl_2d.py.
- Seri Qwen3-VL, Qwen3.5, Qwen3.6, dan Qwen3.7 (seperti qwen3.5-plus, qwen3.6-plus, dan qwen3.7-plus): Koordinat yang dikembalikan bersifat relatif dan dinormalisasi ke rentang
[0, 999]. Untuk menggambar bingkai deteksi, lihat kode dalam qwen3_vl_2d.py (posisi 2D) atau qwen3_vl_3d.zip (posisi 3D).












