Qwen-OCR adalah model pemahaman visual yang mengekstraksi teks dan data terstruktur dari gambar—seperti dokumen hasil pindaian, tabel, struk, dan lainnya. Model ini mendukung berbagai bahasa serta tugas OCR tingkat lanjut, termasuk ekstraksi informasi, penguraian tabel, pengenalan rumus, dan penguraian dokumen.
Contoh
| Gambar input | Hasil pengenalan |
|---|---|
Kenali berbagai bahasa![]() | INTERNATIONALMOTHER LANGUAGEDAYПривет!你好!Bonjour!Merhaba!Ciao!Hello!Ola!בר מולדSalam! |
Kenali gambar miring![]() | Perkenalan ProdukFilamen serat impor dari Korea Selatan.6941990612023No. Item: 2023 |
Temukan posisi teks![]() pengenalan presisi tinggi mendukung pelokalisasian teks. | Visualisasi pelokalisasian![]() Lihat FAQ tentang cara menggambar kotak pembatas setiap baris teks ke gambar asli. |
Pemilihan model
Qwen-OCR menyediakan model-model berikut. Pilih sesuai kebutuhan bisnis Anda:
- Qwen3.5-OCR: Dibangun di atas arsitektur Qwen3.5, dengan peningkatan komprehensif dalam penguraian dokumen, pelokalisasian teks, dan ekstraksi informasi kunci. Mendukung percakapan multi-putaran dan penguraian dokumen PDF. Mengalami peningkatan signifikan dalam mengekstraksi informasi dari sertifikat bisnis (seperti KTP dan SIM). Untuk jenis sertifikat yang didukung, lihat Jenis sertifikat dan dokumen yang didukung. Termasuk model
qwen3.5-ocr. - Qwen-VL-OCR: Dibangun di atas arsitektur Qwen3-VL. Mendukung tugas bawaan termasuk penguraian dokumen, pelokalisasian teks (pengenalan presisi tinggi), ekstraksi informasi, penguraian tabel, pengenalan rumus, pengenalan teks umum, dan pengenalan multibahasa. Juga mendukung koreksi rotasi gambar. Termasuk model
qwen-vl-ocr(stabil),qwen-vl-ocr-latest(terbaru),qwen-vl-ocr-2025-11-20, danqwen-vl-ocr-2025-08-28. - Versi lama (tidak direkomendasikan): Versi-versi ini lebih rendah dibanding model baru baik dari segi fitur maupun performa. Kami merekomendasikan migrasi ke
qwen3.5-ocr. Termasuk modelqwen-vl-ocr-2025-04-13danqwen-vl-ocr-2024-10-28.
Pengalaman online: Kunjungi Konsol Model Studio, pilih wilayah target di pojok kanan atas, lalu buka Model Vision untuk mencoba model Qwen-OCR.qwen-vl-ocr, qwen-vl-ocr-2025-04-13, dan qwen-vl-ocr-2025-08-28, parametermax_tokens(panjang output maksimum) secara default bernilai 4096. Untuk meningkatkan nilai ini menjadi rentang 4097 hingga 8192, hubungi manajer komersial Anda dan berikan informasi berikut: ID akun Alibaba Cloud Anda, jenis gambar (misalnya gambar dokumen, gambar e-commerce, atau kontrak), nama model, perkiraan Queries Per Second (QPS) dan total permintaan harian, serta persentase permintaan di mana panjang output model melebihi 4096 token.
Persiapan
- Buat Kunci API dan tetapkan sebagai variabel lingkungan.
-
Jika Anda menggunakan SDK OpenAI atau SDK DashScope, instal versi SDK terbaru. Versi minimum: SDK Python DashScope 1.22.2, SDK Java 2.21.8.
-
SDK DashScope
- Keunggulan: Akses penuh ke fitur-fitur tingkat lanjut—seperti koreksi rotasi gambar dan tugas OCR bawaan—dengan API yang sederhana.
- Paling cocok untuk: Proyek yang membutuhkan rangkaian fitur lengkap.
-
SDK kompatibel OpenAI
- Keunggulan: Pengganti langsung untuk integrasi SDK OpenAI yang sudah ada.
- Keterbatasan: Fitur-fitur tingkat lanjut seperti koreksi rotasi gambar dan tugas OCR bawaan tidak tersedia langsung sebagai parameter. Simulasikan dengan menyusun prompt dan mengurai output.
- Paling cocok untuk: Proyek yang sudah menggunakan OpenAI dan tidak memerlukan fitur eksklusif DashScope.
-
SDK DashScope
Memulai
Contoh berikut mengekstraksi bidang terstruktur dari gambar tiket kereta (URL) dan mengembalikan hasil dalam format JSON. Untuk file lokal, lihat cara meneruskan file lokal. Untuk batasan input, lihat batasan gambar.
- OpenAI compatible-Chat
- OpenAI compatible-Response
- DashScope
Contoh respons
Contoh respons
Panggil tugas bawaan
Model (kecuali qwen-vl-ocr-2024-10-28) dilengkapi tugas bawaan untuk skenario OCR umum.
Cara memanggil tugas bawaan:
- SDK DashScope: Atur parameter
ocr_optionsuntuk memanggil tugas bawaan. Mulai dariqwen3.5-ocr, tugas bawaan berjalan bersama Prompt kustom Anda (tidak lagi menimpanya), dan hasilnya dikembalikan dalam bidangocr_result. Model sebelumnya menggunakanPromptinternal yang tetap. - SDK kompatibel OpenAI: Teruskan
Promptspesifik tugas secara manual dalam pesan Anda.
task, Prompt tetap, format output, dan contoh output:
- Pengenalan presisi tinggi
- Ekstraksi informasi
- Penguraian tabel
- Penguraian dokumen
- Pengenalan rumus
- Pengenalan teks umum
- Pengenalan multibahasa
qwen-vl-ocr-2025-08-28 atau versi terbaru (direkomendasikan). Fitur-fitur:- Mengenali dan mengekstraksi konten teks.
- Mendeteksi posisi teks dengan melokalisasi baris teks dan mengeluarkan koordinatnya.
Untuk menggambar kotak pembatas pada gambar asli menggunakan koordinat yang dikembalikan, lihat FAQ.
| Nilai Tugas | Prompt yang ditentukan | Format output dan contoh |
|---|---|---|
advanced_recognition | Temukan semua baris teks dan kembalikan koordinat persegi panjang yang diputar ([cx, cy, width, height, angle]). |
|
Contoh respons
Contoh respons
Penguraian dokumen PDF
qwen3.5-ocr mendukung penerusan file PDF secara langsung melalui API Response untuk penguraian dokumen, tanpa perlu membagi PDF menjadi gambar secara manual. Panjang output tidak dibatasi oleh panjang output maksimum model, sehingga memungkinkan penguraian lengkap dokumen panjang. Hanya API Response yang didukung; API Chat tidak didukung. Batasan file PDF: tidak lebih dari 100 MB. Batas jumlah halaman bergantung pada task di ocr_options: hingga 50 halaman jika task disetel ke document_parsing, dan hingga 10 halaman jika task tidak disetel atau disetel ke tugas lain.
Contoh berikut menggunakan API Response untuk meneruskan file PDF guna penguraian dokumen.
Untuk model versi lama (qwen-vl-ocr-2025-11-20dan sebelumnya) yang tidak mendukung API Response, gunakan pustaka pemrosesan gambar sepertiPython'spdf2imageuntuk mengonversi setiap halaman PDF menjadi gambar, lalu gunakan metode input multi-gambar untuk pengenalan per halaman.
Untuk penggunaan API Responses kompatibel OpenAI lainnya (seperti mengambil dan mengelola respons model yang telah selesai), lihat OpenAI compatible - Responses.
Meneruskan file lokal (encoding Base64 atau jalur file)
Unggah file lokal menggunakan encoding Base64 atau jalur file langsung. Pilih metode berdasarkan ukuran file dan jenis SDK — lihat Cara memilih metode unggah file. Kedua metode harus memenuhi persyaratan file dalam Batasan gambar.
- Gunakan encoding Base64
- Gunakan jalur file
Langkah-langkah untuk meneruskan string terenkripsi Base64
Langkah-langkah untuk meneruskan string terenkripsi Base64
-
Enkode file: Konversi gambar lokal menjadi string terenkripsi Base64.
Contoh Kode untuk Mengonversi Gambar ke String Berenkode Base64
-
Buat Data URL dalam format berikut:
data:[MIME_type];base64,{base64_image}.- Ganti
MIME_typedengan jenis media aktual. Pastikan jenis tersebut sesuai dengan nilaiMIME Typedalam tabel Batasan gambar, sepertiimage/jpegatauimage/png. base64_imageadalah string terenkripsi Base64 yang dihasilkan pada langkah sebelumnya.
- Ganti
-
Panggil model: Teruskan
Data URLmenggunakan parameterimageatauimage_urluntuk memanggil model.
- Meneruskan jalur file
- Melewatkan string yang dienkode Base64
Penerusan jalur file hanya didukung untuk panggilan yang dilakukan dengan SDK Python dan Java DashScope. Metode ini tidak didukung untuk metode HTTP DashScope atau kompatibel OpenAI.
Penggunaan lainnya
Batasan
Batasan gambar
- Dimensi dan rasio aspek: Lebar dan tinggi gambar harus keduanya lebih besar dari 10 piksel. Rasio aspek tidak boleh melebihi 200:1 atau 1:200.
- Total piksel: Model secara otomatis menskalakan gambar, sehingga tidak ada batasan ketat pada jumlah total piksel. Namun, gambar tidak boleh melebihi 15,68 juta piksel.
-
Format gambar yang didukung
-
Untuk gambar dengan resolusi di bawah 4K
(3840x2160), format berikut didukung:Format gambar
Ekstensi umum
Jenis MIME
BMP
.bmp
image/bmp
JPEG
.jpe, .jpeg, .jpg
image/jpeg
PNG
.png
image/png
TIFF
.tif, .tiff
image/tiff
WEBP
.webp
image/webp
HEIC
.heic
image/heic
-
Untuk gambar dengan resolusi dari
4K(3840x2160)hingga8K(7680x4320), hanya format JPEG, JPG, dan PNG yang didukung.
-
Untuk gambar dengan resolusi di bawah 4K
-
Ukuran gambar:
- Jika Anda menyediakan gambar menggunakan URL publik atau jalur lokal:
qwen3.5-ocrmendukung gambar hingga20 MB; versi lain mendukung hingga10 MB. - Jika Anda menyediakan data dalam encoding Base64, string terenkripsi tidak boleh melebihi
10 MB.
Lihat juga: Bagaimana cara memampatkan gambar atau video ke ukuran yang diperlukan?.
- Jika Anda menyediakan gambar menggunakan URL publik atau jalur lokal:
Batasan model
-
Pesan sistem: Qwen-OCR menggunakan
System Messageinternal tetap dan tidak menerima pesan kustom. Teruskan semua instruksi dalamUser Message. -
Percakapan multi-putaran: Mulai dari
qwen3.5-ocr, percakapan multi-putaran didukung—Anda dapat mengirim pesan teks lanjutan tanpa URL gambar. Versiqwen-vl-ocr-2025-11-20dan sebelumnya hanya memproses pesan terbaru dan tidak menyimpan konteks. - Risiko halusinasi: Model mungkin mengalami halusinasi jika teks dalam gambar terlalu kecil atau memiliki resolusi rendah. Selain itu, akurasi jawaban untuk pertanyaan yang tidak terkait ekstraksi teks tidak dijamin.
-
Kesalahan Pemrosesan File Teks:
- Untuk file yang berisi data gambar, ikuti rekomendasi dalam Going live untuk mengubahnya menjadi urutan gambar sebelum diproses.
- Untuk file dengan teks biasa atau data terstruktur, gunakan Qwen-Long, model yang dapat mengurai teks panjang.
Jenis sertifikat dan dokumen yang didukung
Tugas ekstraksi informasi mendukung ekstraksi data terstruktur dari sertifikat, struk, dan izin berikut.
- Paspor dan dokumen perjalanan: Paspor Tiongkok, paspor Makau, Izin Perjalanan Daratan untuk Penduduk Hong Kong dan Makau, Izin Perjalanan Daratan untuk Penduduk Taiwan, dan Izin Pulang untuk Penduduk Hong Kong dan Makau.
- Dokumen kendaraan dan faktur penjualan: SIM, plat nama kendaraan, sertifikat kesesuaian kendaraan, sertifikat registrasi kendaraan, faktur penjualan kendaraan bermotor, dan faktur penjualan kendaraan bekas.
- Faktur dan struk pajak: Faktur PPN biasa (gulung), faktur khusus nominal tetap, faktur cetak mesin umum, sertifikat pembayaran pajak, dan struk pendapatan non-pajak pusat.
- Struk transportasi: Tiket kereta cepat 12306, tiket kereta, tiket kapal, struk tol jalan raya, dan faktur cetak mesin tol jalan raya.
- Kartu keuangan dan struk: Kartu kredit, wesel bank elektronik, struk pembayaran, dan kartu jaminan sosial.
- Lisensi dan izin usaha: Lisensi usaha, lisensi usaha makanan, lisensi produksi makanan, lisensi usaha farmasi, dan lisensi usaha alat kesehatan.
- Sertifikat properti: Sertifikat kepemilikan properti.
- KTP internasional: KTP Hong Kong, KTP Makau, KTP Indonesia, KTP Thailand, KTP Vietnam, KTP Malaysia, KTP Filipina, KTP India, KTP Turki, KTP Pakistan, KTP Meksiko, KTP Inggris, dan KTP AS.
- Paspor dan SIM internasional: Paspor India, paspor Singapura, paspor Thailand, paspor AS, paspor Australia, paspor UEA, SIM Filipina, SIM Jepang, dan SIM AS.
Penagihan dan pembatasan laju
-
Penagihan: Qwen-OCR adalah model multimodal. Total biaya dihitung sebagai berikut: (Jumlah token input × Harga satuan input) + (Jumlah token output × Harga satuan output). Lihat tagihan atau isi ulang akun Anda di konsol Biaya dan Pengeluaran.
-
Menghitung token gambar: Gunakan kode berikut untuk memperkirakan penggunaan token gambar. Penagihan aktual berdasarkan respons API.
Kode contoh untuk memperkirakan token gambar
Rumus: Token gambar =(h_bar * w_bar) / token_pixels + 2.-
h_bar * w_barmerepresentasikan dimensi gambar yang diskalakan. Model melakukan pra-pemrosesan gambar dengan menskalakannya ke batas piksel tertentu. Batas ini bergantung pada nilai parametermax_pixels. -
token_pixelsmerepresentasikan nilai piksel perToken.- Untuk
qwen3.5-ocr,qwen-vl-ocr,qwen-vl-ocr-2025-11-20, danqwen-vl-ocr-latest, nilai ini tetap pada32*32(yaitu1024). - Untuk model lain, nilai ini tetap pada
28*28(yaitu784).
- Untuk
-
-
Menghitung token gambar: Gunakan kode berikut untuk memperkirakan penggunaan token gambar. Penagihan aktual berdasarkan respons API.
- Pembatasan laju: Untuk batas laju Qwen-OCR, lihat Pembatasan laju.
- Kuota gratis (hanya Singapura): Qwen-OCR menyediakan kuota gratis 1 juta token. Kuota ini berlaku selama 90 hari, mulai dari tanggal Anda mengaktifkan Model Studio atau permintaan Anda untuk menggunakan model disetujui.
Going live
-
Pra-pemrosesan gambar:
-
Pastikan gambar input jelas, pencahayaan merata, dan tidak terlalu terkompresi:
- Simpan dan transmisikan gambar dalam format lossless (misalnya PNG) untuk menghindari kehilangan informasi.
- Untuk meningkatkan definisi gambar, gunakan algoritma penghilangan derau, seperti filter mean atau median, untuk menghaluskan gambar berisik.
- Untuk mengoreksi pencahayaan tidak merata, gunakan algoritma seperti equalisasi histogram adaptif untuk menyesuaikan kecerahan dan kontras.
-
Gambar miring: Atur
enable_rotate: truedalam SDK DashScope untuk mengoreksi rotasi sebelum pengenalan. -
Gambar sangat kecil atau sangat besar: Gunakan
min_pixelsdanmax_pixelsuntuk mengatur penskalaan gambar.min_pixels: Memperbesar gambar kecil guna meningkatkan detail. Pertahankan nilai default.max_pixels: Mencegah gambar berukuran terlalu besar mengonsumsi terlalu banyak token. Nilai default mencakup sebagian besar kasus. Tingkatkan nilai ini jika teks kecil terlewat—hal ini akan meningkatkan penggunaan token.
-
Pastikan gambar input jelas, pencahayaan merata, dan tidak terlalu terkompresi:
- Validasi hasil: Hasil pengenalan model mungkin mengandung kesalahan. Untuk operasi bisnis kritis, terapkan proses tinjauan manual atau tambahkan aturan validasi untuk memverifikasi akurasi output model. Misalnya, gunakan validasi format untuk nomor KTP dan kartu bank.
- Pemrosesan batch: Untuk beban kerja volume tinggi non-real-time, gunakan API Batch untuk memproses pekerjaan secara asinkron dengan biaya lebih rendah.
FAQ
Bagaimana memilih metode unggah file?
Bagaimana memilih metode unggah file?
Jenis | Spesifikasi | SDK DashScope (Python, Java) | OpenAI compatible / DashScope HTTP |
|---|---|---|---|
Gambar | Lebih dari 7 MB dan kurang dari 10 MB | Teruskan jalur lokal | Hanya URL publik yang didukung. Gunakan Layanan Penyimpanan Objek. |
Kurang dari 7 MB | Teruskan jalur lokal | Encoding Base64 |
Encoding Base64 meningkatkan ukuran data. Ukuran file asli harus kurang dari 7 MB.
Menggunakan jalur lokal atau encoding Base64 membantu mencegah timeout unduhan di sisi server dan meningkatkan stabilitas.
Bagaimana cara menggambar bingkai deteksi pada gambar asli setelah model mengeluarkan hasil pelokalisasian teks?
Bagaimana cara menggambar bingkai deteksi pada gambar asli setelah model mengeluarkan hasil pelokalisasian teks?
Respons kosong atau berisi tag gaya antarmuka depan setelah saya meneruskan Prompt kustom. Apa yang harus saya lakukan?
Respons kosong atau berisi tag gaya antarmuka depan setelah saya meneruskan Prompt kustom. Apa yang harus saya lakukan?
qwen3.5-ocr, jika Prompt kustom Anda berisi struktur HTML lengkap, seperti <html><body>...</body></html>, model mungkin mengikuti struktur tersebut dan mengembalikan hasil OCR dalam format HTML alih-alih teks biasa. Respons kemudian tampak kosong atau tampak berisi tag gaya antarmuka depan. Tag sederhana, seperti <br> saja, tidak memicu perilaku ini.Untuk mengatasi masalah ini, gunakan salah satu metode berikut:- Periksa apakah Prompt Anda berisi struktur tag HTML lengkap. Jika iya, ganti dengan instruksi teks biasa dan coba lagi. Misalnya, ubah
<html><body>Extract all text from the image</body></html>menjadiExtract all text from the image. - Jika Anda tidak yakin apakah Prompt Anda memengaruhi format output, abaikan bidang
textuntuk menggunakan Prompt default model. - Gunakan model
qwen3.7-plussebagai gantinya. Model ini mengembalikan hasil teks biasa bahkan ketika Anda meneruskan Prompt yang sama yang berisi struktur HTML.



