Beberapa model yang didukung oleh Token Plan (qwen3.8-max, qwen3.7-plus, dll.) secara native mendukung pemahaman visual dan dapat memproses input gambar secara langsung. Untuk model berbasis teks saja seperti glm-5.2 dan deepseek-v4-pro, Anda dapat menambahkan kemampuan visual dengan mengonfigurasi Skill lokal.
Prasyarat
- Anda telah berlangganan Token Plan.
- Anda telah menyelesaikan konfigurasi integrasi di alat AI dan dapat mengobrol secara normal. Untuk detailnya, lihat Clients and Developer Tools.
Dukungan visi
Untuk informasi apakah setiap model mendukung pemahaman visual, lihat tabel model yang didukung di Ringkasan Token Plan Personal Edition dan Ringkasan Token Plan Team Edition.
Metode 1: Gunakan model visi secara langsung (direkomendasikan)
Model seperti qwen3.7-plus memiliki kemampuan pemahaman visual bawaan. Jika Anda sering perlu memproses gambar, beralih ke salah satu model ini merupakan pendekatan paling sederhana dan direkomendasikan.
Tool | Cara mengganti model |
|---|---|
Claude Code |
|
OpenCode |
|
Qwen Code |
|
Metode 2: Tambahkan kemampuan visual melalui Skill atau Agent
Jika Anda perlu menggunakan model berbasis teks saja seperti glm-5.2 atau deepseek-v4-pro untuk pemrosesan gambar, Anda dapat mengonfigurasi Skill atau Agent untuk mengaktifkan kemampuan visual.
- Claude Code
- OpenCode
-
Tambahkan Skill
Buat folder
.claudedi direktori proyek Anda, lalu buat direktoriskills/image-analyzerdi dalamnya:
SKILL.md di direktori tersebut dengan konten berikut:-
Mulai
-
Jalankan
claudedi direktori proyek Anda untuk memulai Claude Code, lalu jalankan/model deepseek-v4-prountuk beralih ke modeldeepseek-v4-pro. -
Unduh alibabacloud.png ke direktori proyek Anda, lalu tanyakan:
Load image-analyzer skill and describe the information displayed at the alibabacloud.png banner location.Anda akan menerima respons seperti berikut: Gambar alibabacloud.png adalah tangkapan layar halaman utama Alibaba Cloud. Judul area banner adalah Coding Plan now supports Qwen3.5, dan teks tersebut menjelaskan bahwa Alibaba Cloud Model Studio mendukung model seperti Qwen3.5, Kimi-k2.5, dan GLM-4.7, dengan pelanggan baru hanya membayar 7,9 yuan untuk bulan pertama. Halaman ini menyediakan titik masuk Subscribe now dan Online consultation.
-
Jalankan
FAQ
Mengapa OpenCode + model visi tidak bisa memahami gambar?
Mengapa OpenCode + model visi tidak bisa memahami gambar?
modalities dalam file konfigurasi.Solusi: Tambahkan bidang modalities ke definisi model dalam file konfigurasi OpenCode Anda, dan atur input menjadi ["text", "image"], seperti pada contoh berikut:Ganti sk-sp-xxx dengan Token Plan API Key Anda.
Mengapa OpenClaw + model visi tidak bisa memahami gambar?
Mengapa OpenClaw + model visi tidak bisa memahami gambar?
- Dalam file konfigurasi
~/.openclaw/openclaw.json, pastikan definisi model mencakup bidang"input": ["text", "image"].
- Setelah mengubah konfigurasi, Anda harus menghapus cache model OpenClaw dan melakukan restart. Jika tidak, konfigurasi lama akan tetap berlaku.