Skip to main content
Praktik terbaik

Tambahkan kemampuan pemahaman visual

Beberapa model yang didukung oleh Token Plan (qwen3.8-max, qwen3.7-plus, dll.) secara native mendukung pemahaman visual dan dapat memproses input gambar secara langsung. Untuk model berbasis teks saja seperti glm-5.2 dan deepseek-v4-pro, Anda dapat menambahkan kemampuan visual dengan mengonfigurasi Skill lokal.

Menjalankan Skill pemahaman gambar akan mengonsumsi Token Plan Credits. Tidak ada biaya tambahan yang dikenakan.

Prasyarat

  1. Anda telah berlangganan Token Plan.
  2. Anda telah menyelesaikan konfigurasi integrasi di alat AI dan dapat mengobrol secara normal. Untuk detailnya, lihat Clients and Developer Tools.

Dukungan visi

Untuk informasi apakah setiap model mendukung pemahaman visual, lihat tabel model yang didukung di Ringkasan Token Plan Personal Edition dan Ringkasan Token Plan Team Edition.

Metode 1: Gunakan model visi secara langsung (direkomendasikan)

Model seperti qwen3.7-plus memiliki kemampuan pemahaman visual bawaan. Jika Anda sering perlu memproses gambar, beralih ke salah satu model ini merupakan pendekatan paling sederhana dan direkomendasikan.

Tool

Cara mengganti model

Claude Code

/model qwen3.8-max atau /model qwen3.8-flash atau /model qwen3.7-plus atau /model kimi-k2.5

OpenCode

/models lalu cari dan pilih qwen3.8-max atau qwen3.8-flash atau qwen3.7-plus atau kimi-k2.5

Qwen Code

/model lalu pilih qwen3.8-max atau qwen3.8-flash atau qwen3.7-plus atau kimi-k2.5

Untuk informasi lebih lanjut tentang cara mengganti model di alat coding lainnya, lihat Clients and Developer Tools. Setelah beralih, Anda dapat mereferensikan path gambar secara langsung dalam percakapan atau menyeret-dan-meletakkan/menempelkan gambar.

Metode 2: Tambahkan kemampuan visual melalui Skill atau Agent

Jika Anda perlu menggunakan model berbasis teks saja seperti glm-5.2 atau deepseek-v4-pro untuk pemrosesan gambar, Anda dapat mengonfigurasi Skill atau Agent untuk mengaktifkan kemampuan visual.
  • Claude Code
  • OpenCode
  1. Tambahkan Skill Buat folder .claude di direktori proyek Anda, lalu buat direktori skills/image-analyzer di dalamnya:
mkdir -p .claude/skills/image-analyzer
Buat file SKILL.md di direktori tersebut dengan konten berikut:
---
name: image-analyzer
description: Membantu model tanpa kemampuan visi memahami gambar. Gunakan skill ini saat Anda perlu menganalisis konten gambar, mengekstraksi informasi, teks, atau elemen UI dari gambar, atau memahami tangkapan layar, grafik, diagram arsitektur, atau konten visual apa pun. Cukup masukkan path gambar untuk mendapatkan deskripsi.
model: qwen3.7-plus
---
qwen3.7-plus memiliki kemampuan pemahaman visual. Gunakan qwen3.7-plus secara langsung untuk pemahaman gambar.
Struktur direktori hasilnya adalah sebagai berikut:
.claude/
└── skills/
    └── image-analyzer/
        └── SKILL.md
  1. Mulai
    1. Jalankan claude di direktori proyek Anda untuk memulai Claude Code, lalu jalankan /model deepseek-v4-pro untuk beralih ke model deepseek-v4-pro.
    2. Unduh alibabacloud.png ke direktori proyek Anda, lalu tanyakan: Load image-analyzer skill and describe the information displayed at the alibabacloud.png banner location. Anda akan menerima respons seperti berikut: Gambar alibabacloud.png adalah tangkapan layar halaman utama Alibaba Cloud. Judul area banner adalah Coding Plan now supports Qwen3.5, dan teks tersebut menjelaskan bahwa Alibaba Cloud Model Studio mendukung model seperti Qwen3.5, Kimi-k2.5, dan GLM-4.7, dengan pelanggan baru hanya membayar 7,9 yuan untuk bulan pertama. Halaman ini menyediakan titik masuk Subscribe now dan Online consultation.

FAQ

Penyebab: OpenCode tidak mengaktifkan kemampuan visi model secara default. Anda harus secara eksplisit mendeklarasikan parameter modalities dalam file konfigurasi.Solusi: Tambahkan bidang modalities ke definisi model dalam file konfigurasi OpenCode Anda, dan atur input menjadi ["text", "image"], seperti pada contoh berikut:
Ganti sk-sp-xxx dengan Token Plan API Key Anda.
{
  "$schema": "https://opencode.ai/config.json",
  "provider": {
    "bailian-token-plan": {
      "npm": "@ai-sdk/anthropic",
      "name": "Model Studio Token Plan",
      "options": {
        "baseURL": "https://token-plan.ap-southeast-1.maas.aliyuncs.com/compatible-mode/v1",
        "apiKey": "sk-sp-xxx"
      },
      "models": {
        "qwen3.6-plus": {
          "name": "Qwen3.6 Plus",
          "modalities": {
            "input": [
              "text",
              "image"
            ],
            "output": [
              "text"
            ]
          },
          "options": {
            "thinking": {
              "type": "enabled",
              "budgetTokens": 1024
            }
          }
        },
        "qwen3.8-flash": {
          "name": "Qwen3.8 Flash",
          "modalities": {
            "input": [
              "text",
              "image"
            ],
            "output": [
              "text"
            ]
          },
          "options": {
            "thinking": {
              "type": "enabled",
              "budgetTokens": 1024
            }
          }
        },
        "kimi-k2.5": {
          "name": "Kimi K2.5",
          "modalities": {
            "input": [
              "text",
              "image"
            ],
            "output": [
              "text"
            ]
          },
          "options": {
            "thinking": {
              "type": "enabled",
              "budgetTokens": 1024
            }
          }
        }
      }
    }
  }
}
Penyebab: OpenClaw memerlukan bidang input dalam file konfigurasi untuk menentukan apakah model mendukung kemampuan visi.Solusi:
  1. Dalam file konfigurasi ~/.openclaw/openclaw.json, pastikan definisi model mencakup bidang "input": ["text", "image"].
{
  "models": {
    "mode": "merge",
    "providers": {
      "bailian": {
        "baseUrl": "https://token-plan.ap-southeast-1.maas.aliyuncs.com/compatible-mode/v1",
        "apiKey": "YOUR_API_KEY",
        "api": "openai-completions",
        "models": [
          {
            "id": "qwen3.6-plus",
            "name": "qwen3.6-plus",
            "reasoning": false,
            "input": ["text", "image"],
            "cost": { "input": 0, "output": 0, "cacheRead": 0, "cacheWrite": 0 },
            "contextWindow": 1000000,
            "maxTokens": 65536
          },
          {
            "id": "qwen3.8-flash",
            "name": "qwen3.8-flash",
            "reasoning": false,
            "input": ["text", "image"],
            "cost": { "input": 0, "output": 0, "cacheRead": 0, "cacheWrite": 0 },
            "contextWindow": 1000000,
            "maxTokens": 65536
          },
          {
            "id": "kimi-k2.5",
            "name": "kimi-k2.5",
            "reasoning": false,
            "input": ["text", "image"],
            "cost": { "input": 0, "output": 0, "cacheRead": 0, "cacheWrite": 0 },
            "contextWindow": 262144,
            "maxTokens": 32768
          }
        ]
      }
    }
  },
  "agents": {
    "defaults": {
      "model": {
        "primary": "bailian/qwen3.6-plus"
      },
      "models": {
        "bailian/qwen3.6-plus": {},
        "bailian/qwen3.8-flash": {},
        "bailian/kimi-k2.5": {}
      }
    }
  },
  "gateway": {
    "mode": "local"
  }
}
  1. Setelah mengubah konfigurasi, Anda harus menghapus cache model OpenClaw dan melakukan restart. Jika tidak, konfigurasi lama akan tetap berlaku.
rm ~/.openclaw/agents/main/agent/models.json
openclaw gateway restart
Model playground
  • Pembuatan audio
  • Pembuatan musik
Statistik dan Pemantauan
Asset Center
Dukungan layanan