Token Plan 支援的部分模型(qwen3.7-plus 等)原生支援視覺理解,可直接處理圖片輸入。對於 glm-5、MiniMax-M2.5 等純文字模型,可通過添加本地 Skill 使其獲得視覺能力。
運行圖片理解 Skill 會消耗 Token Plan Credits,無其他收費項。
前提條件
- 已訂閱 Token Plan。
- 已在 AI 工具中完成接入配置,且能正常對話,詳情請參見接入用戶端/開發工具。
視覺支援情況
模型 | 是否支援視覺 | 說明 |
|---|---|---|
| 是 | 無需額外配置,可直接傳入圖片 |
| 否 | 需通過 Skill 或 Agent 輔助模型獲得視覺能力 |
方法 1:直接使用視覺模型(推薦)
qwen3.7-plus 等模型具備視覺理解能力。如果經常需要處理圖片,直接切換到這些模型是最簡單、推薦的做法。
工具 | 模型切換方式 |
|---|---|
Claude Code |
|
OpenCode |
|
Qwen Code |
|
方法 2:通過 Skill 或 Agent 添加視覺能力
如需使用 glm-5、MiniMax-M2.5 等不支援視覺的模型處理圖片,可通過配置 Skill 或 Agent 實現。
- Claude Code
- OpenCode
-
添加 Skill
在專案目錄下的
.claude檔案夾中建立skills/image-analyzer目錄:
SKILL.md 檔案,並寫入以下內容:-
開始使用
-
在專案目錄下運行
claude啟動 Claude Code,並運行/model glm-5切換到glm-5模型。 -
下載alibabacloud.png到專案目錄下,並提問:
Load image-analyzer skill and describe the information displayed at the alibabacloud.png banner location.可收到如下回複: aliyun.png 為阿里雲官網首頁截圖,banner 地區標題為 Coding Plan 已支援 Qwen3.5,本文介紹阿里雲百鍊支援 Qwen3.5、Kimi-k2.5、GLM-4.7 等模型,新客首月僅 7.9 元,頁面提供立即訂閱和線上諮詢入口。
-
在專案目錄下運行
常見問題
OpenCode + 視覺理解模型為什麼無法理解圖片?
OpenCode + 視覺理解模型為什麼無法理解圖片?
原因:OpenCode 預設不啟用模型的視覺能力,需要在設定檔中顯式聲明
modalities 參數。解決方案:在 OpenCode 設定檔的模型定義中添加 modalities 欄位,將 input 設為 ["text", "image"],如下所示:將sk-sp-xxx替換為Token Plan API Key。
OpenClaw + 視覺理解模型為什麼無法理解圖片?
OpenClaw + 視覺理解模型為什麼無法理解圖片?
原因:OpenClaw 需要通過設定檔中的 input 欄位來判斷模型是否支援視覺能力。解決方案:
- 在
~/.openclaw/openclaw.json設定檔中,確保模型定義包含"input": ["text", "image"]欄位。
- 修改配置後,需要清除 OpenClaw 的模型緩衝並重啟,否則舊的配置仍會生效。