Skip to main content
Melhores práticas

Add visual understanding capabilities

Alguns modelos compatíveis com o Token Plan (como qwen3.8-max, qwen3.7-plus) oferecem suporte nativo à compreensão visual e processam entradas de imagem diretamente. Para modelos exclusivos de texto, como glm-5.2 e deepseek-v4-pro, adicione recursos visuais configurando um Skill local.

A execução do Skill de compreensão de imagens consome créditos do Token Plan. Não há cobranças adicionais.

Pré-requisitos

  1. Assine o Token Plan.
  2. Conclua a configuração de integração em uma ferramenta de IA e confirme que o chat funciona normalmente. Para mais detalhes, consulte Clients and Developer Tools.

Suporte a visão

Para saber se cada modelo oferece suporte à compreensão visual, consulte as tabelas de modelos com suporte na Visão geral do Token Plan Personal Edition e na Visão geral do Token Plan Team Edition.

Método 1: Usar um modelo de visão diretamente (recomendado)

O qwen3.7-plus e outros modelos possuem recursos de compreensão visual. Se você precisa processar imagens com frequência, mudar para um desses modelos é a abordagem mais simples e recomendada.

Ferramenta

Como trocar de modelo

Claude Code

/model qwen3.8-max ou /model qwen3.8-flash ou /model qwen3.7-plus

OpenCode

/models e então pesquise e selecione qwen3.8-max ou qwen3.8-flash ou qwen3.7-plus

Qwen Code

/model e então selecione qwen3.8-max ou qwen3.8-flash ou qwen3.7-plus

Para mais informações sobre como trocar modelos em outras ferramentas de codificação, consulte Clients and Developer Tools. Após a troca, referencie caminhos de imagem diretamente na conversa ou arraste e solte/cole imagens.

Método 2: Adicionar recursos visuais via Skill ou Agent

Caso precise usar modelos exclusivos de texto, como glm-5.2 ou deepseek-v4-pro, para processamento de imagens, configure um Skill ou Agent para ativar os recursos visuais.
  • Claude Code
  • OpenCode
  1. Adicionar o Skill Crie uma pasta .claude no diretório do projeto e crie um diretório skills/image-analyzer dentro dela:
mkdir -p .claude/skills/image-analyzer
Crie um arquivo SKILL.md nesse diretório com o seguinte conteúdo:
---
name: image-analyzer
description: Helps models without vision capabilities understand images. Use this skill when you need to analyze image content, extract information, text, or UI elements from images, or understand screenshots, charts, architecture diagrams, or any visual content. Simply pass in the image path to get a description.
model: qwen3.7-plus
---
qwen3.7-plus has visual understanding capabilities. Use qwen3.7-plus directly for image understanding.
A estrutura de diretórios resultante é a seguinte:
.claude/
└── skills/
    └── image-analyzer/
        └── SKILL.md
  1. Começar a usar
    1. Execute claude no diretório do projeto para iniciar o Claude Code e execute /model deepseek-v4-pro para mudar para o modelo deepseek-v4-pro.
    2. Baixe alibabacloud.png para o diretório do projeto e pergunte: Load image-analyzer skill and describe the information displayed at the alibabacloud.png banner location. A resposta será semelhante à seguinte: O alibabacloud.png é uma captura de tela da página inicial do Alibaba Cloud. O título da área do banner é Coding Plan now supports Qwen3.5, e o texto informa que o Alibaba Cloud Model Studio oferece suporte a modelos como Qwen3.5, Kimi-k2.5 e GLM-4.7, com novos clientes obtendo o primeiro mês por apenas 7,9 yuans. A página fornece pontos de entrada para Subscribe now e Online consultation.

FAQ

Causa: O OpenCode não ativa os recursos de visão de um modelo por padrão. Declare explicitamente o parâmetro modalities no arquivo de configuração.Solução: Adicione um campo modalities à definição do modelo no arquivo de configuração do OpenCode e defina input como ["text", "image"], conforme mostrado abaixo:
Substitua sk-sp-xxx pela sua API Key do Token Plan.
{
  "$schema": "https://opencode.ai/config.json",
  "provider": {
    "bailian-token-plan": {
      "npm": "@ai-sdk/anthropic",
      "name": "Model Studio Token Plan",
      "options": {
        "baseURL": "https://token-plan.ap-southeast-1.maas.aliyuncs.com/compatible-mode/v1",
        "apiKey": "sk-sp-xxx"
      },
      "models": {
        "qwen3.6-plus": {
          "name": "Qwen3.6 Plus",
          "modalities": {
            "input": [
              "text",
              "image"
            ],
            "output": [
              "text"
            ]
          },
          "options": {
            "thinking": {
              "type": "enabled",
              "budgetTokens": 1024
            }
          }
        },
        "qwen3.8-flash": {
          "name": "Qwen3.8 Flash",
          "modalities": {
            "input": [
              "text",
              "image"
            ],
            "output": [
              "text"
            ]
          },
          "options": {
            "thinking": {
              "type": "enabled",
              "budgetTokens": 1024
            }
          }
        },
        "kimi-k2.5": {
          "name": "Kimi K2.5",
          "modalities": {
            "input": [
              "text",
              "image"
            ],
            "output": [
              "text"
            ]
          },
          "options": {
            "thinking": {
              "type": "enabled",
              "budgetTokens": 1024
            }
          }
        }
      }
    }
  }
}
Causa: O OpenClaw exige o campo input no arquivo de configuração para determinar se um modelo oferece suporte a recursos de visão.Solução:
  1. No arquivo de configuração ~/.openclaw/openclaw.json, verifique se a definição do modelo inclui o campo "input": ["text", "image"].
{
  "models": {
    "mode": "merge",
    "providers": {
      "bailian": {
        "baseUrl": "https://token-plan.ap-southeast-1.maas.aliyuncs.com/compatible-mode/v1",
        "apiKey": "YOUR_API_KEY",
        "api": "openai-completions",
        "models": [
          {
            "id": "qwen3.6-plus",
            "name": "qwen3.6-plus",
            "reasoning": false,
            "input": ["text", "image"],
            "cost": { "input": 0, "output": 0, "cacheRead": 0, "cacheWrite": 0 },
            "contextWindow": 1000000,
            "maxTokens": 65536
          },
          {
            "id": "qwen3.8-flash",
            "name": "qwen3.8-flash",
            "reasoning": false,
            "input": ["text", "image"],
            "cost": { "input": 0, "output": 0, "cacheRead": 0, "cacheWrite": 0 },
            "contextWindow": 1000000,
            "maxTokens": 65536
          },
          {
            "id": "kimi-k2.5",
            "name": "kimi-k2.5",
            "reasoning": false,
            "input": ["text", "image"],
            "cost": { "input": 0, "output": 0, "cacheRead": 0, "cacheWrite": 0 },
            "contextWindow": 262144,
            "maxTokens": 32768
          }
        ]
      }
    }
  },
  "agents": {
    "defaults": {
      "model": {
        "primary": "bailian/qwen3.6-plus"
      },
      "models": {
        "bailian/qwen3.6-plus": {},
        "bailian/qwen3.8-flash": {},
        "bailian/kimi-k2.5": {}
      }
    }
  },
  "gateway": {
    "mode": "local"
  }
}
  1. Após modificar a configuração, limpe o cache de modelos do OpenClaw e reinicie. Caso contrário, a configuração antiga permanecerá em vigor.
rm ~/.openclaw/agents/main/agent/models.json
openclaw gateway restart
Playground de Modelos
  • Music generation
Inferência do Modelo
Avaliação
Compressão de Modelos
Estatísticas e Monitoramento
Suporte