Alguns modelos compatíveis com o Token Plan (como qwen3.8-max, qwen3.7-plus) oferecem suporte nativo à compreensão visual e processam entradas de imagem diretamente. Para modelos exclusivos de texto, como glm-5.2 e deepseek-v4-pro, adicione recursos visuais configurando um Skill local.
Pré-requisitos
- Assine o Token Plan.
- Conclua a configuração de integração em uma ferramenta de IA e confirme que o chat funciona normalmente. Para mais detalhes, consulte Clients and Developer Tools.
Suporte a visão
Para saber se cada modelo oferece suporte à compreensão visual, consulte as tabelas de modelos com suporte na Visão geral do Token Plan Personal Edition e na Visão geral do Token Plan Team Edition.
Método 1: Usar um modelo de visão diretamente (recomendado)
O qwen3.7-plus e outros modelos possuem recursos de compreensão visual. Se você precisa processar imagens com frequência, mudar para um desses modelos é a abordagem mais simples e recomendada.
Ferramenta | Como trocar de modelo |
|---|---|
Claude Code |
|
OpenCode |
|
Qwen Code |
|
Método 2: Adicionar recursos visuais via Skill ou Agent
Caso precise usar modelos exclusivos de texto, como glm-5.2 ou deepseek-v4-pro, para processamento de imagens, configure um Skill ou Agent para ativar os recursos visuais.
- Claude Code
- OpenCode
-
Adicionar o Skill
Crie uma pasta
.claudeno diretório do projeto e crie um diretórioskills/image-analyzerdentro dela:
SKILL.md nesse diretório com o seguinte conteúdo:-
Começar a usar
-
Execute
claudeno diretório do projeto para iniciar o Claude Code e execute/model deepseek-v4-propara mudar para o modelodeepseek-v4-pro. -
Baixe alibabacloud.png para o diretório do projeto e pergunte:
Load image-analyzer skill and describe the information displayed at the alibabacloud.png banner location.A resposta será semelhante à seguinte: O alibabacloud.png é uma captura de tela da página inicial do Alibaba Cloud. O título da área do banner é Coding Plan now supports Qwen3.5, e o texto informa que o Alibaba Cloud Model Studio oferece suporte a modelos como Qwen3.5, Kimi-k2.5 e GLM-4.7, com novos clientes obtendo o primeiro mês por apenas 7,9 yuans. A página fornece pontos de entrada para Subscribe now e Online consultation.
-
Execute
FAQ
Por que o OpenCode + um modelo de visão não consegue entender imagens?
Por que o OpenCode + um modelo de visão não consegue entender imagens?
modalities no arquivo de configuração.Solução: Adicione um campo modalities à definição do modelo no arquivo de configuração do OpenCode e defina input como ["text", "image"], conforme mostrado abaixo:Substitua sk-sp-xxx pela sua API Key do Token Plan.
Por que o OpenClaw + um modelo de visão não consegue entender imagens?
Por que o OpenClaw + um modelo de visão não consegue entender imagens?
- No arquivo de configuração
~/.openclaw/openclaw.json, verifique se a definição do modelo inclui o campo"input": ["text", "image"].
- Após modificar a configuração, limpe o cache de modelos do OpenClaw e reinicie. Caso contrário, a configuração antiga permanecerá em vigor.