Skip to main content
Melhores práticas

Integrar modelos de geração multimodal

Integre os modelos de geração de imagens, geração de vídeo e síntese de fala do Token Plan por meio do mecanismo de extensão de cada ferramenta (Skill, Slash Command ou Agent).

Exemplo: Integrar um modelo de geração de imagens no Claude Code

Este exemplo demonstra como integrar um modelo de geração de imagens no Claude Code usando um Slash Command. O processo é semelhante para outras ferramentas, com diferenças apenas no mecanismo de extensão e no caminho do arquivo de configuração.

Etapa 1: Crie um Slash Command

Defina a API Key específica do plano (com o prefixo sk-sp-) como a variável de ambiente $ANTHROPIC_AUTH_TOKEN para autenticação via curl nas etapas seguintes. Crie o arquivo .claude/commands/text-to-image.md no diretório raiz do seu projeto com o seguinte conteúdo:
Call the Token Plan text-to-image API to generate an image based on a description.

User request: $ARGUMENTS

## Steps

1. Extract prompt (image description), model, and size (default 1024*1024) from the user request. If the user explicitly specifies a model (e.g., "model=wan2.7-image" or "use wan2.7-image to draw"), you must use exactly that model name and must not fall back to the default; use the default qwen-image-2.0 only when no model is specified. Common image generation models include qwen-image-2.0, qwen-image-2.0-pro, wan2.7-image, and wan2.7-image-pro; see the Model Studio model list for the full set.

2. Call the API to generate an image (use the Bash tool to run curl):

curl -s -X POST "https://token-plan.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generation" \
  -H "Authorization: Bearer $ANTHROPIC_AUTH_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "<model>",
    "input": {
      "messages": [{"role":"user","content":[{"text":"<prompt>"}]}]
    },
    "parameters": {"size":"<size>"}
  }'

3. Extract the image URL from output.choices[*].message.content[*].image in the response JSON.

4. Download the image to the current directory with curl -s -o "generated_$(date +%Y%m%d_%H%M%S).png" "<URL>".

5. Display the generated image file path to the user.

Etapa 2: Gerar uma imagem

No Claude Code, digite /text-to-image draw a cat. Para usar um modelo de geração de imagens diferente do padrão, inclua o nome do modelo no comando, por exemplo /text-to-image draw a cat using wan2.7-image.

Exemplo: Integrar um modelo de geração de vídeo no Claude Code

Este exemplo ilustra a integração de um modelo de geração de vídeo no Claude Code por meio de um Slash Command. A geração de vídeo utiliza uma API assíncrona com o seguinte fluxo de trabalho: envio da tarefa, consulta do status e download do vídeo.

Etapa 1: Crie um Slash Command

Defina a API Key específica do plano (com o prefixo sk-sp-) como a variável de ambiente $ANTHROPIC_AUTH_TOKEN para autenticação via curl nas etapas seguintes. Crie o arquivo .claude/commands/text-to-video.md no diretório raiz do seu projeto com o seguinte conteúdo:
Call the Token Plan text-to-video API to generate a video based on a description and automatically download it locally.

User request: $ARGUMENTS

## Steps

1. Extract prompt (video description), model (default happyhorse-1.1-t2v), resolution (default 720P), ratio (default 16:9), and duration (default 5 seconds) from the user request. If the user explicitly specifies a model (e.g., "model=happyhorse-1.1-r2v"), you must use exactly that model name.

2. Use the Bash tool to run the following script, which submits the task, waits for completion, and downloads the video in one go:

#!/bin/bash
set -e

TASK_RESPONSE=$(curl -s -X POST "https://token-plan.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/video-generation/video-synthesis" \
  -H "X-DashScope-Async: enable" \
  -H "Authorization: Bearer $ANTHROPIC_AUTH_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "<model>",
    "input": {"prompt": "<prompt>"},
    "parameters": {"resolution": "<resolution>", "ratio": "<ratio>", "duration": <duration>}
  }')

TASK_ID=$(echo "$TASK_RESPONSE" | grep -o '"task_id":"[^"]*"' | head -1 | cut -d'"' -f4)
if [ -z "$TASK_ID" ]; then echo "Submission failed: $TASK_RESPONSE"; exit 1; fi
echo "Task submitted, ID: $TASK_ID. Waiting for generation..."

while true; do
  sleep 15
  STATUS_RESPONSE=$(curl -s "https://token-plan.ap-southeast-1.maas.aliyuncs.com/api/v1/tasks/$TASK_ID" \
    -H "Authorization: Bearer $ANTHROPIC_AUTH_TOKEN")
  STATUS=$(echo "$STATUS_RESPONSE" | grep -o '"task_status":"[^"]*"' | cut -d'"' -f4)
  if [ "$STATUS" = "SUCCEEDED" ]; then
    VIDEO_URL=$(echo "$STATUS_RESPONSE" | grep -o '"video_url":"[^"]*"' | cut -d'"' -f4)
    OUTPUT="generated_$(date +%Y%m%d_%H%M%S).mp4"
    curl -s -o "$OUTPUT" "$VIDEO_URL"
    echo "Video downloaded: $(pwd)/$OUTPUT"
    exit 0
  elif [ "$STATUS" = "FAILED" ]; then
    echo "Generation failed: $STATUS_RESPONSE"; exit 1
  fi
  echo "Generating..."
done

3. Display the generated video file path to the user.

Etapa 2: Gerar um vídeo

No Claude Code, digite /text-to-video a white cat sunbathing on a balcony. Caso prefira outro modelo de geração de vídeo, especifique o nome do modelo no comando, como em /text-to-video generate a video of a cat jumping using happyhorse-1.1-r2v.

Exemplo: Integrar um modelo de síntese de fala no Claude Code

Este exemplo demonstra como integrar um modelo de síntese de fala no Claude Code usando um Slash Command. A síntese de fala utiliza uma API síncrona e oferece suporte aos modos sem streaming e com streaming.

Etapa 1: Crie um Slash Command

Defina a API Key específica do plano (com o prefixo sk-sp-) como a variável de ambiente $ANTHROPIC_AUTH_TOKEN para autenticação via curl nas etapas seguintes. Crie o arquivo .claude/commands/text-to-speech.md no diretório raiz do seu projeto com o seguinte conteúdo:
Call the Token Plan speech synthesis API to convert text to an audio file.

User request: $ARGUMENTS

## Steps

1. Extract text (the text to synthesize), voice (voice style, default longanhuan_v3.6), format (audio format, default mp3), and sample_rate (sample rate, default 24000) from the user request. If the user explicitly specifies a model, use that model name; otherwise default to qwen-audio-3.0-tts-plus.

2. Call the API to synthesize speech (use the Bash tool to run curl):

curl -s -X POST "https://token-plan.ap-southeast-1.maas.aliyuncs.com/api/v1/services/audio/tts/SpeechSynthesizer" \
  -H "Authorization: Bearer $ANTHROPIC_AUTH_TOKEN" \
  -H "Content-Type: application/json" \
  -o "speech_$(date +%Y%m%d_%H%M%S).<format>" \
  -d '{
    "model": "<model>",
    "input": {
      "text": "<text>",
      "voice": "<voice>",
      "format": "<format>",
      "sample_rate": <sample_rate>
    }
  }'

3. Display the generated audio file path to the user.

Etapa 2: Sintetizar fala

No Claude Code, digite /text-to-speech Hello, welcome to Model Studio.

Outras ferramentas

A tabela a seguir lista o mecanismo de extensão e o caminho do arquivo de configuração das principais ferramentas de codificação com IA que aceitam extensões. Salve o mesmo conteúdo do exemplo do Claude Code acima no caminho correspondente.

Ferramenta

Mecanismo de extensão

Caminho do arquivo de configuração

Claude Code

Slash Command

.claude/commands/text-to-image.md

Codex

Skill

~/.codex/skills/token-plan-image/SKILL.md

Qwen Code

Skill

~/.qwen/skills/text-to-image/SKILL.md

OpenCode

Agent

.opencode/agents/text-to-image.md

OpenClaw

Skill

~/.openclaw/workspace/skills/token-plan-image/SKILL.md

Hermes Agent

Skill

~/.hermes/skills/media/text-to-image/SKILL.md

Qoder

Skill

~/.qoder/skills/text-to-image/SKILL.md

Ferramentas baseadas em Skill (Codex, Qwen Code, OpenClaw, Hermes Agent, Qoder) exigem um front matter YAML no início do arquivo de configuração:
---
name: "token-plan-image"
description: "Call the Token Plan text-to-image model to generate images from text descriptions. Activates when the user asks to draw or generate images."
---

(... same content as the Claude Code example above ...)
O Agent do OpenCode requer um formato diferente de front matter:
---
description: "Call the Token Plan text-to-image model to generate images from text descriptions."
mode: subagent
tools:
  bash: true
  write: false
  edit: false
---

(... same content as the Claude Code example above ...)
Playground de Modelos
  • Music generation
Inferência do Modelo
Avaliação
Compressão de Modelos
Estatísticas e Monitoramento
Suporte