Skip to main content
最佳實務

接入多模態產生模型

Token Plan 中的映像產生、視頻產生、語音合成模型需通過工具的擴充機制(Skill、Slash Command 或 Agent)接入。

樣本:在 Claude Code 中接入映像產生模型

以 Claude Code 為例,通過 Slash Command 接入映像產生模型。其他工具的接入方式類似,區別在於擴充機制和設定檔路徑不同。

步驟一:建立 Slash Command

將套餐 API Key(以 sk-sp- 為首碼)配置為環境變數 $ANTHROPIC_AUTH_TOKEN,供後續 curl 鑒權使用。 在專案根目錄建立 .claude/commands/text-to-image.md,寫入以下內容:
調用 Token Plan 文生圖 API,根據描述產生圖片。

使用者需求:$ARGUMENTS

## 步驟

1. 從使用者需求中提取 prompt(圖片描述)、model、size(預設 1024*1024)。若使用者明確指定了模型(如“模型=wan2.7-image”或“用 wan2.7-image 畫”),必須嚴格使用使用者指定的模型名,不要回退到預設模型;僅當使用者未指定模型時才使用預設 qwen-image-2.0。常用映像產生模型有 qwen-image-2.0、qwen-image-2.0-pro、wan2.7-image、wan2.7-image-pro 等,完整列表以百鍊模型列表為準。

2. 調用 API 產生圖片(使用 Bash 工具執行 curl):

```
curl -s -X POST "https://token-plan.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generation" \
  -H "Authorization: Bearer $ANTHROPIC_AUTH_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "<model>",
    "input": {
      "messages": [{"role":"user","content":[{"text":"<prompt>"}]}]
    },
    "parameters": {"size":"<size>"}
  }'
```

3. 從返回 JSON 的 output.choices[*].message.content[*].image 中提取圖片 URL。

4. 用 curl -s -o "generated_$(date +%Y%m%d_%H%M%S).png" "<URL>" 下載到目前的目錄。

5. 向使用者展示產生的圖片檔案路徑。

步驟二:產生圖片

在 Claude Code 中輸入 /text-to-image 畫一隻貓。如需使用預設模型以外的映像產生模型,在指令中寫明模型名即可,例如 /text-to-image 用 wan2.7-image 畫一隻貓

樣本:在 Claude Code 中接入視頻產生模型

以 Claude Code 為例,通過 Slash Command 接入視頻產生模型。視頻產生為非同步介面,流程為"提交任務 → 輪詢狀態 → 下載視頻"。

步驟一:建立 Slash Command

將套餐 API Key(以 sk-sp- 為首碼)配置為環境變數 $ANTHROPIC_AUTH_TOKEN,供後續 curl 鑒權使用。 在專案根目錄建立 .claude/commands/text-to-video.md,寫入以下內容:
調用 Token Plan 文生視頻 API,根據描述產生視頻並自動下載到本地。

使用者需求:$ARGUMENTS

## 步驟

1. 從使用者需求中提取 prompt(視頻描述)、model(預設 happyhorse-1.1-t2v)、resolution(預設 720P)、ratio(預設 16:9)、duration(預設 5 秒)。若使用者明確指定了模型(如"模型=happyhorse-1.0-t2v"),必須嚴格使用使用者指定的模型名。

2. 使用 Bash 工具執行以下指令碼,一次性完成提交任務、等待完成、下載視頻:

```bash
#!/bin/bash
set -e

TASK_RESPONSE=$(curl -s -X POST "https://token-plan.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/video-generation/video-synthesis" \
  -H "X-DashScope-Async: enable" \
  -H "Authorization: Bearer $ANTHROPIC_AUTH_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "<model>",
    "input": {"prompt": "<prompt>"},
    "parameters": {"resolution": "<resolution>", "ratio": "<ratio>", "duration": <duration>}
  }')

TASK_ID=$(echo "$TASK_RESPONSE" | grep -o '"task_id":"[^"]*"' | head -1 | cut -d'"' -f4)
if [ -z "$TASK_ID" ]; then echo "提交失敗: $TASK_RESPONSE"; exit 1; fi
echo "任務已提交,ID: $TASK_ID,等待產生..."

while true; do
  sleep 15
  STATUS_RESPONSE=$(curl -s "https://token-plan.ap-southeast-1.maas.aliyuncs.com/api/v1/tasks/$TASK_ID" \
    -H "Authorization: Bearer $ANTHROPIC_AUTH_TOKEN")
  STATUS=$(echo "$STATUS_RESPONSE" | grep -o '"task_status":"[^"]*"' | cut -d'"' -f4)
  if [ "$STATUS" = "SUCCEEDED" ]; then
    VIDEO_URL=$(echo "$STATUS_RESPONSE" | grep -o '"video_url":"[^"]*"' | cut -d'"' -f4)
    OUTPUT="generated_$(date +%Y%m%d_%H%M%S).mp4"
    curl -s -o "$OUTPUT" "$VIDEO_URL"
    echo "視頻已下載: $(pwd)/$OUTPUT"
    exit 0
  elif [ "$STATUS" = "FAILED" ]; then
    echo "產生失敗: $STATUS_RESPONSE"; exit 1
  fi
  echo "產生中..."
done
```

3. 向使用者展示產生的視頻檔案路徑。

步驟二:產生視頻

在 Claude Code 中輸入 /text-to-video 一隻白色的貓在陽台上曬太陽。如需使用其他視頻產生模型,在指令中寫明模型名即可,例如 /text-to-video 用 happyhorse-1.1-r2v 產生一隻貓跳躍的視頻

樣本:在 Claude Code 中接入語音合成模型

以 Claude Code 為例,通過 Slash Command 接入語音合成模型。語音合成為同步介面,支援非流式和流式兩種調用模式。

步驟一:建立 Slash Command

將套餐 API Key(以 sk-sp- 為首碼)配置為環境變數 $ANTHROPIC_AUTH_TOKEN,供後續 curl 鑒權使用。 在專案根目錄建立 .claude/commands/text-to-speech.md,寫入以下內容:
調用 Token Plan 語音合成 API,將文本轉為語音檔案。

使用者需求:$ARGUMENTS

## 步驟

1. 從使用者需求中提取 text(待合成文本)、voice(音色,預設 longanhuan_v3.6)、format(音頻格式,預設 mp3)、sample_rate(採樣率,預設 24000)。若使用者明確指定了模型,使用使用者指定的模型名;否則預設使用 qwen-audio-3.0-tts-plus。

2. 調用 API 合成語音(使用 Bash 工具執行 curl):

```
curl -s -X POST "https://token-plan.ap-southeast-1.maas.aliyuncs.com/api/v1/services/audio/tts/SpeechSynthesizer" \
  -H "Authorization: Bearer $ANTHROPIC_AUTH_TOKEN" \
  -H "Content-Type: application/json" \
  -o "speech_$(date +%Y%m%d_%H%M%S).<format>" \
  -d '{
    "model": "<model>",
    "input": {
      "text": "<text>",
      "voice": "<voice>",
      "format": "<format>",
      "sample_rate": <sample_rate>
    }
  }'
```

3. 向使用者展示產生的音頻檔案路徑。

步驟二:合成語音

在 Claude Code 中輸入 /text-to-speech 你好,歡迎使用百鍊

其他工具

不同工具的擴充機制和設定檔路徑如下表所示,該表為支援擴充機制的主流 AI 編程工具樣本。將上述 Claude Code 樣本中的配置內容儲存到對應路徑即可。

工具

擴充機制

設定檔路徑

Claude Code

Slash Command

.claude/commands/text-to-image.md

Codex

Skill

~/.codex/skills/token-plan-image/SKILL.md

Qwen Code

Skill

~/.qwen/skills/text-to-image/SKILL.md

OpenCode

Agent

.opencode/agents/text-to-image.md

OpenClaw

Skill

~/.openclaw/workspace/skills/token-plan-image/SKILL.md

Hermes Agent

Skill

~/.hermes/skills/media/text-to-image/SKILL.md

Qoder

Skill

~/.qoder/skills/text-to-image/SKILL.md

Skill 類工具(Codex、Qwen Code、OpenClaw、Hermes Agent、Qoder)需要在設定檔開頭添加 YAML front matter:
---
name: "token-plan-image"
description: "調用 Token Plan 文生圖模型,根據文字描述產生圖片。當使用者要求畫圖、產生圖片時啟用。"
---

(... 與上述 Claude Code 樣本相同的內容 ...)
OpenCode Agent 需要不同的 front matter 格式:
---
description: "調用 Token Plan 文生圖模型,根據文字描述產生圖片。"
mode: subagent
tools:
  bash: true
  write: false
  edit: false
---

(... 與上述 Claude Code 樣本相同的內容 ...)
模型體驗
  • 音樂產生
用量統計與效能監控
資產中心
服務支援