Skip to main content
語音辨識

qwen3-omni-30b-a3b-captioner

千問3-Omni-30b-a3b-Captioner是一款強大的音頻細粒度分析模型,專為在複雜多變的音頻情境中產生精準、全面的內容描述而設計,可自動解析並描述從複雜語音、環境聲到音樂、影視聲效等各類音頻內容,能夠在多聲源、混合化的環境中亦保持穩定而可信的輸出。

推理服務供應商

qwen3-omni-30b-a3b-captioner模型的推理服務供應商為阿里雲百鍊。

模型能力

能力項支援情況能力項支援情況

輸入模態

Audio

輸出模態

Text

模型體驗

不支援

Function Calling

不支援

結構化輸出

不支援

連網搜尋

不支援

首碼續寫

不支援

上下文緩衝

不支援

批量推理

不支援

模型調優

不支援

上下文限制

參數參數

最大輸入長度

32768

最大輸出長度

32768

上下文長度

65536

模型價格

本文僅展示模型調用原價,不包含限時優惠等活動資訊,請前往百鍊控制台查看活動優惠。
  • 華北2(北京)
  • 新加坡
計費項目價格(美元)單位

輸入:音頻

2.265

每百萬tokens

輸出:文本(輸入包含圖片/音頻/視頻時)

1.821

每百萬tokens

限流

  • 華北2(北京)
  • 新加坡
參數

RPM(每分鐘請求數)

60

TPM(每分鐘tokens)

100,000

Token Plan
模型體驗
  • 音樂產生
用量統計與效能監控
資產中心