千問3-Omni-30b-a3b-Captioner是一款強大的音頻細粒度分析模型,專為在複雜多變的音頻情境中產生精準、全面的內容描述而設計,可自動解析並描述從複雜語音、環境聲到音樂、影視聲效等各類音頻內容,能夠在多聲源、混合化的環境中亦保持穩定而可信的輸出。
推理服務供應商
qwen3-omni-30b-a3b-captioner模型的推理服務供應商為阿里雲百鍊。
模型能力
| 能力項 | 支援情況 | 能力項 | 支援情況 |
|---|---|---|---|
輸入模態 | Audio | 輸出模態 | Text |
模型體驗 | 不支援 | Function Calling | 不支援 |
結構化輸出 | 不支援 | 連網搜尋 | 不支援 |
首碼續寫 | 不支援 | 上下文緩衝 | 不支援 |
批量推理 | 不支援 | 模型調優 | 不支援 |
上下文限制
| 參數 | 值 | 參數 | 值 |
|---|---|---|---|
最大輸入長度 | 32768 | 最大輸出長度 | 32768 |
上下文長度 | 65536 |
模型價格
本文僅展示模型調用原價,不包含限時優惠等活動資訊,請前往百鍊控制台查看活動優惠。
- 華北2(北京)
- 新加坡
| 計費項目 | 價格(美元) | 單位 |
|---|---|---|
輸入:音頻 | 2.265 | 每百萬tokens |
輸出:文本(輸入包含圖片/音頻/視頻時) | 1.821 | 每百萬tokens |
限流
- 華北2(北京)
- 新加坡
| 參數 | 值 |
|---|---|
RPM(每分鐘請求數) | 60 |
TPM(每分鐘tokens) | 100,000 |