Skip to main content
语音识别

qwen-audio-3.1-asr-flash

Qwen-Audio-3.1-ASR-Flash是一款支持短语音高效识别的大模型,面向高质量、多语种及文化内容转写场景。模型支持多语种与多地区中文方言识别,同时针对中文古诗词的韵律、节奏与文言表达进行优化。具备上下文增强、标点预测与文本规范化能力。同时该版本支持多种方言 ASR/AST 可控输出。原生转写润色能力及工业级多人对话分角色转写能力。

推理服务供应商

qwen-audio-3.1-asr-flash模型的推理服务供应商为阿里云百炼。

模型能力

能力项支持情况能力项支持情况
输入模态Audio输出模态Text
模型体验不支持Function Calling不支持
结构化输出不支持联网搜索不支持
前缀续写不支持上下文缓存不支持
批量推理不支持模型调优不支持

上下文限制

参数参数
最大输入长度7168 Token最大输出长度1024 Token
上下文长度8192 Token

模型价格

本文仅展示模型调用原价,不包含限时优惠等活动信息,请前往百炼控制台查看活动优惠。
  • 华北2(北京)
  • 新加坡
计费项价格(美元)单位
输入0.113每百万 Token
输出0.382每百万 Token

限流

  • 华北2(北京)
  • 新加坡
参数
RPM(每分钟请求数)600

调用方式

Token Plan
模型体验
  • 音频生成
  • 音乐生成
用量统计与性能监控
资产中心