Skip to main content
语音识别

qwen-audio-3.1-asr-flash-streaming

Qwen-Audio-3.1-ASR-Flash-Streaming端到端实时语音识别大模型,面向实时会议、直播字幕与智能交互等场景,具备低延迟、高精度的流式语音转写能力。模型支持多语种与多地区中文方言识别、中英文自由切换、热词及上下文增强、标点预测与文本规范化,并具备较强的噪声鲁棒性,可适应复杂声学环境。同时该版本支持多种方言 ASR/AST 可控输出。

推理服务供应商

qwen-audio-3.1-asr-flash-streaming模型的推理服务供应商为阿里云百炼。

模型能力

能力项支持情况能力项支持情况
输入模态Audio输出模态Text
模型体验不支持Function Calling不支持
结构化输出不支持联网搜索不支持
前缀续写不支持上下文缓存不支持
批量推理不支持模型调优不支持

上下文限制

参数参数
最大输入长度8192 Token最大输出长度1024 Token
上下文长度8192 Token

模型价格

本文仅展示模型调用原价,不包含限时优惠等活动信息,请前往百炼控制台查看活动优惠。
  • 华北2(北京)
  • 新加坡
计费项价格(美元)单位
输入0.848每百万 Token
输出0.636每百万 Token

限流

  • 华北2(北京)
  • 新加坡
参数
RPM(每分钟请求数)600

调用方式

Token Plan
模型体验
  • 音频生成
  • 音乐生成
用量统计与性能监控
资产中心