通义实验室新一代端到端语音识别大模型的实时版,基于领先的自研语音技术,具备卓越的上下文感知和高精度语音转写能力。基于端到端架构,Fun-ASR 集成了创新的 RAG 技术,支持大规模热词自定义、敏感/语气词自动过滤、ITN 规范化、标点预测等多维功能,显著提升了整体识别准确率和语境贴合度。同时,Fun-ASR 支持中英文自由切换,多地区方言覆盖,具备更强的噪声鲁棒性,适应多样复杂环境。
推理服务供应商
fun-asr-realtime模型的推理服务供应商为阿里云百炼。
模型能力
| 能力项 | 支持情况 | 能力项 | 支持情况 |
|---|---|---|---|
输入模态 | Audio | 输出模态 | Text |
模型体验 | 不支持 | Function Calling | 不支持 |
结构化输出 | 不支持 | 联网搜索 | 不支持 |
前缀续写 | 不支持 | 上下文缓存 | 不支持 |
批量推理 | 不支持 | 模型调优 | 不支持 |
上下文限制
| 参数 | 值 | 参数 | 值 |
|---|---|---|---|
最大输入长度 | — | 最大输出长度 | — |
上下文长度 | — |
模型价格
本文仅展示模型调用原价,不包含限时优惠等活动信息,请前往百炼控制台查看活动优惠。
- 华北2(北京)
| 计费项 | 价格(美元) | 单位 |
|---|---|---|
音频时长 | 0.000047 | 每秒 |
限流
- 华北2(北京)
- 新加坡
| 参数 | 值 |
|---|---|
RPM(每分钟请求数) | 1200 |
快照版本
fun-asr-realtime-2026-02-28
通义百聆推出的新一代轻量级实时语音识别模型,依托自研的先进语音技术架构,具备强大的上下文理解能力。专为中文电话客服场景设计:覆盖多地区方言口音,在低采样率、低信噪比环境下实现低延迟、高准确率的流式转写,满足高效部署需求。此版本为2026年2月28日的快照版本,在近场VAD方面进行了优化。
推理服务供应商
fun-asr-realtime-2026-02-28模型的推理服务供应商为阿里云百炼。
模型能力
| 能力项 | 支持情况 | 能力项 | 支持情况 |
|---|---|---|---|
输入模态 | Audio | 输出模态 | Text |
模型体验 | 不支持 | Function Calling | 不支持 |
结构化输出 | 不支持 | 联网搜索 | 不支持 |
前缀续写 | 不支持 | 上下文缓存 | 不支持 |
批量推理 | 不支持 | 模型调优 | 不支持 |
上下文限制
| 参数 | 值 | 参数 | 值 |
|---|---|---|---|
最大输入长度 | — | 最大输出长度 | — |
上下文长度 | — |
模型价格
本文仅展示模型调用原价,不包含限时优惠等活动信息,请前往百炼控制台查看活动优惠。
- 华北2(北京)
| 计费项 | 价格(美元) | 单位 |
|---|---|---|
音频时长 | 0.000047 | 每秒 |
限流
- 华北2(北京)
| 参数 | 值 |
|---|---|
RPM(每分钟请求数) | 1200 |
fun-asr-realtime-2025-11-07
通义实验室新一代端到端语音识别大模型的实时版,基于领先的自研语音技术,具备卓越的上下文感知和高精度语音转写能力。基于端到端架构,Fun-ASR 集成了创新的 RAG 技术,支持大规模热词自定义、敏感/语气词自动过滤、ITN 规范化、标点预测等多维功能,显著提升了整体识别准确率和语境贴合度。同时,Fun-ASR 支持中英文自由切换,多地区方言覆盖,具备更强的噪声鲁棒性,适应多样复杂环境。此版本为2025年11月7日的快照版本。
推理服务供应商
fun-asr-realtime-2025-11-07模型的推理服务供应商为阿里云百炼。
模型能力
| 能力项 | 支持情况 | 能力项 | 支持情况 |
|---|---|---|---|
输入模态 | Audio | 输出模态 | Text |
模型体验 | 不支持 | Function Calling | 不支持 |
结构化输出 | 不支持 | 联网搜索 | 不支持 |
前缀续写 | 不支持 | 上下文缓存 | 不支持 |
批量推理 | 不支持 | 模型调优 | 不支持 |
上下文限制
| 参数 | 值 | 参数 | 值 |
|---|---|---|---|
最大输入长度 | — | 最大输出长度 | — |
上下文长度 | — |
模型价格
本文仅展示模型调用原价,不包含限时优惠等活动信息,请前往百炼控制台查看活动优惠。
- 华北2(北京)
| 计费项 | 价格(美元) | 单位 |
|---|---|---|
音频时长 | 0.000047 | 每秒 |
限流
- 华北2(北京)
- 新加坡
| 参数 | 值 |
|---|---|
RPM(每分钟请求数) | 1200 |
fun-asr-realtime-2025-09-15
通义实验室新一代端到端语音识别大模型的实时版,基于领先的自研语音技术,具备卓越的上下文感知和高精度语音转写能力。基于端到端架构,Fun-ASR 集成了创新的 RAG 技术,支持大规模热词自定义、敏感/语气词自动过滤、ITN 规范化、标点预测等多维功能,显著提升了整体识别准确率和语境贴合度。同时,Fun-ASR 支持中英文自由切换,多地区方言覆盖,具备更强的噪声鲁棒性,适应多样复杂环境。此版本为2025年9月15日的快照版本。
推理服务供应商
fun-asr-realtime-2025-09-15模型的推理服务供应商为阿里云百炼。
模型能力
| 能力项 | 支持情况 | 能力项 | 支持情况 |
|---|---|---|---|
输入模态 | Audio | 输出模态 | Text |
模型体验 | 不支持 | Function Calling | 不支持 |
结构化输出 | 不支持 | 联网搜索 | 不支持 |
前缀续写 | 不支持 | 上下文缓存 | 不支持 |
批量推理 | 不支持 | 模型调优 | 不支持 |
上下文限制
| 参数 | 值 | 参数 | 值 |
|---|---|---|---|
最大输入长度 | — | 最大输出长度 | — |
上下文长度 | — |
模型价格
本文仅展示模型调用原价,不包含限时优惠等活动信息,请前往百炼控制台查看活动优惠。
- 华北2(北京)
| 计费项 | 价格(美元) | 单位 |
|---|---|---|
音频时长 | 0.000047 | 每秒 |
限流
- 华北2(北京)
| 参数 | 值 |
|---|---|
RPM(每分钟请求数) | 1200 |