Choose the right model for real-time or file-based speech recognition.
Migrate from closed-source models
Map your current Whisper, Deepgram, or Google ASR service to a Bailian equivalent.
Use case | Closed-source examples | Bailian recommendation |
|---|---|---|
Real-time recognition | Deepgram Nova-3, Google Chirp 3 |
|
Offline / file transcription | OpenAI gpt-4o-transcribe, Whisper |
|
Selection criteria
Evaluate four dimensions to find the right model.
Real-time or offline?
Real-time recognition returns results as the user speaks. Offline recognition transcribes a pre-recorded file after recording ends.
- Real-time (streaming recognition): Uses a WebSocket connection to stream audio in and text out. Ideal for live captions, voice assistants, and meeting transcription. Recommended model:
qwen-audio-3.0-asr-flash-streaming(hot words, prompt context, multilingual with dialects). - Offline (file transcription): Uses an HTTP API to submit audio files and retrieve transcription results. Suited for call center recordings, podcasts, and interviews. Recommended model:
qwen-audio-3.0-asr-flash-filetrans(hot words, prompt context, speaker diarization).
Domain terminology
Two approaches, ranked by flexibility:
- Prompt context injection: Describe your domain in the system prompt. No setup required—the model adapts per request. Recommended: the Qwen-Audio-3.0-ASR-Flash-Streaming, Qwen-Audio-3.0-ASR-Flash-Filetrans, and Qwen-Audio-3.0-ASR-Flash series.
- Hot words: Supply a weighted vocabulary list. Recommended: the Qwen-Audio-3.0-ASR-Flash-Streaming, Qwen-Audio-3.0-ASR-Flash-Filetrans, and Qwen-Audio-3.0-ASR-Flash series.
Speaker diarization
The Qwen-Audio-3.0-ASR-Flash-Filetrans series (qwen-audio-3.0-asr-flash-filetrans) and Fun-ASR offline models (fun-asr and fun-asr-mtl) support speaker diarization. To identify who said what, use qwen-audio-3.0-asr-flash-filetrans.
Emotion recognition
Qwen-ASR models detect emotions alongside transcription. Recommended models: qwen3-asr-flash-realtime (real-time) or qwen3-asr-flash-filetrans (offline).
Recommended models
Top picks for common scenarios.
Model ID | Mode | API | Accuracy boost | Emotion recognition | Speaker diarization | Languages | Max audio duration/size |
|---|---|---|---|---|---|---|---|
| Real-time | WebSocket | Hot words, prompt context | Unsupported | Unsupported | Multilingual with dialects | Unlimited |
| Offline | HTTP | Hot words, prompt context | Unsupported | Supported | Multilingual with dialects | 12 hours / 2 GB |
All models
Qwen-Audio-3.0-ASR-Flash-Streaming
Model ID | Mode | API | Accuracy boost | Emotion recognition | Speaker diarization | Max audio duration/size | |
|---|---|---|---|---|---|---|---|
| Real-time | WebSocket | Hot words, prompt context | Unsupported | Unsupported | Multilingual with dialects | Unlimited |
qwen-audio-3.0-asr-flash-streaming: Chinese (Mandarin, Cantonese, Wu, Hokkien, Hakka, Gan, Xiang, Jin; plus regional accents including Central Plains, Southwestern, Ji-Lu, Jianghuai, Lan-Yin, Jiao-Liao, Northeastern, Beijing, and Hong Kong/Taiwan—covering Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu, and Ningxia accents), English, Japanese, Korean, Vietnamese, Thai, Indonesian, Malay, Filipino, Hindi, Arabic, French, German, Spanish, Portuguese, Russian, Italian, Dutch, Swedish, Danish, Finnish, Norwegian, Greek, Polish, Czech, Hungarian, Romanian, Bulgarian, Croatian, Slovak
Qwen-Audio-3.0-ASR-Flash-Filetrans
Model ID | Mode | API | Accuracy boost | Emotion recognition | Speaker diarization | Max audio duration/size | |
|---|---|---|---|---|---|---|---|
| Offline | HTTP | Hot words, prompt context | Unsupported | Supported | Multilingual with dialects | 12 hours / 2 GB |
qwen-audio-3.0-asr-flash-filetrans: Chinese (Mandarin, Cantonese, Wu, Hokkien, Hakka, Gan, Xiang, Jin; plus regional accents including Central Plains, Southwestern, Ji-Lu, Jianghuai, Lan-Yin, Jiao-Liao, Northeastern, Beijing, and Hong Kong/Taiwan—covering Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu, and Ningxia accents), English, Japanese, Korean, Vietnamese, Thai, Indonesian, Malay, Filipino, Hindi, Arabic, French, German, Spanish, Portuguese, Russian, Italian, Dutch, Swedish, Danish, Finnish, Norwegian, Greek, Polish, Czech, Hungarian, Romanian, Bulgarian, Croatian, Slovak
Qwen-Audio-3.0-ASR-Flash
Model ID | Mode | API | Accuracy boost | Emotion recognition | Speaker diarization | Max audio duration/size | |
|---|---|---|---|---|---|---|---|
| Offline | HTTP | Hot words, prompt context | Unsupported | Unsupported | Multilingual with dialects | 5 minutes / 2 GB |
qwen-audio-3.0-asr-flash: Chinese (Mandarin, Cantonese, Wu, Hokkien, Hakka, Gan, Xiang, Jin; plus regional accents including Central Plains, Southwestern, Ji-Lu, Jianghuai, Lan-Yin, Jiao-Liao, Northeastern, Beijing, and Hong Kong/Taiwan—covering Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu, and Ningxia accents), English, Japanese, Korean, Vietnamese, Thai, Indonesian, Malay, Filipino, Hindi, Arabic, French, German, Spanish, Portuguese, Russian, Italian, Dutch, Swedish, Danish, Finnish, Norwegian, Greek, Polish, Czech, Hungarian, Romanian, Bulgarian, Croatian, Slovak
Fun-ASR
Model ID | Mode | API | Accuracy boost | Emotion recognition | Speaker diarization | Max audio duration/size | |
|---|---|---|---|---|---|---|---|
| Real-time | WebSocket | Hot words | Unsupported | Unsupported | Chinese, English, Japanese, and dialects | Unlimited |
| Real-time | WebSocket | Hot words | Unsupported | Unsupported | Chinese, English, Japanese, and dialects | Unlimited |
| Real-time | WebSocket | Hot words | Unsupported | Unsupported | Chinese, English, Japanese, and dialects | Unlimited |
| Real-time | WebSocket | Hot words | Unsupported | Unsupported | Chinese, English | Unlimited |
| Real-time | WebSocket | Hot words | Unsupported | Unsupported | Chinese | Unlimited |
| Real-time | WebSocket | Hot words | Unsupported | Unsupported | Chinese | Unlimited |
| Offline | HTTP | Hot words | Unsupported | Supported | Multilingual with dialects | 12 hours / 2 GB |
| Offline | HTTP | Prompt context | Unsupported | Unsupported | Multilingual with dialects | 5 minutes / 2 GB |
| Offline | HTTP | Hot words | Unsupported | Supported | Multilingual with dialects | 12 hours / 2 GB |
| Offline | HTTP | Hot words | Unsupported | Supported | Chinese, English | 12 hours / 2 GB |
| Offline | HTTP | Hot words | Unsupported | Supported | Multilingual with dialects | 12 hours / 2 GB |
| Offline | HTTP | Hot words | Unsupported | Supported | Multilingual with dialects | 12 hours / 2 GB |
- Fun-ASR-Realtime main versions (
fun-asr-realtime,fun-asr-realtime-2026-02-28,fun-asr-realtime-2025-11-07): Chinese (Mandarin, Cantonese, Wu, Hokkien, Hakka, Gan, Xiang, Jin; plus regional accents including Central Plains, Southwestern, Ji-Lu, Jianghuai, Lan-Yin, Jiao-Liao, Northeastern, Beijing, and Hong Kong/Taiwan—covering Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu, and Ningxia accents), English, Japanese fun-asr-realtime-2025-09-15: Chinese (Mandarin), English- Fun-ASR-Flash-Realtime(8K) (
fun-asr-flash-8k-realtime,fun-asr-flash-8k-realtime-2026-01-28): Chinese - Fun-ASR main versions (
fun-asr,fun-asr-2025-11-07): Chinese (Mandarin, Cantonese, Wu, Hokkien, Hakka, Gan, Xiang, Jin; plus regional accents including Central Plains, Southwestern, Ji-Lu, Jianghuai, Lan-Yin, Jiao-Liao, Northeastern, Beijing, and Hong Kong/Taiwan—covering Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu, and Ningxia accents), English, Japanese, Korean, Vietnamese, Thai, Indonesian, Malay, Filipino, Hindi, Arabic, French, German, Spanish, Portuguese, Russian, Italian, Dutch, Swedish, Danish, Finnish, Norwegian, Greek, Polish, Czech, Hungarian, Romanian, Bulgarian, Croatian, Slovak - Fun-ASR-Flash (
fun-asr-flash-2026-06-15): Chinese (Mandarin, Cantonese, Wu, Hokkien, Hakka, Gan, Xiang, Jin; plus regional accents including Central Plains, Southwestern, Ji-Lu, Jianghuai, Lan-Yin, Jiao-Liao, Northeastern, Beijing, and Hong Kong/Taiwan—covering Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu, and Ningxia accents), English, Japanese, Korean, Vietnamese, Thai, Indonesian, Malay, Filipino, Hindi, Arabic, French, German, Spanish, Portuguese, Russian, Italian, Dutch, Swedish, Danish, Finnish, Norwegian, Greek, Polish, Czech, Hungarian, Romanian, Bulgarian, Croatian, Slovak fun-asr-2025-08-25: Chinese (Mandarin), English- Fun-ASR(MTL) (
fun-asr-mtl,fun-asr-mtl-2025-08-25): Chinese (Mandarin, Cantonese), English, Japanese, Korean, Vietnamese, Thai, Indonesian, Malay, Filipino, Hindi, Arabic, French, German, Spanish, Portuguese, Russian, Italian, Dutch, Swedish, Danish, Finnish, Norwegian, Greek, Polish, Czech, Hungarian, Romanian, Bulgarian, Croatian, Slovak
Qwen-ASR
Model ID | Mode | API | Accuracy boost | Emotion recognition | Speaker diarization | Max audio duration/size | |
|---|---|---|---|---|---|---|---|
| Real-time | WebSocket | Unsupported | Supported | Unsupported | Multilingual with dialects | Unlimited |
| Real-time | WebSocket | Unsupported | Supported | Unsupported | Multilingual with dialects | Unlimited |
| Real-time | WebSocket | Unsupported | Supported | Unsupported | Multilingual with dialects | Unlimited |
| Offline | HTTP | Unsupported | Supported | Unsupported | Multilingual with dialects | 12 hours / 2 GB |
| Offline | HTTP | Unsupported | Supported | Unsupported | Multilingual with dialects | 12 hours / 2 GB |
| Offline | HTTP (OpenAI-compatible) | Unsupported | Supported | Unsupported | Multilingual with dialects | 5 minutes / 10 MB |
| Offline | HTTP (OpenAI-compatible) | Unsupported | Supported | Unsupported | Multilingual with dialects | 5 minutes / 10 MB |
| Offline | HTTP (OpenAI-compatible) | Unsupported | Supported | Unsupported | Multilingual with dialects | 5 minutes / 10 MB |
qwen3-asr-flash-realtime, qwen3-asr-flash-filetrans, qwen3-asr-flash, and their snapshot versions) share the same language list: Chinese (Mandarin, Sichuanese, Hokkien, Wu, Cantonese), English, Japanese, German, Korean, Russian, French, Portuguese, Arabic, Italian, Spanish, Hindi, Indonesian, Thai, Turkish, Ukrainian, Vietnamese, Czech, Danish, Filipino, Finnish, Icelandic, Malay, Norwegian, Polish, Swedish.
Paraformer
Paraformer is an older-generation ASR model family. Migrate to Fun-ASR or Qwen-ASR when possible.
Model ID | API | Description |
|---|---|---|
| WebSocket | Real-time recognition; Chinese, English, Japanese, Korean, German, French, Russian |
| WebSocket | Real-time recognition; Chinese, English, Japanese, Korean, German, French, Russian |
| WebSocket | Real-time recognition for 8 kHz telephony; Chinese |
| WebSocket | Real-time recognition for 8 kHz telephony; Chinese |
| HTTP | File transcription with speaker diarization; Chinese, English, Japanese, Korean, German, French, Russian |
| HTTP | File transcription for 8 kHz telephony; Chinese |
paraformer-realtime-v2,paraformer-v2: Chinese (Mandarin, Cantonese, Wu, Hokkien, Northeastern, Gansu, Guizhou, Henan, Hubei, Hunan, Ningxia, Shanxi, Shaanxi, Shandong, Sichuan, Tianjin, Jiangxi, Yunnan, Shanghai), English, Japanese, Korean, German, French, Russianparaformer-realtime-v1,paraformer-realtime-8k-v2,paraformer-realtime-8k-v1,paraformer-8k-v2: Chinese (Mandarin)
Audio specifications
Audio specifications for real-time and offline modes. For supported languages, see the model family subsection under "All models".
Real-time
Model ID | Input method | Audio format | Sample rate | Size/duration |
|---|---|---|---|---|
Qwen-Audio-3.0-ASR-Flash-Streaming ( | Binary stream |
| Any | Unlimited |
Fun-ASR-Realtime / Fun-ASR-MTL-Realtime ( | Binary stream |
| Any | Unlimited |
Fun-ASR-Flash-8K-Realtime ( | Binary stream | Same as Fun-ASR-Realtime | 8 kHz | Unlimited |
Qwen-ASR-Realtime ( | Binary stream |
| 8 kHz, 16 kHz | Unlimited |
Paraformer-Realtime ( | Binary stream | Same as Fun-ASR-Realtime |
| Unlimited |
Offline
Model ID | Input method | Audio format | Sample rate | File size/duration |
|---|---|---|---|---|
Qwen-Audio-3.0-ASR-Flash-Filetrans ( | Publicly accessible file URL; 1 URL per request |
| Any | ≤2 GB; ≤12 hours (≤2 hours recommended when speaker diarization is enabled) |
Qwen-Audio-3.0-ASR-Flash ( | URL / Base64; 1 file per request |
| Any | ≤2 GB; ≤5 minutes |
Fun-ASR ( | Publicly accessible file URL; 1 URL per request |
| Any | ≤2 GB; ≤12 hours (≤2 hours recommended when speaker diarization is enabled) |
Fun-ASR-Flash ( | URL / Base64; 1 file per request |
| Any | ≤2 GB; ≤5 minutes |
Paraformer ( | Same as Fun-ASR | Same as Fun-ASR | paraformer-v2 any rate; | Same as Fun-ASR |
Qwen3-ASR-Flash-Filetrans ( | Publicly accessible file URL; 1 URL per request |
|
| ≤2 GB; ≤12 hours |
Qwen3-ASR-Flash ( | URL / Base64 / local file absolute path; 1 file per request |
|
| ≤10 MB; ≤5 minutes |