Choose a model for voice conversation, audio and video analysis, content moderation, voice translation, and other omni-modal tasks.
Migrate from closed-source models
Map your current GPT or Gemini omni-modal/real-time capabilities to an equivalent Bailian model.
Closed-source examples | Bailian recommendation | |
|---|---|---|
Highest capability | GPT-5.5, Gemini 3.1 Pro |
|
Lightweight & low-cost | GPT-5.4-mini, Gemini 3.1 Flash |
|
Real-time translation | Gemini 3.1 Live |
|
Use cases
Omni-modal models understand text, audio, images, and video simultaneously, producing both text and speech output. Three families are available: Qwen3.5-Omni (flagship), Qwen3-Omni-Flash (lightweight, lower cost, supports thinking mode), and Qwen3.5-Livetranslate (purpose-built translation). Choose by use case:
Use case | Recommended model | User guide |
|---|---|---|
Real-time voice/video conversation: Interact with AI through a microphone and camera (voice assistants, customer service bots, visual Q&A, live-stream analysis) | Qwen3.5-Omni Realtime (WebSocket) | |
Audio and video analysis: Upload audio or video files for AI-generated text or speech responses (video content moderation, meeting transcription, caption generation) | Qwen3.5-Omni (HTTP) | |
Lightweight audio and video analysis: Analyze uploaded audio or video files at lower cost (single input capped at 150 seconds). Supports thinking mode with text-only output | Qwen3-Omni-Flash (HTTP) | |
Real-time voice translation: Simultaneous interpretation with approximately 3-second latency, supporting 60 languages (live interpretation, multilingual meetings) | Qwen3.5-Livetranslate (WebSocket) | |
Audio and video file translation: Upload audio or video files and translate them into a target language (video dubbing, podcast translation) | Qwen3-Livetranslate (HTTP) | |
Voice cloning: Provide a reference audio clip and the AI generates speech responses in that voice | Qwen3.5-Omni Plus / Flash (HTTP / WebSocket) | |
Real-time voice conversation with semantic VAD: End-to-end voice interaction, semantic turn detection (smart_turn), non-meaningful utterances won't interrupt the conversation, supports Function Calling (voice assistants, smart customer service) | Qwen-Audio (WebSocket) |
- For content analysis, Qwen3.5-Omni supports audio up to 3 hours and video up to 1 hour per request.
- Qwen3.5-Omni (WebSocket + HTTP), Qwen3-Omni-Flash (HTTP only), and Qwen-Audio Realtime (WebSocket) support function calling.
- Only Qwen3.5-Omni supports web search (HTTP / WebSocket). Web search and function calling cannot be enabled at the same time.
Translation
Multiple omni-modal models support voice translation, each suited to different scenarios.
Supported languages
Supported languages
Language | Qwen3.5-Livetranslate | Qwen3-Livetranslate | Qwen3.5-Omni | Qwen3-Omni-Flash |
|---|---|---|---|---|
English | Supported | Supported | Supported | Supported |
Chinese (Mandarin) | Supported | Supported | Supported | Supported |
Cantonese | Supported | Supported | Supported Text only | Supported |
Sichuanese | Supported | Supported | Supported | Supported |
Shanghainese | Supported | Supported | Supported | Supported |
Beijingese | Supported | Supported | Supported | Supported |
Tianjinese | Supported | Supported | Supported | Supported |
Nanjingese | Unsupported Text only | Unsupported | Supported | Supported |
Shaanxi dialect | Unsupported Text only | Unsupported | Supported | Supported |
Hokkien | Unsupported Text only | Unsupported | Supported | Supported |
French | Supported | Supported | Supported | Supported |
German | Supported | Supported | Supported | Supported |
Russian | Supported | Supported | Supported | Supported |
Italian | Supported | Supported | Supported | Supported |
Spanish | Supported | Supported | Supported | Supported |
Portuguese | Supported | Supported | Supported | Supported |
Japanese | Supported | Supported | Supported | Supported |
Korean | Supported | Supported | Supported | Supported |
Thai | Supported | Supported Text only | Supported | Supported |
Indonesian | Supported | Supported Text only | Supported | Unsupported |
Vietnamese | Supported | Supported Text only | Supported | Unsupported |
Arabic | Supported | Supported Text only | Supported | Unsupported |
Hindi | Supported | Supported Text only | Supported | Unsupported |
Turkish | Supported | Supported Text only | Supported | Unsupported |
Finnish | Unsupported Text only | Unsupported | Supported | Unsupported |
Polish | Unsupported Text only | Unsupported | Supported | Unsupported |
Dutch | Unsupported Text only | Unsupported | Supported | Unsupported |
Czech | Unsupported Text only | Unsupported | Supported | Unsupported |
Urdu | Unsupported Text only | Unsupported | Supported | Unsupported |
Tagalog | Unsupported Text only | Unsupported | Supported | Unsupported |
Swedish | Unsupported Text only | Unsupported | Supported | Unsupported |
Danish | Unsupported Text only | Unsupported | Supported | Unsupported |
Hebrew | Unsupported Text only | Unsupported | Supported | Unsupported |
Icelandic | Unsupported Text only | Unsupported | Supported | Unsupported |
Malay | Unsupported Text only | Unsupported | Supported | Unsupported |
Norwegian | Unsupported Text only | Unsupported | Supported | Unsupported |
Persian | Unsupported Text only | Unsupported | Supported | Unsupported |
Greek | Supported Text only | Supported Text only | Unsupported | Unsupported |
qwen-omni-turbo supports only Chinese and English.Recommended models
Model ID | API | Input | Function calling | Web search | Thinking mode |
|---|---|---|---|---|---|
| WebSocket | Text, audio, images | Supported | Supported | Unsupported |
| HTTP | Text, audio, images, video | Supported | Supported | Unsupported |
| WebSocket | Text, audio, images | Supported | Supported | Unsupported |
| HTTP | Text, audio, images, video | Supported | Supported | Unsupported |
| WebSocket | Text, audio, images, video | Unsupported | Unsupported | Unsupported |
| HTTP | Text, audio, images, video | Supported | Unsupported | Supported |
| WebSocket | Audio, images | Unsupported | Unsupported | Unsupported |
| HTTP | Audio, video | Unsupported | Unsupported | Unsupported |
| WebSocket | Audio, text | Supported | Unsupported | Unsupported |
| WebSocket | Audio, text | Supported | Unsupported | Unsupported |
All models
Qwen3.5-Omni
Model ID | API | Input | Function calling | Web search | Thinking mode |
|---|---|---|---|---|---|
| WebSocket | Text, audio, images, video | Supported | Supported | Unsupported |
| WebSocket | Text, audio, images, video | Supported | Supported | Unsupported |
| HTTP | Text, audio, images, video | Supported | Supported | Unsupported |
| HTTP | Text, audio, images, video | Supported | Supported | Unsupported |
| WebSocket | Text, audio, images, video | Supported | Supported | Unsupported |
| WebSocket | Text, audio, images, video | Supported | Supported | Unsupported |
| HTTP | Text, audio, images, video | Supported | Supported | Unsupported |
| HTTP | Text, audio, images, video | Supported | Supported | Unsupported |
Qwen3-Omni
Model ID | API | Input | Function calling | Web search | Thinking mode |
|---|---|---|---|---|---|
| WebSocket | Text, audio, images, video | Unsupported | Unsupported | Unsupported |
| WebSocket | Text, audio, images, video | Unsupported | Unsupported | Unsupported |
| WebSocket | Text, audio, images, video | Unsupported | Unsupported | Unsupported |
| HTTP | Text, audio, images, video | Supported | Unsupported | Supported |
| HTTP | Text, audio, images, video | Supported | Unsupported | Supported |
| HTTP | Text, audio, images, video | Supported | Unsupported | Supported |
Qwen3.5-Livetranslate
Model ID | API | Input | Languages |
|---|---|---|---|
| WebSocket | Audio | 60 |
| WebSocket | Audio | 60 |
Qwen3-Livetranslate
Model ID | API | Input | Languages |
|---|---|---|---|
| WebSocket | Audio | 18 |
| WebSocket | Audio | 18 |
| HTTP | Audio, video | 18 |
| HTTP | Audio, video | 18 |
Qwen-Audio
Model ID | API | Input | Function calling | Web search | Thinking mode |
|---|---|---|---|---|---|
| WebSocket | Audio, text | Supported | Unsupported | Unsupported |
| WebSocket | Audio, text | Supported | Unsupported | Unsupported |
Legacy models
The following models are no longer updated. Use Qwen3.5-Omni for new projects.
Model ID | Input | API |
|---|---|---|
| Text, audio, images, video | HTTP |
| Text, audio, images, video | HTTP |
| Text, audio, images, video | HTTP |
| Text, audio, images, video | HTTP |
| Text, audio | WebSocket |
| Text, audio | WebSocket |
| Text, audio | WebSocket |