Skip to main content
产品动态

模型上下架与更新

模型上架 详见下表, 模型下线 规则及清单请参考 模型下线机制说明 。

  • 新加坡
  • 美国(弗吉尼亚)
  • 华北2(北京)
  • 中国香港
  • 德国(法兰克福)
  • 日本(东京)

模型类型

时间

服务部署范围

模型ID

功能说明

文本生成、深度思考、视觉理解

2026-09-02

国际

qwen3.8-max-0902

Qwen3.8-Max-0902(别名qwen3.8-max-2026-09-02)是qwen3.8-max的快照版本。编码深度再突破,可驾驭更复杂的工程级项目与长程自主开发;协作智能体能力显著增强,在多工具调度与端到端交付中表现更从容;视觉理解全面精进,图表推理、文档解析与多模态感知更敏锐准确。延续 100 万上下文、思考模式与完整工具生态,在更高智能水平上持续进化。

图像翻译

2026-08-28

国际

qwen-mt-image-2.0

专注做图片翻译的模型服务,能将中、英、日等55个语言的图片翻译到指定的语言,精准还原图片排版和内容信息,支持术语定义、敏感词过滤、商品主体检测等自定义功能,提供灵活、准确、高效的图像本地化服务。

文本生成、深度思考、视觉理解

2026-08-26

国际

qwen3.8-flash

Qwen3.8-Flash 是通义千问最新推出的多模态大模型,兼具强大的理解与生成能力和出色的响应速度。模型原生支持百万级上下文窗口,能够一次性处理超长文档、代码仓库和复杂对话。在编程辅助、智能体协作、图文理解等场景中表现尤为出色——无论是自动修复代码、操作桌面应用,还是分析图表与长视频,都能给出准确、高质量的结果。同时兼容 OpenAI 与 Anthropic 主流接口协议,可无缝接入 Claude Code、Codex 等开发者工具,轻松构建高并发应用与智能工作流。凭借优异的性能与极具竞争力的推理成本,Qwen3.8-Flash 是开发者和企业在 AI 应用中兼顾效果与效率的理想选择。

视频生成

2026-08-20

国际

wan3.0-video-prime

Wan3.0-Video-Prime 是万相3.0 的高速版视频生成模型,能力对齐 Wan3.0-Video 标准版,支持四模态全能参考,最长可生成30秒视频,带来沉浸式视听体验的同时端到端速度显著提升。

文本生成、深度思考、视觉理解

2026-08-19

国际

kimi-k3

Kimi-K3 是 Kimi 迄今能力最强的旗舰模型,拥有 2.8 万亿参数,基于 KDA 混合线性注意力机制(Kimi Delta Attention)和注意力残差(Attention Residuals)技术构建,原生支持视觉理解,并拥有 100 万 token 上下文窗口。它是全球首个开源的 3 万亿级别模型,面向长程编程、知识工作和推理等前沿智能场景而设计。

文本生成、深度思考、视觉理解

2026-08-17

国际

qwen3.8-27b

Qwen3.8系列27B原生视觉语言Dense模型,模型效果相较3.6-27B重点提升了文本和视觉模态下的编程和办公场景能力,能更可靠地端到端完成复杂任务,输出值得信赖的成果。

文本生成、深度思考

2026-08-17

国际

ZHIPU/GLM-5.3

GLM-5.3是智谱迄今编程能力最强的模型,在内部自建体感评测中较GLM-5.2提升50%;网络安全能力:在白盒代码审查与漏洞发现等安全任务中,GLM-5.3的表现持平Mythos 5,展现出面向网络安全防御场景的强大潜力。

文本生成、深度思考

2026-08-14

国际

deepseek-v4-pro-0813

旗舰级 MoE 大模型,总参1.6T、激活 49B,原生支持百万级超长上下文。依托海量高质量训练数据,具备顶尖数学逻辑、复杂推理、专业代码与长文本深度解析能力,适配高阶科研、复杂办公、深度智能代理等高难度场景。

文本生成

2026-08-12

国际

qwen3.8-2.4t-a95b

Qwen3.8-2.4T-A95B 是通义千问最新旗舰系列的开源版本,2026 年 8 月发布。采用稀疏 MoE 架构,总参数 2.4 万亿,每步激活约 950 亿,配合混合注意力机制,支持 100 万 Token 上下文。核心基准:GPQA Diamond 92.6、PaperBench 93.0、OSWorld 86.1、BabyVision 82.0,CodeArena 全球第 4。

实时语音对话

2026-08-10

国际

qwen-audio-3.0-realtime-plus

千问实时语音大模型 是一款登顶全球权威评测的下一代实时双工语音大模型,它在全球权威第三方评测平台 Artificial Analysis Speech-to-Speech子项中取得综合排名第一。千问实时语音大模型 兼顾了模型智商与双工对话节奏,在保持流畅、自然的实时交互体验的同时,语音推理能力不打折扣;并通过并行推理和全向流式等工程优化,将端到端响应时延控制在低水平,实现"又快又聪明"的对话体验。标准版更注重高质量的回复结果。

实时语音对话

2026-08-10

国际

qwen-audio-3.0-realtime-flash

千问实时语音对话大模型3.0 是一款登顶全球权威评测的下一代实时双工语音大模型,它在全球权威第三方评测平台 Artificial Analysis Speech-to-Speech子项中取得综合排名第一。千问实时语音对话大模型3.0兼顾了模型智商与双工对话节奏,在保持流畅、自然的实时交互体验的同时,语音推理能力不打折扣;并通过并行推理和全向流式等工程优化,将端到端响应时延控制在低水平,实现"又快又聪明"的对话体验。极速版更注重极致的响应速度

文本生成、深度思考、视觉理解

2026-08-07

国际

kimi/kimi-k3

Kimi K3 是 Kimi 迄今能力最强的旗舰模型,拥有 2.8 万亿参数,基于 KDA 混合线性注意力机制(Kimi Delta Attention)和注意力残差(Attention Residuals)技术构建,原生支持视觉理解,并拥有 100 万 token 上下文窗口。它是全球首个开源的 3 万亿级别模型,面向长程编程、知识工作和推理等前沿智能场景而设计。

文本生成、深度思考

2026-08-07

国际

ZHIPU/GLM-5.2

智谱原厂直供。GLM-5.2 支持真正可用的 1M 上下文,并在长程任务中继续保持领先。

视频生成

2026-08-06

国际

wan3.0-video

万相3.0是 all-in-one 视频生成模型,统一支持参考、编辑、复刻、驱动等多种创作功能,四模态全能参考,最长支持30秒视频生成,可解析文件、网页及复杂图片。生产级角色一致性保持,音画真实,带来身临其境的视听冲击力。

图片生成

2026-08-04

国际

qwen-image-3.0

指令理解清晰:支持最大 4.5k token 输入,复杂图文指令一次生成到位。 文字渲染稳定:10px 小字、12 国语言、20+ 字体清晰可辨,信息图和界面直接可用。 批量产出趁手:海报、网页、界面等日常任务可批量生成,成本更优,适合持续创作。 Qwen-Image-3.0 Standard 不只在追求生成效果,更在追求日常创作里的顺手与省心——让图像生成成为可持续的内容生产力。

文本生成、深度思考、视觉理解

2026-08-02

国际

qwen3.8-max

2.4万亿参数MoE旗舰,编程与办公能力全面跃升,可自主编程十数天交付完整项目。胜任法律、金融、设计等数百种专业任务,一次对话端到端交付生产级成果。原生视觉理解贯穿规划、执行与验证全流程,支持超长文档与长视频的深度语义解析。长程任务中自主规划与闭环迭代,持续进化。

文本生成、深度思考

2026-08-01

国际

deepseek-v4-flash-0731

高效轻量化MoE模型,总参284B,激活13B,原生支持百万超长上下文能力。推理速度快、延迟低、调用成本低廉,综合能力均衡,主打高并发、轻量化任务,适合日常对话、内容创作、基础 RAG、批量文案处理等普惠刚需场景。

文本向量

2026-07-31

国际

qwen3.7-text-embedding

是通义实验室基于Qwen3.7训练的多语言文本统一向量模型,相较text-embedding-v4版本在文本检索、聚类、分类性能大幅提升;在MTEB多语言、中英、Code检索等评测任务上效果提升20%;支持256~2560维用户自定义向量维度。

语音识别

2026-07-30

国际

qwen-audio-3.0-asr-flash-streaming

qwen-audio-3.0-asr-flash-filetrans

qwen-audio-3.0-asr-flash

新增Qwen-Audio-3.0-ASR-Flash-Streaming(实时)、Qwen-Audio-3.0-ASR-Flash-Filetrans(非实时)和Qwen-Audio-3.0-ASR-Flash(非实时)系列模型:方言支持:支持汉语七大方言(官话/吴/湘/赣/客/闽/粤)及 20+ 地区口音;古诗词优化:提升古诗词识别准确率,适用于文化教育、有声读物等场景;文本优化:标点预测与文本归一化增强,数字/日期/金额自动转标准格式;多语种扩展:支持中、英、日、韩等共 30 个语种;热词和上下文能力:支持热词(预编译热词和即时热词) context 上下文,提升特定词汇识别准确率。

文本生成、深度思考、视觉理解

2026-07-21

国际

qwen3.7-flash

qwen3.7-flash-2026-07-15

Qwen3.7原生视觉语言系列Flash模型,相较3.6-Flash全面提升多模态理解与Agent执行能力。重点强化多模态基础能力、万物识别能力更强,真实世界感知与空间智能进一步提升,Search Agent、CI Agent等多模态Agent场景能力显著升级、端到端任务执行更稳定,多模态Coding能力优化、vibe coding 体验更加流畅。

图片生成

2026-07-20

国际

qwen-image-3.0-pro

内容丰实:支持最大 4.5k token 输入,支持图中图密集信息排版,让报纸、分镜、菜单、试卷等复杂版面一次生成。 细节真实:支持 10px 小字精准渲染,微表情、毛孔、发丝等细节生动还原,逼近真实摄影的质感。 知识厚实:支持 12 国语言、多种字体原生渲染,主流网页、游戏、直播等界面仿真,外部知识全纳入。 Qwen-Image-3.0-Pro 不只是在追求"好看",更在追求“好用”——让图像生成真正成为可落地的生产力工具。

语音合成、实时语音合成

2026-07-14

国际

qwen-audio-3.0-tts-plus

Qwen-Audio-3.0-TTS-Plus是面向高质量语音生成场景打造的高性能语音合成大模型。相比前一版本,模型支持更多小语种和中文方言,显著提升方言发音的正宗程度,并增强了 free-style 指令遵循能力和细粒度标签控制能力,可更准确地控制情绪、语气、角色、语速、音量和合成风格。同时,模型在噪声、混响等复杂声学条件下具备更强鲁棒性,进一步提升了音质、清晰度、分辨率和整体表现力。Plus 版本更强调合成效果和细节表现,适用于有更高音质、自然度和表现力要求的专业场景,如内容创作、有声书、影视配音、品牌声音设计和高品质语音服务。

实时语音合成

2026-07-14

国际

qwen-audio-3.0-tts-flash

Qwen-Audio-3.0-TTS-Flash是面向实时交互场景优化的高性能语音合成大模型。相比前一版本,模型支持更多小语种和中文方言,提升了方言发音的正宗程度,并增强了 free-style 指令遵循能力和细粒度标签控制能力,可更灵活地控制情绪、语气、角色、语速、音量等表达方式。同时,模型在噪声、混响等复杂声学条件下具备更强鲁棒性,提升了音质、清晰度和整体表现力。Flash 版本重点优化实时合成体验,适用于语音助手、实时对话、智能客服等低延迟交互场景。

文本生成

2026-07-10

国际

glm-5.2-fast-preview

GLM-5.2-Fast-Preview 是智谱 AI 旗舰模型 GLM-5.2 的高速版本,支持 1M 超长上下文,模型能力对齐 GLM-5.2 标准版,具备逻辑推理、长文本理解与代码生成能力。通过推理加速优化,输出 TPS 可达 GLM-5.2 标准版的 1.5~2 倍,显著提升输出速度,适用于实时对话、Agent 多轮调用、流式代码生成等对输出速度敏感的场景。

视频生成

2026-07-01

国际

wan2.7-t2v-2026-06-12

万相2.7-文生视频,演绎能力全面升级,文戏情感细腻自然,动作戏激烈拳拳到肉,搭配更富有戏剧性和节奏感的镜头切换,实现更强表演能力。该版本为2026年6月12日快照。

视频生成

2026-07-01

国际

wan2.7-r2v-2026-06-12

万相2.7-参考生视频,更加稳定的角色、道具与场景参考,支持最大5个图/视频混合参考,支持音频音色参考,搭配基础能力升级实现更强表演能力。该版本为2026年6月12日快照。

图片生成

2026-06-25

国际

qwen-image-2.0-pro-2026-06-22

Qwen-Image-2.0系列满血版模型,实现了图片生成和图片编辑的融合;具备更专业的文字渲染1k token指令支持能力、更细腻的真实质感,细腻刻画写实场景、更强的语义遵循能力。满血版具备2.0系列最强的文字渲染能力和真实质感。

文本生成、深度思考、视觉理解

2026-06-25

国际

kimi-k2.7-code

kimi-k2.7-code是 kimi 迄今最智能的coding模型,在长上下文中更可靠地遵循指令,能以更高的成功率完成编程任务,同时支持文本、图片与视频输入,思考模式,对话与 Agent 任务。

文本生成、深度思考

2026-06-25

国际

glm-5.2

GLM-5.2是智谱AI推出的面向长程任务(Long Horizon Task)设计的最新旗舰模型,支持1M超长上下文。拥有强大逻辑推理、长文本理解与代码生成能力、兼顾性能与推理效率;在多任务基准中表现优异,适用于智能交互、企业应用、开发辅助等场景。

语音识别

2026-06-17

国际

fun-asr-flash-2026-06-15

百聆2026年6月更新的大模型ASR版本,全面支持汉语传统七大方言体系(官话/吴/湘/赣/客/闽/粤),并适配 20+ 地区口音官话。针对中文古诗词的韵律、节奏与文言表达特点进行专项优化,提升对古诗词内容的识别准确率,适用于文化传承、教育讲解、有声读物等场景。优化标点预测与文本归一化能力,使输出文本更符合书面表达习惯,数字、日期、金额等信息自动转换为标准格式,增强内容的可读性与专业性。同时语种扩展至英语、日语、韩语、越南语、泰语、印尼语、马来语、菲律宾语、印地语、阿拉伯语、法语、德语、西班牙语、葡萄牙语、俄语、意大利语、荷兰语、瑞典语、丹麦语、芬兰语、挪威语、希腊语、波兰语、捷克语、匈牙利语、罗马尼亚、保加利亚语、克罗地亚语、斯洛伐克语等,共计30个语种。支持context上下文能力,可转写5分钟以内的音频。

视频生成

2026-06-16

国际

happyhorse-1.1-t2v

HappyHorse-1.1-T2V支持文生视频,进一步提升文本语义理解、镜头调度与动态生成表现。模型能够更精准地还原创作意图,在人物动作、场景氛围、视觉美感和物理运动上生成更流畅自然、细节丰富且一致性更高的高质量视频。

视频生成

2026-06-16

国际

happyhorse-1.1-r2v

HappyHorse-1.1-R2V支持参考生视频,进一步提升主体、场景风格与画面一致性的稳定保持。模型最多支持9张参考图片输入,能够更精准理解并延续创作意图,在人物、场景、风格和镜头表现上带来更强的可控性与表现力。

视频生成

2026-06-16

国际

happyhorse-1.1-i2v

HappyHorse-1.1-I2V支持图生视频,进一步提升画面质感、动态表现与跨片段一致性。模型能够更精准地理解输入图像并延续创作意图,在人物皮肤质感、ID跨片段保持、动作流畅度、文字渲染稳定性以及音画同步上带来显著改善,输出更真实自然、细节丰富且一致性更高的高质量视频。

文本生成、深度思考、视觉理解

2026-06-10

国际

qwen3.7-max-2026-06-08

Qwen3.7系列中规模最大、综合能力最强的Max模型,相较于5月20日快照增加了视觉模态理解能力,能够感知真实世界场景,具备多模态交互混合智能体能力。该版本为2026年6月8日快照。

文本生成、深度思考、视觉理解

2026-06-01

国际

qwen3.7-plus

qwen3.7-plus-2026-05-26

Qwen3.7系列中高性价比Plus模型,在强大文本能力的基础上全面升级了视觉-语言能力,同时保持了在编码、工具使用和生产力工作流方面的完整智能体能力。其核心特色为多模态交互混合智能体能力,能够感知真实世界场景、读取屏幕并操作 GUI、基于视觉参考生成代码、端到端导航移动应用。

文本生成、深度思考

2026-05-21

国际

qwen3.7-max

qwen3.7-max-2026-05-20

Qwen3.7系列中规模最大、综合能力最强的Max模型,当前开放纯文本模型能力供体验。Qwen3.7是面向智能体时代的新一代旗舰模型,核心优势在于智能体能力的广度与深度:在编程、办公与生产力、长周期自主执行方面均能出色胜任各项任务。

文本生成、深度思考

2026-05-20

国际

qwen3.7-max-preview

qwen3.7-max-2026-05-17

Qwen3.7系列中规模最大、综合能力最强的Max模型预览版,仅支持思考模式,开放纯文本模型能力供体验。主要优化面向用户的通用对话场景,例如知识问答、指令跟随、创意写作等。

实时语音翻译

2026-05-19

国际

qwen3.5-livetranslate-flash-realtime

qwen3.5-livetranslate-flash-realtime-2026-05-19

Qwen3.5-LiveTranslate-Flash的实时版本,一款高精度、高响应、高鲁棒性的多语言实时音视频同传大模型。依托Qwen3.5-Omni强大的基座能力、海量多模态数据、跨语言跨模态对齐和视觉增强等技术,通义千问3.5-LiveTranslate-Flash 实现了离线和实时两种音视频翻译能力,能听懂60种语言,会说29种语言。

文本生成、深度思考

2026-05-11

国际

deepseek-v4-pro

旗舰级 MoE 大模型,总参1.6T、激活 49B,原生支持百万级超长上下文。依托海量高质量训练数据,具备顶尖数学逻辑、复杂推理、专业代码与长文本深度解析能力,适配高阶科研、复杂办公、深度智能代理等高难度场景。

文本生成、深度思考

2026-05-11

国际

deepseek-v4-flash

高效轻量化MoE模型,总参284B,激活13B,原生支持百万超长上下文能力。推理速度快、延迟低、调用成本低廉,综合能力均衡,主打高并发、轻量化任务,适合日常对话、内容创作、基础 RAG、批量文案处理等普惠刚需场景。

视频生成

2026-04-26

国际

wan2.7-t2v-2026-04-25

万相2.7-文生视频,演绎能力全面升级,文戏情感细腻自然,动作戏激烈拳拳到肉,搭配更富有戏剧性和节奏感的镜头切换,实现更强表演能力。该版本为2026年4月25日快照。

视频生成

2026-04-26

国际

wan2.7-i2v-2026-04-25

万相2.7-图生视频,演绎能力全面升级,文戏情感细腻自然,动作戏激烈拳拳到肉,搭配更富有戏剧性和节奏感的镜头切换,实现更强表演能力。该版本为2026年4月25日快照。

视频生成

2026-04-26

国际

happyhorse-1.0-video-edit

HappyHorse-1.0-Video-Edit支持视频编辑,自然语言指令编辑视频,可参考最多5张图片局部或全局编辑视频元素,能够精准复刻视频动态过程,实现更强表现能力。

视频生成

2026-04-26

国际

happyhorse-1.0-r2v

HappyHorse-1.0-R2V支持参考生视频,更加稳定的主体与场景参考,支持最多9张图片参考,能够精准保持创作意图,实现更强表现能力。

文本生成、深度思考、视觉理解

2026-04-23

国际

qwen3.5-plus-2026-04-20

Qwen3.5原生视觉语言系列Plus模型,相较于2月15日快照,本模型在Agentic coding能力上大幅提升;推理速度显著提升;知识、推理与长上下文能力保持较高水准,满足复杂Agent任务的需求,适合应用于编码智能体、生产工作流和高吞吐场景。该版本为2026年4月20日快照。

图片生成

2026-04-23

国际

qwen-image-2.0-pro

qwen-image-2.0-pro-2026-04-22

Qwen-Image-2.0系列满血版模型,实现了图片生成和图片编辑的融合;具备更专业的文字渲染1k token指令支持能力、更细腻的真实质感,细腻刻画写实场景、更强的语义遵循能力。满血版具备2.0系列最强的文字渲染能力和真实质感。

文本生成、深度思考、视觉理解

2026-04-22

国际

qwen3.6-27b

Qwen3.6系列27B原生视觉语言Dense模型,模型效果相较3.5-27B重点提升了Agentic coding能力、模型STEM与推理能力进一步增强;视觉模态方面在空间智能、物体定位与检测能力上显著增强,视频理解、文档OCR及视觉Agent能力稳步提升。

视频生成

2026-04-22

国际

happyhorse-1.0-t2v

HappyHorse-1.0-T2V支持文生视频,具备高度还原的动态画面生成能力,能够精准理解文本语义,输出流畅自然、细节丰富的高质量视频。

视频生成

2026-04-22

国际

happyhorse-1.0-i2v

HappyHorse-1.0-I2V支持图生视频,具备高度还原的动态画面生成能力,能够精准理解文本语义,输出流畅自然、细节丰富的高质量视频。

文本生成、深度思考、视觉理解

2026-04-17

国际

qwen3.6-flash

qwen3.6-flash-2026-04-16

Qwen3.6原生视觉语言系列Flash模型,模型效果相较3.5-Flash显著提升。本模型重点提升agentic coding能力(在多项代码智能体基准上大幅超越前代)、数学推理和代码推理能力;视觉方面在空间智能能力上显著增强,物体定位与目标检测提升尤为突出。

文本生成、深度思考、视觉理解

2026-04-17

国际

qwen3.6-35b-a3b

Qwen3.6系列35B-A3B原生视觉语言模型,基于混合架构设计,融合了线性注意力机制与稀疏混合专家模型,实现了更高的推理效率。模型效果相较3.5-35B-A3B显著提升了agentic coding能力、数学推理和代码推理能力、空间智能能力、物体定位与目标检测能力。

语音合成

2026-04-15

国际

voice-enrollment

大模型声音复刻服务依托先进的大模型技术进行特征提取,无需训练过程就可以完成声音的复刻。仅需提供极短的音频,即可迅速生成高度相似且听感自然的定制声音。 大模型声音设计使用FunAudioGen-VD模型,支持通过文本Prompt描述,创造声音。无需受限任何音频质量,根据目标场景对音色、语气、语调、语速、情绪等各方面表现力的需求描述,即可生成高质量语音。高度还原专业配音演员的演出水准。

文本生成、深度思考

2026-04-14

国际

qwen3.6-max-preview

Qwen3.6系列中规模最大、综合能力最强的Max模型Preview版本,当前开放纯文本模型能力供体验。相较于此前发布的Qwen3-Max和Qwen3.6-Plus,本模型在vibe coding能力上进一步提升、coding agent执行更加高效、前端编程开发能力显著提升;长尾知识能力进一步升级。

文本生成、深度思考

2026-04-14

国际

glm-5.1

GLM-5.1是智谱AI推出的面向长程任务(Long Horizon Task)设计的模型,总参数744B,支持200K超长上下文,最大输出 128K tokens。拥有强大逻辑推理、长文本理解与代码生成能力、兼顾性能与推理效率;在多任务基准中表现优异,适用于智能交互、企业应用、开发辅助等场景。

视频生成

2026-04-03

国际

wan2.7-videoedit

Wan2.7-VideoEdit,自然语言指令编辑视频,支持局部或全局编辑,可参考图像替换视频元素,支持复刻视频动作、特效、运镜等动态过程。

视频生成

2026-04-03

国际

wan2.7-t2v

Wan2.7-T2V,演绎能力全面升级,文戏情感细腻自然,动作戏激烈拳拳到肉,搭配更富有戏剧性和节奏感的镜头切换,实现更强表演能力。

视频生成

2026-04-03

国际

wan2.7-r2v

Wan2.7-R2V,更加稳定的角色、道具与场景参考,支持最大5个图/视频混合参考,支持音频音色参考,搭配基础能力升级实现更强表演能力。

视频生成

2026-04-03

国际

wan2.7-i2v

万相2.7-图生视频,演绎能力全面升级,文戏情感细腻自然,动作戏激烈拳拳到肉,搭配更富有戏剧性和节奏感的镜头切换,实现更强表演能力。

图片生成

2026-04-01

国际

wan2.7-image-pro

万相2.7-图像生成与编辑旗舰版模型,支持文生图、文生组图、图生组图、图像编辑、多图参考生成、交互式编辑,在文字渲染、主体一致性、复杂指令遵循上都有更强表现。

图片生成

2026-04-01

国际

wan2.7-image

万相2.7-图像生成与编辑,支持文生图、文生组图、图生组图、图像编辑、多图参考生成、交互式编辑,在文字渲染、主体一致性、复杂指令遵循上都有更强表现

文本生成、深度思考、视觉理解

2026-04-01

国际

qwen3.6-plus

qwen3.6-plus-2026-04-02

Qwen3.6原生视觉语言系列Plus模型,展现出与当前顶尖前沿模型相媲美的卓越性能,模型效果相较3.5系列显著提升。模型在Agentic coding、前端编程、Vibe coding等代码能力、多模态万物识别、OCR、物体定位等能力上显著增强。

实时全模态

2026-03-26

国际

qwen3.5-omni-plus-realtime

Qwen3.5-Omni是Qwen最新一代全模态大模型,支持文本,图片,音频,音视频理解与交互。作为 Qwen3-Omni 的全面进化版本,支持60+种语言音频输入,30+语言语音输出以及可控语音对话,WebSearch和复杂FunctionCall的调用,并且具备智能语义打断的交互能力,广泛应用于文本创作、语音助手、多媒体分析等场景,提供自然流畅的多模态交互体验。

全模态

2026-03-26

国际

qwen3.5-omni-plus

qwen3.5-omni-plus-2026-03-15

Qwen3.5-Omni是Qwen最新一代全模态大模型,支持文本,图片,音频,音视频理解与交互。作为 Qwen3-Omni 的全面进化版本, 支持超过 10 小时的音频理解及超过 400 秒的 720P(1 FPS)音视频理解与对话,并进一步拓展语言范围,支持60+种语言音频输入,30+语言语音输出,并且具备强大的结构化音视频理解能力,广泛应用于文本创作、语音助手、多媒体分析等场景,提供自然流畅的多模态理解与交互体验。

实时全模态

2026-03-26

国际

qwen3.5-omni-flash-realtime

qwen3.5-omni-flash-realtime-2026-03-15

Qwen3.5-Omni是Qwen最新一代全模态大模型,支持文本,图片,音频,音视频理解与交互。作为 Qwen3-Omni 的全面进化版本,支持60+种语言音频输入,30+语言语音输出以及可控语音对话,WebSearch和复杂FunctionCall的调用,并且具备智能语义打断的交互能力,广泛应用于文本创作、语音助手、多媒体分析等场景,提供自然流畅的多模态交互体验。

全模态

2026-03-26

国际

qwen3.5-omni-flash

qwen3.5-omni-flash-2026-03-15

Qwen3.5-Omni是Qwen最新一代全模态大模型,支持文本,图片,音频,音视频理解与交互。作为 Qwen3-Omni 的全面进化版本, 支持超过 10 小时的音频理解及超过 400 秒的 720P(1 FPS)音视频理解与对话,并进一步拓展语言范围,支持60+种语言音频输入,30+语言语音输出,并且具备强大的结构化音视频理解能力,广泛应用于文本创作、语音助手、多媒体分析等场景,提供自然流畅的多模态理解与交互体验。

实时全模态

2026-03-25

国际

qwen3.5-omni-plus-realtime-2026-03-15

Qwen3.5-Omni是Qwen最新一代全模态大模型,支持文本,图片,音频,音视频理解与交互。作为 Qwen3-Omni 的全面进化版本,支持60+种语言音频输入,30+语言语音输出以及可控语音对话,WebSearch和复杂FunctionCall的调用,并且具备智能语义打断的交互能力,广泛应用于文本创作、语音助手、多媒体分析等场景,提供自然流畅的多模态交互体验。该版本为2026年3月15日快照。

文本生成、深度思考

2026-03-20

国际

deepseek-v3.2

DeepSeek-V3.2是引入DeepSeek Sparse Attention(一种稀疏注意力机制)的正式版模型,也是DeepSeek推出的首个将思考融入工具使用的模型,同时支持思考模式与非思考模式的工具调用。

图片生成

2026-03-03

国际

qwen-image-2.0-pro-2026-03-03

Qwen-Image-2.0系列满血版模型,实现了图片生成和图片编辑的融合;具备更专业的文字渲染1k token指令支持能力、更细腻的真实质感,细腻刻画写实场景、更强的语义遵循能力。满血版具备2.0系列最强的文字渲染能力和真实质感。该版本为2026年3月3日快照。

图片生成

2026-03-03

国际

qwen-image-2.0

qwen-image-2.0-2026-03-03

Qwen-Image-2.0系列加速版模型,实现了图片生成和图片编辑的融合;具备更专业的文字渲染1k token指令支持能力、更细腻的真实质感,细腻刻画写实场景、更强的语义遵循能力。加速版有效实现了模型效果和性能的最佳平衡。

语音识别

2026-03-02

国际

qwen3-asr-flash-2026-02-10

通义千问3-ASR-Flash,一款基于大语言模型的高精度、高智能、高鲁棒性的多语种语音识别模型。依托强大的基座模型、海量的文本与多模态数据、千万小时音频数据,通义千问3-ASR-Flash实现了高精度的语音识别功能,能够自动判断语种并准确识别 多个语种的语音,在复杂的音频环境下能够保证精确转录。此版本为2026年2月10日的快照版本。

文本生成、深度思考、视觉理解

2026-02-23

国际

qwen3.5-flash

qwen3.5-flash-2026-02-23

Qwen3.5原生视觉语言系列Flash模型,基于混合架构设计,融合了线性注意力机制与稀疏混合专家模型,实现了更高的推理效率。模型效果在纯文本与多模态方面相较3系列均实现飞跃式进步;响应速度快,兼具推理速度和性能。

文本生成、深度思考、视觉理解

2026-02-23

国际

qwen3.5-35b-a3b

Qwen3.5系列35B-A3B原生视觉语言模型,基于混合架构设计,融合了线性注意力机制与稀疏混合专家模型,实现了更高的推理效率。该模型的综合表现接近于Qwen3.5-27B。

文本生成、深度思考、视觉理解

2026-02-23

国际

qwen3.5-27b

Qwen3.5系列27B原生视觉语言Dense模型,融合了线性注意力机制;响应速度快,兼具推理速度和性能。该模型的综合能力接近于Qwen3.5-122B-A10B。

文本生成、深度思考、视觉理解

2026-02-23

国际

qwen3.5-122b-a10b

Qwen3.5系列122B-A10B原生视觉语言模型,基于混合架构设计,融合了线性注意力机制与稀疏混合专家模型,实现了更高的推理效率。该模型的综合表现仅次于Qwen3.5-397B-A17B,文本能力显著优于Qwen3-235B-2507,视觉能力优于Qwen3-VL-235B。

文本生成

2026-02-20

国际

qwen3-coder-next

Qwen3系列新一代代码生成模型,效果接近Qwen3-Coder-Plus兼具更优性能。模型重点优化仓库级别理解、支持多轮工具交互、提升对于agentic coding类工具的适配能力。

文本生成、深度思考、视觉理解

2026-02-15

国际

qwen3.5-plus

qwen3.5-plus-2026-02-15

Qwen3.5原生视觉语言系列Plus模型,基于混合架构设计,融合了线性注意力机制与稀疏混合专家模型,实现了更高的推理效率。在多项任务评测中,3.5系列均展现出与当前顶尖前沿模型相媲美的卓越性能,模型效果在纯文本与多模态方面相较3系列均实现飞跃式进步。

文本生成、深度思考、视觉理解

2026-02-15

国际

qwen3.5-397b-a17b

Qwen3.5系列397B-A17B原生视觉语言模型,基于混合架构设计,融合了线性注意力机制与稀疏混合专家模型,实现了更高的推理效率。在语言理解、逻辑推理、代码生成、智能体任务、图像理解、视频理解、图形用户界面(GUI)等多种任务中,均展现出与当前顶尖前沿模型相媲美的卓越性能。具备强大的代码生成与智能体能力,对于各类智能体场景具有良好的泛化性。

语音识别

2026-02-13

国际

qwen3-asr-flash-realtime-2026-02-10

Qwen3-ASR-Flash的实时版,一款基于大语言模型的高精度、高智能、高鲁棒性的多语种语音识别模型。依托强大的基座模型、海量的文本与多模态数据、千万小时音频数据,Qwen3-ASR-Flash实现了高精度的语音识别功能,能够自动判断语种并准确识别 多个语种的语音,在复杂的音频环境下能够保证精确转录。此版本为2026年2月10日的快照版本。

语音合成

2026-02-10

国际

qwen3-tts-vd-2026-01-26

Qwen3-TTS-VD模型是通义最新推出的实时语音合成大模型,可对qwen3-voice-design服务设计的声音进行高保真实时语音合成,且同一音色支持11个语种的语音输出。该模型经过海量数据训练,合成音频可以根据文本自适应调节语气,对复杂文本合成也有较好的处理能力。该模型为2026年01月26日快照版本模型。

语音合成

2026-02-10

国际

qwen3-tts-vc-2026-01-22

Qwen3-TTS-Flash模型是通义最新推出的实时语音合成大模型,可对qwen-voice-enrollment服务复刻的声音进行高保真实时语音合成,且同一音色支持11个语种的语音输出。该模型经过海量数据训练,合成音频可以根据文本自适应调节语气,对复杂文本合成也有较好的处理能力。该模型为2026年01月22日快照版本模型。

语音合成

2026-02-10

国际

qwen3-tts-instruct-flash

qwen3-tts-instruct-flash-2026-01-26

Qwen3-TTS-Flash模型是通义实验室最新推出的实时语音合成大模型,Instruct模型可通过自然语言进行合成效果的处理,确保在不同语境下,合成情感、表达高度贴合的语音。目前支持25个音色的中英文Instruct调节。

语音合成

2026-02-10

国际

cosyvoice-v3-plus

克隆能力:CosyVoice-v3-plus是通义实验室CosyVoice系列最新版的语音克隆大模型,具有更好的音质和复刻相似度,适用于更专业的场景。仅需提供5-20s的参考音频,即可迅速生成高度相似且听感自然的定制声音。合成能力:CosyVoice-v3-plus是通义实验室CosyVoice系列最新版的语音合成大模型,具有更好的音质和表现力,适用于更专业的场景。该模型支持文本至语音的实时流式合成。

语音合成

2026-02-09

国际

cosyvoice-v3-flash

合成能力:CosyVoice-v3-Flash是通义实验室CosyVoice系列最新版高性能的语音合成大模型,较之前版本在自然度、音质、韵律、情感表现力上有更好的表现。该模型支持文本至语音的实时流式合成。克隆能力:CosyVoice-v3-Flash也是通义实验室CosyVoice系列最新版的语音克隆大模型,较之前版本提升了发音准确性、音色相似度,并且增加了更多小语种支持(德、西、法、意、俄)。仅需提供5-20s的参考音频,即可迅速生成高度相似且听感自然的定制声音。

文本生成

2026-01-30

国际

qwen-plus-character

千问系列角色扮演模型,本模型是动态更新版本,模型更新会提前通知,适合拟人化的角色扮演,同时优化了限定人设指令遵循、话题推进、倾听共情等能力,支持个性化角色的深度还原。

视频生成

2026-01-29

国际

wan2.6-r2v-flash

万相2.6-参考生视频-Flash,生成更快性价比更高。支持指定人物或任意物品进行参考,精准保持形象和声音的一致性,支持多角色参考合拍

排序模型

2026-01-27

国际

qwen3-rerank

基于Qwen LLM底座训练的文本排序模型,对输入的Query和候选Docs进行相关性排序,支持100+语种和长文本输入,适用于文本检索、RAG等场景,效果对齐开源Qwen3-Rerank系列模型

文本生成、深度思考

2026-01-23

国际

qwen3-max-2026-01-23

千问3系列Max模型,相较2025年9月23日快照,此版本实现思考模式和非思考模式的有效融合,模型整体效果得到全方位的大幅度提升。在思考模式下,同时发布Web搜索、Web信息提取和代码解释器工具能力,使得模型在慢思考的同时,能够通过引入外部工具,以更高的准确性解决更有难度的问题。此版本为2026年1月23日快照。

视觉理解

2026-01-22

国际

qwen3-vl-flash-2026-01-22

Qwen3系列小尺寸视觉理解模型,实现思考模式和非思考模式的有效融合,相较于2025年10月15日快照,模型整体效果有大幅提升:在通用视觉识别与推理方面有增强;在安防、巡店、巡检、拍照解题等业务场景识别效果上提升显著。此版本为2026年1月22日快照版本。

语音合成

2026-01-21

国际

qwen3-tts-instruct-flash-realtime

qwen3-tts-instruct-flash-realtime-2026-01-22

千问3-TTS-Flash模型是通义实验室最新推出的实时语音合成大模型,Instruct模型可通过自然语言进行合成效果的处理,确保在不同语境下,合成情感、表达高度贴合的语音。目前支持25个音色的中英文Instruct调节。该模型等同于2026年01月22日快照版本模型。

视频生成

2026-01-15

国际

wan2.6-i2v-flash

万相2.6-图生视频-Flash,生成更快更高性价比。智能分镜调度支持多镜头叙事,多人稳定对话,更自然真实音色,最高支持15秒时长生成

图片生成

2026-01-15

国际

qwen-image-edit-max

qwen-image-edit-max-2026-01-16

千问图像编辑模型Max系列,提供更稳定、更丰富的编辑能力:提升工业设计与几何推理能力;提升角色一致性;减轻偏移问题;集成Lora能力,可以进行更多功能的图像编辑。

语音合成

2026-01-14

国际

qwen3-tts-vd-realtime-2026-01-15

千问3-TTS-VD模型是通义实验室最新推出的实时语音合成大模型,可对qwen3-voice-design服务设计的声音进行高保真实时语音合成,且同一音色支持11个语种的语音输出。该模型经过海量数据训练,合成音频可以根据文本自适应调节语气,对复杂文本合成也有较好的处理能力。该模型为2026年01月15日快照版本模型。

语音合成

2026-01-14

国际

qwen3-tts-vc-realtime-2026-01-15

千问3-TTS-Flash模型是通义最新推出的实时语音合成大模型,可对qwen-voice-enrollment服务复刻的声音进行高保真实时语音合成,且同一音色支持11个语种的语音输出。该模型经过海量数据训练,合成音频可以根据文本自适应调节语气,对复杂文本合成也有较好的处理能力。该模型为2026年01月15日快照版本模型。

文本生成

2026-01-13

国际

qwen-flash-character

千问系列多语言角色扮演模型,本模型是动态更新版本,模型更新会提前通知,适合拟人化的角色扮演,同时优化了限定人设指令遵循、话题推进、倾听共情等能力,支持个性化角色的深度还原。

图片生成

2026-01-09

国际

qwen-image-plus-2026-01-09

千问系列图像生成模型,具备卓越的文本渲染能力,在复杂文本渲染、各类生成与编辑任务重表现出色。此版本为2026年1月9日快照,为Qwen-Image-Max的蒸馏加速版,可以更快速地生成高质量图片。

图片生成

2025-12-30

国际

qwen-image-max

qwen-image-max-2025-12-30

千问图像生成模型Max系列,在各类生成任务中表现出色,相较Plus系列大幅度降低生成图片的AI感,提升图像真实性;具备更真实的人物质感、更细腻的自然纹理、更美观的文字渲染。

图片生成

2025-12-22

国际

z-image-turbo

Z-Image-Turbo是在Artificial Analysis评测中荣登文生图开源模型世界第一的高效图像生成模型,仅用60亿参数和8步推理就能生成媲美大规模商业模型的照片级真实感图像,并在中英双语文本渲染、复杂语义理解和多样化主题生成上表现卓越。

深度思考、视觉理解

2025-12-18

国际

qwen3-vl-plus-2025-12-19

Qwen3系列视觉理解模型,实现思考模式和非思考模式的有效融合。相较于9月23日快照,在推理及分析任务、风格控制上表现更优;同时拥有更低的延时和更快的响应速度。此版本为2025年12月19日快照版本。

视频生成

2025-12-16

国际

wan2.6-r2v

万相2.6-参考生视频,支持指定人物或任意物品进行参考,精准保持形象和声音的一致性,支持多角色参考合拍。提醒:当使用视频进行参考时,输入视频也会计入费用,详见模型计费文档。

图片生成

2025-12-15

国际

wan2.6-t2i

万相2.6-文生图,画面质感、美学表现、指令遵循升级,在艺术风格精准控制、真实感人像、长文本生图及广泛历史文化IP覆盖上均表现出卓越能力,可生成高质量且富有表现力的视觉内容。

图片生成

2025-12-15

国际

wan2.6-image

万相2.6-图像生成,全能图像生成模型,支持图文一体化推理生成,具备多图创意融合、商用级一致性、美学要素迁移与镜头光影精确控制,全面提升图像生成的一致性、可控性和表现力。

图片生成

2025-12-15

国际

qwen-image-edit-plus-2025-12-15

千问系列图像编辑Plus模型,相较10月30日快照提升角色一致性、工业设计能力、几何推理能力;同时集成例如打光等Lora能力、减轻偏移问题。此版本为2025年12月15日快照。

语音合成

2025-12-12

国际

qwen3-tts-vd-realtime-2025-12-16

千问3-TTS-VD模型是通义实验室最新推出的实时语音合成大模型,可对qwen3-voice-design服务设计的声音进行高保真实时语音合成,且同一音色支持11个语种的语音输出。该模型经过海量数据训练,合成音频可以根据文本自适应调节语气,对复杂文本合成也有较好的处理能力。该模型为2025年12月16日快照版本模型。

语音合成

2025-12-12

国际

qwen-voice-design

千问voice-design模型是千问语音模型的声音设计系列模型,仅需输入简单的文字描述,即可迅速设计出符合要求的相关声音。结合qwen3-tts-vd-realtime模型使用,可设计输出10个语种的语音。且合成音频可以根据文本自适应调节语气,对复杂文本合成也有较好的处理能力。

实时全模态

2025-12-04

国际

qwen3-omni-flash-realtime

qwen3-omni-flash-realtime-2025-12-01

千问3-Omni-Flash多模态大模型的实时版,基于Thinker–Talker混合专家(MoE)架构,支持文本、图像、音频、视频的高效理解与语音生成能力,可进行119种语言文本交互和20种语言语音交互,生成类人语音实现跨语言精准沟通。模型具备强大指令跟随与系统提示定制功能,灵活适配对话风格与角色设定,广泛应用于文本创作、语音助手、多媒体分析等场景,提供自然流畅的多模态交互体验。

全模态

2025-12-04

国际

qwen3-omni-flash

qwen3-omni-flash-2025-12-01

千问3-Omni-Flash多模态大模型,基于Thinker–Talker混合专家(MoE)架构,支持文本、图像、音频、视频的高效理解与语音生成能力,可进行119种语言文本交互和20种语言语音交互,生成类人语音实现跨语言精准沟通。模型具备强大指令跟随与系统提示定制功能,灵活适配对话风格与角色设定,广泛应用于文本创作、语音助手、多媒体分析等场景,提供自然流畅的多模态交互体验。

实时语音识别

2025-12-04

国际

qwen3-livetranslate-flash

qwen3-livetranslate-flash-2025-12-01

Qwen3-LiveTranslate-Flash,一款高精度、高响应、高鲁棒性的多语言实时音视频同传大模型。依托Qwen3-Omni强大的基座能力、海量多模态数据、跨语言跨模态对齐和视觉增强等技术,Qwen3-LiveTranslate-Flash 实现了离线和实时两种音视频翻译能力,能听懂19种语言,会说10种语言以及8种中文方言。

视频生成

2025-12-03

国际

wan2.6-t2v

万相2.6-文生视频,智能分镜调度支持多镜头叙事,能够生成主体、场景和氛围一致的多镜头叙事视频,最高支持15秒时长,更高品质的声音生成,更好的指令遵循和视觉质量

视频生成

2025-12-03

国际

wan2.6-i2v

万相2.6-图生视频,智能分镜调度支持多镜头叙事,更高品质的声音生成,多人稳定对话,更自然真实音色,最高支持15秒时长生成

2025-12-01

国际

qwen-plus-2025-12-01

本版本为2025年12月1日快照,相较7月28日快照在推理能力上有提升;智能体能力、多轮工具调用能力进一步增强;主观创作类任务表现更优。支持1M上下文长度,按照上下文长度进行阶梯计费。

语音合成

2025-11-27

国际

qwen3-tts-vc-realtime-2025-11-27

千问3-TTS-Flash模型是通义实验室最新推出的实时语音合成大模型,可对qwen3-voice-enrollment服务复刻的声音进行高保真实时语音合成,且同一音色支持11个语种的语音输出。该模型经过海量数据训练,合成音频可以根据文本自适应调节语气,对复杂文本合成也有较好的处理能力。该模型为2025年11月27日快照版本模型。

语音合成

2025-11-27

国际

qwen3-tts-flash-realtime

qwen3-tts-flash-realtime-2025-11-27

千问3-TTS-Flash-Realtime模型是通义实验室最新的实时语音合成大模型,不仅拥有17种高表现力的拟人音色,且能低延迟高稳定地实时合成音频;同时支持多种语言,方言,支持同一音色多语言输出。该模型经过海量数据训练,合成音频可以根据文本自适应调节语气,对复杂文本合成也有较好的处理能力。

语音合成

2025-11-27

国际

qwen3-tts-flash

qwen3-tts-flash-2025-11-27

Qwen3-TTS-Flash模型是通义实验室最新推出的离线语音合成大模型,不仅拥有17种高表现力的拟人音色,且能低延迟高稳定地合成音频;同时支持多种语言,方言,支持同一音色多语言输出。该模型经过海量数据训练,合成音频可以根据文本自适应调节语气,对复杂文本合成也有较好的处理能力。

语音合成

2025-11-27

国际

qwen-voice-enrollment

千问voice-enrollment模型是千问语音模型的声音复刻系列模型,仅需5s以上的音频,即可迅速复刻高相似度声音。结合qwen3-tts-vc-realtime模型使用,可将一个人的声音高保真复刻,输出10个语种的语音。且合成音频可以根据文本自适应调节语气,对复杂文本合成也有较好的处理能力。

视觉理解

2025-11-21

国际

qwen-vl-ocr-2025-11-20

本模型为2025年11月20日的快照版本,基于最新Qwen-VL3架构全面升级,在文档解析,文字定位能力全面升级,端到端时延,幻觉大幅降低。

语音识别

2025-11-21

国际

fun-asr-2025-11-07

百聆2026年4月更新的大模型ASR版本,全面支持汉语传统七大方言体系(官话/吴/湘/赣/客/闽/粤),并适配 20+ 地区口音官话。针对中文古诗词的韵律、节奏与文言表达特点进行专项优化,提升对古诗词内容的识别准确率,适用于文化传承、教育讲解、有声读物等场景。优化标点预测与文本归一化能力,使输出文本更符合书面表达习惯,数字、日期、金额等信息自动转换为标准格式,增强内容的可读性与专业性。同时语种扩展至英语、日语、韩语、越南语、泰语、印尼语、马来语、菲律宾语、印地语、阿拉伯语、法语、德语、西班牙语、葡萄牙语、俄语、意大利语、荷兰语、瑞典语、丹麦语、芬兰语、挪威语、希腊语、波兰语、捷克语、匈牙利语、罗马尼亚、保加利亚语、克罗地亚语、斯洛伐克语等,共计30个语种。此版本为2025年11月7日的快照版本。

视觉理解

2025-11-20

国际

qwen-vl-ocr

千问VL-OCR(qwen-vl-ocr),即基于Qwen-VL训练的OCR识别大模型。通过统一模型的方式聚合多种图文识别、解析、处理类任务,提供强大的图文识别能力。

文本生成

2025-11-19

国际

qwen-mt-lite

基于Qwen3全面升级的基础级文本翻译大模型,支持32个语种互译,模型性能和翻译效果全面升级,并提供更稳定的术语定制、格式还原度、领域提示能力,让译文更精准、自然。

语音识别

2025-11-18

国际

qwen3-asr-flash-filetrans

qwen3-asr-flash-filetrans-2025-11-17

千问3-ASR-Flash的大文件转录版本,千问3-ASR-Flash是一款基于大语言模型的高精度、高智能、高鲁棒性的多语种语音识别模型。依托强大的基座模型、海量的文本与多模态数据、千万小时音频数据,千问3-ASR-Flash实现了高精度的语音识别功能,能够自动判断语种并准确识别多个语种的语音,在复杂的音频环境下能够保证精确转录。

实时语音识别

2025-11-17

国际

fun-asr-realtime-2025-11-07

通义实验室新一代端到端语音识别大模型的实时版,基于领先的自研语音技术,具备卓越的上下文感知和高精度语音转写能力。基于端到端架构,Fun-ASR 集成了创新的 RAG 技术,支持大规模热词自定义、敏感/语气词自动过滤、ITN 规范化、标点预测等多维功能,显著提升了整体识别准确率和语境贴合度。同时,Fun-ASR 支持中英文自由切换,多地区方言覆盖,具备更强的噪声鲁棒性,适应多样复杂环境。此版本为2025年11月7日的快照版本。

文本生成

2025-11-11

国际

qwen-mt-flash

基于Qwen3全面升级的轻量级文本翻译大模型,支持92个语种互译,模型性能和翻译效果全面升级,并提供更稳定的术语定制、格式还原度、领域提示能力,让译文更精准、自然。

视频生成

2025-11-10

国际

wan2.2-animate-move

wan2.2-animate-move图生动作是一款角色动画生成模型,用户只需上传一张角色照片和一段参考表演视频,即可将视频中的表情和动作迁移到图片角色上,生成高保真的动画视频。

视频生成

2025-11-10

国际

wan2.2-animate-mix

wan2.2-animate-mix视频换人是一款角色替换的模型产品,上传一张角色照片与一段表演视频,即可将原视频中的角色精准替换为照片中的角色,完整保留原始视频的场景、光照和色调等环境细节。

多模态向量

2025-10-31

国际

tongyi-embedding-vision-plus

Embedding-Vision是基于LLM底座的视觉多模态表征模型,具有以视觉为中心、领域性能优异(电商、 安防、相册/图库、自驾等)、高性价比的特点。兼容文本、图像、视频3种模态,可应用于以图搜图、以文搜图、以文搜视频,以视频搜视频等下游任务场景。

多模态向量

2025-10-31

国际

tongyi-embedding-vision-flash

Embedding-Vision是基于LLM底座的视觉多模态表征模型,具有以视觉为中心、领域性能优异(电商、 安防、相册/图库、自驾等)、高性价比的特点。兼容文本、图像、视频3种模态,可应用于以图搜图、以文搜图、以文搜视频,以视频搜视频等下游任务场景。本模型(tongyi-embedding-vision-flash)是轻量化版本,在视觉向量化上具备极高性价比。

图片生成

2025-10-31

国际

qwen-image-edit-plus

qwen-image-edit-plus-2025-10-30

千问系列图像编辑Plus模型,在首版Edit模型基础上进一步优化了推理性能与系统稳定性,大幅缩短图像生成与编辑的响应时间;支持单次请求返回多张图片,显著提升用户体验。

实时语音识别

2025-10-29

国际

qwen3-asr-flash-realtime

qwen3-asr-flash-realtime-2025-10-27

千问3-ASR-Flash的实时版,一款基于大语言模型的高精度、高智能、高鲁棒性的多语种语音识别模型。依托强大的基座模型、海量的文本与多模态数据、千万小时音频数据,通义千问3-ASR-Flash实现了高精度的语音识别功能,能够自动判断语种并准确识别多个语种的语音,在复杂的音频环境下能够保证精确转录。

深度思考、视觉理解

2025-10-21

国际

qwen3-vl-32b-thinking

Qwen3-VL系列最大尺寸Dense模型的推理版本,多模态推理能力仅次于Qwen3-VL-235B-Thinking,STEM&数学类解题能力、通用图像和视频理解能力出众,多模态Agent能力达到SOTA,适合做复杂多模态推理任务。

视觉理解

2025-10-21

国际

qwen3-vl-32b-instruct

Qwen3-VL系列最大尺寸Dense模型的非推理版本,综合表现仅次于Qwen3-VL-235B-Instruct,文档识别和理解能力出色,空间感知与万物识别能力强,视觉2D检测/空间推理能力达到SOTA,适合通用场景下的复杂感知任务。

深度思考、视觉理解

2025-10-15

国际

qwen3-vl-flash

qwen3-vl-flash-2025-10-15

Qwen3系列小尺寸视觉理解模型,实现思考模式和非思考模式的有效融合,效果优于开源版Qwen3-VL-30B-A3B,响应速度快。全面升级图像/视频理解,支持长视频长文档等超长上下文、空间感知与万物识别;具备视觉2D/3D定位能力,胜任复杂现实任务。

深度思考、视觉理解

2025-10-03

国际

qwen3-vl-30b-a3b-thinking

Qwen3-VL系列第二大MoE模型的Thinking版本,响应速度快,具备更强多模态理解与推理、视觉智能体、长视频长文档等超长上下文支持能力;全面升级图像/视频理解、空间感知与万物识别能力,胜任复杂现实任务。

视觉理解

2025-10-03

国际

qwen3-vl-30b-a3b-instruct

Qwen3-VL系列第二大MoE模型的Instruct版本,响应速度快,支持长视频长文档等超长上下文;全面升级图像/视频理解、空间感知与万物识别能力;具备视觉2D/3D定位能力,胜任复杂现实任务。

深度思考、视觉理解

2025-09-30

国际

qwen3-vl-8b-thinking

Qwen3-VL系列8B Dense模型的Thinking版本,占用显存更低,能够完成多模态理解与推理;支持长视频长文档等超长上下文、视觉2D/3D定位;全面升级图像/视频理解、空间感知与万物识别能力。

视觉理解

2025-09-30

国际

qwen3-vl-8b-instruct

Qwen3-VL系列8B Dense模型的Instruct版本,占用显存更低,全面升级图像/视频理解、长视频长文档等超长上下文支持、空间感知与万物识别能力,胜任复杂现实任务。

语音识别

2025-09-25

国际

fun-asr-mtl

fun-asr-mtl-2025-08-25

百聆多语言语音识别大模型,支持超过31种语言,支持语种自由切换,出海用户首推,尤其东南亚出海。fun-asr为该模型的升级版本,建议切换使用fun-asr。

图片生成

2025-09-24

国际

wan2.5-t2i-preview

万相2.5-文生图-Preview,全新升级模型架构。画面美学、设计感、真实质感显著提升,精准指令遵循,擅长中英文和小语种文字生成,支持复杂结构化长文本和图表、架构图等内容生成。

图片生成

2025-09-24

国际

wan2.5-i2i-preview

万相2.5-图像编辑-Preview,全新升级模型架构。支持指令控制实现丰富的图像编辑能力,指令遵循能力进一步提升,支持高一致性保持的多图参考生成,文字生成表现优异。

文本生成、深度思考

2025-09-24

国际

qwen3-max

qwen3-max-2025-09-23

千问3系列Max模型,相较preview版本在智能体编程与工具调用方向进行了专项升级。本次发布的正式版模型达到领域SOTA水平,适配场景更加复杂的智能体需求。

实时语音翻译

2025-09-24

国际

qwen3-livetranslate-flash-realtime

Qwen3-LiveTranslate-Flash的实时版本,一款高精度、高响应、高鲁棒性的多语言实时音视频同传大模型。依托Qwen3-Omni强大的基座能力、海量多模态数据、跨语言跨模态对齐和视觉增强等技术,通义千问3-LiveTranslate-Flash 实现了离线和实时两种音视频翻译能力,能听懂19种语言,会说10种语言以及8种中文方言。

语音识别

2025-09-24

国际

fun-asr

fun-asr-2025-08-25

百聆2026年4月更新的大模型ASR版本,全面支持汉语传统七大方言体系(官话/吴/湘/赣/客/闽/粤),并适配 20+ 地区口音官话。针对中文古诗词的韵律、节奏与文言表达特点进行专项优化,提升对古诗词内容的识别准确率,适用于文化传承、教育讲解、有声读物等场景。优化标点预测与文本归一化能力,使输出文本更符合书面表达习惯,数字、日期、金额等信息自动转换为标准格式,增强内容的可读性与专业性。同时语种扩展至英语、日语、韩语、越南语、泰语、印尼语、马来语、菲律宾语、印地语、阿拉伯语、法语、德语、西班牙语、葡萄牙语、俄语、意大利语、荷兰语、瑞典语、丹麦语、芬兰语、挪威语、希腊语、波兰语、捷克语、匈牙利语、罗马尼亚、保加利亚语、克罗地亚语、斯洛伐克语等,共计30个语种。此版本等同于2025年11月7日的快照版本。

视频生成

2025-09-23

国际

wan2.5-t2v-preview

万相2.5-文生视频-Preview,全新升级模型架构,支持与画面同步的声音生成,支持10秒长视频生成,更强的指令遵循能力,运动能力、画面质感进一步提升。

视频生成

2025-09-23

国际

wan2.5-i2v-preview

万相2.5-图生视频-Preview,全新升级技术架构,支持与画面同步的声音生成,支持10秒长视频生成,更强的指令遵循能力,运动能力、画面质感进一步提升。

视觉理解

2025-09-23

国际

qwen3-vl-plus

qwen3-vl-plus-2025-09-23

Qwen3系列视觉理解模型,实现思考模式和非思考模式的有效融合,视觉智能体能力在OS World等公开测试集上达到世界顶尖水平。此版本在视觉coding、空间感知、多模态思考等方向全面升级;视觉感知与识别能力大幅提升,支持超长视频理解。

深度思考、视觉理解

2025-09-23

国际

qwen3-vl-235b-a22b-thinking

Qwen3系列视觉理解模型,多模态思考能力显著增强,模型在STEM与数学推理方面进行了重点优化;视觉感知与识别能力全面提升、OCR能力迎来重大升级。

视觉理解

2025-09-23

国际

qwen3-vl-235b-a22b-instruct

Qwen3系列视觉理解模型,在视觉coding、空间感知等方向全面升级;视觉感知与识别能力大幅提升,支持超长视频理解,OCR能力迎来重大升级。

实时语音翻译

2025-09-23

国际

qwen3-livetranslate-flash-realtime-2025-09-22

千问3-LiveTranslate-Flash的实时版本,一款高精度、高响应、高鲁棒性的多语言实时音视频同传大模型。依托Qwen3-Omni强大的基座能力、海量多模态数据、跨语言跨模态对齐和视觉增强等技术,千问3-LiveTranslate-Flash 实现了离线和实时两种音视频翻译能力,能听懂19种语言,会说10种语言以及8种中文方言。此版本为2025年9月22日的快照版本。

文本生成

2025-09-23

国际

qwen3-coder-plus-2025-09-23

基于Qwen3的代码生成模型,具有强大的Coding Agent能力,擅长工具调用和环境交互,能够实现自主编程、代码能力卓越的同时兼具通用能力。本版本为2025年9月23日快照,相较上一版本(7月22日快照)在下游任务效果和工具调用方面鲁棒性有所提升;代码安全性增强。

图片生成

2025-09-23

国际

qwen-image-plus

千问系列图像生成模型,参数规模200亿。具备卓越的文本渲染能力,在复杂文本渲染、各类生成与编辑任务重表现出色,在多个公开基准测试中获得SOTA,模型性能大幅提升。

实时语音识别

2025-09-23

国际

fun-asr-realtime

通义实验室新一代端到端语音识别大模型的实时版,基于领先的自研语音技术,具备卓越的上下文感知和高精度语音转写能力。基于端到端架构,Fun-ASR 集成了创新的 RAG 技术,支持大规模热词自定义、敏感/语气词自动过滤、ITN 规范化、标点预测等多维功能,显著提升了整体识别准确率和语境贴合度。同时,Fun-ASR 支持中英文自由切换,多地区方言覆盖,具备更强的噪声鲁棒性,适应多样复杂环境。

语音识别

2025-09-19

国际

qwen3-omni-30b-a3b-captioner

千问3-Omni-30b-a3b-Captioner是一款强大的音频细粒度分析模型,专为在复杂多变的音频场景中生成精准、全面的内容描述而设计,可自动解析并描述从复杂语音、环境声到音乐、影视声效等各类音频内容,能够在多声源、混合化的环境中亦保持稳定而可信的输出。

实时全模态

2025-09-17

国际

qwen3-omni-flash-realtime-2025-09-15

千问3-Omni-Flash多模态大模型的实时版,基于Thinker–Talker混合专家(MoE)架构,支持文本、图像、音频、视频的高效理解与语音生成能力,可进行119种语言文本交互和20种语言语音交互,生成类人语音实现跨语言精准沟通。模型具备强大指令跟随与系统提示定制功能,灵活适配对话风格与角色设定,广泛应用于文本创作、语音助手、多媒体分析等场景,提供自然流畅的多模态交互体验。此版本为2025年9月15日的快照版本。

全模态

2025-09-17

国际

qwen3-omni-flash-2025-09-15

Qwen3-Omni-Flash多模态大模型,基于Thinker–Talker混合专家(MoE)架构,支持文本、图像、音频、视频的高效理解与语音生成能力,可进行119种语言文本交互和20种语言语音交互,生成类人语音实现跨语言精准沟通。模型具备强大指令跟随与系统提示定制功能,灵活适配对话风格与角色设定,广泛应用于文本创作、语音助手、多媒体分析等场景,提供自然流畅的多模态交互体验。此版本为2025年9月15日的快照版本。

语音合成

2025-09-16

国际

qwen3-tts-flash-realtime-2025-09-18

Qwen3-TTS-Flash-Realtime-2025-09-18模型是通义实验室最新的实时语音合成大模型,不仅拥有17种高表现力的拟人音色,且能低延迟高稳定地实时合成音频;同时支持多种语言,方言,支持同一音色多语言输出。该模型经过海量数据训练,合成音频可以根据文本自适应调节语气,对复杂文本合成也有较好的处理能力。该模型为2025年9月18日快照版本模型。

语音合成

2025-09-16

国际

qwen3-tts-flash-2025-09-18

千问3-TTS-Flash-2025-09-18模型是通义实验室最新推出的离线语音合成大模型,不仅拥有17种高表现力的拟人音色,且能低延迟高稳定地合成音频;同时支持多种语言,方言,支持同一音色多语言输出。该模型经过海量数据训练,合成音频可以根据文本自适应调节语气,对复杂文本合成也有较好的处理能力。该模型为2025年9月18日快照版本模型。

语音识别

2025-09-16

国际

qwen3-asr-flash

qwen3-asr-flash-2025-09-08

千问3-ASR-Flash是一款基于大语言模型的高精度、高智能、高鲁棒性的多语种语音识别模型。依托强大的基座模型、海量的文本与多模态数据、千万小时音频数据,千问3-ASR-Flash实现了高精度的语音识别功能,能够自动判断语种并准确识别多个语种的语音,在复杂的音频环境下能够保证精确转录。

视觉理解

2025-09-16

国际

qwen-vl-plus

千问VL-Plus(qwen-vl-plus),即千问大规模视觉语言模型增强版。大幅提升细节识别能力和文字识别能力,支持超百万像素分辨率和任意长宽比规格的图像。在广泛的视觉任务上提供卓越的性能。

视觉理解

2025-09-16

国际

qwen-vl-max

千问VL-Max(qwen-vl-max),即千问超大规模视觉语言模型。相比增强版,再次提升视觉推理能力和指令遵循能力,提供更高的视觉感知和认知水平。在更多复杂任务上提供最佳的性能。

文本生成、深度思考

2025-09-16

国际

qwen-plus

Qwen3系列Plus模型,实现思考模式和非思考模式的有效融合,可在对话中切换模式。推理能力显著超过QwQ、通用能力显著超过Qwen2.5-Plus,达到同规模业界SOTA水平。

视觉理解

2025-09-12

国际

wan2.2-kf2v-flash

全新升级的万相2.2-首尾帧生视频,生成速度更快。优化视频动态稳定性与成功率,更强大的指令遵循能力,两张图片生成丝滑过度视频。

文本生成、深度思考

2025-09-11

国际

qwen3-next-80b-a3b-thinking

基于Qwen3的新一代思考模式开源模型,相较上一版本(千问3-235B-A22B-Thinking-2507指令遵循能力有提升、模型总结回复更加精简。

文本生成

2025-09-11

国际

qwen3-next-80b-a3b-instruct

基于Qwen3的新一代非思考模式开源模型,相较上一版本(千问3-235B-A22B-Instruct-2507)中文文本理解能力更佳、逻辑推理能力有增强、文本生成类任务表现更好。

文本生成、深度思考

2025-09-11

国际

qwen-plus-2025-09-11

本版本为2025年9月11日快照,相较7月28日快照在思考模式下指令遵循能力有提升、模型总结回复更加精简;在非思考模式下中文文本理解能力更佳、逻辑推理能力有增强。支持1M上下文长度,按照上下文长度进行阶梯计费。

文本生成、深度思考

2025-09-05

国际

qwen3-max-preview

Qwen3系列Max模型Preview版本,实现思考模式和非思考模式的有效融合。思考模式下在智能体编程能力、常识知识推理能力、数学/科学/通用类推理等能力上均有显著增强。

文本向量

2025-08-25

国际

text-embedding-v4

通用文本向量V4版本,是通义实验室基于Qwen3训练的多语言文本统一向量模型,相较V3版本在文本检索、聚类、分类性能大幅提升;在MTEB多语言、中英、Code检索等评测任务上效果提升15%~40%;支持64~2048维用户自定义向量维度。

图片生成

2025-08-18

国际

qwen-image-edit

千问系列首个图像编辑模型,成功将Qwen-Image的文本渲染能力拓展到编辑任务上。支持精准的中英双语文字编辑、视觉外观与语义双重编辑、具备强大的跨基准性能表现。

视频生成

2025-08-15

国际

wan2.2-i2v-flash

全新升级的万相2.2图生视频,生成速度更快。优化视频生成稳定性与成功率,更强大的指令遵循能力,稳定保持图片文字、人像和商品一致性,精准运镜控制。

实时全模态

2025-08-14

国际

qwen-omni-turbo-realtime

qwen-omni-turbo-realtime-latest

qwen-omni-turbo-realtime-2025-05-08

千问全新多模态理解生成大模型实时版,适合实时音频交互场景。支持音频伴随文本、图像、视频混合输入理解,具备语音和文本同时流式生成能力,提供了4种自然对话音色。

图片生成

2025-08-14

国际

qwen-image

千问系列首个图像生成模型,参数规模200亿。具备卓越的文本渲染能力,在复杂文本渲染、各类生成与编辑任务重表现出色,在多个公开基准测试中获得SOTA。

文本生成、深度思考

2025-08-01

国际

qwen-flash

qwen-flash-2025-07-28

Qwen3系列Flash模型,实现思考模式和非思考模式的有效融合,可在对话中切换模式。复杂推理类任务性能优秀,指令遵循、文本理解等能力显著提高。支持1M上下文长度,按照上下文长度进行阶梯计费。

文本生成

2025-07-31

国际

qwen3-coder-30b-a3b-instruct

基于Qwen3的代码生成模型,继承Qwen3-Coder-480B-A35B-Instruct的coding agent能力,代码能力达到同尺寸规模模型SOTA。

文本生成、深度思考

2025-07-31

国际

qwen-plus-latest

千问系列能力均衡的模型,推理效果和速度介于千问-Max和千问-Turbo之间,适合中等复杂任务。本模型是动态更新版本,模型更新不会提前通知。

文本生成、深度思考

2025-07-30

国际

qwen3-30b-a3b-thinking-2507

基于Qwen3的思考模式开源模型,相较上一版本(千问3-30B-A3B)复杂推理类任务性能优秀,包括逻辑推理、数学、科学、代码类等具有一定难度的任务场景,指令遵循、文本理解、多语言翻译等能力显著提高。

文本生成

2025-07-29

国际

qwen3-coder-flash

qwen3-coder-flash-2025-07-28

基于Qwen3的代码生成模型,继承Qwen3-Coder-Plus的coding agent能力,支持多轮工具交互,重点优化仓库级别理解能力并增加工具调用稳定性。

文本生成

2025-07-29

国际

qwen3-30b-a3b-instruct-2507

基于Qwen3的非思考模式开源模型,相较上一版本(千问3-30B-A3B)中英文和多语言整体通用能力有大幅提升。主观开放类任务专项优化,显著更加符合用户偏好,能够提供更有帮助性的回复。

文本生成、深度思考

2025-07-29

国际

qwen-plus-2025-07-28

Qwen3系列Plus模型,实现思考模式和非思考模式的有效融合,可在对话中切换模式。相较上个版本在中英文能力、工具调用上进行了专用增强。本版本为2025年7月28日快照,首次支持1M上下文长度,按照上下文长度进行阶梯计费。

视频生成

2025-07-28

国际

wan2.2-t2v-plus

全新升级的万相2.2文生视频,视频品质更高。可稳定生成大幅度复杂运动,支持影视级画面表现与控制,更强大的指令遵循能力,实现物理世界还原。

图片生成

2025-07-28

国际

wan2.2-t2i-plus

全新升级的万相2.2文生图,更丰富的画面细节。在生成图像创意性、稳定性、写实质感方面全面升级,指令遵循更强,原生支持多种风格。支持最大200万像素生成,支持智能提示词改写等。

图片生成

2025-07-28

国际

wan2.2-t2i-flash

全新升级的万相2.2文生图,更快的生成速度。在生成图像创意性、稳定性、写实质感方面全面升级,指令遵循更强,原生支持多种风格。支持最大200万像素生成,支持智能提示词改写等。

视频生成

2025-07-28

国际

wan2.2-i2v-plus

全新升级的万相2.2图生视频,视频品质更高。优化视频生成稳定性与成功率,更强大的指令遵循能力,稳定保持图片文字、人像和商品一致性,精准运镜控制。

文本生成、深度思考

2025-07-25

国际

qwen3-235b-a22b-thinking-2507

基于Qwen3的思考模式开源模型,相较上一版本(千问3-235B-A22B)逻辑能力、通用能力、知识增强及创作能力均有大幅提升,适用于高难度强推理场景。

文本生成

2025-07-24

国际

qwen-mt-turbo

基于Qwen3全面升级的轻量级文本翻译大模型,支持92个语种互译,模型性能和翻译效果全面升级,提供更稳定的术语定制、格式还原度、领域提示能力,让译文更精准、自然。

文本生成

2025-07-24

国际

qwen-mt-plus

基于Qwen3全面升级的旗舰级翻译大模型,支持92个语种互译,模型性能和翻译效果全面升级,并提供更稳定的术语定制、格式还原度、领域提示能力,让译文更精准、自然。

文本生成

2025-07-23

国际

qwen3-coder-plus

qwen3-coder-plus-2025-07-22

基于Qwen3的代码生成模型,具有强大的Coding Agent能力,擅长工具调用和环境交互,能够实现自主编程、代码能力卓越的同时兼具通用能力。

文本生成

2025-07-23

国际

qwen3-coder-480b-a35b-instruct

基于Qwen3的代码生成模型,具有强大的Coding Agent能力,代码能力达到开源模型 SOTA。

文本生成

2025-07-23

国际

qwen3-235b-a22b-instruct-2507

基于Qwen3的非思考模式开源模型,相较上一版本(千问3-235B-A22B)主观创作能力与模型安全性均有小幅度提升。

文本生成、深度思考

2025-07-23

国际

qwen-plus-2025-07-14

Qwen3系列Plus模型,实现思考模式和非思考模式的有效融合,可在对话中切换模式。此版本为2025年7月14日快照模型,相较上个版本在非thinking模式下中英文能力均有大幅提升,工具调用能力专项增强。

文本生成

2025-07-21

国际

qwen-plus-character-ja

千问系列角色扮演模型,针对日语拟人化交互场景专项优化。在角色一致性保持、上下文感知的话题推进、倾听共情等方面表现出色,可精准还原个性化角色。本版本显著增强了日语本地化表达(含方言与敬语)、拟人化角色扮演真实度、叙事连贯性控制以及场景化认知能力。

全模态

2025-07-18

国际

qwen-omni-turbo

qwen-omni-turbo-latest

qwen-omni-turbo-2025-03-26

千问全新多模态理解生成大模型,支持文本, 图像,语音,视频输入理解和混合输入理解,具备文本和语音同时流式生成能力,多模态内容理解速度显著提升,提供了4种自然对话音色。

图片生成

2025-05-22

国际

wan2.1-t2i-turbo

万相2.1-文生图Turbo版,生成速度更快。在图像美感、真实感与艺术性上全面升级,语义理解能力更强,风格泛化能力丰富,支持最高200万像素生成,支持智能改写提示词。

图片生成

2025-05-22

国际

wan2.1-t2i-plus

万相2.1-文生图Plus版,生成图像细节更丰富。在图像美感、真实感与艺术性上全面升级,语义理解能力更强,风格泛化能力丰富,支持最高200万像素生成,支持智能改写提示词。

视频生成

2025-05-14

国际

wan2.1-vace-plus

万相2.1-VACE-Plus 视频创作与编辑一体化模型。支持局部编辑、视频重绘、背景扩展、时长延展、图像参考等视频编辑与生成任务,并支持通过文本、图像、视频进行多模态条件控制。

文本生成、深度思考

2025-05-12

国际

qwen3-8b

实现思考模式和非思考模式的有效融合,可在对话中切换模式。推理能力达到同规模业界SOTA水平、通用能力显著超过Qwen2.5-7B。

文本生成、深度思考

2025-05-12

国际

qwen3-32b

实现思考模式和非思考模式的有效融合,可在对话中切换模式。推理能力显著超过QwQ、通用能力显著超过Qwen2.5-32B-Instruct,达到同规模业界SOTA水平。

文本生成、深度思考

2025-05-12

国际

qwen3-30b-a3b

实现思考模式和非思考模式的有效融合,可在对话中切换模式。推理能力以更小参数规模比肩QwQ-32B、通用能力显著超过Qwen2.5-14B,达到同规模业界SOTA水平。

文本生成、深度思考

2025-05-12

国际

qwen3-235b-a22b

实现思考模式和非思考模式的有效融合,可在对话中切换模式。推理能力显著超过QwQ、通用能力显著超过Qwen2.5-72B-Instruct,达到同规模业界SOTA水平。

文本生成、深度思考

2025-05-12

国际

qwen3-14b

实现思考模式和非思考模式的有效融合,可在对话中切换模式。推理能力达到同规模业界SOTA水平、通用能力显著超过Qwen2.5-14B。

文本生成、深度思考

2025-04-29

国际

qwen-plus-2025-04-28

Qwen3系列Plus模型,实现思考模式和非思考模式的有效融合,可在对话中切换模式。推理能力显著超过QwQ、通用能力显著超过Qwen2.5-Plus,达到同规模业界SOTA水平。此版本为2025年4月28日快照模型。

视频生成

2025-04-07

国际

wan2.1-kf2v-plus

万相2.1-首尾帧生视频Plus版,为两张图片生成流畅的过渡视频。支持大幅度复杂运动、遵循物理规律、丰富的艺术风格与影视级画面质感,指令遵循能力进一步增强,生成视频细节更丰富。

全模态

2025-03-26

国际

qwen2.5-omni-7b

基于Qwen2.5训练的全新多模态理解生成大模型,支持文本, 图像,语音,视频输入理解和混合输入理解,具备文本和语音同时流式生成能力,多模态内容理解速度显著提升,提供了4种自然对话音色。

深度思考、视觉理解

2025-03-26

国际

qvq-max

千问QVQ视觉推理模型,支持视觉输入及思维链输出,在数学、编程、视觉分析、创作以及通用任务上都表现了更强的能力。

深度思考

2025-03-05

国际

qwq-plus

千问QwQ推理模型增强版,基于Qwen2.5模型训练的QwQ推理模型,通过强化学习大幅度提升了模型推理能力。模型数学代码等核心指标(AIME 24/25、livecodebench)以及部分通用指标(IFEval、LiveBench等)达到DeepSeek-R1 满血版水平。

视频生成

2025-02-27

国际

wan2.1-i2v-turbo

万相2.1-图生视频Turbo版,让静态图片生成视频。支持大幅度复杂运动、遵循物理规律、电影级艺术风格与画面质感,指令遵循能力进一步提升,生成速度更快。

文本生成、深度思考

2025-01-30

国际

qwen-turbo

Qwen3系列Turbo模型,实现思考模式和非思考模式的有效融合,可在对话中切换模式。推理能力以更小参数规模比肩QwQ-32B、通用能力显著超过Qwen2.5-Turbo,达到同规模业界SOTA水平。

文本生成

2025-01-30

国际

qwen-plus-2025-01-25

千问系列能力均衡的模型,推理效果和速度介于千问-Max和千问-Turbo之间,适合中等复杂任务。相对于通义千问-Plus-2025-0112版本,整体中英文能力都有综合能力升级,中英文code能力、逻辑能力、多语言能力显著提升,回复风格面向人类偏好进行大幅调整,尤其是数学、逻辑推理、知识问答等客观类query,模型回复详实程度和格式清晰度明显改善,创作类专项、json格式遵循专项、角色扮演专项能力均定向提升,预计维护至下一个快照上线前一个月。

文本生成

2025-01-30

国际

qwen-max

千问2.5系列千亿级别超大规模语言模型,支持中文、英文等不同语言输入。随着模型的升级,qwen-max将滚动更新升级。如果希望使用固定版本,请使用历史快照版本。

视频生成

2025-01-20

国际

wan2.1-i2v-plus

万相2.1-图生视频Plus版,让静态图片生成视频。支持大幅度复杂运动、遵循物理规律、电影级艺术风格与画面质感,指令遵循能力进一步提升,视频质量更佳。

视频生成

2025-01-09

国际

wan2.1-t2v-turbo

万相2.1-文生视频Turbo版,一句话生成视频。支持大幅度复杂运动、遵循物理规律、电影级艺术风格与画面质感,指令遵循能力进一步提升,生成速度更快。

视频生成

2025-01-09

国际

wan2.1-t2v-plus

万相2.1-文生视频Plus版,一句话生成视频。支持大幅度复杂运动、遵循物理规律、电影级艺术风格与画面质感,指令遵循能力进一步提升,视频质量更佳。

文本向量

2024-07-12

国际

text-embedding-v3

通用文本向量,是通义实验室基于LLM底座的多语言文本统一向量模型,面向全球多个主流语种,提供高水准的向量服务,帮助开发者将文本数据快速转换为高质量的向量数据。

Token Plan
模型体验
  • 音乐生成
用量统计与性能监控
资产中心
服务支持