
Qwen3.5-Omni 是千问团队推出的最新一代全模态大模型,支持文本、图片、音频、音视频内容的理解。该系列包含 Plus、Flash 和 Light 三种尺寸的 Instruct 版本,支持 256k 长上下文输入。模型可处理超过 10 小时的音频输入,以及时长超 400 秒的 720P(1 FPS)音视频输入。
- 架构层面,Qwen3.5-Omni 的 Thinker 与 Talker 模块,均采用 Hybrid-Attention MoE 架构。
- 它基于海量文本、视觉数据,以及超 1 亿小时的音视频数据完成原生多模态预训练,展现出了卓越的全模态感知与生成能力。
相比前代 Qwen3-Omni,Qwen3.5-Omni 的多语言能力大幅升级,支持 113 种语种与方言的语音识别,以及 36 种语种与方言的语音生成。目前,该模型已通过 Offline API 与 Realtime API 开放体验,你也可以到 Qwen Chat 网站免费体验 Plus 版本。
Qwen3.5-Omni 模型架构

Qwen3.5-Omni 延续了 Thinker-Talker 架构设计:
- 其中,Thinker 模块通过 Vision Encoder 与 AuT 接收视觉和音频信号输入,音视频信号会经过交织处理,并搭配 TMRoPE 完成位置信息编码。Thinker 的核心职责,是处理全模态信号并输出文本内容。
- Talker 模块则接收来自 Thinker 的多模态输入与文本输出结果,完成上下文相关的语音生成。其语音表征采用 Qwen3-Omni 提出的 RVQ 编码方式,替代了算力消耗较高的 DiT 运算。
- 得益于分块流式输入设计与流式 Talker 设计,整个模型可支持实时交互。
和上一代 Qwen3-Omni 的双轨 Talker 输入设计不同,新一代 Talker 在输入组织上,采用了 ARIA 自适应速率交错对齐技术,动态对齐文本与语音单元后再进行交错排布,从根源上解决了文本与语音 Token 编码效率差异带来的语音不稳定问题,包括漏读、误读、数字发音模糊等常见问题。
离线(Offline)
Qwen3.5-Omni-Plus 在音频与音视频的理解、推理、交互类任务中,拿下了 215 项子任务与 Benchmark 的 SOTA 成绩,涵盖 3 个音视频 Benchmark、5 个音频 Benchmark、8 个 ASR Benchmark、156 个语种专属 S2TT 任务,以及 43 个语种专属 ASR 任务。
- 其中,在通用音频的理解、推理、识别、翻译、对话能力上全面超越 Gemini 3.1 Pro,整体音视频理解能力达到 Gemini 3.1 Pro 水准,同时视觉与文本能力对齐同尺寸 Qwen3.5 模型的表现。
- Qwen3.5-Omni-Plus 的核心亮点之一,是强大的音视频字幕生成能力。它可以生成可控、详细、结构化的音视频字幕,还能输出剧本级的细粒度描述,包括自动切片、时间戳标注,以及人物与音频对应关系的详细说明。
- 除此之外,通过原生多模态 Scaling,全模态模型涌现出一项全新能力:可以直接根据音视频指令完成代码编写,千问团队将其命名为 Audio-Visual Vibe Coding。
实时(Realtime)
在强大的基座能力之外,重点升级了 Qwen3.5-Omni 的交互能力,带来了多项核心更新:
- 支持「语义打断」:千问团队基于 Omni 原生开发了对话轮次意图自动识别能力,可避免因附和声、无意义背景音造成的误打断,该能力已在 API 中原生支持。
- 原生支持 WebSearch 与复杂 Function Call 调用能力:模型可自主判断是否需要调用 WebSearch,来响应用户的实时性问题。
- 支持端到端语音控制与对话:模型可以像人类一样遵循指令,自由调节音量、语速、表达情绪等语音相关属性。
- Qwen3.5-Omni 支持音色克隆:用户可以上传自定义音色,定制专属的 AI 助手音色。
- 针对流式语音交互中,因文本与语音 Token 编码效率差异导致的语音不稳定问题(如漏读、误读、数字发音模糊等),提出了 ARIA 技术,全称为自适应速率交错对齐(Adaptive Rate Interleave Alignment)。该技术能动态对齐文本与语音单元,在保障实时性的同时,大幅提升了语音合成的自然度与鲁棒性。
Qwen3.5-Omni vs. Qwen3-Omni

| Qwen3-Omni | Qwen3.5-Omni | |
|---|---|---|
| 主干框架 | MoE | Hybrid-MoE |
| 支持序列 | 32k | 256k 音频:10个小时 音视频 (FPS=1):400秒 |
| Caption能力 | 音频 | 音视频 |
| 智能语义打断 | 无 | 支持 |
| WebSearch/Tool | 无 | 原生API支持 |
| 语音控制 | 无 | 支持 |
| 音色克隆 | 无 | 支持 |
| Talker | 双轨自回归 | Interleave |
| Text-Audio Tokenizer Rate | Fixed (1:1) | ARIA (Adaptive Rate Interleaved Alignment) |
| 语音识别 | 11种多语言:中文、英语、德语、法语、意大利语、泰语、韩语、日语、俄语、西班牙语、葡萄牙语8种方言:四川话、上海话、粤语、闽南语、陕西话、南京话、天津话、北京话 | – 74种多语言:南非语、阿拉伯语、阿斯图里亚斯语、阿塞拜疆语、巴斯克语、白俄罗斯语、孟加拉语、波斯尼亚语、保加利亚语、粤语、加泰罗尼亚语、宿务语、中文、克罗地亚语、捷克语、丹麦语、荷兰语、英语、世界语、爱沙尼亚语、菲律宾语、芬兰语、法语、加利西亚语、格鲁吉亚语、德语、希腊语、希伯来语、印地语、匈牙利语、冰岛语、印尼语、国际语、意大利语、日语、爪哇语、卡纳达语、哈萨克语、韩语、柯尔克孜语、林加拉语、拉脱维亚语、立陶宛语、马其顿语、马来语、马拉雅拉姆语、马耳他语、毛利语、马拉地语、蒙古语、挪威语(博克马尔)、新挪威语、奥里亚语、波斯语、波兰语、葡萄牙语、旁遮普语、罗马尼亚语、俄语、塞尔维亚语、斯洛伐克语、斯洛文尼亚语、西班牙语、斯瓦希里语、瑞典语、塔吉克语、泰米尔语、泰卢固语、泰语、土耳其语、乌克兰语、乌尔都语、维吾尔语、越南语 – 39种方言:东北话、贵州话、广东粤语、河南话、香港粤语、上海话、陕西话、天津话、台湾话、云南话、安徽话、福建话、甘肃话、广东普通话、湖北话、湖南话、江西话、山东话、山西话、四川话、广西话、海南话、重庆话、长沙话、杭州话、合肥话、银川话、郑州话、沈阳话、温州话、武汉话、昆明话、太原话、南昌话、济南话、兰州话、南京话、客家话、闽南语 |
| 语音合成 | – 29种多语言:中文、英语、德语、意大利语、葡萄牙语、西班牙语、日语、韩语、法语、俄语、泰语、印度尼西亚语、阿拉伯语、越南语、土耳其语、芬兰语、波兰语、印地语、荷兰语、捷克语、乌尔都语、他加禄语、瑞典语、丹麦语、希伯来语、冰岛语、马来语、挪威语、波斯语 – 7种方言:四川话、北京话、天津话、南京话、陕西话、粤语、闽南语 |










最新评论
提供snap包没意见,但是移除deb,还把deb改成虚包指向snap,实在是让人作呕
为什么关机关电源后,开机时打开电源就开机了。对电脑有损伤吗?
有多亮,是blingbling的吗🤣
这个网站眼前一亮