系统极客一直在努力
专注操作系统及软件使用技能

Qwen3.5-Omni:新一代大规模原生全模态大模型

Qwen3.5-Omni

Qwen3.5-Omni 是千问团队推出的最新一代全模态大模型,支持文本、图片、音频、音视频内容的理解。该系列包含 Plus、Flash 和 Light 三种尺寸的 Instruct 版本,支持 256k 长上下文输入。模型可处理超过 10 小时的音频输入,以及时长超 400 秒的 720P(1 FPS)音视频输入。

  • 架构层面,Qwen3.5-Omni 的 Thinker 与 Talker 模块,均采用 Hybrid-Attention MoE 架构。
  • 它基于海量文本、视觉数据,以及超 1 亿小时的音视频数据完成原生多模态预训练,展现出了卓越的全模态感知与生成能力。

相比前代 Qwen3-Omni,Qwen3.5-Omni 的多语言能力大幅升级,支持 113 种语种与方言的语音识别,以及 36 种语种与方言的语音生成。目前,该模型已通过 Offline APIRealtime API 开放体验,你也可以到 Qwen Chat 网站免费体验 Plus 版本。

Qwen3.5-Omni 模型架构

Qwen3.5-Omni 模型架构
Qwen3.5-Omni 模型架构

Qwen3.5-Omni 延续了 Thinker-Talker 架构设计:

  • 其中,Thinker 模块通过 Vision Encoder 与 AuT 接收视觉和音频信号输入,音视频信号会经过交织处理,并搭配 TMRoPE 完成位置信息编码。Thinker 的核心职责,是处理全模态信号并输出文本内容。
  • Talker 模块则接收来自 Thinker 的多模态输入与文本输出结果,完成上下文相关的语音生成。其语音表征采用 Qwen3-Omni 提出的 RVQ 编码方式,替代了算力消耗较高的 DiT 运算。
  • 得益于分块流式输入设计与流式 Talker 设计,整个模型可支持实时交互。

和上一代 Qwen3-Omni 的双轨 Talker 输入设计不同,新一代 Talker 在输入组织上,采用了 ARIA 自适应速率交错对齐技术,动态对齐文本与语音单元后再进行交错排布,从根源上解决了文本与语音 Token 编码效率差异带来的语音不稳定问题,包括漏读、误读、数字发音模糊等常见问题。

离线(Offline)

Qwen3.5-Omni-Plus 在音频与音视频的理解、推理、交互类任务中,拿下了 215 项子任务与 Benchmark 的 SOTA 成绩,涵盖 3 个音视频 Benchmark、5 个音频 Benchmark、8 个 ASR Benchmark、156 个语种专属 S2TT 任务,以及 43 个语种专属 ASR 任务。

  • 其中,在通用音频的理解、推理、识别、翻译、对话能力上全面超越 Gemini 3.1 Pro,整体音视频理解能力达到 Gemini 3.1 Pro 水准,同时视觉与文本能力对齐同尺寸 Qwen3.5 模型的表现。
  • Qwen3.5-Omni-Plus 的核心亮点之一,是强大的音视频字幕生成能力。它可以生成可控、详细、结构化的音视频字幕,还能输出剧本级的细粒度描述,包括自动切片、时间戳标注,以及人物与音频对应关系的详细说明。
  • 除此之外,通过原生多模态 Scaling,全模态模型涌现出一项全新能力:可以直接根据音视频指令完成代码编写,千问团队将其命名为 Audio-Visual Vibe Coding。

实时(Realtime)

在强大的基座能力之外,重点升级了 Qwen3.5-Omni 的交互能力,带来了多项核心更新:

  1. 支持「语义打断」:千问团队基于 Omni 原生开发了对话轮次意图自动识别能力,可避免因附和声、无意义背景音造成的误打断,该能力已在 API 中原生支持。
  2. 原生支持 WebSearch 与复杂 Function Call 调用能力:模型可自主判断是否需要调用 WebSearch,来响应用户的实时性问题。
  3. 支持端到端语音控制与对话:模型可以像人类一样遵循指令,自由调节音量、语速、表达情绪等语音相关属性。
  4. Qwen3.5-Omni 支持音色克隆:用户可以上传自定义音色,定制专属的 AI 助手音色。
  5. 针对流式语音交互中,因文本与语音 Token 编码效率差异导致的语音不稳定问题(如漏读、误读、数字发音模糊等),提出了 ARIA 技术,全称为自适应速率交错对齐(Adaptive Rate Interleave Alignment)。该技术能动态对齐文本与语音单元,在保障实时性的同时,大幅提升了语音合成的自然度与鲁棒性。

Qwen3.5-Omni vs. Qwen3-Omni

Qwen3.5-Omni 基准测试
Qwen3.5-Omni 基准测试
Qwen3-OmniQwen3.5-Omni
主干框架MoEHybrid-MoE
支持序列32k256k
音频:10个小时
音视频 (FPS=1):400秒
Caption能力音频音视频
智能语义打断支持
WebSearch/Tool原生API支持
语音控制支持
音色克隆支持
Talker双轨自回归Interleave
Text-Audio Tokenizer RateFixed (1:1)ARIA (Adaptive Rate Interleaved Alignment)
语音识别11种多语言:中文、英语、德语、法语、意大利语、泰语、韩语、日语、俄语、西班牙语、葡萄牙语8种方言:四川话、上海话、粤语、闽南语、陕西话、南京话、天津话、北京话– 74种多语言:南非语、阿拉伯语、阿斯图里亚斯语、阿塞拜疆语、巴斯克语、白俄罗斯语、孟加拉语、波斯尼亚语、保加利亚语、粤语、加泰罗尼亚语、宿务语、中文、克罗地亚语、捷克语、丹麦语、荷兰语、英语、世界语、爱沙尼亚语、菲律宾语、芬兰语、法语、加利西亚语、格鲁吉亚语、德语、希腊语、希伯来语、印地语、匈牙利语、冰岛语、印尼语、国际语、意大利语、日语、爪哇语、卡纳达语、哈萨克语、韩语、柯尔克孜语、林加拉语、拉脱维亚语、立陶宛语、马其顿语、马来语、马拉雅拉姆语、马耳他语、毛利语、马拉地语、蒙古语、挪威语(博克马尔)、新挪威语、奥里亚语、波斯语、波兰语、葡萄牙语、旁遮普语、罗马尼亚语、俄语、塞尔维亚语、斯洛伐克语、斯洛文尼亚语、西班牙语、斯瓦希里语、瑞典语、塔吉克语、泰米尔语、泰卢固语、泰语、土耳其语、乌克兰语、乌尔都语、维吾尔语、越南语
– 39种方言:东北话、贵州话、广东粤语、河南话、香港粤语、上海话、陕西话、天津话、台湾话、云南话、安徽话、福建话、甘肃话、广东普通话、湖北话、湖南话、江西话、山东话、山西话、四川话、广西话、海南话、重庆话、长沙话、杭州话、合肥话、银川话、郑州话、沈阳话、温州话、武汉话、昆明话、太原话、南昌话、济南话、兰州话、南京话、客家话、闽南语
语音合成– 29种多语言:中文、英语、德语、意大利语、葡萄牙语、西班牙语、日语、韩语、法语、俄语、泰语、印度尼西亚语、阿拉伯语、越南语、土耳其语、芬兰语、波兰语、印地语、荷兰语、捷克语、乌尔都语、他加禄语、瑞典语、丹麦语、希伯来语、冰岛语、马来语、挪威语、波斯语
– 7种方言:四川话、北京话、天津话、南京话、陕西话、粤语、闽南语
赞(0)
分享到

评论 抢沙发