系统极客一直在努力
专注操作系统及软件使用技能

Qwen3.8-Flash-Next:全新架构,迈向极致性价比

Qwen

阿里千问开源了多模态 MoE 模型 Qwen3.8-Flash-Next 的权重,它同时也是 Qwen4 架构的先导预览。定位和当年 Qwen3-Next 之于 Qwen3.5 一样:那一次引入的 Gated DeltaNet + Gated Attention 混合结构,后续沿用到了 Qwen3.5、Qwen3.6、Qwen3.7 和 Qwen3.8 全系列。

Qwen3.8-Flash-Next 从 Attention、Residual、Embedding 和 Optimization 四个方向进行了架构升级,兼顾能力提升、计算效率、模型容量和训练稳定性:

  • Attention:采用 Gated DeltaNet + QSA 混合架构。Gated DeltaNet(GDN)负责高效压缩历史信息;Qwen Sparse Attention(QSA) 用轻量压缩索引器在 micro-block 粒度筛选重要上下文,大幅降低长序列 Attention 的计算开销。
  • Residual:引入门控残差(Gated Residual, GR),把原本单路的残差流扩展为 4 条分支,通过动态门控控制信息读写,增强跨层信息传递能力和训练稳定性。
  • Embedding:引入 N-gram Embedding,结合局部上下文查表,用极少的额外计算扩展模型容量;嵌入表可卸载到主机内存,通过异步预取和模型计算并行执行,不占用额外 GPU 时间。
  • Optimization:采用 Muon 优化器,围绕正交化精度、Muon 与 AdamW 的参数分工、融合参数拆分三个方向做了适配,并针对新架构重新拟合了 Scaling Law。

Qwen3.8-Flash-Next 主模型参数量 125B,额外配了 51B 的 N-gram Embedding 参数,每个 token 仅激活 6B 参数。和 Qwen3.7-Plus 相比,它的训练和推理成本大幅降低,训练开销仅为前者的 1/9,编码、办公类任务的表现还更好。

它原生支持 262144 token 上下文,通过 YaRN 可扩展到 1000000 token。更多架构设计、训练方法和实验分析细节,可以看 GitHub 仓库里的技术报告

模型表现

纯文本

Qwen3.8-Flash-NextQwen3.8-27BQwen3.7-PlusDeepSeek-V4-Flash-0731Claude-Opus-4.6 (Max)
# Params125B27B397B284B
# Activated params6B27B17B13B
# N-gram embedding params51B
Coding
Agentic codingDeepSWE 1.158.742.216.554.4
Agentic codingSWE-bench Pro62.561.755.856.053.4
Multilingual software engineeringSWE-bench Multilingual81.073.875.877.5
Repo-level code generationNL2Repo-Bench48.142.341.154.247.6
Agent
Long-horizon office workCoWorkBench73.970.765.145.168.2
Professional job tasksJobBench55.733.427.641.336.6
Frontier agentic tasksAgents’ Last ExamPass@124.3Score51.2Pass@120.4Score42.9Pass@113.2Score33.6Pass@125.2Score–
Real-world tool useToolathlon Verified (Pass@1)73.567.150.670.3
General
Instruction followingIFBench81.379.579.179.262.5
Scientific reasoningGPQA Diamond91.789.290.390.891.3
Multidisciplinary reasoningHLE35.930.834.733.840.0
Competitive codingLiveCodeBench v691.990.389.690.688.8

多模态

Qwen3.8-Flash-NextQwen3.8-27BQwen3.7-PlusClaude-Opus-4.6 (Max)
Agentic Multimodal Intelligence
Multimodal tool useClawEval-MMPass@364.4Average60.4Pass@357.4Average56.9Pass@357.4Average60.1Pass@352.5Average54.7
Application recreationRecreationBench49.947.130.2
Mobile useAndroidWorld84.581.981.062.0
Computer useOSWorld 2.0Binary19.4Partial52.3Binary19.4Partial48.0Binary2.8Partial21.5
Visual web developmentVision2Web64.062.942.1
General Multimodal Intelligence
Embodied intelligenceERQA72.365.569.840.8
Long video understandingLVBench76.672.476.263.0
Real-world perceptionRealWorldQA88.585.986.973.9
Visual math problem solvingMathVisionWithout CI90.6With CI95.7Without CI90.0With CI94.6Without CI90.3With CI88.7Without CI65.5
Scientific chart analysisCharXiv (RQ)Without CI84.6With CI90.6Without CI83.7With CI90.2Without CI85.8With CI85.9Without CI66.0

模型结构

Qwen3.8-Flash-Next 模型结构

Attention:GDN + QSA,高效记忆与精准检索

传统全注意力(Full Attention)可以直接访问所有历史 token,但上下文越长,计算和 KV 缓存的访存成本越高。

延续 Qwen3.5 的设计思路,Qwen3.8-Flash-Next 用了 GDN + Attention 的混合架构:每四层里三层用 GDN,把历史信息持续压缩到固定大小的状态里,剩下一层保留全局注意力,负责精确检索全局信息。

全局注意力层换成了自研的 Qwen 稀疏注意力(Qwen Sparse Attention, QSA)。稀疏注意力的思路是只关注重要上下文来降低长序列计算量,但现有的 DSA 这类方案通常需要一个 token 级的索引器来定位重要位置,上下文越长,索引器本身的计算开销越明显。

QSA 把这个步骤做了进一步压缩:轻量索引器先把序列聚合成 micro-block(微块),在块粒度上估计上下文重要性,再选出最相关的区域计算注意力。这不仅减少了实际注意力的计算量,也大幅降低了定位重要上下文本身的索引开销。和跨层共享索引的方案不同,QSA 每一层独立完成序列压缩,不依赖跨层注意力的相似性,更适配 GDN 和注意力交替的混合架构。

可以简单理解为:GDN 负责高效记忆,QSA 负责精准检索。

在 1M token 长度下,QSA 的注意力核在 Prefill 和 Decode 阶段分别实现最高 7.6 倍和 4.9 倍的加速。在贴近线上高缓存复用的测试场景下(前缀缓存命中率 90%),Qwen3.8-Flash-Next 1M 上下文的 Prefill 吞吐是 Qwen3.7-Plus 的 8.6 倍。

Gated Residual:给信息更多传递路径

传统 Transformer 中,所有层都在同一条残差流上读写信息。网络越深,早期特征越容易和后续信息混合,关键信息慢慢被稀释。

门控残差(GR) 是两种思路的结合:一方面沿用 Hyper-Connection 把残差流扩展为多分支的设计,另一方面把 GatedNorm 的逐元素动态门控融入残差读取逻辑。原本单路的残差流最终被扩展成 4 条并行分支,模型可以根据当前内容动态决定每个分支读写信息的比例。

可以类比成把单车道扩成多车道:有些分支负责传递局部信息,有些则能把浅层信息直接送到很深的网络层。实际分析发现,其中一条分支会自然形成长距离通路,连接第一层注意力和大部分中后层。

GR 还简化了 Hyper-Connection 的设计:当读写逻辑足够灵活时,额外的分支混合操作没有明显收益,可以直接去掉,减少访存开销和不稳定因素。归一化后的门控能有效抑制激活异常值(activation outlier),提升训练稳定性;残差状态支持用 FP8 存储,进一步降低访存压力。

N-gram Embedding:低成本扩展模型容量

受 Gemma 3n 的 Per-Layer Embedding、DeepSeek Engram 等工作启发,引入了 N-gram Embedding,从 Transformer 常规参数之外的维度扩展模型容量。

普通 Embedding 只根据单个 token 查表,N-gram Embedding 则会结合当前 token 和前几个 token 的局部上下文匹配,给常见短语和局部模式提供额外的表示向量。

它的核心优势很直接:能加大量参数,但几乎不增加每个 token 的计算量。

Qwen3.8-Flash-Next 额外加了 51B 的 N-gram Embedding 参数。因为查询位置可以提前确定,这些参数可以存在主机内存里,通过异步预取和模型计算并行,不需要长期占用 GPU 显存。

最终模型只在前端用一层 N-gram Embedding,用很低的额外成本加了一个大规模的「局部模式记忆库」。

Optimization:架构和优化协同设计

Qwen3.8-Flash-Next 使用 Muon 优化器训练,千问团队针对大模型训练场景适配了三个关键点:正交化精度、Muon 和 AdamW 的参数分工,以及融合参数矩阵的拆分策略。

真正做二维线性映射的参数,比如注意力层、GDN、MoE 专家的主要权重,用 Muon 优化;Embedding、MoE 路由层、GR 低秩参数这类,继续用 AdamW。工程实现里融合存储的 QKV、SwiGLU、GDN Projection 参数,会先按实际对应的独立线性变换拆分,再分别做正交化。

针对新架构和优化器,团队重新拟合了缩放定律。结果显示模型可以稳定使用更大的学习率和批量大小,收敛效率和大规模并行训练吞吐都有提升。

实验还有个反直觉的发现:过去大模型训练常用的 Batch Size Warmup 没必要了——从小批量逐步加到目标批量,最终效果没有提升,反而多跑了 18.8% 的优化器步。所以最终训练配置里,直接从目标批量大小开始训练。

其他架构优化

其余组件沿用了 Qwen3-Next 确立、并在 Qwen3.5 到 Qwen3.8 系列里持续打磨的成熟设计。

  • 极致稀疏 MoE:在全局负载均衡策略下,固定激活专家数量、持续增加专家总参数量,可以稳定降低训练 loss。Qwen3.8-Flash-Next 用了比较大的专家池,每个 token 只路由到少量专家,同时配了一个共享专家。
  • 多 Token 预测(MTP):MTP 模块用多步方式训练,保持训练和推理的一致性,提升实际场景下投机解码的接受率,同时也能提升主干模型的性能。其中的全注意力层也换成了 QSA。
  • 训练稳定性优化:保留零中心 RMSNorm,给归一化权重加权重衰减、注意力输出门控机制,以及 MoE 路由层参数初始化归一化。这些设计让小规模消融实验结果更可靠,也能保障大规模训练平稳运行。

Base 模型表现

千问团队把 Qwen3.8-Flash-Next-Base 和 Qwen3.8-27B、Qwen3.7-Plus 的基础模型做了对比。

Qwen3.8-Flash-Next-BaseQwen3.8-27B-BaseQwen3.7-Plus-Base
# Params125B27B397B
# Activated params6B27B17B
# N-gram embedding params51B
General tasks
MMLU90.3687.5190.43
MMLU-Redux90.6887.2691.47
MMLU-Pro73.2368.6070.90
SuperGPQA51.3644.8648.42
BBH90.8789.5689.41
Math & STEM tasks
GPQA51.4245.0151.52
GSM8K93.2993.1892.95
MATH72.7860.5474.38
Coding tasks
EvalPlus78.7676.0578.06
MultiPL-E79.0974.5081.68
SWEBench-Pretrain50.9941.6649.24
Multilingual tasks
MGSM89.3386.3785.42
MMMLU84.8679.7484.53
INCLUDE78.4074.3778.90

开始使用 Qwen3.8-Flash-Next

Qwen3.8-Flash-Next 已经在 HuggingFaceModelScope 开源,千问 AI 平台上以qwen3.8-flash为模型名提供服务,兼容行业标准协议,包括 OpenAI 的 Chat Completions、Responses API,以及 Anthropic 兼容接口。

模型在能力、延迟和成本之间取得了很好的平衡,适合高并发应用、工具调用工作流,以及编程、协同办公类助手场景。

赞(0)
分享到

评论 抢沙发