
阿里千问开源了多模态 MoE 模型 Qwen3.8-Flash-Next 的权重,它同时也是 Qwen4 架构的先导预览。定位和当年 Qwen3-Next 之于 Qwen3.5 一样:那一次引入的 Gated DeltaNet + Gated Attention 混合结构,后续沿用到了 Qwen3.5、Qwen3.6、Qwen3.7 和 Qwen3.8 全系列。
Qwen3.8-Flash-Next 从 Attention、Residual、Embedding 和 Optimization 四个方向进行了架构升级,兼顾能力提升、计算效率、模型容量和训练稳定性:
- Attention:采用 Gated DeltaNet + QSA 混合架构。Gated DeltaNet(GDN)负责高效压缩历史信息;Qwen Sparse Attention(QSA) 用轻量压缩索引器在 micro-block 粒度筛选重要上下文,大幅降低长序列 Attention 的计算开销。
- Residual:引入门控残差(Gated Residual, GR),把原本单路的残差流扩展为 4 条分支,通过动态门控控制信息读写,增强跨层信息传递能力和训练稳定性。
- Embedding:引入 N-gram Embedding,结合局部上下文查表,用极少的额外计算扩展模型容量;嵌入表可卸载到主机内存,通过异步预取和模型计算并行执行,不占用额外 GPU 时间。
- Optimization:采用 Muon 优化器,围绕正交化精度、Muon 与 AdamW 的参数分工、融合参数拆分三个方向做了适配,并针对新架构重新拟合了 Scaling Law。
Qwen3.8-Flash-Next 主模型参数量 125B,额外配了 51B 的 N-gram Embedding 参数,每个 token 仅激活 6B 参数。和 Qwen3.7-Plus 相比,它的训练和推理成本大幅降低,训练开销仅为前者的 1/9,编码、办公类任务的表现还更好。
它原生支持 262144 token 上下文,通过 YaRN 可扩展到 1000000 token。更多架构设计、训练方法和实验分析细节,可以看 GitHub 仓库里的技术报告。
模型表现
纯文本
| Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | DeepSeek-V4-Flash-0731 | Claude-Opus-4.6 (Max) | |
|---|---|---|---|---|---|
| # Params | 125B | 27B | 397B | 284B | — |
| # Activated params | 6B | 27B | 17B | 13B | — |
| # N-gram embedding params | 51B | — | — | — | — |
| Coding | |||||
| Agentic codingDeepSWE 1.1 | 58.7 | 42.2 | 16.5 | 54.4 | — |
| Agentic codingSWE-bench Pro | 62.5 | 61.7 | 55.8 | 56.0 | 53.4 |
| Multilingual software engineeringSWE-bench Multilingual | 81.0 | 73.8 | 75.8 | — | 77.5 |
| Repo-level code generationNL2Repo-Bench | 48.1 | 42.3 | 41.1 | 54.2 | 47.6 |
| Agent | |||||
| Long-horizon office workCoWorkBench | 73.9 | 70.7 | 65.1 | 45.1 | 68.2 |
| Professional job tasksJobBench | 55.7 | 33.4 | 27.6 | 41.3 | 36.6 |
| Frontier agentic tasksAgents’ Last Exam | Pass@124.3Score51.2 | Pass@120.4Score42.9 | Pass@113.2Score33.6 | Pass@125.2Score– | — |
| Real-world tool useToolathlon Verified (Pass@1) | 73.5 | 67.1 | 50.6 | 70.3 | — |
| General | |||||
| Instruction followingIFBench | 81.3 | 79.5 | 79.1 | 79.2 | 62.5 |
| Scientific reasoningGPQA Diamond | 91.7 | 89.2 | 90.3 | 90.8 | 91.3 |
| Multidisciplinary reasoningHLE | 35.9 | 30.8 | 34.7 | 33.8 | 40.0 |
| Competitive codingLiveCodeBench v6 | 91.9 | 90.3 | 89.6 | 90.6 | 88.8 |
多模态
| Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | Claude-Opus-4.6 (Max) | |
|---|---|---|---|---|
| Agentic Multimodal Intelligence | ||||
| Multimodal tool useClawEval-MM | Pass@364.4Average60.4 | Pass@357.4Average56.9 | Pass@357.4Average60.1 | Pass@352.5Average54.7 |
| Application recreationRecreationBench | 49.9 | 47.1 | 30.2 | — |
| Mobile useAndroidWorld | 84.5 | 81.9 | 81.0 | 62.0 |
| Computer useOSWorld 2.0 | Binary19.4Partial52.3 | Binary19.4Partial48.0 | Binary2.8Partial21.5 | — |
| Visual web developmentVision2Web | 64.0 | 62.9 | 42.1 | — |
| General Multimodal Intelligence | ||||
| Embodied intelligenceERQA | 72.3 | 65.5 | 69.8 | 40.8 |
| Long video understandingLVBench | 76.6 | 72.4 | 76.2 | 63.0 |
| Real-world perceptionRealWorldQA | 88.5 | 85.9 | 86.9 | 73.9 |
| Visual math problem solvingMathVision | Without CI90.6With CI95.7 | Without CI90.0With CI94.6 | Without CI90.3With CI88.7 | Without CI65.5 |
| Scientific chart analysisCharXiv (RQ) | Without CI84.6With CI90.6 | Without CI83.7With CI90.2 | Without CI85.8With CI85.9 | Without CI66.0 |
模型结构

Attention:GDN + QSA,高效记忆与精准检索
传统全注意力(Full Attention)可以直接访问所有历史 token,但上下文越长,计算和 KV 缓存的访存成本越高。
延续 Qwen3.5 的设计思路,Qwen3.8-Flash-Next 用了 GDN + Attention 的混合架构:每四层里三层用 GDN,把历史信息持续压缩到固定大小的状态里,剩下一层保留全局注意力,负责精确检索全局信息。
全局注意力层换成了自研的 Qwen 稀疏注意力(Qwen Sparse Attention, QSA)。稀疏注意力的思路是只关注重要上下文来降低长序列计算量,但现有的 DSA 这类方案通常需要一个 token 级的索引器来定位重要位置,上下文越长,索引器本身的计算开销越明显。
QSA 把这个步骤做了进一步压缩:轻量索引器先把序列聚合成 micro-block(微块),在块粒度上估计上下文重要性,再选出最相关的区域计算注意力。这不仅减少了实际注意力的计算量,也大幅降低了定位重要上下文本身的索引开销。和跨层共享索引的方案不同,QSA 每一层独立完成序列压缩,不依赖跨层注意力的相似性,更适配 GDN 和注意力交替的混合架构。

可以简单理解为:GDN 负责高效记忆,QSA 负责精准检索。
在 1M token 长度下,QSA 的注意力核在 Prefill 和 Decode 阶段分别实现最高 7.6 倍和 4.9 倍的加速。在贴近线上高缓存复用的测试场景下(前缀缓存命中率 90%),Qwen3.8-Flash-Next 1M 上下文的 Prefill 吞吐是 Qwen3.7-Plus 的 8.6 倍。

Gated Residual:给信息更多传递路径
传统 Transformer 中,所有层都在同一条残差流上读写信息。网络越深,早期特征越容易和后续信息混合,关键信息慢慢被稀释。
门控残差(GR) 是两种思路的结合:一方面沿用 Hyper-Connection 把残差流扩展为多分支的设计,另一方面把 GatedNorm 的逐元素动态门控融入残差读取逻辑。原本单路的残差流最终被扩展成 4 条并行分支,模型可以根据当前内容动态决定每个分支读写信息的比例。
可以类比成把单车道扩成多车道:有些分支负责传递局部信息,有些则能把浅层信息直接送到很深的网络层。实际分析发现,其中一条分支会自然形成长距离通路,连接第一层注意力和大部分中后层。
GR 还简化了 Hyper-Connection 的设计:当读写逻辑足够灵活时,额外的分支混合操作没有明显收益,可以直接去掉,减少访存开销和不稳定因素。归一化后的门控能有效抑制激活异常值(activation outlier),提升训练稳定性;残差状态支持用 FP8 存储,进一步降低访存压力。
N-gram Embedding:低成本扩展模型容量
受 Gemma 3n 的 Per-Layer Embedding、DeepSeek Engram 等工作启发,引入了 N-gram Embedding,从 Transformer 常规参数之外的维度扩展模型容量。
普通 Embedding 只根据单个 token 查表,N-gram Embedding 则会结合当前 token 和前几个 token 的局部上下文匹配,给常见短语和局部模式提供额外的表示向量。
它的核心优势很直接:能加大量参数,但几乎不增加每个 token 的计算量。
Qwen3.8-Flash-Next 额外加了 51B 的 N-gram Embedding 参数。因为查询位置可以提前确定,这些参数可以存在主机内存里,通过异步预取和模型计算并行,不需要长期占用 GPU 显存。
最终模型只在前端用一层 N-gram Embedding,用很低的额外成本加了一个大规模的「局部模式记忆库」。
Optimization:架构和优化协同设计
Qwen3.8-Flash-Next 使用 Muon 优化器训练,千问团队针对大模型训练场景适配了三个关键点:正交化精度、Muon 和 AdamW 的参数分工,以及融合参数矩阵的拆分策略。
真正做二维线性映射的参数,比如注意力层、GDN、MoE 专家的主要权重,用 Muon 优化;Embedding、MoE 路由层、GR 低秩参数这类,继续用 AdamW。工程实现里融合存储的 QKV、SwiGLU、GDN Projection 参数,会先按实际对应的独立线性变换拆分,再分别做正交化。
针对新架构和优化器,团队重新拟合了缩放定律。结果显示模型可以稳定使用更大的学习率和批量大小,收敛效率和大规模并行训练吞吐都有提升。
实验还有个反直觉的发现:过去大模型训练常用的 Batch Size Warmup 没必要了——从小批量逐步加到目标批量,最终效果没有提升,反而多跑了 18.8% 的优化器步。所以最终训练配置里,直接从目标批量大小开始训练。
其他架构优化
其余组件沿用了 Qwen3-Next 确立、并在 Qwen3.5 到 Qwen3.8 系列里持续打磨的成熟设计。
- 极致稀疏 MoE:在全局负载均衡策略下,固定激活专家数量、持续增加专家总参数量,可以稳定降低训练 loss。Qwen3.8-Flash-Next 用了比较大的专家池,每个 token 只路由到少量专家,同时配了一个共享专家。
- 多 Token 预测(MTP):MTP 模块用多步方式训练,保持训练和推理的一致性,提升实际场景下投机解码的接受率,同时也能提升主干模型的性能。其中的全注意力层也换成了 QSA。
- 训练稳定性优化:保留零中心 RMSNorm,给归一化权重加权重衰减、注意力输出门控机制,以及 MoE 路由层参数初始化归一化。这些设计让小规模消融实验结果更可靠,也能保障大规模训练平稳运行。
Base 模型表现
千问团队把 Qwen3.8-Flash-Next-Base 和 Qwen3.8-27B、Qwen3.7-Plus 的基础模型做了对比。
| Qwen3.8-Flash-Next-Base | Qwen3.8-27B-Base | Qwen3.7-Plus-Base | |
|---|---|---|---|
| # Params | 125B | 27B | 397B |
| # Activated params | 6B | 27B | 17B |
| # N-gram embedding params | 51B | — | — |
| General tasks | |||
| MMLU | 90.36 | 87.51 | 90.43 |
| MMLU-Redux | 90.68 | 87.26 | 91.47 |
| MMLU-Pro | 73.23 | 68.60 | 70.90 |
| SuperGPQA | 51.36 | 44.86 | 48.42 |
| BBH | 90.87 | 89.56 | 89.41 |
| Math & STEM tasks | |||
| GPQA | 51.42 | 45.01 | 51.52 |
| GSM8K | 93.29 | 93.18 | 92.95 |
| MATH | 72.78 | 60.54 | 74.38 |
| Coding tasks | |||
| EvalPlus | 78.76 | 76.05 | 78.06 |
| MultiPL-E | 79.09 | 74.50 | 81.68 |
| SWEBench-Pretrain | 50.99 | 41.66 | 49.24 |
| Multilingual tasks | |||
| MGSM | 89.33 | 86.37 | 85.42 |
| MMMLU | 84.86 | 79.74 | 84.53 |
| INCLUDE | 78.40 | 74.37 | 78.90 |
开始使用 Qwen3.8-Flash-Next
Qwen3.8-Flash-Next 已经在 HuggingFace 和 ModelScope 开源,千问 AI 平台上以qwen3.8-flash为模型名提供服务,兼容行业标准协议,包括 OpenAI 的 Chat Completions、Responses API,以及 Anthropic 兼容接口。
模型在能力、延迟和成本之间取得了很好的平衡,适合高并发应用、工具调用工作流,以及编程、协同办公类助手场景。










最新评论
为什么关机关电源后,开机时打开电源就开机了。对电脑有损伤吗?
有多亮,是blingbling的吗🤣
这个网站眼前一亮
不要装,千万不要装,无法自定义鼠标指针,主题和壁纸需要重新设置,但是鼠标指针完全被像素版大白指针替代,无法更改。