系统极客一直在努力
专注操作系统及软件使用技能

Qwen3.7:专为智能体打造的旗舰大模型

Qwen

阿里千问发布了新一代旗舰模型 Qwen3.7-Max。这次更新的核心指向很明确——智能体(Agent)场景。它既能写代码、改 Bug,也能自动化办公流程,还能扛住数百乃至数千步的长周期自主任务。

具体到落地场景,Qwen3.7-Max 的能力边界拓宽了不少:

  • 编程方面,它现在能接手从前端原型到复杂多文件工程的全流程开发。
  • 办公场景下,通过集成 MCP 和多智能体协作,工作流自动化成了现实。
  • 更关键的是长周期执行能力。在一场长达 35 小时、涉及超 1000 次工具调用的全自主内核优化实验中,模型全程保持了连贯推理,没有中途崩溃或迷失上下文。

底层框架的兼容性也做了解耦。无论是跑在 Claude Code、OpenClaw 和 Qwen Code,还是其他自定义框架下,性能输出都足够稳定。

模型表现

Qwen3.7-Max 基准测试
Qwen3.7-Max 基准测试

模型表现

Opus-4.6 MaxK2.6 ThinkingGLM-5.1 ThinkingDS-V4-Pro MaxQwen3.6-PlusQwen3.7-Max
Coding Agent
Terminal Bench 2.0-Terminus65.466.763.567.961.669.7
SWE-Verified80.880.280.678.880.4
SWE-Pro57.359.558.859.056.660.6
SWE-Multilingual77.576.776.273.878.3
NL2repo47.642.841.035.534.447.2
SciCode51.952.245.141.453.5
QwenWebDev16171564157015001568
QwenSVG154113251605150614321608
General Agent
Qwenclaw65.554.758.759.257.264.3
CoWorkBench68.258.266.066.364.567.2
ClawEval70.461.562.758.457.165.2
Skillsbench56.253.152.345.759.2
BFCL-V476.771.370.970.668.975.0
MCP-Mark56.755.957.557.148.260.8
MCP-Atlas75.866.671.873.674.176.4
Vitabench39.145.151.942.847.9
SpreadSheetBench-v189.384.585.284.980.287.0
Kernel Bench L32.63/98%1.41/80%2.00/78%1.07/54%1.03/48%1.98/96%
HLE w/ tools53.054.052.348.250.253.5
QwenWorldBench56.150.950.252.347.657.3
STEM & Reasoning
GPQA Diamond91.390.586.290.190.492.4
HLE40.036.434.737.728.841.4
LiveCodeBench88.889.693.587.191.6
HMMT 2026 Feb96.292.789.495.287.897.1
IMOAnswerBench75.386.083.889.883.890.0
CritPT12.68.04.612.92.911.4
Apex34.524.011.538.38.844.5
General Capability
MMLU-Pro89.787.186.387.588.589.6
MMLU-Redux95.295.394.394.894.595.0
SuperGPQA72.571.368.069.971.673.6
IFEval91.994.594.591.994.394.3
IFBench62.576.076.077.074.279.1
MRCR-v2 128k84.063.162.074.485.990.4
Multilingualism
WMT24++82.781.681.882.284.385.8
MAXIFE81.387.787.788.988.289.2
MMMLU90.687.587.287.989.590.3
MMLU-ProX86.183.783.983.984.787.0
NOVA-6359.156.754.652.857.959.0
INCLUDE87.484.284.386.185.186.2
Global PIQA91.289.289.590.589.891.4
PolyMATH80.282.767.672.077.486.5

编程智能体

在编程基准测试中,Qwen3.7-Max 稳居第一梯队。SWE-Pro 拿到 60.6 分,SWE-Multilingual 78.3 分,SciCode 53.5 分,QwenSVG 则达到 1608 分。Terminal Bench 2.0-Terminus 得分 69.7,小幅领先 DS-V4-Pro Max 的 67.9。在 SWE-Verified 测试中,它拿到了 80.4 分,与 Opus-4.6 Max(80.8)和 DS-V4-Pro Max(80.6)咬得很紧。

通用智能体

通用智能体能力的提升幅度更为显著。MCP-Mark 得分 60.8,超越了 GLM-5.1(57.5);MCP-Atlas 拿到 76.4 分,略高于 Opus-4.6 (75.8);Skillsbench 得分 59.2,同样领先 K2.6 (56.2)。

在 GPU 内核优化基准 Kernel Bench L3 上,它实现了 1.98 倍的中位数加速,加速覆盖率高达 96%。

其余基准测试中,BFCL-V4(75.0)、Qwenclaw(64.3)和 ClawEval(65.2)的得分也紧追 Opus-4.6 Max。办公自动化基准 SpreadSheetBench-v1 则拿到了 87.0 分,处于行业头部位置。

推理

高难度推理是 Qwen3.7-Max 的另一个强项。GPQA Diamond 得分 92.4,HLE 41.4,HMMT 2026 Feb 97.1,这三项均小幅超越了 Opus-4.6。

在 IMOAnswerBench 和 Apex 测试中,它分别拿到 90.0 和 44.5 分,拉开了与 DS-V4-Pro(89.8/38.3)的差距。

通用能力与多语言

指令遵循能力上,IFBench 得分 79.1,领先 DS-V4-Pro(77.0)。多语言和翻译能力稳居第一梯队,WMT24++ 和 MAXIFE 分别拿到 85.8 和 89.2 分。SuperGPQA(73.6)与 QwenWorldBench(57.3)的表现也保持在高水准。

以上评测成绩均来自不同的智能体框架。Qwen3.7-Max 没有针对单一框架做定向刷榜。无论是在 Claude Code、OpenClaw、Qwen Code 还是各类自定义工具链中,它都能保持稳定输出。

生产力助手

在真实的生产力场景中,Qwen3.7-Max 更像是一个能扛活的深度协作者。

  • 依托智能体架构,它能接手高复杂度的企业级任务。比如批量研读并整合海量信息、对复杂数据进行深度分析建模,或者直接生成出版级文档与可视化成果。
  • 得益于对主流智能体框架的原生适配,它支撑得起数小时级别的自主规划与运行。通过上千次工具调用和数十轮版本迭代,模型可以持续打磨交付物质量。过去需要专业团队耗费 1-2 周推进的复杂项目,现在由 Qwen3.7-Max 驱动的智能体接管,几个小时就能跑通端到端交付。

智能体扩展

Qwen3.5 引入的环境扩展方法基础上,Qwen3.7 进一步拉升了训练环境的质量与多样性。这与语言模型通过多样化预训练文本获取泛化能力的逻辑如出一辙——智能体能力同样能借由多样化的训练环境实现泛化。

评测结果已经印证了这条路径的有效性。环境扩展带来的性能提升轨迹清晰且稳定,Qwen3.7-Max 的综合排名已跻身前三,逼近 Claude-4.6-Opus-Max。

所有评测使用的环境均为训练阶段未曾见过的域外全新场景,排除了模型死记硬背的可能。

跨框架泛化能力

千问团队的 Rollout 环境基础设施做了一项关键改动:将每个训练实例解耦为任务(Task)、运行框架(Harness)与验证器(Verifier)三个正交组件。这三者可以自由重组。该架构兼容多种运行框架及其迭代版本,且所有环境均基于真实场景构建,摒弃了合成数据。

解耦设计带来了组合式扩展的红利。同一个任务能以极低的边际成本,匹配不同类型和版本的框架与验证器。更核心的是,它支持跨框架、跨验证器的强化学习训练。模型必须在多变的框架配置下处理同源任务,这迫使它去学习具备泛化能力的解题策略,而不是去走特定框架的捷径。

在 QwenClawBench 和 CoWorkBench 评测中,无论套用哪种运行框架,Qwen3.7-Max 的性能输出都保持了高度一致,明显拉开与 Qwen3.6 系列的差距。这意味着,它确实掌握了任务求解的通用逻辑,而非对特定框架产生了过拟合。

开始使用 Qwen3.7

  • Qwen3.7-Max 的 API 服务即将在阿里云百炼上线,支持直接接入主流智能体框架与编程助手。
  • 如果你想快速测试效果,也可以到 Qwen Studio 里跑几个真实任务试水 Qwen3.7-Max-Preview 和 Qwen3.7-Plus-Preview。
赞(2)
分享到

评论 抢沙发