
阿里千问发布了新一代旗舰模型 Qwen3.7-Max。这次更新的核心指向很明确——智能体(Agent)场景。它既能写代码、改 Bug,也能自动化办公流程,还能扛住数百乃至数千步的长周期自主任务。
具体到落地场景,Qwen3.7-Max 的能力边界拓宽了不少:
- 编程方面,它现在能接手从前端原型到复杂多文件工程的全流程开发。
- 办公场景下,通过集成 MCP 和多智能体协作,工作流自动化成了现实。
- 更关键的是长周期执行能力。在一场长达 35 小时、涉及超 1000 次工具调用的全自主内核优化实验中,模型全程保持了连贯推理,没有中途崩溃或迷失上下文。
底层框架的兼容性也做了解耦。无论是跑在 Claude Code、OpenClaw 和 Qwen Code,还是其他自定义框架下,性能输出都足够稳定。
模型表现

模型表现
| Opus-4.6 Max | K2.6 Thinking | GLM-5.1 Thinking | DS-V4-Pro Max | Qwen3.6-Plus | Qwen3.7-Max | |
|---|---|---|---|---|---|---|
| Coding Agent | ||||||
| Terminal Bench 2.0-Terminus | 65.4 | 66.7 | 63.5 | 67.9 | 61.6 | 69.7 |
| SWE-Verified | 80.8 | 80.2 | — | 80.6 | 78.8 | 80.4 |
| SWE-Pro | 57.3 | 59.5 | 58.8 | 59.0 | 56.6 | 60.6 |
| SWE-Multilingual | 77.5 | 76.7 | — | 76.2 | 73.8 | 78.3 |
| NL2repo | 47.6 | 42.8 | 41.0 | 35.5 | 34.4 | 47.2 |
| SciCode | 51.9 | 52.2 | 45.1 | — | 41.4 | 53.5 |
| QwenWebDev | 1617 | — | 1564 | 1570 | 1500 | 1568 |
| QwenSVG | 1541 | 1325 | 1605 | 1506 | 1432 | 1608 |
| General Agent | ||||||
| Qwenclaw | 65.5 | 54.7 | 58.7 | 59.2 | 57.2 | 64.3 |
| CoWorkBench | 68.2 | 58.2 | 66.0 | 66.3 | 64.5 | 67.2 |
| ClawEval | 70.4 | 61.5 | 62.7 | 58.4 | 57.1 | 65.2 |
| Skillsbench | — | 56.2 | 53.1 | 52.3 | 45.7 | 59.2 |
| BFCL-V4 | 76.7 | 71.3 | 70.9 | 70.6 | 68.9 | 75.0 |
| MCP-Mark | 56.7 | 55.9 | 57.5 | 57.1 | 48.2 | 60.8 |
| MCP-Atlas | 75.8 | 66.6 | 71.8 | 73.6 | 74.1 | 76.4 |
| Vitabench | — | 39.1 | 45.1 | 51.9 | 42.8 | 47.9 |
| SpreadSheetBench-v1 | 89.3 | 84.5 | 85.2 | 84.9 | 80.2 | 87.0 |
| Kernel Bench L3 | 2.63/98% | 1.41/80% | 2.00/78% | 1.07/54% | 1.03/48% | 1.98/96% |
| HLE w/ tools | 53.0 | 54.0 | 52.3 | 48.2 | 50.2 | 53.5 |
| QwenWorldBench | 56.1 | 50.9 | 50.2 | 52.3 | 47.6 | 57.3 |
| STEM & Reasoning | ||||||
| GPQA Diamond | 91.3 | 90.5 | 86.2 | 90.1 | 90.4 | 92.4 |
| HLE | 40.0 | 36.4 | 34.7 | 37.7 | 28.8 | 41.4 |
| LiveCodeBench | 88.8 | 89.6 | — | 93.5 | 87.1 | 91.6 |
| HMMT 2026 Feb | 96.2 | 92.7 | 89.4 | 95.2 | 87.8 | 97.1 |
| IMOAnswerBench | 75.3 | 86.0 | 83.8 | 89.8 | 83.8 | 90.0 |
| CritPT | 12.6 | 8.0 | 4.6 | 12.9 | 2.9 | 11.4 |
| Apex | 34.5 | 24.0 | 11.5 | 38.3 | 8.8 | 44.5 |
| General Capability | ||||||
| MMLU-Pro | 89.7 | 87.1 | 86.3 | 87.5 | 88.5 | 89.6 |
| MMLU-Redux | 95.2 | 95.3 | 94.3 | 94.8 | 94.5 | 95.0 |
| SuperGPQA | 72.5 | 71.3 | 68.0 | 69.9 | 71.6 | 73.6 |
| IFEval | 91.9 | 94.5 | 94.5 | 91.9 | 94.3 | 94.3 |
| IFBench | 62.5 | 76.0 | 76.0 | 77.0 | 74.2 | 79.1 |
| MRCR-v2 128k | 84.0 | 63.1 | 62.0 | 74.4 | 85.9 | 90.4 |
| Multilingualism | ||||||
| WMT24++ | 82.7 | 81.6 | 81.8 | 82.2 | 84.3 | 85.8 |
| MAXIFE | 81.3 | 87.7 | 87.7 | 88.9 | 88.2 | 89.2 |
| MMMLU | 90.6 | 87.5 | 87.2 | 87.9 | 89.5 | 90.3 |
| MMLU-ProX | 86.1 | 83.7 | 83.9 | 83.9 | 84.7 | 87.0 |
| NOVA-63 | 59.1 | 56.7 | 54.6 | 52.8 | 57.9 | 59.0 |
| INCLUDE | 87.4 | 84.2 | 84.3 | 86.1 | 85.1 | 86.2 |
| Global PIQA | 91.2 | 89.2 | 89.5 | 90.5 | 89.8 | 91.4 |
| PolyMATH | 80.2 | 82.7 | 67.6 | 72.0 | 77.4 | 86.5 |
编程智能体
在编程基准测试中,Qwen3.7-Max 稳居第一梯队。SWE-Pro 拿到 60.6 分,SWE-Multilingual 78.3 分,SciCode 53.5 分,QwenSVG 则达到 1608 分。Terminal Bench 2.0-Terminus 得分 69.7,小幅领先 DS-V4-Pro Max 的 67.9。在 SWE-Verified 测试中,它拿到了 80.4 分,与 Opus-4.6 Max(80.8)和 DS-V4-Pro Max(80.6)咬得很紧。
通用智能体
通用智能体能力的提升幅度更为显著。MCP-Mark 得分 60.8,超越了 GLM-5.1(57.5);MCP-Atlas 拿到 76.4 分,略高于 Opus-4.6 (75.8);Skillsbench 得分 59.2,同样领先 K2.6 (56.2)。
在 GPU 内核优化基准 Kernel Bench L3 上,它实现了 1.98 倍的中位数加速,加速覆盖率高达 96%。
其余基准测试中,BFCL-V4(75.0)、Qwenclaw(64.3)和 ClawEval(65.2)的得分也紧追 Opus-4.6 Max。办公自动化基准 SpreadSheetBench-v1 则拿到了 87.0 分,处于行业头部位置。
推理
高难度推理是 Qwen3.7-Max 的另一个强项。GPQA Diamond 得分 92.4,HLE 41.4,HMMT 2026 Feb 97.1,这三项均小幅超越了 Opus-4.6。
在 IMOAnswerBench 和 Apex 测试中,它分别拿到 90.0 和 44.5 分,拉开了与 DS-V4-Pro(89.8/38.3)的差距。
通用能力与多语言
指令遵循能力上,IFBench 得分 79.1,领先 DS-V4-Pro(77.0)。多语言和翻译能力稳居第一梯队,WMT24++ 和 MAXIFE 分别拿到 85.8 和 89.2 分。SuperGPQA(73.6)与 QwenWorldBench(57.3)的表现也保持在高水准。
以上评测成绩均来自不同的智能体框架。Qwen3.7-Max 没有针对单一框架做定向刷榜。无论是在 Claude Code、OpenClaw、Qwen Code 还是各类自定义工具链中,它都能保持稳定输出。
生产力助手
在真实的生产力场景中,Qwen3.7-Max 更像是一个能扛活的深度协作者。
- 依托智能体架构,它能接手高复杂度的企业级任务。比如批量研读并整合海量信息、对复杂数据进行深度分析建模,或者直接生成出版级文档与可视化成果。
- 得益于对主流智能体框架的原生适配,它支撑得起数小时级别的自主规划与运行。通过上千次工具调用和数十轮版本迭代,模型可以持续打磨交付物质量。过去需要专业团队耗费 1-2 周推进的复杂项目,现在由 Qwen3.7-Max 驱动的智能体接管,几个小时就能跑通端到端交付。
智能体扩展
在 Qwen3.5 引入的环境扩展方法基础上,Qwen3.7 进一步拉升了训练环境的质量与多样性。这与语言模型通过多样化预训练文本获取泛化能力的逻辑如出一辙——智能体能力同样能借由多样化的训练环境实现泛化。
评测结果已经印证了这条路径的有效性。环境扩展带来的性能提升轨迹清晰且稳定,Qwen3.7-Max 的综合排名已跻身前三,逼近 Claude-4.6-Opus-Max。
所有评测使用的环境均为训练阶段未曾见过的域外全新场景,排除了模型死记硬背的可能。
跨框架泛化能力
千问团队的 Rollout 环境基础设施做了一项关键改动:将每个训练实例解耦为任务(Task)、运行框架(Harness)与验证器(Verifier)三个正交组件。这三者可以自由重组。该架构兼容多种运行框架及其迭代版本,且所有环境均基于真实场景构建,摒弃了合成数据。
解耦设计带来了组合式扩展的红利。同一个任务能以极低的边际成本,匹配不同类型和版本的框架与验证器。更核心的是,它支持跨框架、跨验证器的强化学习训练。模型必须在多变的框架配置下处理同源任务,这迫使它去学习具备泛化能力的解题策略,而不是去走特定框架的捷径。
在 QwenClawBench 和 CoWorkBench 评测中,无论套用哪种运行框架,Qwen3.7-Max 的性能输出都保持了高度一致,明显拉开与 Qwen3.6 系列的差距。这意味着,它确实掌握了任务求解的通用逻辑,而非对特定框架产生了过拟合。
开始使用 Qwen3.7
- Qwen3.7-Max 的 API 服务即将在阿里云百炼上线,支持直接接入主流智能体框架与编程助手。
- 如果你想快速测试效果,也可以到 Qwen Studio 里跑几个真实任务试水 Qwen3.7-Max-Preview 和 Qwen3.7-Plus-Preview。









最新评论
提供snap包没意见,但是移除deb,还把deb改成虚包指向snap,实在是让人作呕
为什么关机关电源后,开机时打开电源就开机了。对电脑有损伤吗?
有多亮,是blingbling的吗🤣
这个网站眼前一亮