系统极客一直在努力
专注操作系统及软件使用技能

Qwen3.6-Max-Preview 上线:更严格的指令遵循

Qwen3.6-Plus 之后,通义千问团队又放出了下一代旗舰模型的早期预览版:Qwen3.6-Max-Preview。虽然作为 Preview 版本,它还在快速迭代,但核心能力的提升已经肉眼可见——更强的世界知识、更严格的指令遵循,以及在智能体编程上的巨大跃升。

模型性能

相比 Qwen3.6-Plus,Qwen3.6-Max-Preview 在几个关键维度拉开了差距:

  • 智能体编程:SkillsBench +9.9、SciCode +10.8、NL2Repo +5.0 和 Terminal-Bench 2.0 +3.8。
  • 世界知识:SuperGPQA +2.3、QwenChineseBench +5.3。
  • 指令遵循:ToolcallFormatIFBench +2.8。

在 Artificial Analysis 最新更新的权威评测榜单中,Qwen3.6-Max-Preview 的性能表现已经超过了 GLM-5.1、MiniMax-M2.7 等模型,登顶最佳国产模型。

Qwen3.6-Max-Preview 基准测试

使用 Qwen3.6-Max-Preview

现在你就可以在 Qwen Studio 直接体验;后续阿里云百炼 API 也会开放qwen3.6-max-preview名称调用。

开启preserve_thinking参数后,模型会在消息中保留所有前序轮次的思维链内容。对于需要多步推理或状态保持的智能体任务,能显著提升表现的稳定性。

赞(0)
分享到

评论 抢沙发