系统极客一直在努力
专注操作系统及软件使用技能

Claude Opus 4.7 上线:提升软件工程能力,视觉能力跃升

Anthropic

Claude Opus 4.7 正式上线,新模型的核心突破,主要在软件工程领域:

  • 能以高度严谨和一致的表现,处理复杂长周期任务,精准执行指令,并在输出前主动验证工作——用户可以放手把「最难啃的骨头」交给它,无需全程盯梢。
  • 视觉能力同步跃升。在完成专业任务时,Opus 4.7 展现出更强的审美与创造力,界面原型、演示文稿和文档的产出质量都更高。

Claude Opus 4.7 核心能力详解

Claude Opus 4.7 基准测试

指令遵循

Opus 4.7 的指令跟随精度显著提升——这也意味着,为旧版模型调校的提示词(Prompt)可能出现预期外的行为:旧版会宽松解读或跳过部分指令,新版则逐字执行。建议在迁移后重新调校提示词和工作流程。

多模态视觉升级

参数Opus 4.6 及更早版本Opus 4.7
图像长边最大像素≈ 840px2576px
近似分辨率约 700K 像素约 3.75M 像素
倍数提升3 倍以上

高分辨率视觉能力解锁了一批此前受限的场景:

  • 计算机操控智能体(Computer-Use Agent):读取密集型截图;
  • 图表数据提取:解析复杂结构图、财务图表;
  • 像素级参考:UI 还原、设计稿对比等精细视觉任务。

真实工作场景表现

  • 在金融智能体评测(Finance Agent Evaluation)中取得了当前最好成绩。
  • 在 GDPval-AA(第三方经济价值知识工作评测,覆盖金融、法律等领域)中同样排名第一。
  • 在 Anthropic 的内部测试中,Opus 4.7 作为财务分析师,产出的分析报告更严谨,演示文稿更专业,跨任务整合度也更高。

记忆能力

更擅长利用文件系统存储记忆:在跨会话的长期任务中,它会记住关键笔记。在开启新任务时,无需重复铺垫背景,直接延续上次的进度。

安全与对齐评估

Opus 4.7 的整体安全表现与 Opus 4.6 相当,欺骗性输出、谄媚(Sycophancy)行为、配合滥用等维度,均保持在较低发生率。

  • 进步方面:诚实性表现更好,对恶意提示词注入(Prompt Injection)攻击的抵御能力有所提升。
  • 待改进方面:在涉及管制物质的危害减少建议(Harm Reduction Advice)上,细节程度略高于理想水平。
Opus 4.7 行为错位

完整安全评估内容见 Claude Opus 4.7 系统卡

同步上线的新功能

更细粒度的「努力控制」

Opus 4.7 新增的xhigh(超高)努力级别,填补了原有highmax之间的空白。用户在推理深度与响应延迟之间,有了更精细的调节空间。

  • Claude Code 现已将所有套餐的默认努力级别提升至xhigh
  • 在测试 Opus 4.7 的 Agentic 场景时,推荐从highxhigh起步。

Claude API 更新

  • 支持更高分辨率图像输入(见上节)。
  • 「任务预算」(Task Budget)上线公测。开发者可设定 Token 消耗上限,引导模型在长时间运行中,合理分配资源。

Claude Code 更新

  • /ultrareview 指令:启动专项代码审查会话,读取变更内容,标记潜在 Bug 和架构设计问题。相当于一位细心的 Code Reviewer 全程把关。Pro 和 Max 用户各获赠送 3 次免费体验。
  • Auto Mode 扩展至 Max 用户:Claude 可以在长任务中自主决策,减少用户干预次数,同时降低跳过所有权限确认所带来的风险。

从 Opus 4.6 迁移指南

Opus 4.7 是 Opus 4.6 的升级版本,但有 2 点变化会影响 Token 用量,需要提前规划好:

  1. 新分词器(Tokenizer):Opus 4.7 采用了更新的分词器,同等输入内容映射的 Token 数量会增加,倍率约为 1.0~1.35×,具体取决于内容类型。
  2. 高努力级别下的推理增加:在智能体场景的后续轮次中,Opus 4.7 在较高努力级别下会产生更多「思考过程」,输出 Token 也因此增加。这带来了更高的可靠性,但成本也会随之上升。

控制 Token 用量的方法:

  • effort参数调整到较低级别;
  • 为长任务设置任务预算(Task Budget);
  • 在提示词中明确要求模型精炼输出。
Opus 4.6/4.7按努力程度划分的智能体编码性能

官方迁移指南详见:迁移至 Opus 4.7

可用渠道与定价

Opus 4.7 现已在以下渠道全面上线:

  • Claude 全线产品(网页版、移动端);
  • Claude API 模型标识符claude-opus-4-7,文档见 Claude API 模型概览
  • Amazon Bedrock;
  • Google Cloud Vertex AI;
  • Microsoft Foundry。

定价与 Opus 4.6 持平:输入 $5/百万 Token,输出 $25/百万 Token。

赞(1)
分享到

评论 抢沙发