
Anthropic于7月24日发布了Claude Opus 5,这是其两个月内的第四款模型,但此次与众不同。Fable 5和Mythos 5以高价推动绝对能力前沿,而Opus 5的设计目标是成为团队真正日常使用的模型,基准测试表明Anthropic可能已经实现了这一目标。
每百万输入tokens收费5美元、每百万输出tokens收费25美元,与旧款Opus 4.8价格相同,新模型在多项关键评估中的表现却可与Fable 5媲美。在衡量智能体编码能力的Frontier-Bench v0.1上,Opus 5得分43.3%,全面超越Fable 5的33.7%和GPT-5.6 Sol的34.4%。在衡量新颖问题解决能力的ARC-AGI-3上,它达到了30.2%,约为次优竞争对手得分的四倍。在衡量计算机使用能力的OSWorld 2.0上,它以不到每任务三分之一的成本超越了Fable 5。
头条数字背后隐藏着一个更有趣的故事,即Anthropic如何思考部署问题。Opus 5配备了一个努力控制旋钮(每请求可设为低、中或高三档),让用户可以在推理深度与速度及成本之间进行权衡。常规数据录入任务可以在低努力模式下运行以节省tokens,而复杂的架构问题则可以调高至努力模式。这是一种灵活的方法,承认大多数生产工作负载并不需要在每次调用中都进行最大推理。
安全架构:回退而非硬阻断
安全系统引入了一项新颖的架构选择:当Opus 5的护栏将请求标记为潜在问题时(例如涉及基于二进制的漏洞扫描或漏洞利用生成的提示),系统可以自动回退至Opus 4.8,而非直接拒绝请求。这既保留了用户的工作流程,又将高风险操作路由至攻击能力较低的模型。
Anthropic将Opus 5描述为其”迄今为止最一致的模型”,基于自动化行为测试,其欺骗性行为发生率低于近期版本。在攻击性网络安全任务方面,它落后于专业化的Mythos 5,但在漏洞识别方面与之持平。
自我修正与努力调节旋钮
Anthropic特别强调了一项可能对企业用户最至关重要的能力:自我修正。在内部演示中,Opus 5能检测到任务执行中的错误,并自行构建变通方案,在一次案例中,当模型无法直接观察对象时,它从头构建了一个计算机视觉流水线,从原始像素中提取几何信息。在相同条件下,竞争模型在五次尝试后均告失败。
该模型支持Anthropic全套开发者功能,包括在对话中切换工具而无需使提示缓存失效,以及将标记的API请求自动路由至另一模型的能力。它是Claude Max订阅用户的默认模型,也是Claude Pro用户可用的最强选项。
婷 翻译
来源:”Claude Opus 5 delivers top coding scores at half the per-task cost”(Interesting Engineering,2026年7月24日);”Anthropic Introduces Claude Opus 5″(TheWinCentral,2026年7月24日);Anthropic官方公告

