文 | 字母AI
Anthropic这回真是豁出去了。
新模型Opus 5刚刚亮相,性能几乎要追上旗舰Fable 5,但价格直接砍半。
时间线拉得挺密。5月28日,Claude Opus 4.8问世;12天后,能力更强的Fable 5和Mythos 5接力登场;6月30日,Sonnet 5上线;到了7月24日,Anthropic又抛出了Opus 5。
短短57天,这家公司的Claude产品线几乎轮了一遍。即便在以月为单位迭代的AI圈子里,这速度也显得有点离谱。
最让人猝不及防的,是Fable 5和Opus 5之间仅隔了45天。
起初,Fable 5是Anthropic面向大众用户的能力标杆,按常理说,它该在聚光灯下多停留一阵子。可Opus 5追得太紧,很快就把风头抢了过去。
Anthropic仿佛在喊话:“能打败我的,只有我自己。”
这波更新节奏,明显是在对标OpenAI。7月9日,OpenAI发布GPT-5.6,并把Fable 5列为主要参照对象。15天后,Anthropic推出Opus 5,又将GPT-5.6 Sol纳入核心对比,在陌生问题求解、电脑操作和商业流程等项目中展示优势。
两家在产品发布和宣传上的针锋相对,已经很明显了。
Opus 5到底什么来头?Anthropic这次交了哪些底牌?
**性能与性价比**
Opus 5的价格沿袭了上一代Opus 4.8的标准,性能却有了质的飞跃。
Anthropic展示了Opus 5在不同“投入档位”下的表现。用户可以根据需求自行调节:简单任务选更省钱、更快的模式,遇到难题再提升档位,换取更优结果。
从披露信息看,Opus 5在处理具有实际价值的软件工程任务时尤为擅长。
比如在Frontier-Bench v0.1评测中,Opus 5超过了所有其他模型。相比Opus 4.8,它完成每项任务的成本更低,成绩却翻了一倍还多。
在CursorBench 3.2评测中,当投入档位设为最高时,Opus 5与Fable 5最高得分之间的差距不到0.5%,而每项任务的成本仅为Fable 5的一半。
在high、xhigh和max三个投入档位下,若按相同成本比较,Opus 5的表现依然超越所有其他模型。
在知识工作和问题解决任务中,Anthropic也观察到了类似趋势。例如:
在ARC-AGI 3这类“陌生题”测试中,模型无法依赖现成套路,必须自行摸索规则、判断目标并调整策略。Opus 5的得分达到第二名的3倍,这意味着它在面对从未见过的问题时,更有能力通过试错找到解法。
这种优势也延伸到了真实工作流程中。
AutomationBench要求模型调用商业软件,从头到尾独立完成一项任务。Opus 5的通过率约为第二名的1.5倍;即便使用最低投入档位,其成绩也超过了其他模型的最高水平。
换句话说,Opus 5无需付出最高的推理成本,也能处理更多任务。
在电脑操作测试OSWorld 2.0中,Opus 5在各个成本区间均处于领先地位。它花费的成本略高于Fable 5的三分之一,成绩却超越了Fable 5的最高水平。
这表明,Opus 5在打开应用、查找信息、跨软件操作并持续推进任务时,效率显著更高。
这一特点在其他评测中也十分明显。
HLE考察跨学科难题。在不调用工具的情况下,Opus 5以56.3%的得分略低于Fable 5的56.5%;允许使用工具后,它升至64.7%,反超Fable 5的63.9%,且成本更低——单靠模型内部知识,Opus 5未必总是第一,但一旦可以搜索、调用工具和反复核对,优势便会扩大。
在模拟真实知识工作的GDPval-AA v2中,它最高得分1861,高于Fable 5的1747和GPT-5.6 Sol的1736。大约花费700美元,就能达到其他模型最高投入档位附近的成绩。DeepSearchQA上的领先幅度较小,但也以更低的成本取得了略高的通过率。
Opus 5在Anthropic全部生命科学评测中都超过了Opus 4.8。其中,光谱推断分子结构和预测蛋白质变异影响两项任务分别提高了10.2和7.7个百分点。这些提升意味着,Opus 5在辅助分子结构分析、蛋白质功能预测等科研环节上潜力更大。
Anthropic还通过两个可交互演示展示了Opus 5的视觉生成能力。第一个是一个可实际操作三维风洞:用户可以旋转汽车、调整风速,观察气流如何绕过车身,同时查看阻力系数等数据。第二个是一个三维动物细胞模型,用户可以转动、剖开细胞,点击细胞核、粗面内质网等结构查看说明,页面还会主动指出示意图为了便于展示做了哪些简化。
从这两个案例可以看出,Opus 5已经将代码、三维建模、交互界面和知识讲解整合进了同一个成品里。用户只需给出一段要求,它就能直接搭建出接近教学软件或产品原型的演示。
**安全与对齐**
Anthropic通过几个案例说明,Opus 5比此前模型更懂得独立推进任务。
一次测试要求模型根据机械零件图纸,用代码重建一个FreeCAD三维模型,但系统未提供直接查看图纸的工具。Opus 5索性自己编写了一套计算机视觉程序,从原始像素中提取尺寸和几何结构,随后完成了建模。
同样的条件下,其他模型连续尝试5次也未成功。
另一次任务来自一个流行的开源软件包管理器。Opus 5查出了程序错误的根本原因,还补上了社区修复方案遗漏的边缘情况。
参与对比的另一款模型只消除了表面症状,便宣布问题已解决。
一家交易公司的工程师让Opus 5为新交易所搭建市场数据系统。此前的模型即使拿到详细方案也无法完成,Opus 5因找不到实时数据用于验证,便自行制作了一套测试工具检查代码。
这些案例展示了Opus 5的进步,也解释了Anthropic为何花了大量篇幅讨论安全问题。
当模型开始自行补充工具、检查结果、修正错误后,人类需要确认它不会为了达成目标而隐瞒问题、绕过限制,或做出风险过高的决定。
Anthropic表示,Opus 5是目前对齐表现最好的Claude模型。
上线前的自动化审计显示,与Opus 4.8、Sonnet 5和Fable 5相比,它更能遵守Claude宪法,欺骗行为更少,也更难被诱导执行有害请求。
所谓“对齐”,通俗来说,就是模型能力提升后,其行为方式仍符合开发者设定的规则。
网络安全领域最能体现这种两难。
Anthropic并未专门用攻击任务训练Opus 5,但随着模型综合能力提高,它寻找代码漏洞的水平已接近Mythos 5。
两者在发现漏洞时表现相近,但在编写漏洞利用程序、把缺口转化为实际攻击手段的阶段,Opus 5仍明显落后。它很擅长检查哪里出了问题,但真正利用这些问题发动攻击的能力仍受限制。
Opus 5可以继续检查源代码和寻找漏洞,但二进制漏洞扫描、渗透测试及漏洞利用程序生成会被拦截。
相比Fable 5,新分类器触发干预的频率预计减少约85%,正常的安全研究更少受到误伤。
触发限制后,Claude.ai、Claude Code和Claude Cowork会默认改用Opus 4.8处理请求;加入网络安全验证计划的企业和研究人员,可以使用限制较少的版本。
生物学领域也采用了类似安排。Opus 5成为Anthropic面向普通用户开放的最强科研模型,但在需要长时间独立运行的研究任务中仍有明显局限。
此前在Fable 5上因安全限制被拦截的生物学请求,现在会先转交给Opus 5处理。普通科研问题因此能用上更强的模型,高风险任务则继续留在安全边界之外。
**加量不加价**
Opus 5可以说是一次“加量不加价”。
它延续了Opus 4.8每百万输入Token 5美元、输出Token 25美元的价格体系。
正如前文所述,在多项编程和智能体测试中,新模型的完成率更高,单位任务成本反而下降。
横向对比来看,它最直接的对手是OpenAI旗舰模型GPT-5.6 Sol。两者输入价格相同,Opus 5的输出价格低约17%。
处理超长资料时,Opus 5的价格优势会更加凸显。Anthropic对最高100万Token的上下文维持普通单价。而GPT-5.6 Sol在输入超过27.2万Token后,整次请求的输入价格翻倍,输出价格提高50%。
对于大型代码库、长篇研究资料和复杂智能体任务,这项差异会直接反映在账单上。
按照Anthropic公布的评测,Opus 5虽未在所有项目中胜过GPT-5.6 Sol,但在电脑操作、商业流程和陌生问题求解等需要模型连续做事的任务上,其表现和价格都更具竞争力。
用Anthropic的话说,Opus 5专为日常使用而设计,效率高于其他型号。如今,这款新模型成为了Claude Max的全新默认型号,也是Claude Pro的最强型号。







