Claude Opus 5发布:半价逼平旗舰,编程逼近Fable 5
来源:互联网7月24日,Anthropic正式发布Claude Opus 5,这是其两个月内推出的第四款Claude 5系列模型。Opus 5以与上一代Opus 4.8持平的定价——输入每百万token 5美元、输出每百万token 25美元,交付了接近旗舰模型Fable 5的性能水平,而Fable 5的定价是10美元/50美元。换句话说,用户用一半的价格,拿到了几乎同等的旗舰能力。
编程和推理能力大幅跃升
Opus 5在软件工程基准FrontierBench v0.1上取得43.3%的得分,不仅超过GPT-5.6 Sol的37.5%和Fable 5的33.7%,更是Opus 4.8得分18.7%的两倍以上。在CursorBench 3.2编程测试中,最高模式下Opus 5与Fable 5仅差0.5个百分点,但单项任务成本只有Fable 5的一半。在Artificial Analysis的Intelligence Index上,Opus 5以61分位居榜首,略超Fable 5的60分和GPT-5.6 Sol的59分。
更值得关注的是Opus 5的自我验证能力。Anthropic在发布公告中强调,Opus 5能够“验证自身工作并仔细迭代直至成功”。在一个测试中,Opus 5被给了一张机器零件图片但没有直接查看方式,它自主搭建了一套计算机视觉管线,从图像原始像素中提取几何信息,最终成功重建了3D模型,而竞品模型在同等条件下五次尝试均告失败。
效率革命:Effort开关让用户按需付费
Opus 5引入了可调节的“努力程度”设置,分为低、中、高三档。即便在最低档位,Opus 5完成的任务数量也超过其他任何模型。开发者可以根据任务难度灵活选择——简单问答用低档省钱,复杂代码生成切换到高档。这套机制的核心逻辑是把算力预算的选择权交给客户,而非一刀切地按最高标准收费。
在科学领域,Opus 5同样表现出色。内部评测显示,根据光谱数据推断分子结构,Opus 5比Opus 4.8高出10.2个百分点;预测蛋白质序列变异对功能的影响,高出7.7个百分点。在ARC-AGI 3测试中,Opus 5的得分是第二名模型的3倍;在Zapier AutomationBench上,其任务通过率约为次优模型的1.5倍,成本相当。
性价比战略应对开源冲击
Opus 5发布的时间节点耐人寻味。就在同一周,月之暗面Kimi K3宣布将全量开源2.8万亿参数权重,中国开源大模型持续蚕食闭源模型的定价权。Anthropic用这款“准旗舰性能、中端价格”的产品,试图在企业级市场筑起一道性价比防线。从Haiku 4.5到Opus 4.5再到Sonnet 5,Anthropic过去一年持续压低模型使用成本,Opus 5是这一策略的集大成者。
安全方面,Anthropic在训练Opus 5时有意回避了网络安全前沿任务,其在漏洞利用能力上与Mythos 5存在明显差距。自动化行为审计显示,Opus 5是Anthropic迄今最“对齐”的模型,欺骗行为发生率低于Opus 4.8、Sonnet 5和Fable 5。Opus 5目前已在Claude API、Claude Max和Claude Pro全平台上线,支持100万token上下文窗口。