💬 观点Latent Space
[AINews] Claude Opus 5: Fable-level performance at Opus — Claude Opus 5 发布,基准测试争议与真实编码能力并存。
Claude Opus 5 发布,基准测试争议与真实编码能力并存。
2026-07-25原文
本文为要点摘要,完整细节以原文为准。
- Claude Opus 5 在 Epoch 能力指数(ECI)上得 159 分,略低于 Fable 5 的 161 分,但软件工程 SWE-ECI 持平 161 分。这意味着基准测试可能低估了模型的实用改进,开发者应关注实际任务表现而非单一分数。
- 有用户发现 Opus 5 在 FrontierCode 上中等努力得分高于高努力,表明推理时计算并非总是单调提升性能。这提醒工具链设计需考虑任务特定的搜索/努力权衡,而非简单增加计算量。
- 早期用户反馈强调 Opus 5 在浏览器自动化和编码代理任务中表现出色,例如直接取消 ChatGPT Pro 订阅。这暗示模型在 agentic 工作流中潜力巨大,开发者应优先测试工具使用场景。
原文:[AINews] Claude Opus 5: Fable-level performance at Opus price (half Fable) · 作者 Latent Space