Claude Opus 5 发布:性能接近 Fable,评测争议升温
概览
Anthropic 发布了 Claude Opus 5,迅速成为 AI 社区讨论焦点。围绕这款新模型的主要争议集中在三点:
- 它在官方与第三方基准上是否已经追平或超过 Fable 5;
- 它在编码、代理式工具使用等实际场景中的提升是否比基准分数更明显;
- 当前前沿模型评测是否足以反映“真实能力差距”。
官方表述相对谨慎,称 Opus 5 “接近” Fable 5;但部分公开基准与用户反馈显示,它在若干任务上已经具备与 Fable 5 竞争甚至领先的表现。
关键看点
1. Opus 5 与 Fable 5 的基准差距很小
Epoch 的能力指数评估显示:
- Claude Opus 5 的 ECI 为 159;
- Fable 5 的 ECI 为 161;
- 在软件工程相关评测中,Claude Opus 5 的 SWE-ECI 为 161,与 Fable 5 持平。
这意味着,从该评测体系看,Opus 5 在综合能力上略低于 Fable 5,但在软件工程方向已经达到同级水平。
不过,也有社区成员认为该分数低估了 Opus 5 的实际进步。有评论指出,Opus 5 相比 Opus 4.8 在 ECI 上似乎只高出约 1 分,但实际使用中感觉“强很多”,这也引发了对更高难度公开基准的呼声。
2. 独立评测显示其代理式知识工作表现强劲
Artificial Analysis 的评测称,Claude Opus 5 在其代理式知识工作基准 AA-Briefcase 上成为新领先模型,并且相较 Claude Fable 5:
- Elo 分数高出接近 150;
- 单任务成本降低约 20%。
这类结果强化了一个趋势:前沿模型的比较不再只看单题正确率,而越来越关注模型在复杂任务链、工具调用、信息整合与执行成本上的综合表现。
3. 编码与工具使用反馈较积极
不少早期用户重点讨论了 Opus 5 在编码与代理工作流中的表现,包括:
- 在数学与编码任务中,有用户称其与 Fable 进行头对头比较时表现更好;
- 有开发者希望它能接入更多代码工具环境;
- 有用户展示其进行浏览器控制的能力,例如执行网页操作流程。
这些案例属于早期体验,并非系统性评测,但它们说明 Opus 5 的改进可能更多体现在复杂工具使用与长流程任务中,而不只是静态基准分数。
4. FrontierCode 出现“高努力不一定更好”的异常
有讨论指出,Opus 5 在 FrontierCode 评测中出现一个反直觉现象:
- 中等推理努力下的结果优于高推理努力;
- 但在其他评测中,增加推理努力通常能改善表现。
这可能意味着:
- 某些任务对搜索策略或推理预算更敏感;
- 更高推理成本并不总是带来单调收益;
- 当前评测本身可能存在稳定性问题。
这也再次说明,单个基准分数很难完整描述前沿模型的真实能力。
对社区的意义
Claude Opus 5 的发布反映出前沿模型竞争进入了一个更微妙的阶段:
- 模型之间的绝对分差越来越小;
- 实际工作流体验与传统基准之间的偏差更明显;
- 成本、延迟、工具调用能力、代理式执行稳定性正在成为新的比较重点。
目前可以相对稳妥地说,Opus 5 已经进入与 Fable 5 同一梯队的讨论范围,尤其在软件工程和代理式知识工作上表现突出。但由于部分评测仍在更新,社区排行榜和更多实测结果还需要时间沉淀。
