Claude Opus 5 发布:更主动,价格延续 Opus 4.8

Simon Willison2 天前

Anthropic 推出了新模型 Claude Opus 5。根据官方描述,这是一款“周到且主动”的模型,智能水平接近 Claude Fable 5,但价格约为后者的一半。

目前外界反馈较为积极。在 Artificial Analysis 的榜单上,Claude Opus 5 暂时位居前列,甚至排在 Fable 5 之前。

定价与模式

Claude Opus 5 的定价与 Opus 4.8 保持一致,同时继续提供 fast mode。该模式的价格为基础模型的两倍,面向需要更快响应的使用场景。

更强的主动性

发布材料中提到的一个 Frontier-Bench 任务,展示了 Opus 5 的主动解决问题能力:

在一项任务中,Opus 5 拿到了一张机器零件图,并被要求编写代码,将其重建为 3D FreeCAD 模型。但任务设计中,模型并不能直接查看这张图。Opus 5 的做法是自行编写计算机视觉流程,从原始像素中提取几何信息,然后重建出完整的机器零件。

这个案例显示,Opus 5 在面对工具或信息受限的任务时,可能会主动构建中间流程来完成目标。

网络安全能力:更会发现漏洞,但弱化利用能力

Anthropic 表示,与 Opus 4.8 类似,Opus 5 并未被刻意训练网络安全任务。不过,由于整体能力提升,它在相关任务上也有明显进步。

官方说明中提到:

Opus 5 在发现网络安全漏洞方面已经接近 Mythos 5。但在漏洞利用方面,也就是将漏洞转化为实际网络威胁的能力上,仍明显落后于 Mythos 5。

这意味着 Opus 5 的能力提升主要体现在漏洞识别,而不是漏洞利用。对于模型安全边界来说,这是一个值得关注的设计取向。

提示词与上下文工程资料

Anthropic 已发布 Claude Opus 5 的提示词指南。同时,Thariq Shihipar 也撰写了关于 Claude 5 代模型上下文工程的新规则,讨论如何更好地组织上下文、约束任务并提升模型输出质量。

初步体验仍需验证

目前已有一些简单测试案例。例如让模型生成“骑自行车的鹈鹕”时,第一次结果漏掉了自行车轮子,第二次尝试效果更好。这类案例只能作为早期体验参考,尚不足以代表模型在复杂任务中的稳定表现。

总体来看,Claude Opus 5 的看点集中在三方面:

  • 价格延续 Opus 4.8,并提供更高价的快速模式;
  • 主动解决问题能力进一步增强;
  • 网络安全能力提升,但官方强调其更偏向发现漏洞,而非利用漏洞。
评论

请登录后发表观点

暂无数据