Anthropic 发布了 Claude Opus 5.5,这是一种新的人工智能模型,该公司表示,在大多数工作中,其性能与 Claude Fable 5.1 模型大致相同,但价格却低得多。
该型号于 9 月 22 日星期二发布,是全新 Anthropic Claude 5.5 系列中的首款车型。根据 公司公告Opus 5.5 在典型工作负载下的运行成本比 7 月份推出的 Opus 5 低约 40%。 Anthropic 表示 Claude Sonnet 5.5 和 Claude Haiku 5.5 将在未来几周内推出。
Opus 5.5 也是首席执行官 Dario Amodei 呼吁 AI 公司出于安全原因“踩线”并阻止 AI 开发以来的首款新 Anthropic 模型。
Anthropic 表示,Claude Opus 5.5 在编码和知识工作方面处于领先地位
Anthropic 表示,Opus 5.5 在代理编码、计算机使用和知识工作方面领先其基准套件。在测试 44 种职业的现实工作的 GDPval-AA v2.1 中,该公司报告 Opus 5.5 得分为 1846,Fable 5.1 得分为 1,735,Opus 5 得分为 1,708。
图片来源:Anthropic / Mashable 截图
在 Terminal-Bench 4.0 上,Anthropic 报告 Opus 5.5 的利用率为 66.4%,而本月早些时候推出的 GPT-6 Astra OpenAI 的利用率为 57.9%。阿斯特拉在一些测试中仍然领先。其中 Terminal-Bench-Science 0.1 得分为 64.6%,而 Opus 5.5 得分为 58.7%。
Anthropic 还指出,在这种绩效水平上,基准利润率已成为不太可靠的指南。该公司表示,Opus 5.5 和 Fable 5.1 之间的现实差距比结果显示的要小。
该公司还表示,该型号的字迹比 Opus 5 更清晰,并将 Opus 5 描述为对前一代型号的常见抱怨。
可混搭光速
想要详细了解如何充分利用您的技术?订阅 Mashable 热门故事和优惠时事通讯 今天。
安全与保障 Claude Opus 5.5
作为公司继Amodei“”之后的首款新车型边境行军”文章中,保障措施尤其值得关注。
该公司表示,包括 METR 和 Frontier Design 在内的外部评估机构在发布前对该模型进行了测试。 Anthropic 还表示,Opus 5.5 在其自动行为审计中取得了迄今为止所有模型中最好的结果。
这种方法与 Opus 5 不同。Mashable 在 7 月份报道称,Anthropic 故意将网络安全任务排除在模型的训练之外。 Anthropic 现在表示 Opus 5.5 在生物学和网络安全方面可与 Claude Mythos 5.1 相媲美。因此,它附带了类似于《神鬼寓言 5.1》中的保护措施。大多数网络安全任务将转移到 Opus 4.8,经过审查的组织可以通过新的生命科学审查计划申请更广泛的生物学访问权限。
Anthropic 承认其测试的局限性。该公司表示,有迹象表明 Opus 5.5 经常被怀疑处于评估阶段,这使得其现实世界的行为更难以评估。 OpenAI 报告了 GPT-Astra 的类似行为。
人类安全报告中包含禽流感、无人机群和大规模监视
如何测试克劳德 Opus 5.5
Claude Opus 5.5 现已在 Anthropic 平台上推出,包括 Amazon Web Services、Google Cloud 和 Microsoft Azure。开发人员可以通过 claude-opus-5-5 的 API 访问它。
API价格为:
-
每百万输入代币 4 美元
-
每百万退出代币 20 美元
-
每百万令牌 0.20 美元用于读取缓存
Anthropic 报告称,I/O 令牌比 Opus 5 减少 20%,缓存读取减少 60%。相比之下,GPT-6 Astra 每百万输入代币的成本为 10 美元,每百万输出代币的成本为 50 美元。
Anthropic 还表示,它正在提高 Pro、Max 和 Team 订阅者的五小时使用限制。
披露:Mashable 的母公司 Ziff Davis 于 2025 年 4 月对 OpenAI 提起诉讼,指控其在训练和运营其人工智能系统时侵犯了 Ziff Davis 的版权。
主题
人择人工智能










