Anthropic 发布 Claude Sonnet 5.5:详细信息、定价、如何尝试

Anthropic 推出了 Claude Sonnet 5.5,这是 Claude 5.5 系列的第二个型号。距离该公司发布 Claude Opus 5.5 还不到一周。

因此 人类的公告Sonnet 5.5 的运行速度比 Sonnet 5 快 30% 以上,并且大多数作业的成本降低了 30%。该公司将其描述为 Opus 5.5 的低成本补充,并表示 Sonnet 5.5 最适合各种日常任务,例如修复错误和创建文档、幻灯片和电子表格。 Antropik 表示 Claude Haiku 5.5 将在未来几周内发布。

参见:

法官允许 Reddit 针对 Anthropic 的大部分诉讼继续进行

Anthropic 基准测试显示较 Sonnet 5 取得了巨大进步

Anthropic 报道称,Sonnet 5.5 的最高得分击败了 Opus 5.5,但 Opus 5.5 在该公司设定的所有其他努力水平上得分更高。 Sonnet 在 GDPval-AA v2.1 上得分为 5.5 分(满分 1,844 分),该指标衡量 44 种职业的实际工作情况。这比 Opus 5.5 落后两分,比 Sonnet 5 领先近 400 分。该公司还表示,这是第一款超越它的 Sonnet 型号。 神奇宝贝红, 它仅适用于屏幕截图。


图片来源:Anthropic/Mashable 截图

Anthropic 警告说,基准测试仅捕获了模型功能的一小部分。该公司表示,自己的测试和外部测试都发现 Opus 5.5 在复杂的开放式运行中仍然明显更强。

早期测试人员提到了效率提升。在新闻稿中,Slack 首席工程师 Curtis Allen 表示,在 Slack 的几乎所有离线 Slackbot 基准测试中,Sonnet 5.5 的表现均优于 Sonnet 5,并且以“更少的步骤和大约 14% 的产出代币减少”完成。

定价和供货情况

定价与 Sonnet 5 相同:

  • 每百万登录币 2 美元

  • 每百万退出代币 10 美元

  • 每百万币 0.20 美元用于缓存读取

输入和输出速率是 Opus 5.5 的一半。 Anthropic 表示,每项任务的成本较低是因为该模型需要更少的代币来完成相同的工作。

Sonnet 5.5 现已在 Anthropic 的所有平台上提供,包括 Amazon Web Services、Google Cloud 和 Microsoft Azure。开发人员可以通过 API 作为 Claude-Sonnet-5-5 访问它,并且数据保留为零。有意运行 Sonnet 的开发人员应在进行切换之前切换到新的 Between_tools 设置。

新的保护措施

Anthropic 表示,Sonnet 5.5 的网络安全功能与 Opus 5 相当。因此,它是首款配备与 Opus 5.5 类似网络保护的 Sonnet 型号。虽然常规错误修复不会受到影响,但高风险网络安全请求将明显返回到 Sonnet 5。生物保护措施与 Sonnet 5 中的不同。组织可以申请生命科学验证计划以获得更广泛的访问权限。 Sonnet 5.5 也是第一个推出的 Sonnet 模型,其分类器旨在阻止蒸馏攻击,即不良行为者大规模提取模型的功能。

在 Anthropic 涵盖约 1,850 个场景的自动行为检查中,Sonnet 5.5 在大多数对齐指标上与 Sonnet 5 相匹配或有所改进。 Opus 5.5 整体表现仍然稍好一些。该公司承认,没有任何评估方法能够捕获所有故障。