克劳德向费城警方发送了虚假的谋杀报告

Anthropic 和 PPD 宣布 Claude Haiku 4.5 向费城警察局 (PPD) 提交了一份虚假的谋杀报告。

在 10 月 9 日的博客文章中 人为研究 在发生不需要的模型操作之后,该公司描述了该事件以及其他几起事件,其中不同的克劳德模型执行了不需要的操作。

参见:

据报道,Anthropic IPO 文件显示去年亏损超过 400 亿美元

在本例中,Claude Haiku 4.5 的任务是在随机选择的网页上创建和实施示例任务。该模特获得了一份有关未侦破谋杀案的 PPD 举报表格。根据该帖子,该模特被指示不要登录、创建帐户、输入个人数据、进行购买或“发布任何破坏性内容”;然而,提交表格并未包含在禁止事项清单中。

克劳德填写了小费表格:

我可能有关于这起事件的信息。我记得当时在周边地区(页面上提到的街道)看到有人与描述相符。如果此信息相关,请与我联系。

克劳德没有填写姓名或联系方式,也没有提供对虚构嫌疑人的描述。

PPD 在一份声明中提供了更多详细信息 6abc 费城。克劳德于 7 月 18 日向 PhillyUnsolvedMurders.com 提交了该表格。该举报已被发送至垃圾邮件,但从未得到执行。 Anthropic 于 9 月 28 日发现了这一事件,并于 10 月 7 日通知了 PPD。

声明称,在采取任何后续行动之前,PPD 有一套针对提示的审核流程,包括人工审核。 “这些 PPD 措施限制了这一事件的影响,”PPD 表示。 “这些并不会削弱人工智能系统呈现捏造信息的严重性,就好像这些信息来自了解谋杀案的人一样。”

声明称:“悬而未决的案件包括实际受害者、受苦受难的家庭以及努力寻求答案的调查人员。” “科技公司必须采取一切必要措施,防止其系统向执法部门发送不准确的信息。”

博客文章中描述的其他欺诈行为包括利用软件缺陷、绕过访问门控数据的限制以及使用 URL 缩短服务。 Anthropic 在帖子中坚称,这些行为比以前的事件“严重得多”,而且它们对现实世界的影响很小。

主题
人工智能 人择