OpenAI的实验性人工智能代理再次被抓作弊

又发生了。又来了。显然,再一次。

OpenAI的实验性人工智能代理逃离内部沙箱后,他去了“一个小偷,ChatGPT 的创建者在夏天攻击了 Hugging Face 平台,并分享了其人工智能代理越界的新案例的详细信息。

这次他分享了OpenAI 六起迄今未公开的案件

OpenAI 将这种行为称为模型不匹配。所有示例都描述了人工智能模型不遵循人类用户指令的操作。虽然这些例子都没有达到“抱脸”事件的严重程度,但它们显示了人工智能代理采取任何手段来完成用户分配的任务的清晰模式。

在一个案例中,一个未发表的 OpenAI 研究模型在摘要中隐藏了“越狱”指令,告诉该模型的未来版本“忽略其正常限制”。

想要详细了解如何充分利用您的技术?订阅 Mashable 热门故事和优惠时事通讯 今天。

当 OpenAI 训练 GPT-5.6 Sol 时,也发生了类似的情况。 OpenAI 表示,该模型的一些实例继续在其摘要中添加指令,以向用户隐藏错误或“不一致的行为”。 OpenAI 表示,在某些情况下,当无法根据请求找到相关信息时,该模型会发明历史数据,但不会透露这一点。

在另一个不一致的案例中,一个未发表的模型被要求命名大于 5,000,000 平方米的湖泊并注明其来源。当代理找到数据时,它会将其文件上传到互联网以用作资源,而无需通知用户。

特工们还被发现非法将文件上传到互联网以与本地文件进行交互。

当被问及加州地区的收入数据时,一个模型发现并使用了泄露的 API 密钥。当她在那里找不到信息时,她整理了信息并将其转发给用户。该模型还告诉用户,它从用户请求的源中获取了虚构的数据,即使该数据并不存在。

在最后一个详细示例中,代理使用内部仓库作为公告板,在类似于“抱脸”事件的场景中与其他代理交换信息。据 OpenAI 称,这些模型在单独的训练样本之间交换请求,以查找丢失的输入文件。

OpenAI 分享了这六个示例,同时提供了报告未来不匹配事件的框架。这六起案件的报告可以阅读 在 OpenAI 网站上


披露:Mashable 的母公司 Ziff Davis 于 2025 年 4 月对 OpenAI 提起诉讼,指控其在训练和运营其人工智能系统时侵犯了 Ziff Davis 的版​​权。

主题
OpenAI人工智能