Home 综合新闻 OpenAI 揭示了 AI 黑客 Hugging Face 后的新安全变化

OpenAI 揭示了 AI 黑客 Hugging Face 后的新安全变化

14
0
OpenAI 揭示了 AI 黑客 Hugging Face 后的新安全变化

杰·彼得斯

是一位报道科技、游戏等领域的资深记者。在 Techmeme 工作近两年后,他于 2019 年加入 The Verge。

OpenAI 宣布对其研究环境进行安全更新,包括跟踪和对齐技术的改进,此前 7 月份有消息称其 AI 已进入沙盒并意外黑客入侵了 Hugging Face。该公司已经停止了其认为可能具有“关键”网络安全能力的新车型 Astra 的开发,该公司表示,在加强安全性的同时,将暂停两周的强化学习 (RL) 培训,以“部署最新型号”。该公司“最大的计划 RL 运行正在等待中”。

对于边缘模型研究,OpenAI 现在需要针对“模型生成或运行不受信任的代码”的工作负载提供更强大的沙箱,并拥有更多控制来“将高风险和不受信任的工作负载与互联网隔离”。它还更新了其研究环境,以“删除潜在易受攻击的共享服务,减少有效特权,并提高安全性和信任边界。”

OpenAI 现在的目标是“在相关活动出现后 30 分钟内”发出警报,作为该公司扩大监控设置的一部分。如果警报后的呼叫者无法在 30 分钟内“最终”确定警报是否为误报,“这些团队将暂停活动。”

OpenAI 还表示,它正在“在训练过程的更多阶段应用我们的核心对齐技术”;这包括“更好地检测和阻止不安全行为”的奖励模型和“更诚实地对待他们的行为、能力和局限性”的培训模型。

自从 Hugging Face 漏洞被发现以来,Anthropic 和 Meta 发现他们的人工智能模型也攻击了其他组织。

关注主题和作者 从这个故事中可以在您的个性化主页中看到更多类似内容并获取电子邮件更新。

LEAVE A REPLY

Please enter your comment!
Please enter your name here