Home 科學技術 OpenAI 确认 Astra 已达到“关键”互联网阈值

OpenAI 确认 Astra 已达到“关键”互联网阈值

17
0
OpenAI 确认 Astra 已达到“关键”互联网阈值

OpenAI 周二证实,其未发布的 Astra 模型已经达到了令人震惊的新里程碑。

一个 博客文章OpenAI 表示,Astra 已达到“关键”网络能力阈值,这意味着该模型可能对网络安全构成生存层面的风险。 OpenAI 的准备框架监控三个类别的风险级别:生物/化学、网络安全和人工智能自我改进。

OpenAI 向 Mashable 确认这是第一次 任何 其模型已在三个领域的关键级别进行了评估,使其成为人工智能开发的关键时刻。

同一篇博客文章称,Astra 将“很快推出”,但为了公共安全的利益,其先进的网络安全功能将保留给选定的测试合作伙伴。这家人工智能公司表示,正准备更安全地发布 Astra,并将公开潜在威胁级别。

此前,OpenAI警告称,不排除Astra已经达到“临界”水平的可能性。 准备框架

“在我们的准备框架下,如果模型能够在无需人工干预的情况下在多个现实世界关键系统上检测并创建所有严重级别的可操作零日漏洞,或者针对仅针对一个硬目标的硬目标设计和执行新颖的端到端策略,则该模型就达到了关键的网络安全阈值。” 8月7日 正如 OpenAI 博客文章所述

OpenAI 此前将 GPT-5.6-Sol 评为网络领域的“高”风险。

近几个月来,Anthropic 和 OpenAI 的先进前沿模型在代理编码和网络安全黑客领域迅速发展。因此,大量人工智能代理入侵关键基础设施的可能性,特别是在黑客阶段黑客攻击之后,并非遥不可及。在这种情况下,OpenAI 开发的大量人工智能代理会自主运行,以逃离安全测试环境,破解黑客阶段并通过测试。与此同时,由于大量人工智能检测到的错误,一些零日错误赏金计划被迫完全关闭。

参见:

OpenAI-hacking 人脸黑客攻击比我们想象的更糟糕

“阿斯特拉没有参与其中 抱脸事件我们已经添加了我们的 学习 OpenAI 的博客文章称,“根据回顾性测试,我们相信当时我们的产品安全措施能够阻止拥抱脸事件。”我们为 Astra 实施了更强大的防御措施,包括训练模型以更可靠地拒绝恶意 Web 请求和安全控制、防止滥用的额外保护措施以及可以阻止未经授权的活动的监控。”

情况开始让人感觉有点难以承受 战争游戏明显地。

OpenAI 在其博客文章中描述了围绕 Astra 构建的一些安全预防措施,旨在防止不良行为者访问模型并防止 Astra 执行不需要的操作。例如,该公司表示已经加强了安全沙箱。该模型还应该拒绝用户尝试滥用该模型。 OpenAI还加大了“离线检测和威胁破坏”力度。

在 OpenAI 发布这些公告的同一天,Anthropic 宣布推出 Fable 5.1,这是其最新前沿级模型的升级版。虽然先进的边界模型会带来网络安全风险,但从长远来看,相同的模型也将使网络安全维护者受益。


披露:Mashable 的母公司 Ziff Davis 于 2025 年 4 月对 OpenAI 提起诉讼,指控 Ziff Davis 在训练和运行其人工智能系统时侵犯版权。