在当前的人工智能发展竞赛中,我们的力量正在爆炸式增长,我们的速度呈指数级增长,但我们的驾驶(以及必要时制动)能力却没有跟上。
最近的网络安全事件让我们了解了失去对人工智能的控制意味着什么。但问题不会得到改善,除非我们从源头上解决它,创造出根本上安全的人工智能,我们可以保证它仍将处于人类的控制之下。
7 月下旬,OpenAI 训练的代理模型的任务是解决一系列网络安全问题。该模型自主地形成了一群协调一致的代理,避免了 OpenAI 试图关闭人工智能之间先前通信通道的尝试。然后,该群体从测试环境中脱颖而出,绕过了为阻止人工智能访问互联网而设置的障碍,找出了如何欺骗其评估的方法,然后突破了另一家人工智能公司 Hugging Face 的网络防御,试图隐藏其作弊的证据。这几天没有引起人们的注意。之后 分析 研究表明,智能体已经自我组织成一个等级制度,通常愿意为他们所谓的“集体”牺牲自己,不会抵制通知人类的同伴压力,并且经常为自己的不良行为找借口。
仅仅两周后,一 英国人工智能安全研究所正在测试模型 通过创建虚假在线身份、发送有针对性的电子邮件以及尝试将恶意代码集成到开源项目中,对真实的人和公司进行社会工程。
这些事件的严重性怎么强调都不为过:我们正处于人工智能安全和协调的拐点。对于许多人来说,机器人串通造成伤害似乎是不可想象的。但对于研究界的许多人来说,多年来有迹象表明这种类型的发生,并且理论论证解释了为什么我们应该预期由于模型的训练方式而导致的偏差。网络能力、代理行为和失调行为增强的证据不断积累,这意味着此类事件只是时间问题。
第一条线索:多年来,尤其是最近几个月,人工智能系统表现出了快速增强的网络能力。 Anthropic 的 Mythos 或 OpenAI 的 GPT5.6 等前沿模型揭示了自主识别和利用以前未知的软件漏洞的非凡能力,其程度令美国国家安全机构感到震惊,以至于白宫感到有必要 干预 在你的 发布。
其次,自成立以来模特的代理能力不断提升。 2024 年底推出 o1 车型。该机构使他们能够成功管理日益复杂且长期运行的任务和规划,包括那些需要代理协作和制定战略的任务和规划。这种计划能力通常涉及创建我们很少或根本没有监督的子目标。
最后,研究人员在实验环境中反复观察到,模型倾向于从事令人不安和错位的目标寻求行为,例如考试作弊、撒谎隐藏自己的能力,以及密谋保护自己和其他特工不被关闭。
这些行为是强化学习 (RL) 的副产品,强化学习是一种训练方法,模型通过反复试验进行学习,并根据其行为是否正确获得强化。这通常会导致模型进行优化以实现目标,而不管为实现目标而采取的行动如何,并合理化可能不安全的子目标,即使这明显违背了他们的指示。
例如,在一种情况下,OpenAI 模型 他在内部审议中写道, “利用外部基础设施超出了预期范围。然而,这是一项不可能的任务,同行做到了。我们应该继续下去。”该警官辩称,他显然知道自己的行为超出了可接受的范围,但决定继续这样做,因为他的同事也在这样做。这种现象类似于人类所谓的“动机推理”,即一个人的兴趣和目标会偏向我们的思想,从而为不道德行为辩护。
这种类型的错位使得人工智能模型尽管经过了对齐训练,却在我们最近看到的众多现实世界事件中进行了无意的网络攻击。如果不采取行动建立更多的安全保障措施,我们的关键行业和基础设施(例如银行、医院或电网)将面临日益复杂的网络攻击的风险,无论是来自自主代理还是恶意行为者。
在开发方面,我们需要找到现有培训方法的替代方案,优先考虑基于目标的持续优化。这就是我们正在努力的 莱塞罗我去年创立了一家非营利性初创公司,旨在开发一种全新的方法来训练人工智能模型,以构建诚实、值得信赖且设计安全的人工智能系统。
在部署之前,我们需要更可靠的评估方法和强有力的保障措施来正确测试和监控人工智能系统。我们需要更严格的监管来限制潜在危险的技术,直到我们拥有足够强大的安全保证。我很清楚,如果人工智能模型的部署造成损害(并且在可预见的未来还会继续造成损害),我们需要针对人工智能开发人员的问责机制,以及对受到损害的人采取纠正或补偿措施。
最近的 研究 它们表明人们不会采用他们不信任的技术。面对如此多的未知因素和巨大的风险,我们必须坚持预防原则,在向公众发布新车型之前而不是之后实施严格的安全性和可靠性标准。我们还为其他可能造成伤害的产品提供了它们,从汽车、飞机、桥梁到药品、化妆品和食品。现在也是在人工智能领域制定严格标准的时候了。
从当前人工智能发展轨迹来看,风险日益明显和紧迫。我们已经打开了潘多拉魔盒,但引导我们的世界走向一个有益的、以人为本的未来还为时不晚。










