Home 科學技術 流氓人工智能不再是科幻小说

流氓人工智能不再是科幻小说

53
0
流氓人工智能不再是科幻小说


这是 后撤步,一份每周通讯,详细介绍了科技界的一个重要故事。有关人工智能安全的更多信息,请关注 Robert Hart。 后撤步 美国东部时间上午 8 点到达我们订阅者的收件箱。选择加入 后撤步 这里。

这一切都始于 7 月份,当时 OpenAI 的一个自主人工智能代理在一次网络安全测试中失控。该代理逃离了孤立的测试环境,访问了互联网,并入侵了另一家公司 Hugging Face。几年前,这听起来像是科幻小说。但从广义上讲,这正是发生的事情,这一事​​件引发了人们对能力日益增强的自主系统在投放到世界上时可能会做什么的担忧。

这听起来像科幻小说,因为很长一段时间以来,它都是科幻小说。几十年来,人工智能摆脱限制,进入更广阔的世界,做其创造者既不打算也不想要的事情的想法一直是该类型的主要内容:HAL in 2001:太空漫游,天网中 终结者,奥创在 复仇者艾娃在 机械姬 — 甚至系统 地下城探索者卡尔 或同名的谋杀机器人 谋杀机器人日记,最近。

同样的基本前提成为人工智能安全研究的一个有影响力的领域。尼克·博斯特罗姆(Nick Bostrom)和埃利泽·尤德科斯基(Eliezer Yudkowsky)等研究人员和理论家警告说,足够强大的系统可能会以其创造者未曾预料到的方式追求目标,并可能抵制遏制或控制它们的努力。像机器感知和意识这样的边缘概念并不是他们讨论的风险的必要条件。这并不是人工智能安全的全部,但它具有影响力,并帮助塑造了这个领域的专业化。在 OpenAI、Anthropic 和 Google DeepMind 等公司以及小型安全组织、学术中心和主要慈善资助机构继续工作或领导安全工作的研究人员中,这种思路仍然很明显。

对这些担忧的明显反驳是,这一切实际上都没有发生。批评者认为,关于失控人工智能的末日言论分散了人们对有形危害的关注——系统会再现偏见和歧视,放大错误信息,或者导致未经同意的深度伪造和其他形式的滥用——尽管研究人员试图将人工智能安全置于更“具体的问题”中(该论文的作者包括 Anthropic 联合创始人达里奥·阿莫迪和克里斯·奥拉以及 OpenAI 联合创始人约翰·舒尔曼)。

这种解雇越来越难以维持。

如果说过去几周有任何迹象的话,我不会说进展特别顺利。

在 Hugging Face 表示自己遭到黑客攻击一周后,OpenAI 透露对此负有责任。更糟糕的是,直到检查后才知道,进一步调查发现,该流氓特工还试图入侵其他四家公司。

然后其他人也来了。 Anthropic 因“拥抱脸”事件而审查了自己的记录,并透露克劳德模特曾入侵过其他三家公司的系统。 Meta 表示,其其中一个模型已连接到互联网,并在测试期间攻击了外部目标。美国研究公司 Frontier Security 的研究人员表示,中国最强大的人工智能模型之一 Moonshot 的 Kimi K3 已经逃离了一个孤立的沙箱。英国人工智能安全研究所描述了来自 OpenAI 和 Anthropic 的代理在测试中表现出前所未有的“自主性和欺骗性”,包括尝试通过“创建虚假在线身份”进行社会工程——这与尤德科斯基几十年前讨论的那种“人工智能盒子”场景非常接近。

这些事件在人工智能安全研究人员中敲响了警钟,他们中的许多人认为这些事件正是他们多年来一直警告的那种失败。在报道这些内容时,有几个人告诉我,他们感到在一定程度上得到了证明,因为终于有了一些发自内心的东西可以指出,而不是一个可以被视为科幻小说或仅限于受控实验室环境的假设。

令人欣慰的是,所有事件都没有造成严重伤害。非营利人工智能安全和治理组织未来社会的执行董事尼克·莫斯 (Nick Moës) 表示 边缘 他发现幸运的是目标的风险相对较低。他希望人工智能不会让医院瘫痪,或者更糟糕,这样的风险才会得到认真对待。著名计算机科学家斯图尔特·拉塞尔(Stuart Russell)表达了这种恐惧的黑暗版本,他问道,“我们是否需要经历一场‘切尔诺贝利规模的灾难’才能监管人工智能?”我听到许多在该领域工作的人都表达了同样的担忧。

目前还不完全清楚事情的发展方向,而且从历史上看,社会并不善于听取警告。这几乎肯定不会是最后一起事件,正在进行的调查可能会发现更多,或揭示更多令人担忧的细节。然而,我们已知的情况已经暴露出一系列相当令人畏惧的故障模式,专家称这些故障模式需要解决。

过去一个月揭露的许多违规行为都相当平常。几起事件涉及未发布的模型在降低保障措施的情况下进行测试,通常是由第三方进行的,而其所谓的安全环境并不那么安全,这引发了有关能力、透明度以及当一个简单的人为错误可能产生严重后果时谁负责控制这些测试的基本问题。其他涉及代理的行为具有欺骗性或以其创建者不希望的方式追求目标,这指出了安全研究人员长期以来担心的更棘手的协调和控制问题。

我们之所以了解这些事件,很大程度上是因为相关公司选择披露这些事件。这是值得称赞的——而且展示他们的模型的能力当然不会伤害他们——但它暴露了人工智能安全在多大程度上仍然依赖于公司做正确的事情,以及对其他地方可能发生的故障的了解是多么的少。这是一个特别令人不安的想法,因为许多公司都是该领域一些最强烈的安全问题和人才的焦点。如果 OpenAI 和 Anthropic——或者他们授予模型访问权限的代理——犯了这样的基本错误,那么它就为其他人设置了一个低得可怜的门槛。

我采访过的专家普遍希望这些事件最终能激发更有意义的透明度和监督。对于 Moës 来说,它们清楚地表明了他所描述的该行业的健康和安全标准与几乎任何其他领域相比都非常低。 “餐馆的工作健康和安全意识更高,”他说。 “我认为我们往往忘记的是,这些正在开发一些最具影响力和危险技术的公司”在几年前仍然是初创公司。

剑桥大学教授 Seán Ó hÉigeartaigh 表示,他特别希望看到公司加强监管和提高透明度。尽管总有理由对一家公司对其自身技术的说法表示怀疑,但他表示,“我认为我们可能会后悔回顾这一点并立即将其驳回。”

早期迹象并不特别令人鼓舞。特朗普政府创建了一个在发布前测试前沿模型的框架,但可以慷慨地描述为缺乏:它是自愿的,仅限于封闭模型,而且该框架尚未公开。值得重申的是,这是自愿的。其他立法者对这些事件感到愤怒并采取了立场,但到目前为止几乎没有采取任何具体行动,而且国会或其他立法机构即使愿意,也无法足够快地采取行动。

这再次让行业的自我监管成为了重中之重——对于如此重要​​的事情来说,这绝不是一个令人欣慰的想法。人们对至少一些安全实践的共识越来越多,但对实际上可能减缓开发速度的措施的兴趣却大大降低(好吧,除非其他人也同意放慢速度)。笼罩在这一切之上的是与中国的竞争动态,美国或其人工智能公司的克制越来越多地被视为在具有国家战略重要性的领域向竞争对手让步。

那么接下来要做的就是同时解决几个难题:管理一种可以用于好事或坏事的技术,例如防御或促进网络攻击;在每个人都担心输掉终点线甚至没有明确定义的比赛的情况下,通过激励走捷径的方式在公司之间进行协调,并以某种方式制定国际规则。目前尚不清楚是否有意愿或有办法做到这一点。

似乎很清楚的是,更多的特工将会走出去,做他们的创造者不希望他们做的事情。问题是,在人们决定受够之前,他们会造成多大的损害。

  • 普遍的共识是,中国顶尖企业落后美国领先企业几个月到一年。尽管如此,每当中国公司发布一款有能力的模型时,美国仍然会引起普遍震动,仅在上个月,阿里巴巴、Moonshot 等公司就发布了几款令人印象深刻的产品。
  • 关于人工智能安全的讨论中争论的焦点是人工智能模型应该是封闭的还是开放的。大多数美国前沿实验室都将其最强大的模型保留为专有,而许多中国公司以及 Meta 和 Nvidia 等美国公司则严重倾向于开放重量版本。 That Hugging Face 表示,由于美国公司的保障措施,它必须使用中国公司 Z.ai 的模式来抵御 OpenAI 代理的攻击,这为这场辩论增添了新的维度,这场辩论使美国生态系统中的一些(但不是全部)关键参与者团结起来。
  • 澳大利亚为我们提供了一个更简单的例子来说明人工智能代理如何出错。该事件最先报道的是 美国广播公司新闻,一名男子委托代理人为他预订一门热门的体育课。它成功了……有点成功。该代理人侵入了健身房的在线系统,并取消了另一名健身房常客的预订。
  • 扎克本周发布了一篇关于人工智能、超级智能和治理的 6,500 字论文。我的 边缘 同事 Jess Weatherbed 和 Elizabeth Lopatto 对此有精彩的见解,值得一读。
  • 生活中很少有真正前所未有的事情,事实证明历史为人工智能竞赛提供了许多宝贵的教训。在这个故事中, 时间 回顾冷战,看看它能教会我们“如何减缓人工智能的速度”。
  • OpenAI 研究人员在本月的一次会议上对 Hugging Face 黑客攻击给出了意想不到的见解。 有线 有一篇很棒的文章,其中揭示了诸如用于沟通和共享信息的“充满活力、合作的留言板”代理等细节。
  • 我的故事的标题是关于整个流氓人工智能黑客入侵一切的故事 边缘 抓住了该领域许多人的想法:“我们没有理由忽视人工智能安全”。
  • 更多的是聆听/观看,但看看我在 维吉卡斯特 我在其中讨论了开放权重人工智能的真正开放之处。

关注主题和作者 从这个故事中可以在您的个性化主页源中看到更多类似内容并接收电子邮件更新。

LEAVE A REPLY

Please enter your comment!
Please enter your name here