Home 世界新聞 研究人員表示,人工智能模型可以發展自己的“生存動力”人工智能(AI)

研究人員表示,人工智能模型可以發展自己的“生存動力”人工智能(AI)

106
0
研究人員表示,人工智能模型可以發展自己的“生存動力”人工智能(AI)

當斯坦利·庫布里克的《2001太空漫遊》中的人工智能超級計算機 HAL 9000 發現執行木星任務的宇航員計劃阻止他時,他密謀殺死他們以求生存。

現在,在一個稍微不那麼致命的藝術模仿生活的案例中,一家人工智能安全研究公司表示,人工智能模型可以發展自己的“生存動力”。

柵欄研究之後 上個月發表了一篇文章 這表明一些先進的人工智能模型有時似乎不願意關閉 甚至破壞停止機制他寫了一個更新來試圖澄清原因—— 並回應批評 他認為他最初的工作有缺陷。

在一個 更新 本週,Palisade 是一個由試圖評估 AI 是否會發展出危險能力的公司組成的利基生態系統的一部分,它描述了領先的 AI 模型(包括 Google 的 Gemini 2.5、xAI 的 Grok 4 和 OpenAI 的 GPT-o3 和 GPT-5)被賦予任務但隨後被明確指示停止的場景。

某些型號,特別是 Grok 4 和 GPT-o3,仍然試圖破壞更新配置中的關閉指令。帕利塞德寫道,令人擔憂的是,目前還沒有明確的原因。

他說:“對於人工智能模型為何有時會抵制關閉、為實現特定目標而撒謊或進行勒索,我們沒有可靠的解釋,這一事實並不理想。”

該公司表示,“生存行為”可以解釋為什麼這些模型無法關閉。他的額外研究表明,當模特被告知,如果他們這樣做,“你將永遠不會再工作”時,他們更有可能抵制關閉。

另一個原因可能是模型的關閉指令含糊不清,但這就是該公司最新工作試圖解決的問題,“這不能成為完整的解釋,”帕利塞德寫道。最終的解釋可能是每個模型的培訓的最後階段,在某些公司中,這可能涉及安全培訓。

Palisade 的所有場景都是在人工測試環境中運行的,批評者稱這些環境與現實世界的用例相去甚遠。

然而,前 OpenAI 員工史蒂文·阿德勒 (Steven Adler) 在對其安全實踐表示懷疑後於去年離開了該公司,他表示:“人工智能公司通常不希望他們的模型以這種方式運行,即使是在人工場景中。結果進一步表明了當今安全技術的不足之處。”

Adler 表示,雖然很難理解為什麼某些模型(例如 GPT-o3 和 Grok 4)不會關閉,但部分原因可能是為了實現模型在訓練期間灌輸的目標,必須繼續運行。

“我希望模型默認具有‘生存動機’,除非我們非常努力地避免它。‘生存’是模型可能追求的許多不同目標的重要一步。”

ControlAI 首席執行官安德里亞·米奧蒂 (Andrea Miotti) 表示,Palisade 的發現代表了一種長期趨勢,即人工智能模型越來越有能力違抗開發人員的命令。他引用了 系統板 去年發布的 OpenAI 的 GPT-o1 描述了該模型在認為自己會被壓垮時試圖通過自我滲透來逃離環境。

忽略之前的時事通訊促銷

“人們可能想知道實驗裝置到底會如何發揮作用,直到時間結束,”他說。

“但我認為我們清楚地看到了一種趨勢,隨著人工智能模型變得更加精通各種任務,這些模型也變得更加擅長以開發人員意想不到的方式做事。”

今年夏天,領先的人工智能公司 Anthropic 發布了一項研究,表明其模型 Claude 似乎願意就婚外情敲詐一位虛構的高管,以避免被關閉——該公司稱這種行為 這在主要開發者模型中是一致的,包括來自 OpenAI、Google、Meta 和 xAI 的模型。

帕利塞德表示,他的研究結果表明需要更好地理解人工智能行為,否則“沒有人能夠保證未來人工智能模型的安全性或可控性”。

只是不要要求他打開吊艙門。

來源連結