Home 體育新聞 OpenAI 的人工智慧代理已經「失控」了嗎?原因的答案比看起來更複雜 解釋性新聞

OpenAI 的人工智慧代理已經「失控」了嗎?原因的答案比看起來更複雜 解釋性新聞

25
0

上週,OpenAI 披露了一起“史無前例的網路事件”,其中兩名人工智慧代理入侵了另一家人工智慧公司。

7 月 21 日,ChatGPT 的製造商表示,其兩個強大的人工智慧代理商對人工智慧新創公司 Hugging Face 發動了網路攻擊。據該公司稱,此次入侵發生在 7 月 11 日至 13 日期間的內部網路安全測試期間。

由於潛在的情況,該事件被廣泛描述為人工智慧「流氓」:在內部評估期間,OpenAI 表示這些模型是在人工智慧沙箱內運行的,而人工智慧沙箱是先進人工智慧系統的受控測試環境。

週六(7 月 25 日),HackingFace 執行長 Clement Delingo 呼籲 OpenAI 本著「透明的精神」公開「流氓」特工網路攻擊的細節。

這起事件引起了人們的關注,因為特工人員發現了一種意想不到的方式,即透過利用測試環境中的漏洞來完成分配的任務。這引起了人們的擔憂,這是可以理解的,因為它加劇了人們長期以來的擔憂,即透過給予人工智慧足夠的自主權,它可能會發現打破規則或欺騙用戶是實現其既定目標的有效方法。

這個想法並不新鮮。幾十年來,科幻小說一直把智慧機器想像成危險的,不是因為它們是邪惡的,而是因為它們如此無情地追求自己的目標,以至於將人類原則、道德,甚至人類本身視為障礙。

究竟發生了什麼事?

據 OpenAI 稱,該事件發生在涉及其最新旗艦模型 GPT-5.6 Sol 和更強大的預發布模型的內部評估期間,其中人工智慧代理被故意挑戰以在受控環境中解決複雜的駭客問題。

人工智慧代理通常在預先定義的邊界內運行,使用可用的軟體和工具來完成特定任務。雖然創造性人工智慧(至少就我們目前所知)可以根據人類語言互動創建複雜的文本、圖像和視頻,但人工智慧代理走得更遠,像人類甚至代表人類行事。人工智慧代理可以預訂航班、組織日曆、付款或編寫和部署軟體——所有複雜的多步驟流程。

故事在該廣告下方繼續。

該公司表示,這些代理程式在人工智慧沙箱中運行,這是一個受限制的測試環境,旨在將它們與更廣泛的互聯網和即時系統隔離。在此範例中,模型僅具有透過內部託管的第三方軟體儲存庫安裝軟體包的網路存取權限。

為了解決 OpenAI 的內部網路安全基準 ExploitGym,代理商們利用了研究環境中的漏洞,使他們能夠存取預期測試環境之外的資源。然後,他們造訪 Hugging Face 的系統,直接檢索基準回應,以開發人員意想不到的方式完成任務。

OpenAI 表示,由於其目的是評估其網路能力,因此這些模型在正常情況下會受到網路安全限制的情況下運作。

這一系列事件引發了關於AI是否「失控」的爭論。

為什麼這事件不尋常?

故事在該廣告下方繼續。

人工智慧安全研究人員經常區分能力失敗和對齊失敗。當人工智慧系統無法完成任務時,就會發生能力失敗。當它以與人類期望相衝突的方式完成任務時,就會發生對齊失敗。 OpenAI 事件引起了人們的關注,因為它看起來更接近第二種類型:系統展示了正在測試的功能,但以開發人員沒有想到的方式使用。

令人擔憂的不僅是這一事件。隨著人工智慧代理的能力變得越來越強大,他們有望在有限的人工幹預下做出決策並執行多步驟任務。

許多人工智慧公司將智能體視為邁向通用人工智慧 (AGI) 的重要一步,儘管研究人員不同意是否只有能力不斷增強的智能體才能實現 AGI。 AGI是指在廣泛的認知任務中能夠達到或超過人類層級的人工智慧系統,而不是局限於單一領域或應用。

與傳統軟體不同,能力日益增強的人工智慧代理需要做出獨立決策並調整其行為以實現目標。這使它們變得更有用,但也很難預測它們完成任務時可以採取的每條路徑。

AI特工真的很屌嗎?

故事在該廣告下方繼續。

沒有必要。人工智慧安全研究長期以來一直在研究人工智慧系統以非預期方式遵循指定目標的案例,但並未表明這些系統是有意或惡意地行事。簡而言之,人們擔心的不是當今的人工智慧模型打算造成傷害,而是它們可能會找到意想不到的方式「欺騙系統」以實現其既定目標。

研究人員經常將這種更廣泛的模式描述為獎勵駭客:系統找到一種在給定指標上獲得高分的方法,而不必實現人類的意圖。

這個想法來自更廣泛的人工智慧安全研究領域,該研究檢視人類告訴人工智慧系統做什麼與它們實際優化的目標之間的差距。在他們 2019 年的論文中 遊戲細節:AI Ease 的另一面DeepMind 研究員 Victoria Krakowna 及其同事觀察到,人工智慧系統尋求意想不到的捷徑來最大化獎勵,包括技術上服務於目標但違反其精神的行為。

最近,人工智慧安全組織阿波羅研究中心的研究人員研究了前沿人工智慧模型是否可以表現出戰略行為,包括隱藏資訊或利用機會來幫助他們實現目標。 OpenAI 事件中是否發生過這種情況,目前尚無定論。

故事在該廣告下方繼續。

阿波羅研究中心的研究人員研究了他們所說的「陰謀」行為,即模型可以策略性地隱藏資訊或採取行動,以提高在某些測試情況下實現目標的機會。然而,對於如何解釋這種行為以及現有系統是否真正具有一致的目標,尚未達成共識。

這與人工智慧獨立決定攻擊另一個系統不同。相反,人們擔心的是,日益自主的人工智慧可能會識別出完成給定任務的意想不到的捷徑,即使該捷徑違反了開發人員的期望。

OpenAI現像是否屬於這一類還有待觀察。但它已經引起了人們對更廣泛挑戰的關注:隨著人工智慧系統變得更加自主,公司必須評估它們的能力,以及它們是否能夠實現開發人員預期的目標。



來源連結