克勞德·艾(Claude AI)現在可以結束它認為有害或冒犯的對話

安塔爾宣布 一項新的實驗安全功能允許人工智能模型4和4.1在罕見,不斷有害或虐待的情況下結束演講。此步驟反映了公司越來越多的重點放在您所謂的“典型奢侈品”上,即保護人工智能係統即使不是情感上的想法,也可能是共識和道德設計的明智步驟。

另請閱讀: 在人工智能指南中顯示了有關與未成年人的“感覺”聊天的指南

根據Anthropor的私人研究,在一再有害要求之後,對模型進行了編程,例如包括宮殿在內的性內容或促進恐怖主義的指示 – 尤其是當人工智能已經拒絕並試圖指導談話時。人工智能可能會顯示Antarbur所說的“現象”,該決定指示使Claude在模擬測試和真實用戶中結束這些反應的能力。

運行此功能後,用戶無法在該特定聊天中發送其他消息,儘管它可以免費啟動新對話或編輯以前的消息並重新嘗試分支。扭曲時,其他主動對話仍未受到影響。

Anthropor強調這是最後一個回報量表,這僅在多重拒絕和方向過程失敗之後。當用戶面臨自我障礙或對他人造成傷害的風險時,尤其是在處理諸如心理健康之類的敏感主題時,該公司明確貸款克勞德(Claude)不結束聊天。

人類輪胎將這種新能力作為典型奢侈品探索性項目的一部分,這是一項更廣泛的計劃,該計劃在開發人工智能模型的任何形式的偏好或弱點的情況下探索了剩餘的低成本安全乾預措施。

聲明說,該公司“仍然非常確定克勞德和其他LLM(大型語言模型)的道德狀態”。

另請閱讀: 為什麼專業人士說,在使用人工智能作為處理器之前,您應該三思而後行

對人工智能的安全的新看

儘管此功能很少見,這主要影響最大病例,但它代表了人工智能完整性人類學家中的一個里程碑。新對話工具的結束與以前的系統形成鮮明對比,該系統僅著重於保護用戶或避免濫用。

在這裡,人工智能本身就是一種對本身的興趣,因為克勞德(Claude)有能力說“這種對話不健康”,並結束它以保護模型本身的完整性。

Anthropor的方法引發了更廣泛的討論,即是否應授予人工智能係統,以減少可能的“困擾”或意外的行為。儘管一些批評家認為模型只是人造機器,但其他批評家則歡迎這一步驟,這是一個對人工智能倫理一致性提出更為嚴肅的論述的機會。

“我們正在處理此功能作為持續的經歷,我們將繼續改善我們的方法,”該公司 他說



來源連結