來自 Anthropic 和蘇黎世聯邦理工學院的科學家參與的新研究表明,現代人工智慧系統可以識別所謂匿名線上帳戶背後的現實世界身份。該研究由 A 發表 arXiv 上的預印本它表明大型語言模型(LLM)可能能夠分析線上活動並將匿名個人資料大規模地與真實個人聯繫起來。
這項名為「與法學碩士進行大規模在線去識別」的研究探討了人工智慧代理如何自動進行去身份識別——將匿名或假名線上帳戶與真實身份聯繫起來的過程。傳統上,這個過程需要分析師進行大量的手動調查,他們梳理散佈在網路上的貼文、寫作風格和線索。然而,研究人員已經證明,現代人工智慧模型可以自動執行其中許多步驟。
在這項研究中,人工智慧系統分析了來自線上平台的公共文本,並提取了與身分相關的線索,例如個人興趣、人口統計線索、寫作風格以及貼文中透露的附帶細節。然後,人工智慧在網路上搜尋匹配的個人資料,並評估線索是否與已知個體匹配。
為了測試這種方法,研究人員創建了幾個具有已知真實身份的資料集
一項實驗試圖將 Hacker News 用戶與他們的 LinkedIn 個人資料進行匹配,即使在刪除了姓名和用戶名等明顯的識別碼之後也是如此。另一個資料集包括將 Reddit 帳戶連結到不同社區的假名。第三個資料集將單一使用者的貼文歷史記錄分成兩個單獨的個人資料,以查看人工智慧是否可以確定它們屬於同一個人。
結果表明,基於 LLM 的系統顯著優於傳統的去識別技術。在某些情況下,模型的召回率高達 68%,準確率約為 90%,這意味著 AI 可以正確識別許多計算,同時保持相對較低的錯誤率。在相同的實驗中,傳統方法的成功率幾乎為零。
研究人員表示,這些發現凸顯了人工智慧如何複製過去需要人類調查人員花費數小時才能完成的任務。人工智慧系統可以自動從文字中提取與身分相關的特徵,在數千個個人資料中搜尋潛在的匹配項,並確定為什麼該候選人是最有效的。
這項發展很重要,因為長期以來,匿名一直被認為是許多網路使用者的基本保護
記者、舉報人、活動人士和希望討論敏感話題而不透露真實身份的普通個人廣泛使用假名帳戶。
該研究表明,隨著人工智慧系統更好地關聯跨平台的數位線索,這一層保護(有時被稱為「實際不透明性」)可能會減弱。如果自動化工具能夠快速且廉價地完成這項工作,那麼識別匿名用戶的障礙就可以大大降低。

研究人員估計,使用他們的實驗管道識別線上帳戶的成本可能在每個個人資料 1 到 4 美元之間,這意味著可以相對便宜地進行大規模調查。
然而,作者也指出,這項研究是在受控環境下使用公共數據進行的。論文尚未經過同行評審,研究人員刻意隱瞞了一些技術細節,以降低誤用的風險。
然而,研究結果已經引發了隱私專家和技術專家的爭議
這項研究表明,個人可能需要重新考慮他們在網路上披露了多少個人資訊——即使在看似匿名的地方也是如此。展望未來,研究人員表示,需要做更多的工作來了解人工智慧匿名化的潛在風險和防禦措施。潛在的解決方案可能包括改進的隱私工具、更強大的平台保護措施或旨在在公開共享敏感資料之前對其進行匿名化的人工智慧系統。
隨著人工智慧分析大量線上內容的能力越來越強,該研究凸顯了一個日益嚴峻的挑戰:平衡人工智慧驅動的發現的力量與數位時代保護個人隱私的需要。









