在政治分歧嚴重的時代,研究人員最近發現了一些值得注意的事情。在英國和美國,不同政治派別的人們在他們更喜歡哪種人工智能工具上基本上達成了一致。
儘管人們一直在談論我們之間的分歧,但事實證明,政治並不是我們之間的主要分歧。最能影響我們人工智能偏好的因素要重要得多:我們的年齡。
但這項名為“HUMAINE”的大規模研究中最令人驚訝的發現並不是人們之間的區別。
Prolific 人工智能團隊的研究員。
雖然近一半的討論集中在健身和營養計劃等積極健康方面,但很大一部分討論涉及更敏感的領域。
關於心理健康和特定醫療狀況的對話是最頻繁和最個人化的。
人們公開使用這些模型作為他們心理狀態的參謀、安慰的來源和身體健康的指南。
深度轉型
這表明我們與技術的關係發生了深刻的轉變,並提出了一個有趣的問題:我們目前評估人工智能的方法是否能夠告訴我們它是否做得很好?
誠實的答案是否定的。當人們看到簡單的人工智能排行榜時,最大的誤解是一個數字就可以捕獲“最佳”模型。問題本身並不具體。最擅長什麼?更重要的是,哪個最適合誰?
AI行業已經變得過於注重技術措施。這種狹隘的關注雖然在特定標准上產生了令人印象深刻的結果,但讓我們忽視了影響我們日常使用技術的以人為本的問題。 法學碩士學位。
目前的評估有兩種主要形式。一方面,我們有衡量抽象技能的學術標準,例如模型解決奧林匹克級別數學問題的能力。
另一方面,我們有匿名用戶投票的公共“競技場”。這在抽象的技術效率和現實世界的實用性之間造成了巨大的差距。
這就是為什麼模型在測試中可能看起來像是天才,但當您需要它來規劃複雜的項目或更重要的是處理敏感的健康查詢時,事實證明它是一個無能的助手。
通過以人為本的視角觀察結果,出現了幾個重要的模式。
要點#1:真正的安全危機是隱形的
鑑於許多對話都圍繞心理健康和醫療狀況等敏感話題,人們可能會認為信任和安全措施是一個關鍵的區別因素。事實並非如此。當參與者在這個維度上對模型進行評分時,迄今為止最常見的反應是平局。儀表的噪音非常大。
這並不意味著安全不重要。相反,它表明信任和安全等品質無法在日常對話中可靠地衡量。測試模型道德支柱的場景很少有機地出現。評估這些關鍵品質需要不同的、更專業的方法。
斯坦福大學最近發表的出版物《探索人工智能在心理健康保健中的風險》中強調的工作就是一個有力的例子。他們的研究調查了人工智能是否準備好充當心理健康提供者,並揭示了重大風險。他們發現,模型不僅會在某些情況下延續有害的恥辱,而且還可能因未能認識到用戶的潛在危機而導致危險的有害行為。
這種嚴格的場景化測試正是我們所需要的。令人鼓舞的是,看到此類框架在 CIP 的 weval.org 等平台上作為標準化評估進行操作,允許在這些高風險情況下對模型進行系統測試。我們迫切需要更多此類評估,以及捕捉使用人工智能的長期影響的評估。
想法#2:我們的指標推動無意識的自動化,而不是有意識的協作
這場爭論並不是簡單的選擇 自動化和協作。自動化枯燥、重複的工作是一份禮物。危險在於無意識的自動化,它只涉及優化以完成工作而不考慮人力成本。
這不是一種假設的恐懼。我們已經看到有報導稱,年輕人和應屆畢業生正在努力尋找入門級工作,而曾經屬於職業階梯第一級的任務正在變得自動化。
當開發人員短視地關注效率來構建和衡量人工智能時,我們面臨著員工技能不足的風險,並創造一個服務於技術而不是人的未來。
在這裡,評估變成了方向盤。如果我們唯一的衡量標準是“工作完成了嗎?”,我們將不可避免地構建取代人工智能的人工智能,而不是增強它。但是,如果我們還測量“人類協作者是否學到了一些東西?”呢?或者“最終產品是否因為人類與人工智能的合作而得到改善?”
HUMAINE 的研究表明,模特具有獨特的技能:有些是偉大的思想家,而另一些則是偉大的溝通者。可持續合作的未來取決於評估和衡量這些互動質量,而不僅僅是最終結果。
要點#3:真正的進步在於細微差別
最終,研究中出現了一個明顯的贏家: 谷歌雙子座 2.5 專業版。但她為什麼獲勝是最重要的教訓。它排名第一,因為它在所有指標和所有人口群體中都是最一致的。
這就是成熟技術的樣子。最好的模特不一定是最迷人的;它們是最可靠且使用最廣泛的。可持續進步在於建立全面、可靠的系統,而不僅僅是提高一項狹隘的技能。
這些要點表明,社會和整個社會對人工智能進步的看法必鬚髮生轉變。
它鼓勵我們超越簡單的分類,並就我們的技術的影響提出更深入的問題,例如模型如何在所有人群中表現以及某些群體是否無意中得不到充分的服務。
它還意味著關注協作中人性的一面:人工智能的參與是一種積極的、雙贏的伙伴關係,還是走向自動化的輸贏滑坡?
最終,更成熟的評估科學並不意味著進展更慢;這是關於引導它。它使我們能夠識別和解決我們的盲點,並引導人工智能的發展,不僅在技術上令人印象深刻,而且真正有用。
世界是複雜的、多樣的、微妙的。也到了我們點評的時間了。
我們列出了用於編程的最佳大型語言模型 (LLM)。
本文是 TechRadarPro 專家見解頻道的一部分,我們在此展示當今科技行業最優秀、最聰明的人才。這裡表達的觀點是作者的觀點,並不一定是 TechRadarPro 或 Future plc 的觀點。如果您有興趣做出貢獻,請在此處了解更多信息: https://www.techradar.com/news/submit-your-story-to-techradar-pro








