Home 科學技術 谷歌的 Gemini 3 模型繼續人工智能炒作——目前

谷歌的 Gemini 3 模型繼續人工智能炒作——目前

265
0

Gemini 3是谷歌最新的AI模型

VCG 來自 Getty Images

據該公司稱,谷歌最新的聊天機器人 Gemini 3 在一系列旨在衡量人工智能進展的基準測試中取得了重大進展。這些成就目前足以緩解人們對人工智能泡沫破裂的擔憂,但目前還不清楚這些分數如何轉化為現實世界的能力。

更重要的是,持續存在的事實錯誤和錯覺已經成為所有大型語言模型的標誌,並且沒有任何被解決的跡象,這對於可靠性至關重要的任何用途來說都可能是個問題。

在一篇博文中 在宣布新模型時,谷歌老闆 Sundar Pichai、Demis Hassabis 和 Kore Kavukcuglu 寫道,Gemini 3 具有“博士級推理能力”,競爭對手 OpenAI 在宣布其 GPT-5 模型時也使用了這一短語。作為證據,他們列出了幾項旨在測試“研究生水平”知識的測試的分數,例如人文學科期末考試,其中包含 2500 個來自數學、科學和人文學科的研究級問題。 Gemini 3 在這次測試中得分為 37.5%,擊敗了之前的記錄保持者 OpenAI 的 GPT-5 版本,得分為 26.5%。

像這樣的跳躍表明模型在某些方面更有效 盧克·羅徹 牛津大學的研究人員,但我們必須謹慎對待如何解釋這些結果。 “如果一個模型從基準的 80% 上升到 90%,這意味著什麼?這意味著該模型以前是 80% 的博士水平,現在是 90% 的博士水平?我很難理解,”他們說。 “我們無法確定人工智能模型是否符合邏輯,因為這是一個非常主觀的概念。”

基準測試需要單一答案或多項選擇答案,這些模型有許多限制,不需要它們顯示其性能。 “用多項選擇題來評分(模型)很容易,”羅徹說,“但如果你去看醫生,醫生不會用多項選擇題來評估你。如果你問律師,律師不會用多項選擇題的答案給你法律建議。”還存在這樣的風險:此類測試的答案可能會嵌入到正在測試的人工智能模型的訓練數據中,從而有效地允許它們作弊。

Rocher 表示,對 Gemini 3 和更先進的人工智能模型的真正考驗——以及它們的性能是否足以證明谷歌和 OpenAI 等公司向人工智能數據中心投入的數万億美元是合理的——將取決於人們如何使用該模型以及他們認為該模型的可靠性。

谷歌表示,該模型的改進功能更適合生成軟件、管理電子郵件和分析文檔。該公司表示,將通過用圖形和模擬取代人工智能生成的結果來改進谷歌搜索。

真正的改進可能會讓人們使用人工智能工具自主編寫代碼,這一過程稱為代理編碼。 亞當·邁赫迪 在牛津大學。 “我認為我們已經達到了簡單聊天機器人所能做到的上限,而 Gemini 3 Pro(Gemini 3 的標準版本)的真正好處可能不在於日常聊天,而在於更複雜、更高效的座席工作流程,”他說。

早期反應已包含在網上 人們很欣賞它 雙子座的編碼能力和推理能力,但與所有新模型發布一樣,有一些帖子強調無法完成看似簡單的任務。 手繪痕跡 箭頭是針對不同的人,還是通用的 視覺推理 測試。

在 Gemini 3 的技術規格中,谷歌承認該模型將在一段時間內繼續誤導並產生現實錯誤,其速度與其他流行的 AI 模型相當。他說,這一領域缺乏發展是一個主要問題 阿維拉·加爾塞斯的亞瑟 在倫敦大學聖喬治市。 “問題在於,兩年多以來,所有人工智能公司一直在努力減少幻想,但你只需要一個非常糟糕的幻想就可以永久破壞對系統的信任,”他說。

專案:

來源連結