當人工智能模型的發布立即催生出表情包和其他文本,宣稱這個行業已經成熟時,你就知道你已經有了一些值得突破的東西。
週二,谷歌發布了 Gemini 3,引起了廣泛關注。公司 被稱為 該模型就是“新智能時代”,第一天就被整合到谷歌搜索中。它在各種基準測試中均優於 OpenAI 和其他競爭對手產品,並在眾包 AI 評估平台 LMArena 上名列前茅,該平台是 Billboard 的 AI 模型排行榜 Hot 100。發布後 24 小時內,超過 100 萬用戶在 Google AI Studio 和 Gemini API 中試用了 Gemini 3。谷歌 AI Studio 和 Gemini API 的產品負責人、谷歌 DeepMind 的 Logan Kilpatrick 表示:“從第一天採用的角度來看,這是我們模型發布以來所見過的最好的。” 邊緣。
OpenAI 首席執行官 Sam Altman 和 xAI 首席執行官埃隆·馬斯克也公開祝賀 Gemini 團隊的出色工作。和 Salesforce 首席執行官馬克·貝尼奧夫 寫道 每天使用 ChatGPT 三年後,在 Gemini 3 上呆了兩個小時後,一切都發生了變化:“天哪……我不會回去。太瘋狂了 – 推理、速度、圖像、視頻……一切都清晰而快速。感覺世界又變了。”
“這不僅僅是排行榜的洗牌,”LMArena 聯合創始人兼首席技術官 Wei-Lin Jiang 說道。蔣說 邊緣 Gemini 3 Pro在編碼、匹配和創意寫作等專業類別上擁有“明顯領先”,其代理編碼能力“在很多情況下已經超越了Clad 4.5和GPT-5.1等頂級編碼模型”。它在視覺理解方面名列前茅,並且是第一個在平台文本排行榜上突破 1500 分的模型。
蔣說,新模型的表現“表明人工智能軍備競賽將由能夠更抽像地推理、更一致地概括並在日益多樣化的現實世界評估中產生可靠結果的模型來塑造。”
DataRobot 首席軟件工程師 Alex Conway 說道 邊緣 Gemini 3 最重要的進步之一是名為 ARC-AGI-2 的特定邏輯基準測試。 Gemini 的得分幾乎是 OpenAI 的 GPT-5 Pro 的兩倍,但每項任務的運行成本約為其十分之一,這“確實挑戰了這些模型處於穩定狀態的觀念”,他說。 Conway 指出,在 SimpleQA 基準測試中(包括涉及廣泛主題的簡單問題和答案,需要大量專業知識),Gemini 3 Pro 的得分是 OpenAI 的 GPT-5.1 的兩倍。 “根據具體情況,它非常適合更多利基主題以及深入研究前沿研究和科學領域,”他說。
但排行榜並不是一切。為狹窄的基準訓練模型比通用的成功更重要——在高壓的人工智能世界中,這可能很誘人。因此,要了解系統的運行情況,您需要依賴現實世界的測試、軼事經驗和復雜的用例。
邊緣 與每天在工作中使用人工智能的學科專家進行了交談。共識:Gemini 3 看起來令人印象深刻,它在各種任務上都表現出色,但當涉及到邊緣情況和特定行業利基時,大多數專業人士不會很快更換他們當前的型號。
大多數人 邊緣 儘管 Gemini 3 在該領域取得了進展,但 Anthropics 表示計劃繼續使用 Clad 來滿足其編碼需求。也有人說 Gemini 3 在用戶交互方面並不完美。卡內基梅隆大學助理教授兼 Ai2 的研究科學家 Tim Dettmers 表示,雖然它是一個“偉大的模型”,但在用戶體驗方面卻有點原始,這意味著“它不完全遵循說明”。
Tulsi Doshi,Google DeepMind for Gemini 和 Zen Media 產品管理高級總監 邊緣 該公司優先考慮以“非常真實的方式”將 Gemini 3 引入各種 Google 產品。當被問及遵循說明的擔憂時,她說了解“人們在哪裡遇到了一些癥結”是有幫助的。
她還表示,由於 Pro 型號是 Gemini 3 套件中的第一個版本,後續型號將有助於“克服這種擔憂”。
湯森路透首席技術官 Joel Hron 表示,該公司有自己的內部基準,在與工作最相關的領域對內部模型和公眾進行排名,例如比較兩份長達數百頁的文件、解釋一份長文件、理解法律合同以及在法律和稅務領域進行推理。到目前為止,Gemini 3 是其中表現最強的,並且“比 Gemini 2.5 有了顯著的提升”,他說。目前它的性能優於一些 Anthropics 和 OpenAI 模型。
放射學人工智能初創公司 Cognita 的聯合創始人兼首席執行官 Louis Blankemeier 表示,就“純粹的數字”而言,Gemini 3 是“超級令人興奮的”。但是,他說,“我們仍然需要一些時間來弄清楚這個模型在現實世界中的效用是什麼。” Blankemeier 說,對於更一般的領域,Gemini 3 是一顆明星,但當他用它進行放射學時,它很難正確檢測胸部 X 光片上的細微肋骨骨折,以及不尋常或罕見的情況。他稱放射學在很多方麵類似於自動駕駛汽車,有許多邊緣情況——因此,隨著時間的推移,一個更強大的新模型可能仍然不如根據自定義數據進行改進和訓練的舊模型那麼有效。 “現實世界是艱難的,”他說。
同樣,為執法調查提供人工智能工具的 Langley 的人工智能主管馬特·霍夫曼 (Matt Hoffman) 也看到了由 Gemini 3 Pro 驅動的 Nano Banana Pro 圖像生成器的前景。圖像生成器使 Langi 能夠創建令人信服的合成數據集進行測試,同時保證真實、敏感的研究數據的安全。雖然基準令人印象深刻,但它們可能無法映射到公司的實際用例。 “我不相信 Longi 能夠改變我們在 Gemini 3 生產中使用的模型並立即看到改進,”他說。
其他公司也表示他們對 Gemini 感到興奮,但不一定用它來取代其他一切。建築貸款初創公司Built目前使用谷歌、Anthropic、OpenAI等公司的混合基礎模型來分析建築繪圖請求——發票和工作證明等文件包,通常發送給建築貸款人,要求支付資金。工程副總裁 Thomas Schlegel 表示,這需要對文本和圖像進行多模態分析,以及用於將關鍵代理任務委派給其他人的大型上下文窗口。 邊緣。這是 Google 對 Gemini 3 承諾的一部分,因此該公司目前正在探索將其遷移到 2.5。
“過去我們認為 Gemini 是全能工作中最好的,而 Gemini 3 看起來也是在這一點上向前邁出了一大步,”Schlegel 說。 “這就是我們對雙子座的熱愛。”但他仍然不認為它會取代所有其他模型,包括用於編碼任務的 Cloud 和用於業務推理的 OpenAI 產品。
對於 AI 代理平台 PromptQL 聯合創始人兼首席執行官 Tanmai Gopal 來說,Gemini 3 引起的轟動是有道理的,但對於谷歌的競爭對手來說,“這肯定不是一切的終結”。由於人工智能模型變得越來越好、越來越便宜,而且它們的發布週期很快,“一個人總是會領先一段時間。” (比如Gemini 3出來的第二天,OpenAI 已發布 (GPT-5.1-Codex-Max,對一周前模型的更新,以在某些編碼基准上挑戰 Gemini 3。)
Gopal 表示,PromptQL 仍在進行內部評估,以確定團隊的模型選擇是否會改變,但“早期結果並不一定比他們當前的陣容好很多”。他表示,他當前的優先代碼產品是 Cloud、用於網絡搜索的 ChatGPT 和用於“深度頭腦風暴”的 GPT-5 Pro,但他可能會將 Gemini 3 添加為默認模型,因為它“可能最適合創意、文本和(和)圖像方面的用戶任務”。
和幾乎所有型號一樣,Gemini 3 也患有我所說的“機械手綜合症”——人工智能係統出色地完成了一項複雜的任務,但以前的機械手卻對拿著汽水罐這一簡單問題感到困惑。著名研究員安德烈·卡帕蒂 (Andrej Karpati),OpenAI 創始成員,特斯拉前人工智能總監, 寫道 在 X 中測試 Gemini 3 後,他指出“昨天在個性、寫作、氛圍編碼、幽默等方面得到了積極的反饋,非常紮實的日常駕駛能力,顯然是一級法學碩士。” 他拒絕相信他 當他說 2025 年,然後他說他忘記打開 Google 搜索時。 (在最初的測試中,他確認給他的是一個帶有舊系統提示的模型。)
在 邊緣根據我們自己測試 Gemini 3 的經驗,我們發現它“表現相當不錯 – 但有一些注意事項”。它永遠不會名列前茅,但對公司來說這是一個明顯的進步。
赫蘭說:“你會從一個模型轉到另一個模型,一個月又一個月,當這個混亂的遊戲中出現新的東西時。” “但我喜歡谷歌發布的一點是,它在模型的許多方面都做出了重大改進——所以它並不是說它在編碼或推理方面做得更好……它真的是全面地好一點。”










