Google 推出 Gemini 3.1 Pro:基準測試以及如何試用

谷歌週四發布了最新的基礎推理模型Gemini 3.1 Pro。 Google表示,Gemini 3.1 Pro 在 ARC-AGI-2(衡量模型邏輯的流行基準測試)上的驗證效能是 3 Pro 的兩倍。

谷歌最初在 11 月發布了 Gemini 3 和 3 Pro,這次新發布顯示了人工智慧公司推出新模型和更新模型的速度有多快。 Gemini 3.1 Pro 是為 Gemini 和許多 Google 人工智慧工具(例如 Gemini 3 Deep Think)提供支援的新基礎模型。谷歌表示,它的目的是提供更具創意的解決方案。

“3.1 Pro 專為那些簡單答案不足以解決的任務而設計,它能夠推進前瞻性思維,使其能夠應對最棘手的挑戰。” 谷歌部落格文章 國家。 「這種增強的智慧可以幫助實際應用——無論您是在尋找對複雜主題的清晰、直觀的解釋,將數據編譯成單一視圖的方法,還是將創意項目變為現實。”

參見:

GPT-5.2 vs Gemini 3 – 這兩個重量級模型在基準、價格和功能集方面如何比較

以下是迄今為止我們所了解的有關 Gemini 3.1 Pro 的所有信息,包括它與 Anthropic 和 OpenAI 的最新模型的比較,以及如何親自嘗試。

如何試用 Gemini 3.1 專業版

從今天開始,Google 將在 Gemini App、Gemini APIA 和 Notebook LM 中推出 Gemini 3.1 Pro。免費用戶將可以在Gemini應用程式中試用3.1 Pro,但GoogleAI Pro和AI Ultra方案的付費用戶將擁有更高的使用率。在 Notebook LM 下,至少目前只有這些付費用戶才能存取版本 3.1 Pro。程式設計師和企業用戶還可以透過Developers存取新平台,企業可以透過AI Studio、Antigravity、Vertex AI、Gemini Enterprise、Gemini CLI和Android Studio存取3.1。

Gemini 3.1 Pro 已經可供使用 Gemini 的 Mashable 編輯使用。要親自嘗試一下,請前往 桌面上的雙子座 或打開 Gemini 行動應用程式。

離開:
同一動畫的兩個結果。
信用:Google

正確的:
信用:Google


為什麼 Gemini 3.1 Pro 很重要?

當Google在 11 月發布 Gemini 3 Pro 時,該模型令人印象深刻,以至於促使 OpenAI 執行長 Sam Altman 宣布代碼為紅色。據報道,隨著 Gemini 3 Pro 登上 AI 排行榜榜首,OpenAI 開始將 ChatGPT 用戶流失到 Gemini 手中。最新的ChatGPT基礎模型GPT-5.2排名下降 像競技場一樣的排行榜 (以前稱為 LMArena),在 Google、Anthropic 和 xAI 等競爭對手面前失去了重要地​​點。

Gemini 3 Pro 在許多基準測試中的表現已經優於 GPT-5.2,並且憑藉更先進的推理模型,Gemini 可以走得更遠。

Gemini 3.1 Pro:基準效能

谷歌發布的基準效能數據顯示,Gemini 3.1 Pro 的效能優於先前的 Gemini 型號、Claude Sonnet 4.6、Claude Opus 4.6 和 GPT-5.2。然而,根據谷歌自己的說法,OpenAI 的新 codex 模型 GPT-5.3-Codex 在經過驗證的 SWE-Bench Pro 基準測試中擊敗了 Gemini 3.1 Pro。

Gemini 3.1 Pro 基準測試結果的亮點包括:

  • 上次人體測驗得分為 44.4%,而 Cloud Opus 4.6 為 40.0%,GPT-5.2 為 34.5%。

  • ARC-AGI-2 上的 77.1%,相較之下,Gemini 3 Pro 為 31.1%,Claude Opus 4.6 為 68.8%,GPT-5.2 為 52.9%

  • GPQA 鑽石級 94.3%,相較之下,Gemini 3 Pro 為 91.9%,Claude Opus 4.6 為 91.3%,GPT-5.2 為 92.4%

  • 80.6% 在 SWE-Bench 上得到驗證,相較之下,Gemini 3 Pro 為 76.2%,Claude Opus 4.6 為 80.8%,GPT-5.2 為 80.0%

  • SWE-Bench Pro(一般)為 54.2%,相較之下,Gemini 3 Pro 為 43.3%,GPT-5.2 為 55.6%,GPT-5.3-Codex 為 56.8%

  • MMLU 92.6%,而 Cloud Opus 4.6 為 91.1%,GPT-5.2 為 89.6%。

谷歌發布了一張圖片,展示了 Gemini 3.1 Pro 的完整基準測試結果:


揭露:Mashable 的母公司 Ziff Davis 於 2025 年 4 月對 OpenAI 提起訴訟,指控其在訓練和營運其人工智慧系統時侵犯了 Ziff Davis 的版​​權。



來源連結