Home 综合新闻 我在谷歌新的人工智能世界生成器中建造了棉花糖城堡

我在谷歌新的人工智能世界生成器中建造了棉花糖城堡

60
0

谷歌 DeepMind 正在開放對 Project Genie 的訪問,這是其人工智能工具,用於根據文本提示或圖像創建交互式遊戲世界。

從周四開始,美國的 Google AI Ultra 用戶可以嘗試實驗性搜索原型,該原型由 Google 最新的世界級 Genie 3、Nano Banana Pro 圖像生成模型和 Gemini 組合提供支持。

此舉是在 Genie 3 研究預覽發布五個月後進行的,是 DeepMind 競相開發更強大的全球模型之際收集用戶反饋和訓練數據的更廣泛活動的一部分。

全局模型是生成環境內部表示的人工智能係統,可用於預測未來結果和計劃行動。許多人工智能領導者,包括 DeepMind 的領導者,認為全局模型是實現通用人工智能 (AGI) 的關鍵一步。但在短期內,像 DeepMind 這樣的實驗室設想了一個進入市場的計劃,從視頻遊戲和其他形式的娛樂開始,並擴展到在模擬中訓練實體代理(又名機器人)。

DeepMind 發布 Project Genie 之際,全球建模競賽開始升溫。李飛飛的世界實驗室去年年底發布了第一個商業產品,名為 Marble。 AI視頻製作初創公司Runway最近也推出了全球模式。 AMI Labs 初創公司前 Meta 首席科學家 Yann LeCun 也將專注於開發世界模型。

DeepMind 研究總監 Shlomi Fruchter 通過視頻採訪告訴 TechCrunch,“我認為能夠讓更多人訪問它並向我們提供反饋是令人興奮的”,他笑得合不攏嘴,顯然對 Project Genie 的發布感到興奮。

TechCrunch 採訪的 DeepMind 研究人員坦率地談到了該工具的實驗性質。它們可能不一致,有時會產生令人印象深刻的可玩世界,有時會產生令人困惑的結果,無法達到目標。這是它的工作原理。

TechCrunch 活動

馬薩諸塞州波士頓
|
2026 年 6 月 23 日

用棉花糖和糖果搭建的粘土主題空中城堡圖片來源:TechCrunch

您首先通過為環境和主角提供文本提示來“繪製世界”,稍後您將能夠從第一人稱或第三人稱視角操縱世界。 Nano Banana Pro 根據提示創建圖像,理論上您可以在 Genie 使用該圖像作為交互式世界的起點之前對其進行編輯。這些調整在很大程度上是有效的,但是當你要求綠色時,模型偶爾會絆倒並給你紫色的頭髮。

您還可以使用現實生活中的圖像作為模型構建世界的基線,而這個世界又是偶然的。 (稍後會詳細介紹。)

一旦您對圖像感到滿意,Project Genie 將花費幾秒鐘來創建一個可探索的世界。您還可以根據現有的提示,或在畫廊中探索精心策劃的世界,或通過隨機發生器尋找靈感,將現有的世界重新混合成新的解釋。然後,您可以下載您剛剛探索的世界的視頻。

DeepMind 目前僅提供 60 秒的全局生成和移動性,部分原因是預算和計算限制。因為精靈3是 自回歸模型,它需要大量的專用計算——這對 DeepMind 可以為用戶提供的計算量設置了嚴格的上限。

“我們將其限制為 60 秒的原因是我們希望將其提供給更多用戶,”Fruchter 說。 “基本上,當您使用它時,會有一個專門適合您的部分並分配給您的會話。”

他補充說,將時間延長到超過 60 秒會降低測試的附加價值。

“這些環境很有趣,但在某些時候,由於其交互性水平,環境的活力有些有限。但是,我們認為這是一個我們希望改進的限制。”

奇思妙想有用,現實主義不行

谷歌去年收到迪士尼的禁令,因此將不再生產與迪士尼相關的模型圖片來源:TechCrunch

當我使用該模型時,安全屏障已經啟動並運行。我無法製作任何類似裸體的東西,也無法創造出哪怕對迪士尼或其他受版權保護的材料有一點啟發的世界。 (去年 12 月,迪士尼對谷歌發出了停止令,指責該公司的人工智能模型通過對迪士尼角色和知識產權進行培訓以及創建未經授權的內容等侵犯了版權。)我什至無法讓珍妮生成美人魚探索水下幻想世界或冰雪女王在冬季城堡中的世界。

然而,演示非常令人印象深刻。我建造的第一個世界是為了實現我童年時的一點幻想,在那裡我可以探索一座由棉花糖製成的雲中城堡,還有一條巧克力醬河和由糖果製成的樹。 (是的,我是個胖孩子。)我讓模特用粘土動畫的方式來做,她呈現了一個我小時候會吃過的奇怪世界;城堡的白色和柔和的砲塔和塔樓看起來蓬鬆而美味,足以撕下一塊並將其浸入巧克力護城河中。 (上面的視頻)。

受《權力的遊戲》啟發的世界未能產生我想要的逼真圖像圖片來源:TechCrunch

然而,Project Genie 仍有一些問題需要解決。

這些模型擅長根據藝術提示創建世界,例如使用水彩、卡通風格或經典動漫美學。但當涉及到現實或電影世界時,它們往往會表現不佳,通常看起來像電子遊戲,而不是真實環境中的真人。

當給她拍攝真實的照片時,她的反應也並不總是很好。當我給他一張我辦公室的照片並要求他根據照片創建一個完全一樣的世界時,他給了我一個世界,其中包含一些與我辦公室相同的家具——木桌、植物和灰色沙發——但排列方式不同。它看起來毫無生氣、數字化,而不是栩栩如生。

當我向它提供一張我的桌子上有毛絨玩具的圖片時,Project Genie 會在玩具在空間中移動時為它設置動畫,甚至當它在它旁邊移動時有時還會與其他物體進行交互。

DeepMind 正在努力改進這種交互。有好幾次我的角色穿過牆壁或其他固體物體。

我讓 Project Genie 搬走一隻毛絨動物 (Bingo Bronson),這樣她就可以探索我的辦公室圖片來源:TechCrunch

當 DeepMind 最初發布 Genie 3 時,研究人員強調了該模型的自回歸架構如何意味著它可以記住它所創建的內容,因此我想通過返回它已經創建的部分環境來測試它,看看它是否相同。在大多數情況下,該模型是有效的。在一個例子中,我創建了一隻貓在探索另一張桌子,只有一次當我回到桌子的右側時,模型才創建了第二個杯子。

我發現最令人沮喪的部分是使用箭頭環顧四周、使用空格鍵跳躍或攀爬以及使用 WASD 鍵移動來導航空間的方式。我不是遊戲玩家,所以我自然不會想到這種情況,但按鍵經常沒有反應,或者把你引向錯誤的方向。試圖從房間的一側走到另一側的門口常常會變成一種混亂的蜿蜒練習,就像試圖駕駛一輛輪子壞了的購物車一樣。

Fruchter 向我保證,他的團隊已經意識到這些缺陷,並再次提醒我 Project Genie 是一個實驗原型。他表示,未來團隊希望增強真實感並提高交互能力,包括讓用戶對動作和環境有更多的控制權。

“我們並不認為(Project Genie)是一個人們每天都可以回來使用的綜合產品,但我們認為已經可以看到一些有趣且獨特的東西,這是其他方式無法做到的,”他說。

來源連結