Guide Labs 推出新型可解釋法學碩士

爭論深度學習模型的挑戰往往在於理解為什麼它要做它所做的事情:無論是 xAI 為微調 Grok 的怪異政策而反覆進行的鬥爭,ChatGPT 與奉承的鬥爭,還是普通的幻覺,深入研究具有數十億參數的神經網絡都不是一件容易的事。

Guide Labs 是一家舊金山新創公司,由執行長 Julius Adebayo 和首席科學長 Aya Abdulsalam Ismail 創立,今天為這個問題提供了答案。週一,該公司獲得了價值 80 億參數的開源 LLM 認證, 斯特林-8B,使用新的架構進行訓練,旨在使其操作易於解釋:模型生成的每個令牌都可以追溯到其在 LLM 訓練資料中的起源。

這可以像識別模型所引用的事實的參考材料一樣簡單,也可以像理解模型對幽默或性的理解一樣複雜。

阿德巴約告訴 TechCrunch:“如果我有一萬億種方式來編碼性,並且我將它們編碼在我的萬億事物中的十億種中,那麼你必須確保找到我編碼的所有這十億種事物,然後你必須能夠可靠地打開和關閉它。” “你可以用現有的模型來做到這一點,但它們非常脆弱……這是一個大問題。”

阿德巴約在麻省理工學院獲得博士學位時開始了這項工作,並與人合著了一本被廣泛引用的書 2018年論文 這表明目前理解深度學習模型的方法並不可靠。這項工作最終創造了一種建立 MBA 的新方法:開發人員在模型中插入一個概念層,將資料分組為可追蹤的類別。這需要預先對數據進行更多註釋,但利用其他人工智慧模型的幫助,他們能夠將該模型訓練為迄今為止最大的概念證明。

「人們做出的這種解釋是……神經科學模型,我們正在顛覆它,」阿德巴約說。 “我們正在做的實際上是從頭開始設計模型,這樣你就不需要研究神經科學了。”

圖片來源:指導實驗室

對這種方法的一個擔憂是,它可能會消除一些使法學碩士如此有趣的新興行為:他們以新的方式概括他們尚未接受過訓練的事情的能力。阿德巴約表示,這種情況仍然在他公司的模型中發生:他的團隊追蹤模型自行發現的所謂“發現的概念”,例如量子計算。

TechCrunch 活動

麻薩諸塞州波士頓
|
2026 年 6 月 9 日

阿德巴約說,這種可解釋的結構將是每個人都需要的。對於面向消費者的法學碩士學生來說,這些技術應該允許模型建構者做一些事情,例如阻止受版權保護的材料的使用,或更好地控制暴力或吸毒等主題的輸出。受監管的行業將需要更易於管理的法學碩士(例如,在金融領域),因為貸款申請人的標準需要考慮財務記錄等因素,而不是種族。科學工作還需要可解釋性,這是 Guide Labs 開發技術的另一個領域。蛋白質折疊對於深度學習模型來說取得了巨大的成功,但科學家需要更深入地了解為什麼他們的程式會發現有希望的組合。

「這個模型表明,訓練可解釋模型不再是一門科學;它現在是一個工程問題,」阿德巴約說。 「我們已經弄清楚了科學原理,我們可以對其進行擴展,而且這種類型的模型沒有理由不能與具有許多參數的前沿模型的性能相匹配」。

Guide Labs 表示,由於採用了新的架構,Steerling-8B 可以實現目前模型 90% 的能力,但使用的訓練資料更少。該公司從 Y Combinator 中分​​離出來,並於 2024 年 11 月籌集了 900 萬美元的種子輪資金,下一步是建立一個更大的模型,並開始向用戶提供應用程式介面 (API) 和代理存取。

阿德巴約告訴 TechCrunch:“我們目前訓練模型的方式非常原始,因此從長遠來看,將固有的可解釋性民主化對於我們在人類中的角色來說實際上是一件好事。” “當我們追求這些超級智能的模型時,你不希望任何對你來說太模糊的決策。”

來源連結