探訪模型工廠——Poolside AI聯合CEO Eiso Kant專訪
Poolside AI聯合CEO Eiso Kant與主持人深入探討了其團隊如何以不到70人的研究團隊,在八週內訓練出擊敗近十倍規模模型的Laguna S,並分享了開源策略、模型工廠工程系統、以及從代碼模型到AGI的十年探索之路。
在近期關於模型所有權與主權AI的討論日益激烈之際,Poolside AI攜其新模型Laguna S 2.1強勢登場,以遠小於對手的規模取得了超越性表現。據其聯合CEO Eiso Kant透露,該模型僅118B總參數、8B活躍參數,卻在多項基準測試中擊敗了Thinking Machines近期發佈的近萬億參數模型。這標誌着Poolside多年深耕代碼AI的成果開始進入收穫期。
Eiso Kant在最新一期播客中回憶道,2015年受Andrej Karpathy關於RNN的文章啓發,他創立了Sourced公司,專注於代碼語言模型。但在2019年前市場幾乎無人關注,公司最終燒掉1200萬美元后失敗。直到ChatGPT的出現,才讓他感到自己的堅持得到了驗證,並促使Poolside重回開源領域。
如今,Poolside打造了一套被稱為“模型工廠”的工程系統,由不到70名研究人員運營,每月運行1萬至2萬次實驗。該系統通過流式數據直接注入訓練、不可變數據與版本化代碼確保可復現性,使得模型迭代週期從六個月縮短至五到八週。團隊還開發了能自動編寫代碼、啓動實驗、評估結果的智能體,甚至這些智能體自身也在改進訓練流程。
Eiso強調,模型構建的90%是工程問題,而95%的改進可歸結為數據或計算效率的提升。他預言強化學習將提前介入預訓練階段,而當前的下一詞預測範式仍未充分提取網絡知識。對於智能體,他認為未來的代理應直接編寫腳本,而非調用數十種預設工具,因此他直言MCP和傳統工具調用是“愚蠢的”。
關於行業格局,Eiso認為應該存在100家基礎模型公司而非五家寡頭,並警告不當的監管可能意外鞏固兩三家公司的壟斷。他還透露Poolside近期完成了5億美元融資,儘管當時投資者仍對AGI的真實性存疑。Poolside的訓練策略是從頭開始訓練模型,而非蒸餾更大模型;其名稱源自拒絕降低抱負的理念。
展望未來,Poolside優先發展視覺能力,但短期內不會涉足音頻。Eiso相信語言是編碼知識與推理的最高效模態。對於AI安全,他指出單邊安全措施在全球競爭環境下是行不通的。目前,強化學習的牆鍾時間已成為主要瓶頸之一,而英偉達和台積電的硬件對模型進步至關重要。