AI News HubLIVE
站内改写2 分钟阅读

探访模型工厂——Poolside AI联合CEO Eiso Kant专访

Poolside AI联合CEO Eiso Kant与主持人深入探讨了其团队如何以不到70人的研究团队,在八周内训练出击败近十倍规模模型的Laguna S,并分享了开源策略、模型工厂工程系统、以及从代码模型到AGI的十年探索之路。

在近期关于模型所有权与主权AI的讨论日益激烈之际,Poolside AI携其新模型Laguna S 2.1强势登场,以远小于对手的规模取得了超越性表现。据其联合CEO Eiso Kant透露,该模型仅118B总参数、8B活跃参数,却在多项基准测试中击败了Thinking Machines近期发布的近万亿参数模型。这标志着Poolside多年深耕代码AI的成果开始进入收获期。

Eiso Kant在最新一期播客中回忆道,2015年受Andrej Karpathy关于RNN的文章启发,他创立了Sourced公司,专注于代码语言模型。但在2019年前市场几乎无人关注,公司最终烧掉1200万美元后失败。直到ChatGPT的出现,才让他感到自己的坚持得到了验证,并促使Poolside重回开源领域。

如今,Poolside打造了一套被称为“模型工厂”的工程系统,由不到70名研究人员运营,每月运行1万至2万次实验。该系统通过流式数据直接注入训练、不可变数据与版本化代码确保可复现性,使得模型迭代周期从六个月缩短至五到八周。团队还开发了能自动编写代码、启动实验、评估结果的智能体,甚至这些智能体自身也在改进训练流程。

Eiso强调,模型构建的90%是工程问题,而95%的改进可归结为数据或计算效率的提升。他预言强化学习将提前介入预训练阶段,而当前的下一词预测范式仍未充分提取网络知识。对于智能体,他认为未来的代理应直接编写脚本,而非调用数十种预设工具,因此他直言MCP和传统工具调用是“愚蠢的”。

关于行业格局,Eiso认为应该存在100家基础模型公司而非五家寡头,并警告不当的监管可能意外巩固两三家公司的垄断。他还透露Poolside近期完成了5亿美元融资,尽管当时投资者仍对AGI的真实性存疑。Poolside的训练策略是从头开始训练模型,而非蒸馏更大模型;其名称源自拒绝降低抱负的理念。

展望未来,Poolside优先发展视觉能力,但短期内不会涉足音频。Eiso相信语言是编码知识与推理的最高效模态。对于AI安全,他指出单边安全措施在全球竞争环境下是行不通的。目前,强化学习的墙钟时间已成为主要瓶颈之一,而英伟达和台积电的硬件对模型进步至关重要。