训练AI科学家复现研究
受法拉第复现电磁学实验启发,Inherent发布27B参数的“AI科学家”Faraday,在复现论文图表任务上超过Claude Opus 4.8和GPT-5.5。通过长程强化学习与编码智能体协作,Faraday学会假设驱动探索,向跨领域创新迈出一步。
1821年,理查德·菲利普斯请朋友迈克尔·法拉第撰写一篇关于新兴电磁学领域的综述。法拉第并不是一个寻常的选择——他几乎没有受过正规教育,在该领域经验有限,但他是一位著名的实验主义者。
为了撰写综述,法拉第决定手动复现过去的实验结果。在皇家研究院烛光地下室进行的实验中,他发现通电导线可以绕磁铁运动。他在日记中写道“非常满意”。法拉第由此发明了电动机。
受此启发,Inherent推出了Faraday——一个270亿参数的“AI科学家”智能体。在复现研究任务上,Faraday超过了Claude Opus 4.8和GPT-5.5。团队通过长程强化学习(RL)并以编码智能体作为工具进行训练,使Faraday掌握严谨科学家的技能,朝着能够跨领域创新的AI科学家迈进一步。
为了训练Faraday,团队提出了Replica:一个可扩展的RL任务空间。每项任务要求智能体在没有原始图表的情况下,在有限的时间和算力预算内复现论文中的一张图。初始套件包含来自100篇机器学习与AI+科学论文的310项任务,涉及NLP、材料科学、天气预报等多个领域。
团队让领先实验室的最新智能体在Replica上运行,发现它们并未使任务空间饱和。Claude Opus 4.8和GPT-5.5作为基线,分别在Claude Code和Codex环境中以最高思考强度运行。Faraday在任务套件的每一类论文上都产生了更忠实的复现,并且对近期研究应对得更好,能够有效地将其科学技能应用于基础模型预训练时未见过的研究。
复现一张图也许看起来不算特别有创新性,但从过程而非输出来看,复现是通向创新的垫脚石。论文描述的是作者发现有效的方法,而不是帮助他们走到那里的失败结果。要成功,智能体必须恢复页面上没有的“99%的汗水”。这需要开放研究中特有的假设驱动探索。
复现构成了一个由不明确任务组成的课程基础。可以从提供给智能体的论文中移除单张图以外的特征,资源限制可以进一步收紧或放宽。甚至可以想象不存在的论文,让同一个Faraday模型在不知不觉中完成创新。
完美还原图表并不等于成功复现,成功的复现还需要良好的实验设计、科学规范、忠于原论文的主张以及有效利用可用资源。归根结底,复现需要“研究品味”。
团队设计了一个LLM评判器,并进行了人类研究来验证它能捕捉专家的研究品味。但用LLM评判器进行训练仍然具有挑战性,因为基础模型的随机性会产生嘈杂的奖励信号。团队使用每任务评分准则来解决这个问题,获得了比LLM基线更高的一致性和更低的噪声。
针对长程RL训练中常见的不稳定性,团队在训练时对评判器做了两项进一步修改:多采样聚合和逐轮信用分配。用这套方法训练后,Faraday学会了成为更严谨的科学家。
Faraday使用GPT-5.5 Codex作为工具,就像人类科学家使用编码智能体一样。值得注意的是,Faraday能够指挥一个比自身大几个数量级的模型,并以提高复现性能的方式指导其工作。此外,Faraday在测试时可以泛化到指挥更强大的智能体:用GPT-5.4-mini训练后,它能够适应GPT-5.5 Codex。随着前沿编码智能体的不断进步,团队预计科学判断的价值只会增加。
Faraday在测试时也能利用之前的发现找到新见解,这与现有AI科学家智能体类似。但与这些智能体不同,Faraday不需要手工编码的进化框架,也没有测试时奖励。换句话说,Faraday学会内在地重视发现。
Faraday代表着一种新范式的第一步,这种范式将一层科学直觉与编码智能体不断增强的能力结合起来。团队相信,由新基础设施和新形式的人机协作驱动的更好的AI科学家,可以造福全社会。
在Inherent,Faraday的改进在整个公司内产生复合效应,使团队能够在牢牢保持人类参与的情况下发现新知识。出于安全考虑,团队正在研究其方法如何推进可扩展监督并缓解奖励黑客问题。他们正在构建一种新型AI和新型研究机构,以适应用AI驱动科学发现的时代。