Show HN:开源AI科学家实现半自动理论发现
Imbue Catalyst 是一个用于半自动科学研究和发现的开源工具。它支持两种核心研究模式:解释现象和可验证目标求解,通过对抗性评审和进化算法增强现有大语言模型的能力。
Imbue 发布了 Catalyst,一个开源工具,旨在实现半自动化的科学研究和理论发现。该工具基于现有的大语言模型(LLM)构建,但通过两种独特的工作流程显著提升了其能力:一是解释现象,即自主开发理论来解释观察到的现象,并支持用户提供理论草案进行修正;二是可验证目标求解,即通过代码验证的方式解决研究目标或优化可测量的指标。此外,还提供预定义的手动操作菜单,如审查理论正确性、提出改进建议或评估候选方案。
Catalyst 特别适合那些能够通过计算实验和数学推导来理解的现象,尤其是机器学习和深度学习理论领域的问题。例如,回答“当我们做Y时,观察到X,导致X的机制是什么?”这类“为什么”问题。它要求问题描述精确、范围有限,并且可以通过编程方式重现和探究。对于可验证目标求解,典型问题包括“找到满足条件X的配置或函数,并通过验证脚本Y测试”或“优化模型A的训练速度,同时不将精度降至B以下”。
相反,Catalyst 不适用于无结构化或约束不足的优化问题(如“让我的模型更好”而无明确指标)、主观成功标准的问题、纯工程问题、超出基础模型能力范围的问题(如证明P=NP)、需要非计算实验的问题,以及需要大量计算资源的问题。默认单次实验超时30分钟。
与直接使用LLM聊天或编码代理相比,Catalyst 引入了对抗性评审-优化循环:一组智能体持续改进理论或解决方案,另一组独立智能体负责反驳、识别边缘情况和局限性。此外,它还采用进化式系统,维护一个竞争性的理论或解群,通过反复排名和实验数据验证来选出最优候选,并进一步细化分支。
使用 Catalyst 需要克隆仓库并安装依赖,支持多种LLM后端,包括 Claude Code、Gemini CLI、Antigravity CLI 和 Codex CLI。不同工作流程的成本差异较大,进化式工作流程通常涉及超过100个子智能体,可能导致显著的token消耗。用户可以通过配置“Step Type Model Overrides”来优化成本,例如仅对开发步骤使用最强模型,评审和评分步骤可使用较弱模型。
Catalyst 由 Imbue 团队开发,采用 AGPL-3.0 许可证。更多详细文档(如快速入门指南、工作流参考和CLI代理使用说明)可在仓库中找到。