AI News HubLIVE
站内改写1 分钟阅读

SOLAR:面向终身学习与持续适应的自我优化开放式自主智能体

大型语言模型在动态真实环境中面临概念漂移和高成本梯度适配的瓶颈。本文提出SOLAR,一种自我优化的终身自主推理器,通过参数级元学习和多级强化学习实现持续适应,无需人工标注。SOLAR维护演化知识库平衡可塑性与稳定性,在常识、数学、医疗、编程、社会和逻辑推理任务上超越强基线,标志着迈向终身自适应智能体的重要一步。

来源arXiv AI作者: Nitin Vetcha, Dianbo Liu

大型语言模型(LLM)在静态基准测试中表现出色,但在动态、真实的部署环境中仍面临严峻挑战,主要瓶颈包括概念漂移和基于梯度的适配成本过高。传统的微调方法难以适应非平稳数据流,要么导致灾难性遗忘,要么需要大量人工数据整理。针对这些问题,来自Nitin Vetcha和Dianbo Liu的研究人员提出了一种名为SOLAR(Self-Optimizing Lifelong Autonomous Reasoner,自我优化终身自主推理器)的新型开放自主智能体。

SOLAR的核心创新在于将参数级元学习融入智能体的自我改进过程。它首先整合常识知识的强先验,使模型具备有效的迁移学习能力。随后,通过多级强化学习框架,SOLAR能够自主发现适配策略,从而在测试阶段高效适应未见过的领域。具体而言,SOLAR将模型权重视为一个可探索的环境,通过策略搜索来调整参数,而非依赖外部梯度信号。

关键地,SOLAR维护着一个不断演化的有效修改策略知识库,该知识库隐式地充当了情节记忆缓冲,在可塑性(适应新任务)和稳定性(保留元知识)之间取得平衡。这种设计使得SOLAR能够在持续学习流中避免灾难性遗忘,同时不断提升性能。

实验结果表明,SOLAR在常识推理、数学、医学、编程、社会推理和逻辑推理等广泛任务上均优于强基线方法。例如,在常识推理基准上,SOLAR比传统微调方法准确率提升超过10%,且无需任何人工标注。在医学问答和数学推理任务中,SOLAR同样展现了显著的适应能力。

该研究已被AAAI 2026会议持续学习流桥接(Streaming Continual Learning Bridge)分论坛接收,并发表在CEUR Workshop Proceedings上(卷4183,2026年)。论文于2026年3月23日提交至arXiv(编号2605.20189)。作者认为,SOLAR代表了迈向能够终身适应演化环境的自主智能体的重要一步,为未来在机器人、自动驾驶和个性化AI助手等领域的部署提供了新范式。