跳到主要内容
AI News HubLIVE
站内改写2 分钟阅读

RISED:面向智能体多环境选择与自蒸馏的评分标准

文章摘要

RISED 利用 LLM 评判生成的评分标准(rubrics)来指导多环境智能体训练中的数据选择与自蒸馏。该方法在多个模型骨干上取得最高的平均通过率,并在各个环境中均排名第一或第二。

RISED:面向智能体多环境选择与自蒸馏的评分标准
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

Apple 机器学习研究团队于 2026 年 10 月发布论文《RISED:面向智能体多环境选择与自蒸馏的评分标准》。作者包括 Jingtan Wang、Sirajul Salekin、Young mok Jung、Javier Movellan、Bryan Kian Hsiang Low 与 Manjot Bilkhu,其中部分工作在新加坡国立大学完成,部分工作是在 Apple 任职期间开展的。该研究关注如何让单一 LLM 智能体在多种交互式环境中联合训练,从而迈向通用智能体。

现有课程学习与数据选择策略通常以环境为单位分配训练,或优先依赖局部奖励信号,而没有显式考虑当前跨环境 rollout 之间的关系来进行提示组选择。与此同时,不同环境的学习速度不同,同一个批次中可能同时出现全部失败和全部成功的 rollout 组,这些数据无法获得组内相对奖励信号。这两个问题共同说明,多环境强化学习中仅依赖标量奖励存在局限:它既难以提供跨环境关系的信息,也无法在组内奖励完全相同时提供对比。因此,研究转向更丰富的文本反馈,例如描述 rollout 行为的评分标准,以指导学习。

RISED 的核心创新在于,不把评分标准仅当作奖励使用,而是同时用于在线数据选择与策略监督。一个 LLM 评判器使用跨环境共享的预定义评分词汇为每个 rollout 打标签。由此得到的 profile 用于选择与混合环境批次整体行为构成一致、同时与已选数据重叠有限的数据。可用的正面评分标准(描述期望行为)为同策略自蒸馏教师提供特权上下文,带来额外的 token 级监督;负面评分标准(描述不期望行为)则引导后续 rollout 生成远离反复出现的失败模式。这些组件共同构成 RISED。

在多种模型骨干上,RISED 在跨环境平均通过率上取得最高成绩,并在每个单独环境中排名第一或第二。基于评分标准的分析还能进一步刻画这些性能提升所伴随的行为变化。

该论文也出现在 Apple 机器学习研究的相关工作中。同一研究方向下,2026 年 8 月 27 日的《From Preferences to Principles:面向有依据知识回答的基于评分标准的对齐》提出以检索证据为基础的查询特定评分标准,将答案质量分解为多个维度,从而在开放域问答中提供细粒度监督。2026 年 3 月 16 日的《RubiCap:面向密集图像描述的评分标准引导强化学习》则尝试用评分标准引导强化学习,以克服合成描述在多样性与泛化上的不足。这些工作共同反映了评分标准在奖励设计与监督信号中的日益重要。

展开要点与分析

文章情报

工程师进阶

要点

  • RISED 将评分标准从奖励信号扩展为在线数据选择与策略监督的指南。
  • LLM 评判器用跨环境共享的评分词汇标记 rollout,从而实现提示组选择并减少数据重叠。
  • 正面评分标准为同策略自蒸馏教师提供 token 级监督,负面评分标准引导后续 rollout 避开失败模式。
  • 在多种模型骨干上,RISED 的平均通过率最高,并在每个单独环境中排名第一或第二。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。