跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

RISED:面向智能體多環境選擇與自蒸餾的評分標準

文章摘要

RISED 利用 LLM 評判生成的評分標準(rubrics)來指導多環境智能體訓練中的數據選擇與自蒸餾。該方法在多個模型骨幹上取得最高的平均通過率,並在各個環境中均排名第一或第二。

RISED:面向智能體多環境選擇與自蒸餾的評分標準
報告錯誤

更正渠道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

Apple 機器學習研究團隊於 2026 年 10 月發佈論文《RISED:面向智能體多環境選擇與自蒸餾的評分標準》。作者包括 Jingtan Wang、Sirajul Salekin、Young mok Jung、Javier Movellan、Bryan Kian Hsiang Low 與 Manjot Bilkhu,其中部分工作在新加坡國立大學完成,部分工作是在 Apple 任職期間開展的。該研究關注如何讓單一 LLM 智能體在多種交互式環境中聯合訓練,從而邁向通用智能體。

現有課程學習與數據選擇策略通常以環境為單位分配訓練,或優先依賴局部獎勵信號,而沒有顯式考慮當前跨環境 rollout 之間的關係來進行提示組選擇。與此同時,不同環境的學習速度不同,同一個批次中可能同時出現全部失敗和全部成功的 rollout 組,這些數據無法獲得組內相對獎勵信號。這兩個問題共同説明,多環境強化學習中僅依賴標量獎勵存在侷限:它既難以提供跨環境關係的信息,也無法在組內獎勵完全相同時提供對比。因此,研究轉向更豐富的文本反饋,例如描述 rollout 行為的評分標準,以指導學習。

RISED 的核心創新在於,不把評分標準僅當作獎勵使用,而是同時用於在線數據選擇與策略監督。一個 LLM 評判器使用跨環境共享的預定義評分詞彙為每個 rollout 打標籤。由此得到的 profile 用於選擇與混合環境批次整體行為構成一致、同時與已選數據重疊有限的數據。可用的正面評分標準(描述期望行為)為同策略自蒸餾教師提供特權上下文,帶來額外的 token 級監督;負面評分標準(描述不期望行為)則引導後續 rollout 生成遠離反覆出現的失敗模式。這些組件共同構成 RISED。

在多種模型骨幹上,RISED 在跨環境平均通過率上取得最高成績,並在每個單獨環境中排名第一或第二。基於評分標準的分析還能進一步刻畫這些性能提升所伴隨的行為變化。

該論文也出現在 Apple 機器學習研究的相關工作中。同一研究方向下,2026 年 8 月 27 日的《From Preferences to Principles:面向有依據知識回答的基於評分標準的對齊》提出以檢索證據為基礎的查詢特定評分標準,將答案質量分解為多個維度,從而在開放域問答中提供細粒度監督。2026 年 3 月 16 日的《RubiCap:面向密集圖像描述的評分標準引導強化學習》則嘗試用評分標準引導強化學習,以克服合成描述在多樣性與泛化上的不足。這些工作共同反映了評分標準在獎勵設計與監督信號中的日益重要。

展開要點與分析

文章情報

工程師進階

要點

  • RISED 將評分標準從獎勵信號擴展為在線數據選擇與策略監督的指南。
  • LLM 評判器用跨環境共享的評分詞彙標記 rollout,從而實現提示組選擇並減少數據重疊。
  • 正面評分標準為同策略自蒸餾教師提供 token 級監督,負面評分標準引導後續 rollout 避開失敗模式。
  • 在多種模型骨幹上,RISED 的平均通過率最高,並在每個單獨環境中排名第一或第二。

技術影響

可能影響 Agent 架構、工具調用、工作流自動化和產品集成。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。