Apple 機器學習研究團隊於 2026 年 10 月釋出論文《RISED:面向智慧體多環境選擇與自蒸餾的評分標準》。作者包括 Jingtan Wang、Sirajul Salekin、Young mok Jung、Javier Movellan、Bryan Kian Hsiang Low 與 Manjot Bilkhu,其中部分工作在新加坡國立大學完成,部分工作是在 Apple 任職期間開展的。該研究關注如何讓單一 LLM 智慧體在多種互動式環境中聯合訓練,從而邁向通用智慧體。
現有課程學習與資料選擇策略通常以環境為單位分配訓練,或優先依賴區域性獎勵訊號,而沒有顯式考慮當前跨環境 rollout 之間的關係來進行提示組選擇。與此同時,不同環境的學習速度不同,同一個批次中可能同時出現全部失敗和全部成功的 rollout 組,這些資料無法獲得組內相對獎勵訊號。這兩個問題共同說明,多環境強化學習中僅依賴標量獎勵存在侷限:它既難以提供跨環境關係的資訊,也無法在組內獎勵完全相同時提供對比。因此,研究轉向更豐富的文本反饋,例如描述 rollout 行為的評分標準,以指導學習。
RISED 的核心創新在於,不把評分標準僅當作獎勵使用,而是同時用於線上資料選擇與策略監督。一個 LLM 評判器使用跨環境共享的預定義評分詞彙為每個 rollout 打標籤。由此得到的 profile 用於選擇與混合環境批次整體行為構成一致、同時與已選資料重疊有限的資料。可用的正面評分標準(描述期望行為)為同策略自蒸餾教師提供特權上下文,帶來額外的 token 級監督;負面評分標準(描述不期望行為)則引導後續 rollout 生成遠離反覆出現的失敗模式。這些元件共同構成 RISED。
在多種模型骨幹上,RISED 在跨環境平均透過率上取得最高成績,並在每個單獨環境中排名第一或第二。基於評分標準的分析還能進一步刻畫這些效能提升所伴隨的行為變化。
該論文也出現在 Apple 機器學習研究的相關工作中。同一研究方向下,2026 年 8 月 27 日的《From Preferences to Principles:面向有依據知識回答的基於評分標準的對齊》提出以檢索證據為基礎的查詢特定評分標準,將答案質量分解為多個維度,從而在開放域問答中提供細粒度監督。2026 年 3 月 16 日的《RubiCap:面向密集影像描述的評分標準引導強化學習》則嘗試用評分標準引導強化學習,以克服合成描述在多樣性與泛化上的不足。這些工作共同反映了評分標準在獎勵設計與監督訊號中的日益重要。