Appleの機械学習研究チームは2026年10月、論文「RISED:エージェントのマルチ環境選択と自己蒸留のためのルーブリック」を公開した。著者はJingtan Wang、Sirajul Salekin、Young mok Jung、Javier Movellan、Bryan Kian Hsiang Low、Manjot Bilkhu。一部はシンガポール国立大学で、一部はApple在籍中に行われた研究である。本論文は、単一のLLMエージェントを多様な対話環境で共同訓練し、汎用エージェントを実現する方法に焦点を当てている。
既存のカリキュラム学習やデータ選択戦略は、環境単位で訓練を配分したり、局所的な報酬シグナルを優先したりすることが多く、プロンプトグループ選択のために環境をまたいだロールアウト間の関係を明示的に考慮していない。また、環境ごとに学習速度が異なるため、同じバッチ内に全失敗と全成功のロールアウトグループが共存し、それらのデータにはグループ相対報酬シグナルが与えられない。これらの課題は、マルチ環境強化学習においてスカラー報酬だけに依存することの限界を示している。スカラー報酬は環境間の関係について限られた情報しか与えず、報酬が同一の場合にはグループ内の報酬コントラストも提供しない。そこで、ロールアウトの行動を記述するルーブリックのような、より豊かなテキストフィードバックが学習を導くために求められる。
RISEDの核心は、ルーブリックを報酬としてだけでなく、オンラインデータ選択と方策監督にも再利用する点にある。LLM判定器が、環境間で共有される定義済みのルーブリック語彙を用いて各ロールアウトにタグを付ける。得られたプロファイルは、混合環境バッチ全体の行動構成に沿い、かつ選択済みデータとの重複を抑えたデータの選択を導く。利用可能な肯定的ルーブリック(望ましい行動を記述)は、オン方策自己蒸留教師に特権的コンテキストを提供し、トークンレベルの追加監督を与える。一方、否定的ルーブリック(望ましくない行動を記述)は、再発する失敗モードから離れるように後続のロールアウト生成を導く。これらの要素が組み合わさってRISEDを構成する。
複数のモデルバックボーンにおいて、RISEDは環境をまたいだ平均合格率で最高を記録し、個々の環境でもすべて1位または2位となった。ルーブリックに基づく分析は、これらの性能向上に伴う行動変化をさらに特徴づけることができる。
本論文はApple機械学習研究の関連研究群の一部でもある。2026年8月27日の「From Preferences to Principles:根拠ある知識回答のためのルーブリックベースアラインメント」は、検索された証拠に基づくクエリ固有のルーブリックを生成し、回答品質を複数次元に分解することで、オープンドメイン質問応答にきめ細かな監督を提供する。2026年3月16日の「RubiCap:高密度画像キャプションのためのルーブリック誘導強化学習」は、合成キャプションの多様性と汎化の弱さを克服するためにルーブリックを用いた強化学習を試みている。これらの研究は、報酬設計と監督信号におけるルーブリックの重要性が高まっていることを示している。