LLMにおける推論努力の制御
本記事では、複数の推論努力モードを持つモデルの開発方法を探り、o1やDeepSeek-R1からGPT-5.6への進化、RLVRトレーニング、推論スケーリング、思考トークン、推論モード切り替えなどの主要技術を解説する。
- 推論モデルは中間推論トレースを出力し、従来のLLMとは異なる。
- RLVRトレーニングは最終回答の正しさのみに報酬を与え、推論トレースは使用しない。
ソース詳細
AI News Hub は Ahead of AI (Sebastian Raschka) の AI 更新を追跡し、ソース状態、利用範囲、収集方法、公開記事を表示します。
Public Substack newsletter; free posts allowed.
本記事では、複数の推論努力モードを持つモデルの開発方法を探り、o1やDeepSeek-R1からGPT-5.6への進化、RLVRトレーニング、推論スケーリング、思考トークン、推論モード切り替えなどの主要技術を解説する。
本記事では、オープンソースツールとオープンウェイト大規模言語モデル(Qwen3.6など)を用いて、完全ローカルのコーディングエージェント環境を構築する方法を詳しく解説します。Claude CodeやCodexのような有料サービスの代替として、ローカル設定の利点、セットアップ手順、パフォーマンス評価、および複数のエージェントフレームワーク(Qwen-Code、Codex、Claude Codeなど)の選択についてカバーしています。
筆者は毎年の習慣に従い、2026年1月から5月までの注目すべきLLM研究論文を整理・分類。アーキテクチャ、トレーニング、推論効率、推論モデル、強化学習、エージェントシステムなど多岐にわたる方向性をカバーし、ハイブリッドアーキテクチャのトレンドやNemotron 3などの代表的な研究を紹介。
Gemma 4からDeepSeek V4まで、新しいオープンウェイトLLMがクロスレイヤーKV共有、レイヤー別埋め込み、注意予算、圧縮畳み込み注意、mHCなどを通じて長コンテキストコストを削減する方法を探る。
新しいオープンウェイトモデルのリリースを理解するための学習指向のワークフロー。公式のテクニカルレポートから始めるが、最近の論文は詳細が不足しているため、Hugging Faceの設定ファイルとリファレンス実装から情報を得る。
コーディングエージェントを効果的にする6つの主要コンポーネント(ライブリポジトリコンテキスト、プロンプトの形状とキャッシュ再利用、ツールアクセスと使用、コンテキスト肥大化の最小化、構造化セッションメモリ、サブエージェントへの委任)を概説し、これらのハーネス機能がどのようにLLMのコーディングタスクにおけるパフォーマンスを向上させるかを説明します。
2026年1月から2月にかけてリリースされた10のオープンウェイト大規模言語モデルのアーキテクチャ比較分析。Arcee Trinity、Kimi K2.5、Step 3.5 Flash、Qwen3-Coder-Next、GLM-5、MiniMax M2.5、Nanbeige 4.1、Qwen3.5、Ling 2.5、Tiny Aya、そしてSarvamのアップデートをカバー。ハイブリッドアテンション、マルチトークン予測、Mixture-of-Expertsなどの技術トレンドに焦点を当てる。
推論時スケーリングは、デプロイされたLLMの回答品質を向上させる最も効果的な方法の1つです。本記事では、チェーン・オブ・ソート、自己一貫性、ベスト・オブ・Nランキング、検証器付きリジェクションサンプリング、自己改良、解経路探索など、様々な推論時スケーリング手法を明確に分類し、最近の論文を概説します。著者は、関連する書籍の章を執筆する際に行った個人的な実験も共有しています。
2025年の大規模言語モデル(LLM)の重要な進展を包括的にレビュー。DeepSeek R1によるRLVR/GRPOを用いた推論の進化、推論時スケーリングとツール使用の台頭、ベンチマークの過剰最適化(benchmaxxing)問題、そして2026年への予測(拡散モデルやRLVRの拡大など)を扱います。
著者が2025年7月から12月までの興味深い研究論文を厳選し、推論モデル、強化学習、アーキテクチャなどのカテゴリに分類して支援者に感謝の意を込めて共有します。
本稿では、DeepSeek V3.2の技術的進化について、アーキテクチャの変更(スパースアテンション機構DSAを含む)、強化学習の更新(GRPOの改良、自己検証と自己洗練)、およびハイブリッド推論モデルの開発を詳しく解説します。V3.2はGPT-5やGemini 3.0 Proに匹敵する性能を持ち、オープンウェイトモデルとして公開された重要なリリースです。
本稿では、従来の自己回帰型デコーダーTransformerに代わる大規模言語モデルの代替アーキテクチャを探ります。線形注意ハイブリッド、テキスト拡散モデル、コードワールドモデル、小型再帰Transformerを紹介し、効率性、推論能力、モデリング性能における利点と限界を分析します。
この記事では、大規模言語モデルを評価する4つの主要な方法を説明します:多肢選択ベンチマーク(MMLUなど)、自由形式の回答のための検証器、ユーザーの好みに基づくリーダーボード(Chatbot Arenaなど)、およびLLMをジャッジとして使う評価です。スクラッチからのコード実装を含み、各方法のトレードオフについて議論します。