本論文では、データレイク上の探索的質問応答(EQA)タスクの失敗要因を分解する診断的アブレーションフレームワークSANA(Search Agent Navigation Ablation framework)を提案する。EQAタスクを実行時プロファイル(ゴールドソース系列、サブクエリ、実行記録)に変換し、理想的な検索・計画・データ分析ツールを構築して各コンポーネントをアブレーションすることで、ポリシーの失敗を診断する。LakeQAおよびKramaBenchの実験では、データ分析が一貫したボトルネックであり、大規模データレイクでは検索が主要な制限要因であることが示された。
AI ニュース速報
リアルタイム監視
最新ニュース
信頼できる情報源、出典、権限、サイト内閲覧を保ちながら、AI の変化を読める情報に圧縮します。
最新ニュース
ニューラルトピックモデルはスケーラブルな意味発見を可能にするが、量子ハードウェアとの統合はほとんど未開拓である。本論文は、トピックモデリングのための概念実証として、パラメータ化量子回路をVAE推論ネットワークに埋め込み、古典的なトピック-単語デコーダを保持するハイブリッド古典量子変分オートエンコーダ(VAE)を提案する。量子ハードウェアのリソース制約に対処するため、潜在空間の次元と抽出するトピック数を切り離す修正ガウスソフトマックス事後分布を提案し、10量子ビットの量子デバイスでの動作を可能にする。AgNewsデータセットにおいて、ハイブリッドVAEは最先端のニューラルトピックモデルを上回り、C_v一貫性スコア0.71、NPMIスコア0.20を達成し、高いトピック多様性を維持する。比較として構築された完全古典変種もAgNewsでSOTAモデルを上回り、潜在空間で明確なクラス分離を示す。これらの結果は、NISQ時代のデバイスでもハイブリッドVAEが計算的に実行可能であり、量子強化トピックモデリングの有望な方向性を示している。
本研究は、大規模言語モデル(LLM)を利用した都市シミュレーターが生成する人間の移動パターンが、経験的に現実的であるか、または単にもっともらしいナラティブに過ぎないかを評価する検証フレームワークを提案する。パリ大都市圏と上海のデータセットを用いてAgentSocietyとCitySimをテストした結果、ナラティブの妥当性と経験的移動現実性の間に大きなギャップがあることが明らかになった。特に、移動距離分布、出発地・目的地フロー、滞在時間、遷移ダイナミクスなどの空間的・時間的制約を再現できない。また、移動多様性の現実性はデフォルトのプロンプト設定に不安定であり、明示的なプロファイル認識初期化が必要であると指摘。さらに、再現可能な評価を支援するため、スケーラブルでオープンなLLM駆動インフラを提供する。
現在の文化的アライメント手法は推論時の介入に焦点を当てており、モデルが十分な文化的知識をすでに持っていると仮定している。本研究は、現代のLLMパイプラインが「文化的データファネル」に悩まされていると主張する。すなわち、ポストトレーニング中に明示的な文化的信号が急激に減少し、地理的に集中したタスク特化データが支配的になる。多言語性は地理的多様性を高めるが、バランスの取れた表現を保証しない。著者らは560万サンプルの文化的タグ付きデータセットを公開し、今後の研究を促進する。
本論文は、イスラム相続推論における大規模言語モデルの性能を評価するQIAS 2026共有タスクの概要を提供する。タスクは12,500件のアラビア語相続ケースからなるMAWARITHベンチマークに基づき、16チームがプロンプティング、RAG、ファインチューニングなどの手法を試みた。結果は、モデルが法的解釈と数値推論に苦戦することを示している。
本論文は、2026年QIASアラビア・イスラム相続推論共有タスクへのPSLチームの参加を報告します。このタスクは、法的解釈、多段階推論、精密な数値計算を必要とする相続案件を解決する大規模言語モデルの能力を評価します。結果は、商用モデル(Gemini 2.5 Flashなど)が正しい相続人の識別、排除ルールの適用、推論の一貫性において優れている一方、オープンソースモデルは特に法的判断や分数の調整において不安定であることを示しました。
新たな研究で、Webエージェントの安全性をテストするために欺瞞的インターフェースを注入するフレームワークWebDeceptが紹介されました。評価の結果、現在のエージェントはターゲット広告やドメインリダイレクトなどの操作に非常に脆弱であり、プロンプトベースの防御は不十分であることが示されました。
LLMを評価者として用いる手法(LLM-as-a-Judge)の信頼性を調べた研究で、ペアワイズ選好の平均反転率が13.6%、28%の問題で20%超、最高56%に達することが判明。GPT-4o-miniは顕著な先頭位置バイアスを示し、評価者間一致率は76%にとどまった。著者らは複数回試行の集約、位置のランダム化、不確実性の明示的報告を推奨している。
脳皮質の神経活動の試行間変動(構造化ノイズ)が、人工ニューラルネットワークの敵対的攻撃や自然画像改変に対するロバスト性を有意に向上させることを示した研究。自然改変に対する効果が最も大きいが、種類間の転移は低く、敵対的ノイズ構造は他の攻撃に一般化できる。
本論文では、拡散政策最適化における二重ドリフト現象を特定し、自己蒸留と政策改善勾配更新を交互に行うDiPODフレームワークを提案。訓練の安定化と高い報酬達成を実現。
新しい論文は、既存のLoRA変種にスパース性を導入することで、Cheap LoRA (cLA)とチェーン循環変種c³LAを提案し、パラメータ効率の良い微調整を実現する。情報理論的汎化誤差限界を導出し、11の微調整手法、10の事前学習モデル、14のデータセットにわたる実験により、スパースな構造化列空間制限が競争力を維持しながら、トレーニング時間を最大10%、ピークGPUメモリを最大15%削減することを示した。
本論文では、超次元計算(HDC)に基づく新しい異常検知フレームワークD2H-ADを提案する。距離ベースの類似性と密度認識エンコーディングを統合し、5つのベンチマークデータセットで既存手法を上回る性能を示し、高精度、解釈可能性、計算効率を実現。TinyMLやエッジAI展開に適している。
最新の研究では、学習中に重みノルムに直接介入することで、ニューラルネットワークの「グロッキング」(遅延汎化)において重みノルムが因果的決定要因であることを確認しました。自由訓練では、ネットワークは重みノルムが臨界値Wcに達したときにグロッキングし、Wcはシードや学習率による変動が小さく、モジュラーベースとともにべき乗則で増加します。ノルムをWcの倍数ρに固定すると、遅延はT_grok ∝ exp(αρ)(α≈7.5)に従います。LayerNormを追加するとこの依存性が解消されます。
本論文は、微分可能な高忠実度ソルバーJAX-Fluidsを活用し、不確実性定量化と物理認識型リファインメントを備えたニューラルエミュレータのトレーニングとデータ生成を統合する完全GPUワークフローを提案する。極超音速流の急峻な勾配を物理的に一貫して捉える課題を解決する。
ファッションEコマースのセールキャンペーン向けに開発された新しいアルゴリズム価格設定ツールは、日次解像度の需要予測と多目的最適化を活用し、ZalandoでのA/Bテストで6%の利益向上を達成しました。
本論文では、スマートフォン上での拡散大規模言語モデル(dLLM)推論を高速化する初のNPU対応フレームワーク「llada.cpp」を提案。マルチブロック投機的デコード、デュアルパス漸進的修正、スワップ最適化メモリランタイムの3手法により、LLaDA-8Bの生成レイテンシをCPUベースライン比17~42倍削減し、品質を維持する。
Gemma 4モデルの繰り返しループは1つのニューロンの編集で修正可能ですが、長時間推論における「ドゥームループ」は知識不足による根本的な問題であり、完全には解決できません。
低リソースのデータサイロにおいて、ローカルな参照分布を用いたデータ選択は、むしろモデル崩壊を加速させ、多様性のべき乗則的な減衰を引き起こす。生データを共有せずに複数のサイロからワッサースタイン代理参照を構築することで、多様性の低下を緩和できる。
TwinBI は、LLMベースのエージェントシステムと実行可能なBIダッシュボード状態を結合するエージェンティックデジタルツインフレームワークであり、会話操作、ダッシュボード操作、意味的グラウンディング、および来歴追跡を統合します。A/Bテストでは、完全一致精度が43.3%から63.3%に、部分一致精度が48.3%から70.8%に向上し、タイムアウト率が40.0%から10.0%に減少しました。ユーザビリティ研究では、統合ダッシュボードとチャットワークフローの利点が確認されました。
YeasierAgentは、共生エージェント、ナラティブワールド、シーン認識インタラクションに基づくアプリケーションビルディングパラダイムである。従来のデバイス結合型ソフトウェアモデルに挑戦し、アプリケーションをユーザー、エージェント、ワールド間のコラボレーションスペースとして再定義する。システムアーキテクチャは2つの主要な貢献を達成する:プラットフォーム非依存のインタラクティブユニット(エージェント、シーン、ダイアログ)を使用したクロスプラットフォームなエージェントネイティブアプリケーションの迅速な構築、そして感情的な伴侶性と実用的なツール実行を単一の体験サンドボックスに統合する。自動生成、ユーザー作成ワールド、空間マルチエージェントコラボレーションを統合することで、YeasierAgentは「共生エージェントネイティブアプリケーション」のカテゴリを正式化し、孤立したツール固有のチャットボットから凝集性のある社会的に埋め込まれた計算環境への移行を示す。
新しい論文は、安全性に微調整されたチャットモデルにおける拒否行動の制御について、Diff-in-Means(DiM)とIterative Nullspace Projection(INLP)を比較しています。研究では、INLPの反事実的フリッピングがDiMの方向的アブレーションと拒否抑制において競合する一方、ヌルスペース投影は一貫して弱いことがわかりました。INLPを主要方向に制限することで、抑制効果をほぼ維持し、ベースラインパープレキシティに近い状態で調整可能な能力が得られます。また、2つのINLP介入は活性化空間の質的に異なる領域に着地し、モデルが概念の「欠如」と「反対」を異なる方法で符号化していることを示唆しています。
2024年、WorkBenchで最良のエージェントGPT-4は43%のタスクを完了し、26%で有害行動。2026年、Claude Opus 4.8は89%完了、2.5%に減少。能力と安全性は共に向上、基本的なミスが残る、オープンウェイトモデルがコスト低下。更新版ベンチマーク公開。
ハイブリッド開放型トリ・エボリューション(HOTE)フレームワークは、ハイブリッドモード強化学習を用いて提案者、解決者、評価者の協調進化を促進し、ウェブ規模の知識に基づいて開放型タスクにおける自律進化エージェントを実現する。8Bモデルは静的8-32Bモデルや最先端の深層研究訓練手法を上回る性能を示した。
本論文では、テキスト、画像、音声、動画など複数のモダリティを統一的に扱うエージェントオーケストレーションフレームワーク「Orchestra-o1」を提案する。モダリティ認識型タスク分解、オンラインサブエージェント特化、並列サブタスク実行を特徴とし、OmniGAIAベンチマークで2位の手法を10.3%上回る精度を達成。さらに、意思決定整合グループ相対方策最適化(DA-GRPO)による強化学習手法を導入し、Orchestra-o1-8Bモデルが既存のオープンソース全モーダルエージェントの中で最先端性能を示した。
泥んこ子供パズルは知識と無知に関するパズルであり、認識論理の発展に影響を与えてきた。その起源は不明で、本稿では過去200年にわたる論理学および文学の出版物からその起源を追跡し、数字や色付き帽子を用いた多数のバリエーションを紹介するとともに、自己言及を含む新しい帽子パズルも提示する。
Noah AIは、製薬、バイオテクノロジー、医療専門家向けに設計されたドメイン特化型AIプラットフォームです。1億以上の研究論文、臨床試験、ガイドライン、特許、財務報告書にアクセスし、質問を引用付きの意思決定対応レポートに変換します。ワークフローを自動化し、専門家スキルと証拠に基づいた回答を提供し、さまざまな役割に対応することで、ユーザーの効率を大幅に向上させます。
新たな研究により、隠されたプロンプトや科学的内容の変更なしに、要旨やナラティブ構造などのプレゼンテーション面のみを修正することで、AI査読者を有意に操作でき、成功率75.1%を達成できることが示された。
NVIDIAの戦略は単なるGPU製造ではなく、AIエコシステム全体への大規模投資を通じて自社の核となる製品への需要を創出し、自己強化サイクルを形成して支配的地位を固めることです。2026年だけで400億ドル以上を投入し、NVIDIAは供給者兼資金提供者として、自社チップがAI経済の基盤リソースであることを確実にしています。
Dream Server は、Linux、Windows、macOS に対応したワンコマンドでインストール可能なローカル AI サーバースタックです。モデル推論、チャット UI、ダッシュボード、音声、エージェント、ワークフロー、RAG、画像生成、プライバシーツールを統合し、クラウドやサブスクリプションは不要です。
エンタープライズAIエージェントは集中型サーバーから分散環境へ移行し、柔軟性と応答速度が向上しています。Focused Labsは3週間で本番対応のエージェントブループリントを提供するサービスを開始しました。