エージェンティックAI財団(AAIF)は、エージェンティックAIの透明かつ協力的な発展を促進する中立的なオープン財団です。最近のニュースには、CoinbaseによるMCPを使用したエージェント取引、SemiAnalysisによるAIサブスクリプション価格設定の過小評価の指摘、Nous ResearchによるHermes Agent Profile Builderのリリースが含まれます。財団はイベントを開催し、MCP、Goose、AGENTS.mdなどのプロジェクトをサポートしています。
AI ニュース速報
リアルタイム監視
最新ニュース
信頼できる情報源、出典、権限、サイト内閲覧を保ちながら、AI の変化を読める情報に圧縮します。
最新ニュース
AATFは、AIエージェントの各決定の理由、検討した代替案、自信度、および却下した選択肢を記録するためのオープン仕様とリファレンスSDKです。OpenTelemetryが観測可能性を提供するのに対し、AATFはエージェントの意思決定の説明責任に焦点を当てています。この記事では、コアフォーマット、クイックスタート、既存ツールとの比較、統合、プロジェクトステータスを説明します。
EUは、生成AIシステムの展開者がAI生成または改変されたコンテンツをラベル表示するためのアイコンセットを開発しました。これはAI法の透明性ルールに従うものです。この記事では、ラベル表示が必要なコンテンツ、例外、アイコンのバリエーション、使用ルール、ライセンスについて説明しています。
LV-Calibは、印刷可能な平面ターゲットを用いてLiDARとカメラの外部パラメータ推定およびLiDAR境界応答のキャリブレーションを行うフレームワークです。視覚フィデューシャルと円形反射率境界を特徴点として利用し、有限ビームフットプリントと混合強度反射による遷移帯の歪みを処理するためにLiDAR側の3D特徴点を反復的に精緻化します。実験では、サブピクセル再投影精度、ミリメートルレベルのLiDAR特徴一貫性、およびオドメトリ性能の向上を示しています。コードとデータは公開予定です。
ViTaLフレームワークは二段階最適化により視覚と触覚を組み合わせ、生成ロボットポリシーを推論時に誘導し、接触を伴う操作タスクの成功率を大幅に向上させる。
新しい研究により、オペレーターは接触豊富な人間-ロボット相互作用において、自律神経系の作業負荷を増加させて熱的不快感を抑制することで、タスクパフォーマンスを維持することが明らかになった。この知見は生理学的認識に基づく制御アーキテクチャの開発を動機付ける。
本論文では、各ロボットが役割認識型LLMエージェントとして動作する分散型フレームワークDynaHMRCを提案する。自己記述、タスク割り当てとリーダーシップ入札、リーダー選出、内省実行の4段階クローズドループプロセスにより、動的タスクにおける異種ロボットチームの柔軟な協調を実現する。集中型LLMスケジューラのスケーラビリティ問題、動的タスクへの適応不足、ドメイン固有データ不足に対処する。実験では、強力なベースラインよりも高い成功率と効率を示し、有望なスケーラビリティを実証した。
VANDERERは、単眼カメラデータのみを使用し、視覚的好奇心モジュール(VCM)が事前学習済み拡散ポリシーをガイドする新たな探索フレームワークです。シミュレーション環境においてNoMaDより平均13.4%多く領域を探索し、屋外環境での視覚的好奇心と幾何学的好奇心の直接的な相関を明らかにしました。
TacStyleは、ユーザーの好みを構造化された潜在表現として学習し、ファウンデーションモデルを用いてその空間を解釈して所望の行動を選択することで、ロボットの行動を細かく制御し、好みのラベルを大幅に削減する手法を提案する。シミュレーションと実世界の実験により、より精密な適応が実証された。
研究者らは、合成データを使用してTransformerベースのモデルを訓練し、ドローンの安全な着陸ゾーン検出を実現するパイプラインを提案。シミュレーションと現実のギャップを埋め、手動アノテーションを不要にする。
固定カメラの長期間自然動画生成において、空間的安定性と運動連続性のトレードオフを解決する新しいフレームワークSteady-Forcing。V-Sink(視覚アンカー)やEMA-Sink(運動記憶)などのコンポーネントを組み合わせ、背景の一貫性と流体力学の視覚的妥当性を向上させる。
本論文では、境界認識優先度とクラスバランスを用いてリプレイサンプルを選択し、解剖学的構造を保持するBBR-Netを提案。CAMUSおよびCardiacNetデータセットで評価し、前方タスクではソースタスク性能を維持し壊滅的忘却を低減、逆タスクでは初期表現がノイズを含む場合に構造認識リプレイが失敗することを発見。構造摂動分析により、リプレイ効果は記憶容量よりも保存された構造情報の信頼性に依存することを示した。
視覚言語モデル(VLM)はロボット工学など重要分野で広く利用され、出力の不確実性定量化が不可欠です。FUSEは、データの曖昧性に起因する偶然的埋め込みレベルの不確実性と、モデルの応答多様性に由来する認識論的モデルレベルの不確実性の2つを補完的に捉える確率的フレームワークです。ベイズ融合機構によりこれらを結合し、スカラー不確実性指標を生成。下流タスクで出力の正しさを予測し、最先端の較正を実現します。
本論文は、畳み込みと自己アテンションがk近傍集約フレームワークで統一可能であることを主張し、標準的な畳み込みと自己アテンションを正確に再現する統一フレームワークConvNNを紹介する。これにより、局所集約と大域集約の間の連続スペクトルを探求できる。
本研究は、AIとコンピュータビジョンを用いて海上セキュリティを強化するもので、6,468枚の画像を用いて6つの深層学習アーキテクチャを比較。Vision Transformerは100%の精度、最低のエラー率、最速の処理速度を達成し、監視、国境保護、自律航法におけるAIの可能性を示した。
RAMSは、組み込みエッジデバイス向けの軽量ランタイムコントローラで、リソース負荷と検出結果に基づいてYOLOv8モデル(NANO/SMALL/MEDIUM)を動的に選択し、精度を維持しつつレイテンシを大幅に削減する。Jetson Orinでは、安全戦略2が平均3.41ミリ秒のレイテンシ(固定MEDIUM比5.6倍高速)を達成し、代理精度の74%を維持。重負荷下では検出条件付きスイッチングによりSWASが最大47.3%向上する。
ReportQAは、知識ツリーとQAペアを活用し、大規模言語モデルを審査員としてQAScoreを計算する新しい放射線レポート評価フレームワークです。従来の指標の臨床的関連性の低さや限られたエンティティカバレッジの問題を解決し、QAScoreは放射線科医の判断とより一致することが示されました。実験では、レポートベースの推論パラダイムの限界も明らかになりました。
本研究では、WESADデータセットを用いて、手首と胸のセンサー信号によるマルチモーダル感情認識において、LSTM、TCN、Transformerを評価。Transformerはマルチモーダル設定で最高精度、TCNは手首のみで最良。アンサンブル法(後期融合)は98.91%の精度と98.56%のマクロF1を達成。
本研究は、固定推論予算の下でウェブエージェントのオンライン拡張モジュールを再評価し、AWM、ASI、ReasoningBankは、同じ予算で追加のアクターステップを使用するトークン一致ベースラインモデルに対して有意な利点を提供しないことを発見しました。ベースラインは、成功率で全拡張手法に匹敵またはそれを上回り、多くの場合、総トークン使用量が少なくなります。この効果は企業の知識作業タスクにも拡張され、実行間分散が重要な評価指標として強調されています。
Nemotron 3 Ultraは、NVIDIAが開発した総パラメータ5500億、活性パラメータ55億の混合専門家言語モデルで、MambaとTransformerを融合。20兆トークンで事前学習し、100万トークンのコンテキストをサポート。推論スループットは既存のオープンLLMの6倍で精度は同等。エージェントタスクに最適で、完全オープンソース。
GRPOベースの強化学習フレームワークCoRAを提案し、モデルの信頼度と生成された根拠を整合させることで、誤解を招く高信頼度の回答を低減。MedQAなどのデータセットで、整合誤差を最大26.51%削減しつつ、精度を維持しキャリブレーションを改善。
因果トランスフォーマーは自己回帰分解により左から右へのデコードに優れるが、過去と未来の両方のトークンに条件付けられたテキストブロックなど、任意の条件付きモデリングには対応できない。提案手法AC-GPTは標準的な因果トランスフォーマーに簡単な修正を加え、過去・未来・混合コンテキストを含む任意の条件付き評価とサンプリングを単一の順伝搬で実現。左から右の順序と次トークン予測目的を維持し、既存LLMのファインチューニングが可能。実験では、任意条件付きモデリングでベースラインを上回り、標準性能も維持した。
研究者は、マルチホップ質問応答におけるコンテキスト圧縮のための「Telegraph English」と呼ばれる可読な記号形式を提案する。これは、検索されたパッセージを構造化されたエンティティ-関係ステートメントに書き換え、推論証拠を低トークンコストで保持する。MuSiQue、TwoWiki、HotpotQAでの制御実験において、Telegraph Englishは3つのマッチド予算圧縮ベースライン(文字レベル削除、トランケーション、ランダムサブサンプリング)をすべてのデータセットで上回り、F1スコアで13〜20ポイントの向上を示した。また、最も難しいデータセットでは、同じエンコーダーによって生成された一貫性のある散文要約をも上回った。事前登録された深さ相互作用仮説は無効であった:アドバンテージはデータセット内の推論の深さとともに増加しない。これらの結果は、マッチドトークン予算において、可読な記号的再表現が自然言語や一貫性のある要約よりもエンティティ内容をより密に保存する証拠として解釈される。
本論文は、Lean 4における証明自動形式化モデルのロバスト性に関する初の研究を提示する。グローバルな摂動(異なるスタイルへの言い換え)とローカルな摂動(値、記号、証明ステップの変更)を導入し、モデルの忠実性をテストした。評価した7つのモデルはすべてグローバルな摂動に敏感であり、ローカルな摂動を忠実に反映できないことが多い。
PhoneHarnessは、検証可能なモバイルワークフローにおけるスマートフォンエージェントを研究するための混合アクションベンチマークおよび実行ハーネスです。GUI、CLI、ホスト側ツールアクションを統合し、75.0%の合格率を達成、非PhoneHarness設定を12.9ポイント上回り、アクションサーフェスルーティングと検証可能な実行の重要性を示しています。
本論文では、制御された入力摂動によりインスタンス依存ノイズ(IDN)を生成するフレームワークCILNを提案し、曖昧性の原因を明示的かつ制御可能にする。CIFAR-10、MNIST、Adultを用いた90のベンチマーク設定により、ノイズ率だけでなくノイズ構造がベンチマークの難易度とアルゴリズムの挙動に重要な役割を果たすことを示し、Co-TeachingやDivideMixなどの手法の故障モードを明らかにした。
この研究では、試験中の生理データ(皮膚電気活動、心拍数、皮膚温度)を用いて機械学習モデルで成績を予測する。様々なモデルを比較し、深層学習は複雑な関係を捉える一方、ランダムフォレストのような単純なモデルが効率性と解釈可能性で優れる場合があることを示した。
19種類のグラフニューラルネットワーク層を軌跡予測で比較した結果、ARMA、Chebyshev、トポロジー認識層が最適で、合計ベースの集約、マルチヘッドアテンション、ホップ距離の重み付けが精度向上に寄与することがわかった。
本研究は、従来の無状態自律実験パターンを、LangGraphを用いたステートフルReActエージェントに再構築し、毎回の反復でコンテキストを再構築する必要性を排除。ハイパーパラメータ調整で90%、コード最適化で52%のトークン削減を達成しつつ、最適化品質を維持する。
本論文は、埋め込みモデルルーティングを低ランクエキスパートを用いた敵対的文脈線形バンディットとして定式化し、効率的なオンライン学習を可能にする対数二次ポリシークラスを導入し、次元の呪いを回避しながら劣線形後悔を達成するHypentropy Policy Gradient (HPG) アルゴリズムを提案する。