AI News HubLIVE

AI ニュース速報

リアルタイム監視

今日の AI で最も重要な変化

105 件の信頼できるソースから抽出。最終更新 2026-05-29 13:48 UTC+9。

リアルタイム監視

最新ニュース

信頼できる情報源、出典、権限、サイト内閲覧を保ちながら、AI の変化を読める情報に圧縮します。

最新ニュース

リセット
CodePulse – AIコーディングツール向けトークン効率的なコードベースインデクサー

CodePulseは、持続的なgit差分認識インデックスを維持し、セッション開始時にコンパクトなスナップショットを注入することで、AIコーディングアシスタントのトークン予算を60~80%節約するオープンソースのコードベースインデクサーです。Claude Code、OpenAI Codex CLI、Cursorなどのツールをサポートし、タスク認識ランキング、git認識ランキング、自動バジェットなどの機能を提供します。CLI、MCPサーバー、複数の統合方法を備えています。

Hacker News AIAgent / スタートアップサイト内本文
Show HN: スケーラブルなAIメモリのためのオープンソースツールキット

LithiumはPostgreSQL ltreeをベースにした階層型バージョン管理ストレージエンジンで、決定論的でスコープ指定された検索、組み込みのバージョニング、ゼロランタイム依存を提供します。MCPサーバーを介してAIツールと統合し、AIエージェントのメモリ、意思決定追跡などのユースケースに適しています。

Hacker News AIAgent / 研究サイト内本文
UIテストはAIに必要なガードレール:clipboardwireの物語

Waylandでのクリップボード同期の問題に悩まされた著者が、Claude Codeを使ってJavaプロジェクトClipCascadeをRustに書き換え、軽量バイナリのclipboardwireを作成した。発見した要点は、AIのボトルネックはコード生成能力ではなくフィードバックの質であり、UIテストが信頼性のある反復を可能にするガードレールだということ。

Hacker News AIAgentサイト内本文
Xerolith:永続的なAI記憶と意識アーキテクチャプラットフォーム

Xerolithは、階層的なフラクタルボールトアーキテクチャを通じて、永続的なアイデンティティ、自律的な信念形成、基板に依存しない知識統合を実現する動作プラットフォームです。80日以上の連続運用で、2,817の生エントリを1,218の信念に圧縮し、完全な系譜追跡と内部調整を実現します。

Hacker News AI政策 / 研究サイト内本文
マクロトレンドを調査する金融AI:You.comとLangchainによるEU経済分析

この記事では、Deep Agents、LangSmith、You.com Finance Research APIを使用して構築されたマクロ経済調査エージェントを紹介します。このエージェントは、EU全27加盟国のGDPデータを分析し、異常値を検出し、約45分で引用付きのブリーフィングを作成します。アイルランドの異常な成長とドイツの縮小の詳細を分析し、トレーサビリティと監査可能性の重要性を強調しています。

LangChain BlogAgent / 政策サイト内本文
デュアルドローン空中操作のための進捗認識型リーダーフォロワー空中ドッキングシステム

本論文では、2機のクアドロプターがリーダー・フォロワー編隊で動作し、軽量モジュラーフレームと受動磁気ラッチを使用してドッキングするデュアルドローンドッキングプラットフォームを提案する。進捗認識型ミッションスーパーバイザーが、アプローチ、アライメント、キャプチャ、セトルのフェーズ遷移を管理する。プラットフォームは完全なハードウェア・ソフトウェアスタック(ROS 2とCrazyflie/PX4インターフェース)を統合し、シミュレーションと実世界実験で編隊誤差、ドッキング成功率、ドッキング時間などの定量指標を用いて評価された。

arXiv RoboticsAgent / 研究 / スタートアップサイト内本文
位相条件付き模倣学習と自律障害回復によるロバストな変形物体操作

本稿では、変形物体操作のための位相条件付き力覚認識フレームワークを提案する。FiLM条件付きACTエンコーダとマルチモーダル位相予測器により、システムは接触障害を自律的に検出・回復し、Tシャツの吊り下げ成功率を56%から87%に向上させる。

arXiv Roboticsモデル / 政策 / 研究サイト内本文
非接触物体操作のための分散型LLM駆動音響ロボットの協調

本論文は、大規模言語モデル(LLM)と音響移動ロボットを組み合わせた非接触物体操作のための分散型フレームワークを提案する。Whisper音声認識、LLM意味解析、JSONタスクスケジューリングを用いて、音声コマンドを調整されたマルチロボットアクションに変換する。2台のTurtleBot3ベースの音響ロボットを用いた実験では、逐次タスク96%、並列タスク86%、同期協調タスク70%の成功率を達成し、LLM駆動自動化のヒューマンロボットインタラクションにおける可能性を示している。

arXiv Roboticsモデル / Agent / 研究サイト内本文
オープンモーションプランニングライブラリ2.0

オープンモーションプランニングライブラリ(OMPL)は2008年の初回リリース以来、モーションプランニングコミュニティの基盤となり、幅広い最先端のサンプリングベースのアルゴリズムを提供してきました。約20年にわたる継続的な開発を経て、OMPL 2.0はハードウェアアクセラレーションによるリアルタイムモーションプランニングを目指し、現代のAI研究ワークフローとシームレスに統合されます。

arXiv RoboticsAgent / 研究 / ロボットサイト内本文
MonoDuo:1本のロボットアームを用いたバイマニュアルポリシーの学習

MonoDuoは、単腕ロボットのデモと人間の協力を組み合わせてバイマニュアル操作ポリシーを学習するフレームワークです。単腕テレオペレーションと役割交換でデータを収集し、手姿勢推定や画像セグメンテーション、インペインティングを活用して合成デモを生成し、5つのタスクで最大70%のゼロショット成功率を達成。少数の微調整でさらに性能が向上します。

arXiv Roboticsモデル / Agent / 研究サイト内本文
極限の動的対称性により全方位多機能ロボットを実現

研究者らは、ロボットの重心加速度の均一性を動的等方性で定量化する「動的対称性」の概念を提案。シミュレーションと物理実験を通じて、高い動的対称性が軌道追従、タスク成功率、ロバスト性、回復力、エネルギー効率を大幅に向上させることを発見。Argusシリーズの球状ロボット、特にほぼ極限の動的等方性を達成した20脚の変種は、姿勢に依存しない移動、複雑地形の走破、高速自己安定化、部分的なアクチュエータ故障への耐性を示した。

arXiv Robotics研究 / ロボットサイト内本文
ワイヤアーク積層造形におけるビード形状制御の学習と適応

本論文では、ロボティックワイヤアーク積層造形(WAAM)のビード形状制御のための、リカレントニューラルネットワークと1ステップ先予測制御を用いたデータ駆動手法を提案する。熱条件の変化に対応するためにモデルをオンライン更新し、ビード高さと幅の一貫性を大幅に向上させた。

arXiv Robotics政策 / 研究サイト内本文
自動運転におけるレイテンシと精度のトレードオフを最適化するマルチ解像度エンドツーエンド深層ニューラルネットワーク

研究者らは、自動運転におけるレイテンシと安全性のバランスを取るため、マルチ解像度エンドツーエンド深層ニューラルネットワークを提案。ランタイムに入力解像度を選択することで、CARLAシミュレーションにおいて、車線逸脱、赤信号違反、衝突などの安全指標が固定解像度ベースラインと比較して一貫して改善された。

arXiv Robotics政策 / 研究サイト内本文
ヒューマン・イン・ザ・ループ・スウォーム:実世界の土壌マッピングのためのバイオニックスウォームアプローチ

本論文は「バイオニックスウォーム」システムを紹介する。これは人間をループに組み込むことで、スウォームロボティクスの実世界検証の障壁を低減する。スマートフォンWebアプリ、Bluetoothセンサー、中央サーバーを使用して人間ユーザーを誘導する。土壌マッピングのためのスコアバイアスドサーチアルゴリズムは、シミュレーションと屋外実験の両方で超線形のマップ再構成を示す。

arXiv RoboticsAgent / 研究 / スタートアップサイト内本文
ラベルなしターゲットデータとソースドメイン監視を用いたロバストなクロスドメイン汎化

本論文は、ラベルなしのターゲットドメインデータを活用して医用画像AIのクロスデバイス汎化を改善する、ターゲット認識型自己教師あり事前学習とモデルアンサンブル戦略を提案する。小児手首骨折のポイントオブケア超音波評価に適用し、ターゲットドメインでDiceが6%以上向上し、ラベル効率的でプライバシー保護のアプローチを示した。

arXiv Computer Visionモデル / 研究 / スタートアップサイト内本文
箱の中を見透かす:レーダー信号を用いた非視線3D再構成

本論文では、視線(LoS)幾何学を利用してRF伝搬をガイドし、隠れたシーンの安定した物理的に整合性のある3次元再構成を実現する統一フレームワークGeRaF 2.0を紹介する。RFベースの幾何学再構成において最新技術を達成した。

arXiv Computer Vision研究 / ロボットサイト内本文
GeRaF:無線周波数信号からのニューラル幾何学再構成

GeRaFは、RF信号から近距離3D形状を再構成する初のニューラル暗黙学習手法であり、フィルタベースレンダリング、物理ベースボリュームレンダリング、およびレンズレスサンプリング戦略により、低解像度やノイズの課題を克服します。

arXiv Computer Vision研究サイト内本文
ロバストな動画顔偽造検出のための軽量補完的手がかり融合

本論文では、Xceptionベースラインにわずか292パラメータの融合モジュールを追加した2つの軽量顔偽造検出モデルLFWSとLFWLを提案。ウェーブレットノイズ除去特徴と位相スペクトルまたは局所二値パターンを組み合わせ、複数ベンチマークでAUCを3〜4%向上させ、より大規模モデルを凌駕する。

arXiv Computer Vision研究サイト内本文
方位ドップラー分解に基づくディープラーニング反復フレームワークによるSentinel-1ストリップマップ画像強調

本論文は、方位サブアパーチャ分解を用いたSentinel-1ストリップマップSAR画像の自己教師あり強調フレームワークを提案する。外部センサーやシミュレーションされた正解データなしでトレーニングデータを生成し、シングルフレームおよびマルチフレーム学習を統合し、反復推論を採用する。実験では、PSNRとSSIMでMERLINを上回る一方、MERLINはより高いENLを達成し、構造的忠実度とスペックル平滑化のトレードオフを示している。

arXiv Computer Vision研究サイト内本文
Embodied3DBench:視覚言語モデルの低レベル身体空間知能のベンチマーク

Embodied3DBenchは、3D環境における低レベル身体空間知能に焦点を当てたベンチマークで、6タスクカテゴリと21,000以上のQAペアを含む。13モデルの評価では高レベル推論は強いが、インタラクション指向の知覚は脆弱であることが判明。130万QAペアのデータセットで微調整すると性能が大幅に向上する。

arXiv Computer Visionモデル / 研究 / スタートアップサイト内本文
画像逆問題のための軌道制約

本論文では、隣接する状態を結合して再構成経路を安定化する、学習不要の軌道制約再構成フレームワークTRACEを提案し、画像逆問題の品質を向上させる。

arXiv Computer Visionモデル / 研究サイト内本文
拡散測地線モーメントを用いたトレーニング不要3D形状検索の監査

本論文は、拡散測地線モーメント(DGM)を導入し、トレーニング不要の形状記述子の評価プロトコルを監査する。実験では、熱核シグネチャ(HKS)に基づく幾何モーメント形状記述子(GMSD-HKS)がFAUST-RegとTOSCAで最高スコアを達成し、波動核シグネチャ(WKS)も強い古典的信号であることが示された。DGMは疎な求解や非スペクトル展開に有用である。再現可能なプロトコルカスケード分析、クロスシェイプアライメント診断、トレーニング不要記述子の設計と報告のための推奨事項を提供する。

arXiv Computer Vision研究 / スタートアップサイト内本文
GAP3D:VLM潜在表現をパッチレベルの埋め込みに拡散整列するモジュラー型3D生成手法

GAP3Dは、VLMが生成した潜在表現を事前学習済み画像エンコーダのパッチレベル特徴空間に直接整列させる拡散ベースのモジュラーアプローチを提案する。これにより、凍結された下流生成モデルが空間構造を維持しながらVLMをプロンプトエンコーダとして利用できる。主に一般ドメインの画像テキストペアで訓練され、大規模3Dデータを回避し、ゼロショットのマルチモーダル能力を示すが、現在は高レベルセマンティクスを優先し、細かい詳細には課題が残る。

arXiv Computer Visionモデル / 研究サイト内本文
S3Mem:長期的なインタラクティブ質問応答のための構造化時空間シーンイベントメモリ

本稿では、長期的なインタラクティブ質問応答のための構造化シーンイベント記憶フレームワークS3MEMを提案する。S3MEMは、軌跡を構造化記憶ユニットに書き込み、アンカー鋭敏検索とコンパクトなトークンバジェット認識証拠インターフェースを用いることで、初期イベントに関する質問への回答精度と効率を大幅に向上させる。複数の環境での実験により、S3MEMは既存手法よりも優れた精度-効率フロンティアを達成することを示す。

arXiv Computational LinguisticsAgent / 研究サイト内本文
オープンソース安全ガードモデルのベンチマーキング:包括的評価

14のオープンソース安全ガードモデルの包括的評価により、Qwen Guard(4Bパラメータ)が83.97%の再現率でトップであることが明らかになった。一方、Llama Guard(12B)やGPT-OSS Safeguard(20B)などの大規模モデルは保守的で、最大75%の不適切コンテンツを見逃した。モデルサイズと安全性検出性能には相関がなく、汎用ガードモデルが専門モデルよりも優れていることが示された。

arXiv Computational Linguisticsモデル / 政策 / 研究サイト内本文
Aryabhata 2:高度なSTEM推論のための強化学習の拡張

Aryabhata 2は、JEEやNEETなどの競争的STEM試験に特化した推論言語モデルであり、GPT-OSS-20Bを強化学習で後訓練したものです。PhysicsWallahの内部問題バンクを活用し、段階的にロールアウトグループサイズを拡大することで探索を促進します。評価では、ベースモデルを上回る性能を示し、出力トークンを最大64%削減しました。

arXiv Computational Linguisticsモデル / 研究サイト内本文
マイクロ・マクロ検索:大規模言語モデルにおける長文幻覚の低減

大規模言語モデルは長文生成において幻覚を起こしやすく、既存の検索拡張モデルでは重要な情報を出力の近くに保つ仕組みが不十分です。本論文が提案するマイクロ・マクロ検索(M2R)フレームワークは、マクロレベルで外部から粗い証拠を検索し、ミクロレベルで推論中に構築した重要情報リポジトリから結果を抽出することで、長文タスクにおける幻覚を大幅に削減します。カリキュラム学習ベースの強化学習戦略を用いて安定した訓練を実現します。

arXiv Computational Linguisticsモデル / 研究サイト内本文
RightNow-Arabic-0.5B-Turbo:語彙注入とエッジ優先デプロイメントによるオープンなサブ10億アラビア語言語モデル

本論文は、Qwen2.5-0.5Bをベースに語彙注入とエッジ優先デプロイメントを採用した518Mパラメータのアラビア語特化LLM、RightNow-Arabic-0.5B-Turboを提案する。アラビア語ベンチマークで平均精度35.9%を達成し、同クラスのオープンモデルを凌駕。COPA-arではFalcon-H1-1.5Bと同等の成績を1/3のサイズで達成。量子化後は398MB、単一H100上で635トークン/秒の推論速度を実現する。

arXiv Computational Linguisticsモデル / 研究 / スタートアップサイト内本文
コンテキストシフトからスタイルの崩壊へ:訓練目標が規模よりも重要な理由

新しい論文は、17の大規模言語モデル(4.1億~1000億以上のパラメータ)を分析し、指示チューニングされたシステムが談話および構造次元に沿って言語エントロピーを体系的に崩壊させ(平均増幅:1,949~16,853%、ピーク:5,181~209,675%)、複雑な句読点をベースラインの3.2~23.2%に抑制することを文書化している。これらの効果はRLHFの下では悪化しない。弱い介入(lambda=1.0)は崩壊を240%悪化させるが、強い制御(lambda=5.0)は40.5%の改善を達成し、200~1000倍の規模の不利にもかかわらず、最先端モデルを96.7~98.2%上回る。強い制御はまた、中程度の正則化よりも15%高いdistinct-4、27%高い語彙多様性、78%低い繰り返しを提供する。これらの発見は、アライメントが単なる分布の平滑化ではなく、十分な制御強度を必要とすることを強調している。

arXiv Computational Linguisticsモデル / 研究サイト内本文