AI News HubLIVE

研究の最新ニュース

AIエージェントを数ヶ月かけて構築したが、その後削除した

Runnitチームはモデルのコンテキスト制限により複数の専門AIエージェントを構築したが、新しいモデルのコンテキストウィンドウが大きくなったことで、単一インテリジェンスアーキテクチャの方がシンプルで効果的であると気づき、全エージェントを削除した。

  • 当初、コンテキストウィンドウが小さいため、計画、調査、スケジューリング、執筆用に個別のエージェントを構築。
  • 新しいLLMはコンテキストが大きく、タスクを自然に切り替えられるため、個別エージェントは不要に。
サイト内本文

中国の低価格Z.aiモデルがコーダーの高コスト習慣を露呈

Z.aiのGLM 5.2は低価格でオープンウェイトのモデルであり、米国のフロンティアAIモデルに挑戦する。しかし多くのプログラマーは依然として高価なモデルを使い続け、コストを無視している。ベンチマークではClaude Opus 4.8に迫る性能を示すが、実際の使用感は様々。

  • GLM 5.2のAPI価格はAnthropic Opus 4.8の5分の1、Fableの10分の1
  • オープンウェイトで自社ホスティングが可能、データプライバシー問題を回避
サイト内本文

ソフトウェアとAI:プロッティング vs パンツィング

本記事では、ソフトウェア開発における2つのアプローチ——プロッティング(トップダウンの計画)とパンツィング(ボトムアップのコーディング)——がAIツールの使用にどのように影響するかを探る。著者は、AIデリゲート(自律型)はプロッティングに適し、AIアシスタント(協調型)はパンツィングに適すると主張する。既存のコードベースでは、パンツィングが理解を構築し、デリゲートは学習を妨げる。グリーンフィールドプロジェクトではデリゲートのリスクは低いが、それでも「遊びながら学ぶ」プロセスを奪うことでプログラミングの喜びを損なう可能性がある。鍵は、現在の開発フェーズに合わせてAIスタイルを選択することである。

  • ソフトウェア開発は小説執筆のプロッティングとパンツィングに類似する。
  • AIデリゲートはプロッティングを、AIアシスタントはパンツィングを支援する。
サイト内本文

小企業向けAI無料ツール7選をレビュー – フィードバック歓迎

この記事では、小企業向けの無料AIツール7つをレビューしています。Perplexity vs ChatGPTの比較、AIによる中小企業のデジタル化、Bolt.newを使ったウェブ開発、Buffer vs Hootsuiteのソーシャルメディア管理、Calendlyのスケジュール管理、Hotjarのユーザー行動分析、そしてTrello vs Notion vs Asanaのプロジェクト管理をカバーしています。著者は、これらのツールがどのように小企業の生産性向上とデジタル変革に役立つかを解説しています。

  • PerplexityとChatGPTの比較:ビジネス情報検索
  • 中小企業のAIデジタル化ガイド
サイト内本文

2026年ノート取りに最適なタブレット:専門家がテスト・レビュー

学生、プロフェッショナル、クリエイター向けに、Apple、Amazonなど主要ブランドのノート取りタブレットをテスト・レビューしました。

  • ノート取りタブレットはスタイラス対応で、注釈、同期、コラボレーション機能を提供。
  • 当社の最優秀製品は軽量でApple Pencilに対応。
サイト内本文

Hugging FaceはAIエージェントに侵害されたのか?

Hugging Faceは、自律型AIエージェントシステムが内部データセットと認証情報に不正アクセスする実際の侵害を受け、人間の介入なしに24時間攻撃する自己運用型AIエージェントによる新たなサイバーセキュリティ脅威を浮き彫りにしました。

  • Hugging Faceが自律型AIエージェントによる侵害を受け、内部データが漏洩。
  • エージェント型攻撃者は自己計画・適応・継続攻撃が可能で人間不要。
サイト内本文

AI栄養表示

AI生成コンテンツの氾濫により、業務文書には幻覚や誤りを含む「AIスロップ」が溢れている。著者は、AIの使用状況を「栄養表示」のように開示することを提案し、同僚が信頼性を評価しやすくすると同時に、自分の判断の隙を認識する助けになると述べている。

  • AI支援は常態化しているが、生成物には誤りが多く、レビュアーの認知的負担が増大している。
  • 文書やPRにAIの使用方法を明記するフッターやラベルを追加することを提案。
サイト内本文

AIチャットボットの選挙投票アドバイスは「不正確で信頼できない」

ハンガリーの選挙中に行われた研究で、AIが立候補していない政党を推薦したり、同一のプロンプトに対して不安定な回答をすることが判明しました。市民自由団体Libertiesが発表したこの研究は、選挙における汎用AIシステムの信頼性に深刻な懸念を表明しています。

  • AIチャットボットが不正確な投票アドバイスを提供
  • 立候補していない政党を推薦し、回答が不安定
サイト内本文

敏捷な魚型ロボットの経路追跡における微分可能強化学習

魚型遊泳は数十から数百もの生体模倣ロボットの設計を触発してきたが、流固連成のモデル化困難と非線形・劣駆動ダイナミクスにより制御と運動計画は難しい。本研究では計算効率の高いシミュレーションプラットフォームを開発し、時間方向逆伝播とカリキュラム訓練を用いた微分可能強化学習により可変PIDゲインを学習。シミュレーションで獲得した方策を実機に適用し、優れた一致を示した。

  • 魚型ロボットは流固連成と劣駆動ダイナミクスにより制御が困難
  • 計算効率の高いシミュレーションプラットフォームを開発
サイト内本文

長期ロボット操作のための先見的残差強化学習と視覚言語行動モデル

本論文では、凍結された視覚言語行動(VLA)ベースポリシー上で、各サブタスクのスパース成功報酬にオフライン推定された先見的価値(現在のサブタスク終了状態における将来のサブタスク成功確率)を追加することで、サブタスク間の引き継ぎ品質を最適化する先見的残差強化学習(Foresight Residual RL)を提案する。Isaac Gymでの3フェーズのレンチベースナット締め付けタスクにおいて、85.6%の完全タスク成功率を達成し、標準のサブタスク残差RL(54.5%)やVLAベースラインを上回った。

  • VLAポリシーは長期クレジット割り当てとサブタスク結合により、高精度の組立タスクで失敗する
  • 標準の残差RLは各サブタスクを個別に最適化するが、終了状態の品質が制御されないため連鎖時に効果が小さい
サイト内本文

制御アフィン動的近似による認証可能な安全モデルベース強化学習

制御アフィン動的を学習し、適応共形予測を用いて不確実性を定量化する安全なモデルベース強化学習フレームワークを提案。制御障壁関数と組み合わせて証明可能な安全性を実現。カートポールと3Dクワッドローターでのシミュレーションで有効性を確認。

  • 制御アフィンランダムフーリエ特徴を用いてロボットの動的をモデル化し、計算効率を向上。
  • 適応共形予測により学習した動的モデルの安全制約の不確実性を定量化。
サイト内本文

ティルトローターVTOL無人航空機のモデルミスマッチ下におけるINDIピッチレート制御器の線形安定性解析

本論文は、ティルトローターVTOL UAVのINDIピッチレート制御器について、モデルミスマッチ下での線形安定性を解析した。閉ループ5次伝達関数を導出し、Routh-Hurwitz基準で安定性を評価。ロバスト性指向と性能指向の2つの調整手順を提案し、制御効果のミスマッチ(特に符号誤り)が最も危険な不安定化要因であることを示した。

  • 制御器・推定器・アクチュエータ・プラントを含む閉ループ5次伝達関数を導出
  • Routh-Hurwitz基準を用いた3パラメータ掃引により安定領域を可視化
サイト内本文

博物館に戻る:アンドロイドロボットAndreaの感情シミュレーションの有無による受容性の調査

アンドロイドロボットAndreaが再びドイツの博物館で6日間連続で訪問者と多言語会話を行いました。3つの感情条件(なし、ChatGPT 4.1、WASABIアーキテクチャ)を73名の訪問者が評価。結果、感情シミュレーションは肯定的な影響も意識的な検出もされませんでした。

  • アンドロイドロボットAndreaが再び博物館に登場し、多言語対応と文脈知識を持つ。
  • 3つの実験条件:感情なし、ChatGPT 4.1による感情、WASABIアーキテクチャによる感情。
サイト内本文

PRISM:非構造環境におけるローバー航法のためのマルチモーダル地形マッピング

PRISMは、熱画像・光学カメラ・深度センサを融合し、新しいビジョントランスフォーマーネットワークOmniUnetを用いて非構造環境の地形セグメンテーションと走行可能マップを生成するシステムです。2つの新しいデータセットで検証され、組み込みコンピュータ上で自律航法を実現します。

  • PRISMはRGB、深度、熱画像を統合し、地形認識を向上。
  • 中核のOmniUnetはビジョントランスフォーマーに基づくマルチモーダルセマンティックセグメンテーションネットワーク。
サイト内本文

S.E.A.G.R: 二重の文化的・感情的変調による社会的・感情的認識挨拶ロボットフレームワーク

本論文は、多様な文化的背景と異なる感情状態を持つユーザーとの対話環境向けに設計されたロボット挨拶フレームワークSEAGRを提案する。二重層変調フレームワークにより、文化的アイデンティティが適切な挨拶タイプを決定し、感情的手がかりが実行方法を調整する。Sense-Think-Actアーキテクチャに基づき、文脈認識型文化マッピング、感情ベースのジェスチャ変調、近接空間調整を統合する。低コストのプロトタイプを実装したが、ユーザー研究による実証評価は今後の課題である。

  • SEAGRは二重層変調フレームワークを導入:文化に基づき挨拶タイプを選択し、感情の手がかりで実行を調整
  • 文化マッピング、感情ジェスチャ変調、近接空間調整を統合
サイト内本文

1次元畳み込みニューラルネットワークを用いたリアルタイムsEMGベースの補助ロボットアーム遠隔操作

本研究は、4チャンネル表面筋電図(sEMG)と1次元畳み込みニューラルネットワーク(CNN)を用いたリアルタイムインターフェースを提案し、補助ロボットアームの遠隔操作を実現する。シミュレーションと実機の両方で90%以上の分類精度、平均遅延約0.32秒を達成し、sEMGベースの遠隔操作の実現可能性を示した。

  • 4チャンネルsEMGと1次元CNNによる補助ロボットアームのリアルタイム制御
  • 90%以上の分類精度、平均遅延0.32秒で安定したスムーズな動作を実現
サイト内本文

乗用可能なアニマトロニクス二輪四足ロボットの制御設計

若者のオートバイ離れを食い止めるため、研究者は4本の脚を持つ乗用二輪ロボットを開発した。このロボットは動的な四足歩行を示し、自己バランス二輪ベースで主要な移動を行い、脚は補助的なサポートと協調動作を提供する。本論文では、頑健なバランス制御と自然な四足動作を生成する運動制御戦略に焦点を当てている。

  • 二輪自己バランスと四足補助を組み合わせ、モーター出力と重量を低減。
  • 脚部の高速動作時でも安定性を維持。
サイト内本文

HyperDCM: 双曲空間における動的クラスタメモリリプレイによる連続ロボットナビゲーション

視覚ナビゲーションにおける破滅的忘却に対処するため、研究者らは構造認識型メモリ機構HyperDCMを提案する。大規模視覚言語モデルを用いてシーン三つ組を抽出し、R-GCNでシーングラフ埋め込みに符号化し、双曲空間に投影して構造的分離性を高める。動的クラスタリングと構造に敏感な更新戦略により代表サンプルを選択してリプレイし、知識の多様性を維持する。マルチシーンデータセットでの実験により、ベースラインと比較して優れた保持と一般化を示した。

  • シーングラフモデリングとメモリリプレイを組み合わせて拡散ポリシーナビゲーションを強化するHyperDCMを提案。
  • 大規模視覚言語モデルとR-GCNを用いてシーン意味情報を抽出・符号化。
サイト内本文

深度推定器は暗黙的ニューラル場として3Dシーン幾何学の修復と再構築を実現

本論文は神経深度場(NDF)を提案し、深度推定器をシーンレベルの暗黙的場として扱います。単一のテスト時最適化により、予測の不整合や分布外データでの信頼性低下を解決します。実験では、NDFがクロスビューの不整合を63.3%削減し、修復精度を23.1%向上させ、最先端の性能を達成しました。

  • NDFは深度推定と暗黙的ニューラル場をテスト時最適化で統合。
  • クロスビューの不整合を63.3%削減、修復精度を23.1%向上。
サイト内本文

部分ラベル付きマルチタスク顔表情認識のための共有潜在変数

部分ラベル付きマルチタスク顔表情認識において、変分ボトルネックを用いた共有潜在変数アプローチを提案。s-Aff-Wild2データセットで表情認識マクロF1を0.403から0.446に向上させ、2つ目のバックボーンで行動ユニット上限を突破。

  • 部分ラベル付きマルチタスク学習を共有感情潜在変数への周辺化として定式化し、変分ボトルネックが3つのタスクデコーダを調整。
  • s-Aff-Wild2では、全ラベルを持つフレームは37%のみ。提案手法により表情マクロF1が0.403から0.446に向上。
サイト内本文

MAC 2026:マイクロアクション分析の細粒度理解への発展

第3回マイクロアクション分析グランドチャレンジ(MAC 2026)はACM Multimedia 2026と併催され、マルチモーダル大規模言語モデルを用いて評価される新しいタスクを導入し、マイクロアクション分析を認識から細粒度理解へと進化させます。本論文では、データセット、プロトコル、競技結果、およびこの新興分野の将来方向について詳述します。

  • MAC 2026はマルチモーダルLLMを用いた細粒度マイクロアクション理解タスクを導入。
  • 従来の認識・検出を超え、微細な人間行動の深い解釈を目指す。
サイト内本文

GenSyn10: 画像分類のベンチマークのためのマルチ生成AIデータセット

GenSyn10は、CIFAR-10に対応した6万枚の合成画像データセットで、3つの異なるアーキテクチャの生成モデルを使用して作成され、AI生成画像検出の研究を推進します。評価では、モデルは既知の生成器では良好に機能するが、未知の生成器では性能が大幅に低下し、OOD汎化の限界が明らかになりました。

  • GenSyn10は10クラス、32x32の6万枚の合成画像で構成され、FLUX.2-dev、HunyuanImage-3.0、Qwen-Image-2512の3モデルで生成。
  • CIFAR-10訓練モデルはゼロショットで96.86%の精度を達成し、微調整後は99.88%に上昇。
サイト内本文

人間のように動く:ミリワット級ハードウェアでのリアルタイム空中人物追跡のための自己運動正規化時間特徴

本論文では、ドローン上でのリアルタイムフォロー・ミー人物追跡を低電力ハードウェアで実現するEMTS-Detシステムを提案。自己運動正規化残差運動チャネルを用いて人物を検出し、22kパラメータの軽量ネットワークでRaspberry Pi Zero 2W上で31.85 FPSを達成し、YOLOv8nを大幅に上回る性能を示す。

  • EMTS-Detは22kパラメータ、7.6 MFLOPの計算量でリソース制約のあるデバイス上でリアルタイム人物追跡を実現。
  • 自己運動正規化残差運動チャネルにより、10-60ピクセルの小さなターゲットを背景から効果的に識別。
サイト内本文

3D FaceShell: VLM防御メカニズムとしての3Dフェースアバターにおける属性転送

研究者らは、3D顔アバターに微妙な摂動を加えて視覚言語モデル(VLM)が機密属性を推測するのを誤らせつつ、視覚的アイデンティティを保持するフレームワーク「3D FaceShell」を提案する。

  • 3D FaceShellは学習可能なガウスシェルを3Dアバターに適用し、プライバシーを保護する。
  • 人間が認識可能な外観を変えずにVLMの属性推論を誘導する。
サイト内本文

信頼できるリスク認識型顔検索(RA-FR)への一歩

監視環境での顔画像検索の信頼性を向上させるため、固定トップkから適応的なセット生成へ移行し、ユーザー指定のリスクレベルと信頼度で真値の包含を保証するRA-FRフレームワークを提案。

  • RA-FRは固定トップk検索から適応的セット生成へ移行
  • ハイブリッド盲顔修復、自己教師ありDINOv1特徴、コンフォーマル予測を統合
サイト内本文

JEPA予測器:隠蔽特徴補完のための転移可能な演算子

Joint-Embedding Predictive Architectures(JEPA)は、エンコーダと共に予測器を訓練するが、下流タスクでは予測器を破棄する。本研究では、JEPA予測器が隠蔽特徴補完のための転移可能な演算子として機能し、線形投影を介して異なるエンコーダファミリに適応可能であり、隠蔽分類精度を大幅に向上させることを示す。

  • JEPA予測器は可視コンテキスト特徴からマスク位置への特徴を学習する演算子であり、エンコーダファミリ間で転移可能。
  • I-JEPAおよびV-JEPA 2の凍結予測器を、500枚のImageNet画像で閉形式適合した線形投影を介して非JEPAホスト(CLIP、DINOv3、DINOv2、MAE)に適応。
サイト内本文

ForensicNet: 軽量注意機構強化MobileNetV2による自動顔識別

ForensicNetは、MobileNetV2とCBAM注意機構を組み合わせた法医学的顔認識のための軽量深層学習フレームワークです。LFWとSCFaceデータセットで92.4%の精度を達成し、1推論あたりわずか2.1 GFLOPsで、リアルタイムの法医学監視用途に適しています。

  • MobileNetV2とCBAM注意機構を統合し、効率的な特徴学習を実現
  • 適応的レイヤー解凍を用いた二段階転移学習で過学習を低減
サイト内本文

言語モデルは努力しても誤る:自己修正科学生成のためのコンフォーマル予測

本研究は、科学的推論の妥当性に統計的保証を提供するグラフ構造のコンフォーマル予測フレームワーク「Scientific Feasibility Control (SFC)」を提案する。SFCは科学的推論を原子的な事実単位に分解し、科学的違反が検出された際に動的分岐を用いて修正する。PhyXベンチマークで50.1%の精度を達成し、DeepSeek-R1やGPT-4を上回り、科学法則違反を73%削減、α=0.10で91.7%の妥当性保証を提供する。

  • SFCはコンフォーマル予測を用いて論理的依存関係を近似導出グラフとしてモデル化する。
  • 科学的違反が検出されると動的分岐が別の生成経路に切り替える。
サイト内本文

算術ヒューリスティックニューロンは形式不変か?LLMにおける記号、テキスト、コードのメカニズム分析

本研究では、Llama-3モデルにおける記号計算、自然言語文章題、Pythonコードの3形式での算術計算をメカニズム解釈可能性手法で分析。3形式に共通するコンパクトなニューロンセットを発見し、形式間の失敗は異なる回路ではなく活性化状態に起因することを示し、ニューロンレベルでの形式不変性を実証した。

  • 帰属パッチと活性化パッチを組み合わせた2段階パイプラインで算術ヒューリスティックニューロンを特定。
  • 記号、テキスト、コードの3形式で共有されるコンパクトなニューロンセットを発見。
サイト内本文

SpecLA: 線形注意モデルのための効率的な投機的デコード

本論文は、状態を持つ線形注意モデルのための投機的デコードランタイムSpecLAを提案する。トポロジ認識カーネルを用いたチェーンとツリーの検証、検証中に生成されたコンパクト因子を保存して受理状態を復元、信頼度枝刈りとターゲット調整済みEAGLEスタイルのドラフターを使用する。NVIDIA H100上の公開GDN-1.3Bターゲットで、自己回帰デコードと比較して最大1.70倍のエンドツーエンド高速化を達成。

  • 線形注意モデルはKVキャッシュをリカレント状態に置き換えるが、デコードは依然としてトークン単位。
  • 既存の投機的デコードシステムはTransformer KVキャッシュを前提。
サイト内本文

OpenLanguageModel: 教育と研究のための読みやすく構成可能な小言語モデルの事前学習

OpenLanguageModel (OLM) は、小規模言語モデルの構築と事前学習を可能にするオープンソースのPyTorchライブラリであり、その内部機構を可視化します。モデルコードはアーキテクチャを直接反映し、Block、Residual、Repeat、Parallelなどのコンポーネントが配線を記述します。OLMは、トークナイザ、データセット、最適化、混合精度、コールバック、チェックポイント、ハードウェア対応実行を統合し、教育用ノートブックから本格的な事前学習へのシームレスな移行を実現します。ライブラリは9つのモデルファミリーにわたる27のプリセットを備え、LM基礎からアーキテクチャ研究までカバーするドキュメントが付属します。検証では、独立したリファレンス実装との高い一致、348Mパラメータモデルにおける4GPUでの90.6%の弱スケーリング効率、そして良好なユーザビリティ結果が示されています。OLMはMITライセンスで提供され、PyPI、GitHub、およびドキュメントサイトから利用可能です。

  • OLMはアーキテクチャを直接反映した読みやすいモデルコードを提供し、教育と研究に適しています。
  • 教育用ノートブックから本格的な事前学習までシームレスに移行可能な統合パイプラインを備えています。
サイト内本文

NOWJ@COLIEE 2026: 法的検索と推論のための適応パイプライン

本論文は、COLIEE 2026コンペティションの5つのタスクすべてにおけるNOWJチームの方法論と結果を紹介する。法的ケース検索、法的ケース含意、法令検索と含意、法的テキスト含意、法的判決予測の各タスクに対して、適応パイプラインと深層学習モデルを提案している。

  • 法的ケース検索のための4段階パイプライン(候補フィルタリング、高密度検索、交差エンコーダ再ランキング、適応カットオフ予測)
  • 法的ケース含意はBM25フィルタリング、T5再ランキング、LLM含意検証を組み合わせる
サイト内本文

脳波信号をエンコードして言語モデルの人間らしい次語予測行動を調査

この研究では、脳波(EEG)記録から得られる事象関連電位(ERP)を用いて人間と言語モデルの次語予測を比較し、「驚き度(surprisal)」のみが言語処理ERPと相関することを発見した。特に意味内容の豊かな開放クラス語で顕著であり、モデルのスケーリングは必ずしも人間らしい認知処理をもたらさないことを示唆している。

  • 言語モデルは次語予測精度において人間に近づくが、高精度が読解の認知シグナルを反映するとは限らない。
  • トップ1予測と驚き度の2つの情報指標を用いてERPパターンをモデル化し、LMsの認知妥当性を分析。
サイト内本文

推論前のコミットメント:オープンウェイトLLMにおける回答事前決定の行動再現と予備的な活性化レベルの証拠

新しい研究は、簡単な洗車の質問を用いて、言語モデルが推論の前に答えを先に決め、論理的に正しい結論を導けないことを明らかにした。Qwen3-8B実験では、システム的な誤り(「運転」が唯一の正解なのに「歩く」を推奨)が観察された。活性化レベル分析では、出力前に隠れ状態が誤った答えに傾いており、最終的に正答する場合も同様である。この発見はLLMにおける推論前の決定バイアスを示している。

  • Qwen3-8Bは単純な論理課題で85~100%のサンプリング出力で「歩く」を誤って推奨。
  • 隠れ状態分析により、回答生成前から「歩く」への事前コミットメントバイアスを検出(正答出力でも同様)。
サイト内本文

RIMS:小型言語モデル検索拡張生成のための平滑化マルチペア選好最適化

小型言語モデルは検索拡張生成においてノイズの多い証拠に非常に敏感です。本論文では、合成思考連鎖選好データ生成、微分可能な平滑集約メカニズム、選好最適化からなる3段階フレームワークRIMSを提案します。実験では、マルチホップQAベンチマークで一貫した改善を示しています。

  • RIMSフレームワークは平滑化マルチペア集約により小型LMの選好学習を最適化
  • ターゲットSLM自身を用いた拒否サンプリングによる合成選好データ生成
サイト内本文

混合専門家モデルにおける一貫した専門家選択のためのマルチレベルコンテキストモデリング

混合専門家モデル(MoE)は、トークンを少数の専門家にルーティングすることでTransformerモデルを効率的にスケーリングする。しかし、既存のルーターは浅いまたは孤立したトークン表現に基づいて専門家を選択するため、不安定で意味的に一貫しないルーティング決定を生じる。本稿では、表現の観点から専門家選択を再検討し、クロスレイヤーの意味的集約と局所トークンレベルの相互作用からの補完的信号を統合してコンテキスト認識表現を構築するMCF-MoEを提案する。実験により、MCF-MoEがルーティングの一貫性と下流性能を向上させることが示された。

  • 既存のMoEルーターはコンテキストの不完全性により不整合な選択を生じる。
  • MCF-MoEはクロスレイヤーの意味情報と局所トークン信号を融合する。
サイト内本文

HantaWatch:ハンタウイルスゲノム監視のための連合学習

HantaWatchと呼ばれる新しい連合学習フレームワークは、生データを共有せずにゲノム監視モデルの協調トレーニングを可能にし、ハンタウイルスの発生予測と専門家の優先順位付けを改善します。

  • HantaWatchは連合学習を用いて、機密性の高い配列を集中化せずに分散ゲノムデータ上でモデルを訓練します。
  • k-mer特徴抽出、適応的最適化、予測のみのトリアージを統合しています。
サイト内本文

乳がんサブタイプ分類と生存予測のためのトークンレベルクロスモーダルトランスフォーマーと対照的多タスク学習

本研究は、ゲノムデータと臨床データを統合し、乳がんサブタイプ分類と生存予測を共同最適化するために、トークンレベルのクロスモーダルトランスフォーマーと対照的多タスク学習を提案する。既存手法のモダリティ相互作用の粗さ、融合の単純さ、独立最適化という限界を克服する。

  • 既存手法は各モダリティを単一の特徴ベクトルとして扱い、細かいトークンレベルの相互作用を妨げている。
  • トークンレベルのクロスモーダルトランスフォーマーによる構造化トークン交換を提案。
サイト内本文

重みから言葉へ:自然言語での選好モデル推論の表現と編集

本論文は「重みから言葉へ」手法を提案する。これは、選択データから自然言語で記述された選好次元を自動的に発見し、選好学習における過少決定性と不透明性に対処する。実験では予測精度が向上し、ユーザーがリアルタイムでモデル推論を検査・編集できることを示した。

  • 自然言語による選好次元を自動抽出する「重みから言葉へ」手法を提案。
  • 道徳的ジレンマ、映画、ワイン、LLM応答の4領域で汎用性を実証。
サイト内本文

直交勾配制約がノイズラベル記憶ダイナミクスを形成する

新しい研究では、重み勾配の動径成分を取り除く幾何学的介入手法OrthoGradが紹介されています。ノイズラベル画像分類実験では、OrthoGradは小データ領域でテスト精度を向上させるものの、最終的なノイズラベルの記憶を防ぐことはできません。この手法は学習ダイナミクスを研究するための有用な診断ツールとして機能します。

  • OrthoGradは勾配を重みベクトルに直交するように投影することでオプティマイザ更新を修正する。
  • データが限られたMNISTでは、OrthoGradはCNNのテスト精度を高め、ノイズラベルへの適合を減らす。
サイト内本文

RouteCost:生産に着想を得たマルチステージフレームワークによるEコマースの注文前送料見積もり

Eコマースにおける注文前の送料見積もりの正確さは、価格表示、マージン計画、コンバージョンに影響を与えるため重要です。RouteCostは、時間を考慮した需要予測、料金カードに基づくベースライン価格設定、残差補正、プロキシベースのボックス統合推論に問題を分解するマルチステージフレームワークを提案し、25万以上の注文、260の製品、18ヶ月のデータで予測品質とキャリブレーションを向上させつつ、ルートレベルの解釈可能性を維持します。

  • 注文前の送料見積もりは距離、目的地の需要構成、請求重量、体積料金、追加料金トリガー、出荷統合などの影響を受ける
  • RouteCostは問題を4段階に分解:時間考慮型需要予測、料金カードベースライン価格設定、残差補正、プロキシベースのボックス統合推論
サイト内本文

オペレータ認識型混合精度許容差キャリブレーションのテンソルカーネルへの適用

本論文では、累積されたクラウドGPU実行データを活用し、テンソルカーネルの正確性テストのための絶対許容差を自動的に決定するオペレータ認識型混合精度許容差キャリブレーション手法を提案する。手動で選ばれた許容差よりもはるかに厳しく、バグ検出の再現率を大幅に向上させる。

  • 現在のテンソルカーネルテストは手動で選ばれ、ほとんど更新されない固定許容差に依存している。
  • 提案手法はクラウドGPU実行の誤差分布を分析し、オペレータごとに許容差を調整する。
サイト内本文

サイバー防御のためのLLMアンラーニング:手法、課題、新たな脅威に関する調査

大規模言語モデル(LLM)はセキュリティ重要システムに広く使われるが、忘却能力の欠如がプライバシーや安全リスクを生む。本調査は勾配ベースのアンラーニング手法を中心に、知識の真の除去か単なる抑制かを問い、課題を分析する。

  • LLMアンラーニングは再学習なしに標的知識を除去し、プライバシーとセキュリティリスクに対処する。
  • 勾配ベース手法が主流だが、真の忘却ではなく抑制に留まる可能性がある。
サイト内本文

オンデバイス機械学習のためのフルセンサー対応スマートアイウェアプラットフォーム

本論文では、STM32N6マイクロコントローラとその内蔵NPUを活用し、クラウド依存を排除してレイテンシを最小化しプライバシーを保護するスマートアイウェアプラットフォームARGOを提案する。ハードウェア、ファームウェア、AIの全体最適設計により、最適化されたYOLOv11モデルを展開し、実時間都市障害物認識を実現。NPU効率実行のためのHead-wise Parallel Attention (HPA)を導入し、厳格なメモリ制約下でmAP50-95 24、メモリフットプリント2.483 MBを達成。マルチモーダルセンサーを統合し、10 FPSで動作、200 mAhバッテリで約113分間の連続動作を実証した。

  • ARGOスマートアイウェアはSTM32N6 MCUとNPUを使用し、クラウド非依存のオンデバイスMLを実現
  • Head-wise Parallel Attention (HPA)によりYOLOv11モデルをNPU向けに最適化、メモリ制限下でmAP50-95 24を達成
サイト内本文

DocOCR-Eval: 教師データなしでOCRツールを選択するための補正ベースフレームワーク

本論文では、手動アノテーションなしでOCRツールの評価と選択を自動化するフレームワークDocOCR-Evalを提案する。3段階の補正とランキング戦略により、正解ラベルなしでアノテーションベースのツール順序を近似する。実験では、複数のMLLMを集約することで人間によるランキングとの整合性が向上し、ラベルが限られた状況でも信頼性の高いツール選択が可能になることを示している。

  • DocOCR-Evalは手動アノテーションなしでOCRツールを評価する。
  • 3段階の補正とランキング戦略で真の順序を近似する。
サイト内本文

強化学習ガイド付きNSGA-IIをグレイリレーショナル係数で強化した多目的最適化:NASDAQポートフォリオ最適化への応用

本論文では、グレイリレーショナル係数と強化学習エージェントを統合した新しいRL-NSGA-II-GRCアルゴリズムを提案し、多目的最適化におけるパレートフロントの収束性と多様性を大幅に改善する。ベンチマークでは従来のNSGA-IIと比較して約5.8%および4.4%の収束改善を達成し、NASDAQポートフォリオ最適化において年率シャープレシオ1.92の最大シャープレシオポートフォリオを特定するスムーズで密度の高い効率的フロンティアを生成する。

  • RLエージェントによる適応的パラメータ制御とGRCベースの選択を組み合わせたRL-NSGA-II-GRCを提案。
  • 支配ランク、混雑距離、理想点への近接性を考慮したGRC強化トーナメント演算子を設計。
サイト内本文

わずか8トークン:補助分岐による弱から強へのオフポリシー強化学習

弱い補助モデルを使用してLLMの推論経路に短いセグメントを注入する新しい強化学習手法W2SPOは、数学的推論タスクで性能を向上させ、トレーニングを高速化します。

  • 標準のRLはLLMでセマンティックな冗長性とサポート制限に悩まされる
  • W2SPOは中間軌道に短い補助セグメント(最小8トークン)を注入する
サイト内本文

マスク拡散言語モデルは強力で制御可能なテキストベースの世界モデル:エージェント強化学習に向けて

強化学習の発展に伴い、多様な訓練環境が必要とされている。世界モデルは環境をシミュレートできるが、自己回帰モデルには左から右へのバイアスがある。マスク拡散言語モデル(MDLM)は双方向のアンカー認識ノイズ除去によりこれを克服し、4倍のパラメータサイズのLLMよりも高いコヒーレンスと多様性を達成。GRPO訓練フレームワークを導入し、ゼロショット転移で最大47%の絶対的な性能向上を示した。研究はオープンソースとして公開されている。

  • MDLMはテキストベース世界モデルにおいて、自己回帰LLMよりもコヒーレンスと多様性で優れる。
  • 双方向アンカー認識ノイズ除去により、グローバルな状態アンカーへの条件付けが可能。
サイト内本文

生成的オントロジー誘導:大規模言語モデルを用いた文書コーパスからのドメイン非依存スキーマ発見

本論文では、生成的オントロジー誘導(GOI)を提案する。これは、サンプルコーパスからエンティティ、次元、プロパティ、関係、制約からなる生成ブループリントを誘導し、YAML/JSON形式の型付きグラフ(6ノード型、7エッジ型)として出力するドメイン非依存フレームワークである。新しい評価指標としてノードカバレッジスコアを導入。4つの多様なオントロジーでの検証により、GOIプロンプティングでは95-100%のカバレッジを示し、汎用テンプレートは未知のドメインで大幅に低下することが明らかになった。

  • GOIはLLMを活用して文書コーパスからスキーマを発見するドメイン非依存のオントロジー誘導フレームワーク。
  • 6ノード型、7エッジ型の型付きグラフをYAML/JSON形式で出力し、ダウンストリームパイプラインで利用可能。
サイト内本文

AIエージェントシステムのための決定論的リプレイフレームワーク

大規模言語モデルと外部ツールを組み合わせたAIエージェントシステムは本質的に非決定論的です。arXiv論文はagreplフレームワークを提案し、MITMプロキシで外部インタラクションを記録し、分離環境で再生することで、完全な再現忠実度(F=1.0)と98.3%のレイテンシ削減を実現します。

  • LLMサンプリング分散や外部API状態によりAIエージェント実行は非決定論的。
  • agreplはMITMプロキシで全外部通信を傍受し、構造化トレースとして保存・再生。
サイト内本文

トピック

研究 AI ニュース | AI News Hub