AI News HubLIVE
サイト内リライト3 分で読了

ML、AI、深層学習の研究トピック

機械学習の研究トピックを広く概観し、幾何学的深層学習、誤差分解と二重降下、グラフ基盤モデル、Transformerの限界と効率化、拡散モデルとフローマッチング、LLMの訓練と整列、グラフMLパイプライン、医療AIを扱う。

ソースHacker News AI著者: sparshrestha

本稿は、機械学習・AI・深層学習の研究トピックを広く概観する。幾何学的深層学習では、非ユークリッド空間へのニューラルネットワークの拡張を扱う。ユークリッド幾何学、群不変性定理、普遍近似定理、ローゼンブラットのパーセプトロン、次元の呪い、ネオコグニトロン、LeNet-5などが挙げられる。また、ソフトウェア1.0と2.0の違い、グラフニューラルネットワークとWeisfeiler–Lehmanテスト、DeepSetsも紹介される。CNNは並進等変、GNN層は置換等変であり、グラフ読み出しは置換不変である。幾何学的深層学習の5GはGrids、Groups、Graphs、Geodesics、Gaugesからなる。

教師あり学習では、近似誤差・推定誤差・最適化誤差という三つの誤差源と経験リスク最小化が論じられる。誤差分解により、総超過誤差はこれら三つの和で表され、モデル複雑度との関係が示される。最近傍分類器、近似レート、Sobolevクラスの次元の呪い、良性ランドスケープ、Lipschitz推定誤差なども言及される。二重降下は、モデル複雑度に対する誤差の非単調な挙動を表す。

グラフ基盤モデルでは、知識グラフTransE、メッセージパッシングニューラルネットワーク、知識グラフ上のリンク予測と転移可能性が取り上げられる。Transformerの研究課題として、二次複雑性があり、LoRA、KVキャッシュ最適化、スパース/ローカル/線形注意、FlashAttentionなどが対策となる。固定コンテキストウィンドウは、長コンテキスト訓練、位置スケーリング、スライディングウィンドウ注意、RAGによって拡張される。帰納的バイアスの欠如を補うため、局所性、等変性、再帰、構造化位置符号化などのアーキテクチャ上の事前知識が導入される。数学的推論の困難さも指摘されている。

拡散モデルとフローマッチングは生成モデリングの中心である。拡散は確率的動学を用いることが多く、フローマッチングは決定論的ODEベクトル場を学習するが、両者は重なり合う。ML成功のレシピとして、大規模で多様なデータセット、明確な性能基準、縮退した解空間、適切な仮説クラスと扱いやすい最適化が挙げられる。データ不足領域には、単純な算術、ソート、サーモスタット調整、道徳推論などがある。言語モデリングでは、ELMoが深層双方向LSTMから文脈埋め込みを生成する。RNNは時間方向の誤差逆伝播のため並列化が難しかったが、Transformerは自己注意、残差接続、層正規化、位置埋め込みによりこれを解決した。

効率化技術としては、KVキャッシュ最適化、4ビット量子化によるメモリ削減、LoRAによるパラメータ効率的ファインチューニング、vLLMによる推論高速化が挙げられる。LLaVAのようなマルチモーダルモデル、スパイキングニューラルネットワーク、状態空間モデルもある。蒸留や長コンテキスト手法(RoPE、ALiBi)も研究されている。LLM基礎では、ABCスケーリング、創発的能力、MMLUベンチマーク、思考連鎖プロンプトがテーマとなる。推論時スケーリングやエージェントAIでは、記憶検索ツールを持つLLMとRAGの組み合わせが重要だ。

グラフMLでは、関係データベースから関係グラフ、グラフ問題への変換パイプラインが提案され、RelBenchがベンチマークを提供する。異種GNN、時系列GNN、関係深層学習アーキテクチャが課題を解決する。GNNと特徴エンジニアリングの比較や、KumoRFMとGriffinのような関係基盤モデルも紹介される。グラフトランスフォーマー(Graphormer、ViT/MLP-Mixer)やスペクトラルGNNがアーキテクチャの方向性である。LLMとGNNを組み合わせたグラフRAGは、幻覚の低減と限られたコンテキストウィンドウの補完に役立ち、グラフ中心タスクで高性能を示す。

最後に医療AIでは、モデル中心からシステム中心への転換が強調される。データプライバシー、低性能デバイス、エッジAIが重要であり、成功はアルゴリズムの新規性ではなく医療システムのパフォーマンス向上で測られる。応用例として、ウガンダでのAI支援産科超音波が挙げられる。また、LVLMの幻覚とデータモデルの不確実性が今後の課題である。