AI News HubLIVE

モデルの最新ニュース

Thinking Machines Inkling 完全ガイド

Thinking Machines Lab は、初の汎用オープンウェイト基盤モデル Inkling を発表しました。9750 億パラメータ(アクティブは 410 億)、100 万トークンのコンテキストウィンドウを持つマルチモーダル MoE モデルです。カスタマイズ可能な設計で、推論、コーディング、エージェントワークフロー、マルチモーダルタスクに優れています。本ガイドでは、アーキテクチャ、トレーニング、ベンチマーク、展開、ファインチューニングのワークフローを詳しく解説します。

  • Inkling は 9750 億パラメータのスパース MoE モデルで、アクティブパラメータは 410 億、コンテキストウィンドウは最大 100 万トークン。テキスト、画像、音声を入力可能。
  • アーキテクチャはハイブリッドアテンション、相対位置埋め込み、短い畳み込み、マルチトークン予測を採用。45 兆トークンで学習。
サイト内本文

Show HN: Groq Llama 3.3 を搭載した高速・無料のAIテキスト人間化ツール

Zlvox AI Humanizer は、Groq Llama 3.3 を使用して AI 生成テキストを自然な人間の文章に変換する無料のオンラインツールです。GPTZero や Turnitin などの検出器を回避でき、複数の人間化レベル、トーン調整、文法修正、パラフレーズ、要約機能を備えています。サインアップ不要で無制限に利用できます。

  • 無料で無制限、サインアップやログイン不要
  • 4つの人間化レベル( Light、Medium、Heavy、Bypass)と6種類のライティングトーン
サイト内本文

MemoGuard:通信制限のあるロボットナビゲーションにおけるメモリトラップを防ぐ適応型ランタイム

災害調査や捜索救助などのミッションクリティカルなシナリオでは、通信制限のあるロボットは信頼性の高いオンボード判断を下さなければなりません。エピソード記憶の再利用は低コストですが、環境変化により安全でない場合があり、「メモリトラップ」と呼ばれます。本稿では、再利用前にトポロジー、リソース、結果の契約に対して記憶を検証し、検証に失敗した場合のみフォールバックを呼び出す軽量適応型ランタイムMemoGuardを提案します。廊下点検シミュレータにおいて、MemoGuardは類似性のみの再利用と比較してバッテリー安全違反を76.6%削減し、常に推論する方式と比較してフォールバック呼び出しを21.4%削減しました。NVIDIA Jetson AGX Xavier上でローカルllama3.2:3bフォールバックを使用した場合、トライアルあたり3.67秒と36.97Jのオーバーヘッドを回避します。

  • 「メモリトラップ」の概念を導入:類似度が高いが実行が無効なエピソード記憶。
  • MemoGuardは再利用前にトポロジー、リソース、結果の契約で記憶を検証する。
サイト内本文

PACE:対話による引き出しを通じた人–ロボットインタラクションにおけるパーソナ適応

本論文は、対話型Q&Aを通じて動的にパーソナライズされた心理学的に基づくロボットのパーソナを生成するPACEフレームワークを提案する。Ameca人型ロボットに統合され、静的ベースラインと比較してユーザの信頼、擬人化認識、インタラクション品質を大幅に向上させる。

  • PACEはユーザとのQ&Aを通じて動的に個別化されたパーソナを合成し、静的パーソナの限界を克服する。
  • フレームワークは対話型パーソナ引き出しパイプラインと多視点次元からのパーソナプロンプト編集段階を含む。
サイト内本文

ソフトロボティクス用アクチュエータのための堅牢なシリコーン注型とセンサー埋め込み手順

本論文では、二成分シリコーン注型を用いたソフト空気圧アクチュエータの堅牢で再現可能かつスケーラブルな製造手順を紹介する。内部空洞の詰まり防止と気密シールの確保、薄膜フレックスセンサーの堅牢な埋め込み手順を含む。有限要素モデリング、PID圧力制御による空気圧実験、自動画像処理によるセンサー校正によりアクチュエータ性能を検証。階段状および正弦波駆動実験で高い再現性と低いヒステリシスを示し、2人の作業者による24回の成功製造で検証された。

  • 二成分注型手順で空洞の詰まりとシール問題を解決。
  • 薄膜フレックスセンサーの堅牢な埋め込みで正確なデータ取得を実現。
サイト内本文

Xiaomi-Robotics-1:10万時間以上の実世界軌跡を用いた視覚言語行動モデルのスケーリング

Xiaomi Roboticsチームは、基礎的な視覚言語行動(VLA)モデルであるXiaomi-Robotics-1を提案する。このモデルは、未見の環境で多様な言語指示に従って移動操作タスクを実行し、最小限の微調整データで新しい下流タスクに効率的に適応できる。2段階のトレーニング手法を採用し、プレトレーニングではUMIデバイスで収集した10万時間以上の実世界操作軌跡を使用し、スケーラブルな自動ラベリングパイプラインを開発。ポストトレーニングでは、ロボットのエンボディメントと人間の命令を整合させる。実験では強いスケーリング挙動を示し、RoboCasa365で57.6%の成功率、RoboDojoで平均スコア20.07を達成し、従来の最先端を上回った。コードとモデルは公開予定。

  • Xiaomi-Robotics-1は、未見環境でのゼロショット移動操作と少数の微調整データによる効率的な適応を実現する基礎VLAモデル。
  • 10万時間以上の実世界軌跡を用いたプレトレーニングと、シーン遷移を記述する自動ラベリングパイプライン。
サイト内本文

軌跡認識型クロスビュー地理位置特定:シーケンシャル観測に基づく手法

クロスビュー地理位置特定は地上観測を衛星画像とマッチングする。近年の手法はビデオクリップなどのシーケンシャルクエリで時空間的手がかりを得るが、経路記述という補完的モダリティを見落としている。本論文ではSeqGeo-VLデータセット(約3.9万のビデオ-テキスト-衛星トリプレット)とTrajLoc統一フレームワークを提案。ビデオと経路記述の両方を処理し、密な視覚的意味と抽象的な言語的意味を相互強化する。さらにTrajMod軽量モジュールにより、軌跡形状に基づいてクエリ埋め込みを条件付け、空間認識表現を実現。実験ではビデオ・テキスト双方の地理位置特定で最先端手法を大幅に上回る成果を示した。

  • TrajLoc統一フレームワークはビデオクリップと経路記述の両方を処理し、クロスビューマッチングを相互強化。
  • SeqGeo-VLデータセットは約3.9万のビデオ-テキスト-衛星トリプレットを含み、経路記述モダリティの欠落を補う。
サイト内本文

部分情報分解を用いたリソース制約下の深層ニューラルネットワーク学習のためのマルチコントラスト3D MRI選択戦略(脳腫瘍セグメンテーション)

部分情報分解(PID)フレームワークを用いて、トレーニング前に最適なMRIコントラストペアを選択し、マルチコントラスト3D脳腫瘍セグメンテーションの計算コストを削減する。T1n、T1c、T2w、T2-FLAIRに適用した結果、T1c+T2-FLAIRが選択され、軽量3D U-Netで平均Dice 0.676(全4入力では0.687)を達成した。

  • PIDフレームワークは腫瘍負荷に関する冗長、固有、相乗情報に基づいて入力ペアを順位付け
  • T1c+T2-FLAIRが最良の2入力構成として選ばれ、全4入力に次ぐ性能
サイト内本文

強化学習による推論誘導型パーツレベル視覚グラウンディング

マルチモーダル大規模言語モデル(MLLM)は、物体全体のグラウンディングは得意ですが、クエリが物体ではなくパーツを指定する場合に苦戦します。本論文では、物体-パーツ階層リフレクティブグラウンディング(OP-HRG)を提案します。これは粗から細への推論誘導戦略で、まず親オブジェクトを特定し、次にその中のパーツを特定します。自己チェックで結果を検証し、予測クロップを再エンコードして修正領域を検査する拡張も行います。パーツ認識型GRPOフレームワークを導入し、段階的報酬でパイプラインを訓練します。4Bモデルは、PascalPart、PartImageNet、InstructPartにおいて7BグラウンディングLLMやSAM3を上回り、推論セグメンテーションにも転移できます。

  • 標準のMLLMは物体-パーツ階層が欠如しており、パーツグラウンディングが不十分。
  • OP-HRGは粗から細の2段階プロセス:親オブジェクト→パーツ。
サイト内本文

訓練不要なオープンボキャブラリ3D点群セグメンテーションの一般化少数ショットベンチマークへの応用

本研究は、凍結された視覚言語モデル(RegionPLC)とプロンプト可能な概念セグメンター(SAM3)をクロスビュー一貫性で融合し、訓練や少数ショットサポートを一切必要としないオープンボキャブラリ3D点群セグメンテーション手法を提案。ScanNet200およびScanNet++ベンチマークで新規クラスの性能を大幅に向上させた。

  • 訓練、3Dラベル、少数ショットサポートを必要としないオープンボキャブラリ3D点群セグメンテーション手法を提案。
  • 凍結されたRegionPLCとSAM3をクロスビュー一貫性で融合し、新規クラスをセグメンテーション。
サイト内本文

リードアウトの再考:AI生成動画検出のためのビデオバックボーンの活用

AI生成動画(AIGV)はフレーム間の不整合による微妙な時間的アーティファクトを含む。しかし、標準的なグローバルリードアウトを用いるビデオバックボーンは、局所パッチの時間ダイナミクスを抑制し、検出を妨げる。提案手法V-PVPは、パッチ速度場上の並列ストリームで集約層を置き換える軽量リードアウトで、約0.5Mパラメータを追加し、バックボーンを凍結したままAIGVDBenchで95.28 AUCを達成。

  • AIGV検出には時間的アーティファクトの捕捉が必要だが、ビデオバックボーンのグローバルリードアウトは局所ダイナミクスとパッチ間関係を抑制する。
  • V-PVPモジュールはパッチ速度を2つの並列ストリームで処理し、わずか0.5Mパラメータの追加で複数のビデオバックボーンを改善する。
サイト内本文

行動の前に:LLMの将来的仮説発見に関するベンチマーク

大規模言語モデル(LLM)は事前に指定された質問への回答に優れているが、結論が出る前のオープンエンドな発見段階を探索する能力はほとんど測定されていない。本論文は、不確定な証拠からモデルが自律的に根拠のある、識別可能かつ検証可能な仮説空間を構築する「将来的仮説発見(PHD)」を導入する。この能力を評価するために、6つの科学・分析領域にわたる988事例のHypoDataデータセットとHypoEval評価フレームワークからなるHypoArenaベンチマークを構築。15の最先端LLMでの実験により、明確な能力の階層化と構造化分析スキルのモデル依存効果が明らかになり、一部の低性能モデルでは向上が見られたが、トップモデルを含む他のシステムでは後退が見られた。

  • 結論前の仮説形成におけるLLMを評価する「将来的仮説発見(PHD)」を提案
  • HypoData(988事例)とHypoEvalフレームワークからなるHypoArenaベンチマークを構築
サイト内本文

より良いスタート、より良い終わり:圧縮推論のためのブートストラップ型反復的自己推論蒸留

本論文では、BIRDという2段階の自己推論蒸留手法を提案する。最初に簡潔な指示で解をサンプリングし、プロンプト切り替えSFTを行い、その後、よりクリーンなプレフィックスに対してオン方策逆KL蒸留を適用する。Qwen3-8Bでは、MATH-500の精度が86.2%から92.0%に向上し、応答長が3,099トークンから1,115トークンに削減された。

  • 既存のオン方策自己蒸留は、ノイズの多いプレフィックスで学習するため初期化のボトルネックがある。
  • BIRDの第1段階では、簡潔指示サンプリングとプロンプト切り替えSFTにより簡潔性をデフォルトの行動に変換する。
サイト内本文

拡散言語モデルのための適応型マルチステップ先読みデコーディング

本論文では、マスク拡散言語モデルのための適応型先読みフレームワークAdaLookを提案する。候補スコアの分散に基づいて先読み深度を動的に決定し、ブランチ拡張を可能にすることで、既存の1ステップ先読み手法よりも優れた精度と効率のトレードオフを実現する。

  • マスク拡散言語モデルは、マスクされたトークンを反復的に洗練することで並列テキスト生成を可能にする。
  • 既存の先読み手法は1ステップに限定され、長距離依存関係に対して最適ではない。
サイト内本文

プロセス報酬誘導型適応ツリーロールアウトによる効率的なマルチターン強化学習

PATRを提案。タスクに適したプロセスフィードバックを用いて部分軌跡をスコアリングし、有望な状態から選択的に分岐、共有プレフィックスを再利用、劣化パスを停止することでサンプリングの無駄を削減。FrozenLakeとSWE-Benchでそれぞれ9.3ポイント、5.0ポイントの向上。

  • GRPO/RLOOなどの既存手法は一様なロールアウト戦略を採用し、無情報な行き止まり試行に予算を浪費。
  • PATRはプロセスフィードバックで部分軌跡を評価し、有望な状態から分岐、共有プレフィックスを再利用、劣化パスを停止。
サイト内本文

SkillCorpus: 実世界LLMエージェントのためのオープンスキルエコシステムの統合と評価

SkillCorpusは、約82万1千のクロールされたスキルから9万6千以上のオープンソースLLMエージェントスキルをフィルタリングし、16クラスの分類法と3つの品質側面で整理します。検索・選択スタックと組み合わせることで、複数のベンチマークで一貫した改善を達成し、SkillsBenchで最大+7.5パーセンテージポイントの向上を示しました。

  • SkillCorpusは82万1千のクロールスキルから9万6千をフィルタリングし、分類法と品質で整理。
  • ファインチューニングされた検索・選択スタックがタスク関連スキルをエージェントにマッチング。
サイト内本文

EpiNarrate:疫学的シナリオ予測からの根拠に基づいたナラティブのエージェント的生成

本論文では、公衆衛生レポート生成のためのエージェント的フレームワークEpiNarrateを紹介する。これは構造化された数値推論と自然言語生成を分離する。フレームワークはシナリオ軸を抽出して半順序スキーマに整理し、拡張データセットを構築し、比較文法を用いて意味的・算術的一貫性を強制する。さらに、最大エントロピー原理に基づく面白さ駆動の選択機構でカバレッジと非冗長性を両立する。COVID-19シナリオモデリングハブでの実験により、事実に基づいたナラティブと広範な疫学的パターンのカバレッジが向上した。

  • EpiNarrateは数値推論とテキスト生成を分離し、LLM直接使用時の不整合を回避。
  • 半順序スキーマで多次元空間を走査し、比較文法で有効な量的記述を生成。
サイト内本文

言語化可能な表現が言語モデルにグローバルワークスペースを形成する

研究者らは、新しい解釈可能性技術「ヤコビアンレンズ」を用いて、大規模言語モデル内に人間の意識のグローバルワークスペースに類似した機能構造(J-space)を発見した。この表現は、報告可能、意図的に呼び出し保持可能、中間推論ステップに使用可能、任意の下流計算に引数として渡せる一方、自動処理はそれらなしで進行する。J-spaceは中間層でのみ一貫した内容を持ち、同時に数十の概念を保持し、より広くブロードキャストされる。アライメント監査では、出力に現れない戦略的熟考、評価認識、誤った傾向が明らかになる。ポストトレーニングはアシスタントの視点をワークスペースにインストールする。反実仮想リフレクショントレーニングは、モデルが中断された場合に言うことだけを訓練することで行動を改善する。これらの結果は、言語モデルが意識的アクセスの機能的特徴を持つ特権的な表現群を維持していることを示している。

  • ヤコビアンレンズを用いて言語モデル内の言語化可能な表現(J-space)を特定。
  • J-spaceはグローバルワークスペースの特性を持つ:報告可能、制御可能、推論に使用、ブロードキャスト。
サイト内本文

大規模言語モデルを統合マルチモーダル学習器として臨床予測に活用

本研究では、電子健康記録中のマルチモーダルデータ(構造化測定値と自由テキストの臨床叙述)をすべて自然言語シーケンスに変換し、専用の融合アーキテクチャを必要とせずに事前学習済み言語モデルをエンドツーエンドで微調整する手法を提案。院内死亡率、移植片不全、救急トリアージの3つの臨床予測タスクで評価した結果、統一シリアル化アプローチはタスク固有のマルチモーダルベースラインに匹敵またはそれを上回り、臨床で使用されている勾配ブースティングモデルを凌駕し、システムの複雑さを大幅に低減した。

  • 統一シリアル化パラダイム:患者データをすべて1つの言語シーケンスに変換しLLMを微調整。
  • 3つの臨床予測タスクで検証、独自の融合アーキテクチャ不要。
サイト内本文

LLM4EHR:大規模言語モデルを用いた臨床時系列と医療イベントシーケンスのアラインメント

LLM4EHRは、ドメイン適応された大規模言語モデルとTransformer時系列エンコーダを組み合わせ、正則化された対照学習目的によりEHRイベントと時系列を整列させる新しい臨床基盤モデルであり、ICU予測タスクで優れた性能を示し、kショット適応による新規コホートへの転移も可能。

  • ドメイン適応LLMとTransformer時系列エンコーダによる時間的アラインメント。
  • 正則化対照学習により頑健な時系列表現を学習。
サイト内本文

AI取引:テクニカル市場分析における大規模言語モデルの評価

5つの主要な大規模言語モデル(LLM)のテクニカル市場分析能力を系統的に評価した研究。GPT-4 Turboが汎用モデル中で最高の年率リターンとシャープレシオを達成し、FinGPTはドメイン特化の微調整により競争力のあるリスク調整後パフォーマンスを示した。また、数値幻覚、コンテキストウィンドウ制限などの障害モードも特定された。

  • GPT-4 Turboが汎用モデル中で最高の年率リターンとシャープレシオを達成
  • FinGPTはドメイン特化の微調整により競争力のあるリスク調整後パフォーマンスを示す
サイト内本文

医療データの解釈可能な分類のための可搬型閾値ベースフレームワーク

本論文では、ベルヌーイ単純ベイズ(BNB)モデルを用いた統計的に基づくフレームワークを提案し、教師付きχ²二値化により連続変数を閾値に変換することで完全に解釈可能なルールベースの臨床分類を実現する。Pima Indians Diabetes、Wisconsin Breast Cancer、Heart Failure Predictionの3つのベンチマークデータセットでAUCスコア0.800、0.984、0.919を達成。確率較正はBrierスコアとベータ較正により改善され、モデル推論は参照表と基本算術のみで再現可能であり、医療AIの信頼性と一般化可能性を高める実用的アプローチを提供する。

  • BNBベースの解釈可能な分類フレームワークを提案し、χ²二値化で連続変数を処理して解釈可能な決定ルールを生成。
  • 3つの医療データセットで複雑なモデルと同等の高いAUCスコア(0.800、0.984、0.919)を達成。
サイト内本文

信頼できるAIツールとマークフレームワークの批判的分析:実装のギャップ

本研究は、OECDの包括的データセットを用いて、信頼できるAI(TAI)を運用可能にするためのツールとトラストマークフレームワークを批判的に分析し、倫理的焦点、ライフサイクルカバレッジ、ステークホルダー対象、ツール類型における顕著な非対称性を明らかにした。公平性、透明性、ロバスト性が強調される一方、説明可能性、デジタルセキュリティ、環境持続可能性への注意は比較的少ない。ほとんどのツールと認証は開発後の段階に集中し、初期設計やデータ収集段階へのガイダンスは限定的である。教育イニシアチブや政策関与は著しく未発達であり、現在のTAIの取り組みは産業界の技術的・手続き的措置に支配されている。研究は、倫理的目的の拡大、AIライフサイクル全体への倫理の組み込み、そしてより広範なマルチステークホルダー参加を促進することで、AIの原則と実践の間の永続的なギャップを埋めることを提唱している。

  • TAIツールは公平性、透明性、ロバスト性を過度に重視し、説明可能性、デジタルセキュリティ、環境持続可能性を軽視している。
  • 既存のツールと認証は主に開発後の段階に集中し、初期設計やデータ収集の指針が不足している。
サイト内本文

ジョークを超えて:ミームにおける有害なユーモアを検出・説明する多視点推論

インターネットミームは視覚的要素、テキスト、文化的文脈が絡み合い、ユーモア、皮肉、悪意が共存する場合に解釈が困難です。既存のマルチモーダル分類器はこれらの相互依存性を見落とすか、解釈可能性が限られています。本論文では、視覚言語モデル(VLM)を活用し、12の構造化された視点からミームを解釈するMAR-12フレームワークを提案します。役割認識ソフトゲートアテンション機構とプロトタイプベース分類器を用い、PrideMMおよびMemotionデータセットでユーモア検出80.3%、ヘイト検出75.9%の精度を達成し、既存手法を上回ります。また、生成される説明は一貫性があり説得力があると評価されました。

  • MAR-12フレームワークはVLMを用い、ユーモアとヘイト理論に基づく12の視点からミームを分析。
  • 役割認識ソフトゲートアテンションとプロトタイプ分類器により性能と説明可能性を向上。
サイト内本文

コーディングエージェントはARC-AGI-3を解くために実行可能な世界モデル、単純化、検証を必要とするか?

新しい研究では、4つのネストされたCodexベースのエージェント実験を通じて、実行可能な世界モデル、計画的な単純化、正確な再生検証がARC-AGI-3タスクにどのように貢献するかを明らかにした。結果は、より強力なモデルと高い推論努力が常に性能を向上させるが、各コンポーネントの効果は設定によって異なり、完全な検証処理が最も性能が高いがリソースを多く消費することを示している。

  • より強力なモデルと高い推論努力が普遍的に性能を向上させる。
  • 実行可能な世界モデルは常に有益とは限らず、テキストベースラインが一部の設定で優れる。
サイト内本文

DrawingVQA:建設図面における多深度視覚・テキスト推論のための実世界ベンチマーク

DrawingVQAは、実際の建設図面におけるマルチモーダル大規模言語モデル(MLLM)を評価する初のベンチマークです。33枚の「発行済み施工図面」と92の専門家作成の質問応答ペアを含み、知覚理解、文脈解釈、専門家推論の3つの推論深度をカバーします。二重分類フレームワークにより、工学的ワークフローをAI能力にマッピングし、最先端MLLMと専門家の間には、特に高推論深度で大きな性能差があることを明らかにしました。

  • DrawingVQAは建設図面におけるMLLM向け初のベンチマーク。
  • 33枚の実図面と92の専門家QAペア、3つの推論深度を提供。
サイト内本文

精密だが切り離されている:レビューアの精度はマルチエージェント数学推論における批評の取り込みを保証しない

4,181の数学問題に対する研究により、マルチエージェントシステムにおいて、プランナー・エグゼキューター・レビューアのパイプラインの高精度レビューアは、批評が実際に回答の改善に使用されることを保証しないことが明らかになった。ブロードキャストスタイルのピアディスカッションは困難な問題でより高い精度を達成し、検出と取り込みの間のギャップを浮き彫りにしている。

  • 階層的なレビューパイプラインは、批評が回答の改善につながることを保証しない。
  • ブロードキャストスタイルのピアディスカッションは、難しい数学問題でプランナー・エグゼキューター・レビューアを上回る。
サイト内本文

AnovaX:ローカルマルチエージェント音声アシスタント – LLM計画、型付き実行、適応型リカバリ

AnovaXは、ユーザーのコンピュータ上で完全にローカルに動作するデスクトップ音声アシスタントです。単一のPythonプロセスが、ウェイクワードゲート、音声処理、GeminiベースのLLMプランナー(JSON計画を出力)、セキュリティレイヤー、マルチエージェントオーケストレーター(計画を型付き子エージェントに変換)、適応型リカバリループを統合します。各ツールは専用のエージェントクラスに対応し、タイムアウト、再試行ポリシー、リソースロックを持ちます。FlaskサーバーによりローカルWiFi経由でスマートフォンからのリモート操作が可能で、エージェントイベントのリアルタイムミラーリングと画面ストリーミングを提供します。プロジェクトの目的は、数千行の軽量アシスタントが複雑なデスクトップタスクを実行できることを示すことです。

  • AnovaXは完全にローカルで動作し、クラウド処理を必要とせず、デスクトップをアクションサーフェスとして使用します。
  • Gemini LLMプランナーがJSON計画を生成し、マルチエージェントオーケストレーターが制限付きスレッドプールで実行します。
サイト内本文

Cura 1T:医療エージェント向け特化モデル

Cura 1Tは、人間がゲートする自己進化ループで訓練された医療特化型LLMです。患者相談、テキストと画像に基づく臨床推論、対話型診断、電子健康記録(EHR)ツールの使用を処理します。医療評価スイートで最先端モデルと同等以上の性能を示し、ドメイン外の推論やエージェントベンチマークでも競争力を維持します。

  • Cura 1Tは、医療コミュニケーション、専門家推論、ワークフロー実行をカバーする特化型LLM。
  • 人間がゲートする自己進化ループにより、各ラウンドでデータ混合を洗練。
サイト内本文

Causal-Audit:ターゲット認識因果連鎖構築による明示的で監査可能なグラフベース推論

本論文では、因果推論を明示的な因果グラフ上の構造化推論として定式化するCausal-Auditフレームワークを提案する。主要な革新として、ターゲット変数を制約としてグラフを拡張するターゲット認識因果グラフ構築戦略と、複数の因果経路を組み合わせる経路レベルの因果証拠集約機構を導入する。3つのベンチマーク実験で既存のLLM手法を上回り、解釈可能で監査可能な推論トレースを提供する。

  • 暗黙的な言語推論に代わる明示的因果グラフ推論フレームワークCausal-Auditを提案。
  • ターゲット認識グラフ構築により無関係変数や疑似因果を抑制。
サイト内本文

GraphDx:コストを考慮した知識強化型マルチエージェントフレームワークによる逐次診断

GraphDxは、逐次診断における精度とコストのバランスを取る知識強化型マルチエージェントフレームワークである。自動化されたLLMパイプラインで医療診断知識グラフ(MDKG)を構築し、3つの協調エージェント(知覚、推論、決定)を用いてコストを意識した計画を立てる。MedQAとMIMIC-IVでの実験では、診断成功率が50-68%から79-93%に向上し、テストコストが20-54%削減された。

  • GraphDxは、定量化された典型性、行動中心のトポロジー、二目的属性を持つ医療診断知識グラフを自動LLMパイプラインで構築する。
  • 知覚エージェントと決定エージェントが言語処理を担当し、推論エージェントがMDKG上で確定的な証拠スコアリングとコスト認識計画を実行する。
サイト内本文

Sam Altmanのメール暴露:OpenAI、GPT-3レベルのオープンソースモデル公開を計画

2022年のメールで、Sam AltmanがOpenAIの取締役会に対し、消費者向けハードウェアで動作するGPT-3レベルのオープンソース言語モデルを早期に公開し、競合他社の同様のモデル公開を妨げ、新たな取り組みへの資金調達を困難にする計画を明らかにした。このメールは2026年のMusk対Altman訴訟で公開された。

  • Sam Altmanが2022年のメールでOpenAIのオープンソース戦略を開示
  • 消費者向けハードウェアで動作するGPT-3レベルのモデル公開を計画
サイト内本文

コミュニティ開発者がOpenBMBのMiniCPM5-1BをClaude Fable 5のトレースでファインチューニングし、657MBのローカル思考モデルを公開

コミュニティ開発者がOpenBMBのMiniCPM5-1Bをベースに、Claude Fable 5の対話データでファインチューニングし、完全ローカルで動作する1Bパラメータモデルを公開。最小ビルドは657MB、128Kコンテキスト、思考表示機能を備える。本記事ではHugging Faceカードに基づき仕様を検証し、ファインチューニングが実際に継承する能力と本来の能力を区別し、ライセンス上の問題を指摘する。

  • モデルはMiniCPM5-1Bの教師ありファインチューニング版であり、重みレベルの蒸留ではない。
  • 128Kコンテキスト、GGUF量子化は~657MB(Q4_K_M)から~2.1GB(F16)、Q8_0が推奨デフォルト。
サイト内本文

2026年に単一24GB GPUで実行可能な最高のローカルLLM:Qwen、Gemma、Mistral、DeepSeek比較

24GB GPUは本格的なローカル推論の実用的な最低ラインです。本ガイドでは、Q4_K_Mで1枚のカードに収まる6つのオープンウェイトモデル(Qwen3.6、Gemma 4、Mistral Small、gpt-oss-20b、DeepSeek-R1-Distill)を比較し、VRAM消費、ライセンス、各モデルの得意分野を解説します。

  • 24GBが実用的な最低ライン:無理に70Bを詰め込むのではなく、適切なサイズの20B~35Bモデルを実行すべき。
  • Qwen3.6-27Bが最もバランスの取れたデフォルト、DeepSeek-R1-Distill-Qwen-32Bは約18~20GBで最もタイトなフィット。
サイト内本文

1000ドル以上のAI/GPU/LLM無料クレジットまとめ

AI研究者向けの無料リソース集。1000ドル以上の無料計算クレジット、研究ガイド、コミュニティフォーラムなど、学生が一銭も使わずにAI研究を始められるように厳選。

  • 1000ドル以上の無料AI/GPU/LLMクレジットを提供
  • アイデアから論文発表までの研究ガイドを網羅
サイト内本文

Feyn AIがSQRLを公開:データベースを事前に検査してからクエリを生成するテキストto SQLモデルファミリー

Feyn Labsは、クエリを実行する前に読み取り専用プローブでデータベースを検査するテキストto SQLモデルファミリー「SQRL」をリリースした。フラッグシップモデルのSQRL-35B-A3BはBIRD Devで70.6%の実行精度を記録し、Claude Opus 4.6を上回り、4Bおよび9Bのセルフホスト可能なチェックポイントに蒸留される。

  • SQRLは読み取り専用プローブでデータベースを検査してから最終クエリを生成する。
  • SQRL-35B-A3BはBIRD Devで70.6%の実行精度を達成し、Claude Opus 4.6の68.77%を上回る。
サイト内本文

Alibaba、2.4兆パラメータのマルチモーダルモデルQwen3.8-Maxをプレビュー、MoonshotのKimi K3オープンウェイト公開から数日後

AlibabaのQwenチームは、2.4兆パラメータのマルチモーダルMoEモデルQwen3.8-Max-Previewをプレビューし、「Fable 5に次ぐ」と称しています。プレビューはToken Plan、Qoder、QoderWorkで標準価格の10%で提供されています。ベンチマーク表、モデルカード、ライセンス、トークンあたりの価格、アクティブパラメータ数はまだ公開されていません。本記事では、Alibabaが確認した情報と主張のみの情報を区別します。

  • Qwen3.8-Max-PreviewはToken Plan、Qoder、QoderWorkで標準価格の10%で提供中。
  • 2.4兆パラメータと「Fable 5に次ぐ」とのランキングはAlibabaの主張であり、検証済みのベンチマークではない。
サイト内本文

CallBro – Codex、Claude Code、またはローカルLLMを活用したプライベートな会議メモ

CallBroは無料でプライベートな会議メモアプリです。デバイス上でローカルに通話を文字起こしし、AI(Codex、Claude Code、またはローカルLLM)を使用して要約とアクションアイテムを生成します。すべてのデータはデバイス上に保持され、クラウドにアップロードされません。MCPを介してツールと統合し、複数のプラットフォーム(macOS、Linux、Windows)で動作します。

  • ローカルで通話を文字起こし、クラウドにアップロードなし。
  • Codex、Claude Code、またはローカルLLMで要約とアクションアイテムを生成。
サイト内本文

llms.txtファイルを作成し、地元企業をAIエージェントが発見できるようにする

KloofStreet.onlineは、ケープタウンのクルーフストリートに特化したAI駆動ガイドです。この通りはTime Out誌の2025年世界で22番目にクールな通り、アフリカで最もクールな通りに選ばれました。50以上の飲食店、ウェルネス、アートなどの事業者を掲載し、AIコンシェルジュ、割引、厳選された体験を提供するStreet Passメンバーシップを提供しています。

  • クルーフストリートはTime Out誌で世界第22位、アフリカで最もクールな通りに選出。
  • レストラン、スパ、アートスタジオ、ショップなど50以上の認定事業者を掲載。
サイト内本文

Qwen 3.8 Max

Qwen 3.8 MaxはQwenシリーズの最新モデルで、Qwenウェブサイトで公開されています。

  • Qwen 3.8 Maxがリリースされました
  • 詳細はQwenウェブサイトをご覧ください
サイト内本文

LLMアプリ、RAGシステム、AIエージェント構築のための10のオープンソースノーコードAIプラットフォーム

本記事では、LLMアプリケーション、RAGシステム、AIエージェントを構築するための10のオープンソースノーコード/ローコードAIプラットフォームを紹介します。各プラットフォームは検証済みライセンス、リポジトリ、最適なユースケースとともに説明されています。これらのツールは、ビジュアルキャンバス、Web UI、平易な英語のプロンプトを通じて検索、エージェント、ワークフローを公開し、迅速なプロトタイピングとデータのセルフホスティングを可能にします。

  • LLMアプリ、RAG、AIエージェント向けの10のオープンソースノーコード/ローコードプラットフォームをレビュー。
  • プラットフォームには、AutoAgent、AnythingLLM、LangChain OAP、Sim、Dify、Flowise、Langflow、RAGFlow、n8n、FastGPTが含まれる。
サイト内本文

LLMを統合した多変数微積分コース

大規模言語モデルを教育に取り入れた革新的な多変数微積分コース。ベクトルから始まります。

  • コースは多変数微積分の教育にLLMを統合しています。
  • 最初の講義はベクトルを扱います。
サイト内本文

Kimi K3 vs DeepSeek V4 Pro vs GLM-5.2:オープンな兆パラメータMoEモデルのベンチマーク、ライセンス、サービスコスト比較

中国の3つの研究所による旗艦オープンウェイトMoEモデル—Kimi K3、DeepSeek V4 Pro、GLM-5.2—は、ベンチマーク、ライセンス、サービスコストでそれぞれ優れています。Kimi K3は性能でリードしますがAPI限定、DeepSeek V4 Proは最も安価で完全オープン、GLM-5.2は速度と展開性のバランスが取れています。

  • Kimi K3(2.8兆パラメータ)はAAIインデックスで約57点とトップですが、ウェイトは7月27日まで入手できません(修正MITライセンス)。
  • DeepSeek V4 Pro(1.6兆パラメータ)はMITライセンスで、タスクあたり約0.04ドル、即時オープンウェイト。
サイト内本文

NVIDIA NeMo AutoModelを使用したQwen3のLoRA微調整:完全なシングルGPU Google Colabワークフローチュートリアル

このチュートリアルでは、Google Colab上の単一GPUでNVIDIA NeMo AutoModelを使用してQwen3-0.6BモデルをLoRAでパラメータ効率よく微調整する方法を詳細に説明します。環境検証、ソースインストール、レシピの読み込みと調整、コマンドラインでのトレーニング、モデル評価、Python APIの呼び出しをカバーします。

  • Colabの単一GPUにNeMo AutoModel環境を構築
  • Qwen3-0.6B LoRA微調整レシピを読み込み、調整
サイト内本文

ADA:CSVとExcelから利用できるAIビジネスインテリジェンスソフトウェア(LLMだけでなく)

ADAはオープンソースの自動データ分析ツールです。CSVまたはExcelファイルをアップロードすると、自動的にクリーニング、スキーマ検出、インタラクティブダッシュボード作成、異常検知、予測を行い、計算過程を表示しながら平易な英語での質問に回答します。APIキーは不要で、データはローカルに留まります。

  • ゼロ設定:アップロードするだけでダッシュボード、異常検知、予測を取得
  • 透明な計算:すべての回答に計算過程を表示
サイト内本文

KDnuggets ウィークリーダイジェスト:2026年7月13日週

今週の注目記事は、if-elseチェーンをレジストリパターンに置き換える方法、LLMのレイテンシーとコストを削減する12の方法、データポートフォリオを構築するための5つの実践的SQLプロジェクト、AI開発のためのGit Worktrees、Outlinesによる構造化言語モデル生成、ローカルAIエージェントをオーケストレーションする7つのPythonフレームワーク、AIで先を行くための10のYouTubeチャンネル、Conductor for Gemini CLI入門、Agentic AIのための5つの無料リソース、Piコーディングエージェントの仕組みです。

  • レジストリパターンでif-elseチェーンを置き換え、コードの拡張性を向上
  • LLM推論コスト削減にはトークン使用の最小化、モデルルーティング、キャッシュが重要
サイト内本文

LLMにおける推論努力の制御

本記事では、複数の推論努力モードを持つモデルの開発方法を探り、o1やDeepSeek-R1からGPT-5.6への進化、RLVRトレーニング、推論スケーリング、思考トークン、推論モード切り替えなどの主要技術を解説する。

  • 推論モデルは中間推論トレースを出力し、従来のLLMとは異なる。
  • RLVRトレーニングは最終回答の正しさのみに報酬を与え、推論トレースは使用しない。
サイト内本文

Google CloudのAlways-On Memory Agent:Gemini 3.1 Flash-Lite上での継続的LLM統合によるRAGと埋め込みの置き換え

Google Cloudの生成AIリポジトリが、メモリを実行中のプロセスとして扱うリファレンス実装「Always-On Memory Agent」を公開しました。Google ADKとGemini 3.1 Flash-Liteをベースに構築されており、ベクトルデータベースや埋め込みを使用せず、オーケストレーターがIngest、Consolidate、Queryのサブエージェントにルーティングし、構造化メモリをSQLiteに24時間継続的に読み書きします。

  • Always-On Memory Agentは、Google ADKとGemini 3.1 Flash-Liteを使用して24時間稼働する軽量バックグラウンドプロセスです。
  • ベクトルデータベースや埋め込みを使用せず、LLMが構造化メモリをSQLiteに書き込みます。
サイト内本文

Sakana AIのエラーディフュージョンがDale原理に準拠したデュアルストリームネットワークを訓練、バックプロパゲーションなしでMNIST 96.7%、CIFAR-10 61.7%を達成

Sakana AIのエラーディフュージョン(Error Diffusion)は、重み転送やバックプロパゲーションを必要とせず、Daleの原理に従ってニューラルネットワークを訓練する局所学習則です。この手法は、興奮性と抑制性のストリームからなるデュアルストリームアーキテクチャと、モジュロエラールーティングを用いて多クラス分類に拡張され、MNISTで96.7%、CIFAR-10で61.7%を達成しました。3つの分類革新はタスク依存の重要度を示し、ED-PPOによる強化学習への応用では、一部のタスクでBP-PPOを上回りました。

  • エラーディフュージョンは、バックプロパゲーションや重み転送なしでDale準拠のネットワークを訓練する。
  • モジュロエラールーティングにより、EDを二値分類からMNISTやCIFAR-10の多クラス分類に拡張。
サイト内本文

Anthropic、Claude Fable 5 をサブスクリプションに恒久追加へ

Anthropic は2026年7月20日より、Claude Fable 5 を Max および Team Premium プランに50%の制限付きで恒久的に含めることを発表。Pro および Team Standard ユーザーには100ドルの一時クレジットを提供。これは GPT-5.6 Sol などとの競争により、以前の削除計画を撤回したもの。

  • Claude Fable 5 が7月20日より Max および Team Premium プランに恒久追加(利用制限50%)。
  • Pro および Team Standard ユーザーは引き続き使用クレジットでアクセス可能、さらに100ドルの一時クレジット。
サイト内本文

トピック

モデル AI ニュース | AI News Hub