AI News HubLIVE

モデルの最新ニュース

AI初心者から実践者へ:無料コース5選

Pythonの基礎がある方向けに、古典的アルゴリズムからLLMのスクラッチ構築までをカバーする5つの無料コースのロードマップを紹介します。

  • ハーバードCS50 AIでAIの論理的基盤を構築
  • Googleの機械学習クラッシュコースで数学とTensorFlowを習得
サイト内本文

中国の低価格Z.aiモデルがコーダーの高コスト習慣を露呈

Z.aiのGLM 5.2は低価格でオープンウェイトのモデルであり、米国のフロンティアAIモデルに挑戦する。しかし多くのプログラマーは依然として高価なモデルを使い続け、コストを無視している。ベンチマークではClaude Opus 4.8に迫る性能を示すが、実際の使用感は様々。

  • GLM 5.2のAPI価格はAnthropic Opus 4.8の5分の1、Fableの10分の1
  • オープンウェイトで自社ホスティングが可能、データプライバシー問題を回避
サイト内本文

「Fable 5に次ぐ」:AlibabaがQwen3.8を発表するも、実データなし

Alibabaは最新の大規模言語モデルQwen3.8を発表し、AnthropicのFable 5に次ぐと主張したが、ベンチマークやモデルカードは提供しなかった。この発表は、競合のMoonshotが詳細な技術情報とともにKimi K3をリリースした直後に行われた。Alibabaの透明性の欠如は、タイミングと動機に疑問を投げかけている。

  • AlibabaはQwen3.8がFable 5に次ぐと主張するが、データは一切提供していない。
  • 発表はMoonshotが完全なベンチマークと技術詳細を添えてKimi K3を公開した直後に行われた。
サイト内本文

先週のAI #250 - Mythos 混乱、GPT 5.6-Sol、GLM 5.2

AnthropicのAI条約議論、米国政府のAIモデルリリースへの影響、OpenAIのプロセッサ開発、メモリ市場への影響など。

  • 米国政府がフロンティアAIのゲーティングを拡大。AnthropicはMythos-5のリリース許可、OpenAIはGPT-5.6 Solを限定アクセスで展開。
  • モデルの能力と安全性シグナルは依然不明瞭で、ベンチマーク開示が限定的。
サイト内本文

中国のオープンウェイトモデルは安価。ワシントンがその代償を決めようとしている

米国の政策立案者は、中国のオープンウェイトモデルに規制リスクを生み出すべきか議論している。Moonshot AIのKimi K3のリリースが議論を再燃させた。企業は性能だけでなく、これらのモデルが1年後も簡単に利用できるかどうかという問題に直面している。

  • Moonshot AIのKimi K3はこれまでで最大のオープンウェイトモデルであり、ワシントンで1年間休眠していた政策論争を再燃させた。
  • 議論されているメカニズムには、連邦調達規則、輸出ブラックリスト、セキュリティ勧告が含まれ、世界中のクラウドプロバイダーを通じて波及する。
サイト内本文

中国のAIモデルがトランプ政権のAI世界を内部対立に陥れる

中国のオープンソースAIモデルKimiのリリースにより、トランプ大統領のAIアドバイザー間で公然と対立が生じている。KimiはOpenAIやAnthropicの有料モデルに匹敵する性能を持ちながら無料であり、経済的・政治的問題を引き起こしている。各派閥はオープンソース推進か規制強化かで意見が分かれている。

  • 中国企業Moonshotが無料のオープンソースモデルKimiを公開。性能は有料モデルに匹敵。
  • 元トランプAI顧問のDavid Sacksと現職高官Emil Michaelが米国AI企業を公然と批判。
サイト内本文

長期ロボット操作のための先見的残差強化学習と視覚言語行動モデル

本論文では、凍結された視覚言語行動(VLA)ベースポリシー上で、各サブタスクのスパース成功報酬にオフライン推定された先見的価値(現在のサブタスク終了状態における将来のサブタスク成功確率)を追加することで、サブタスク間の引き継ぎ品質を最適化する先見的残差強化学習(Foresight Residual RL)を提案する。Isaac Gymでの3フェーズのレンチベースナット締め付けタスクにおいて、85.6%の完全タスク成功率を達成し、標準のサブタスク残差RL(54.5%)やVLAベースラインを上回った。

  • VLAポリシーは長期クレジット割り当てとサブタスク結合により、高精度の組立タスクで失敗する
  • 標準の残差RLは各サブタスクを個別に最適化するが、終了状態の品質が制御されないため連鎖時に効果が小さい
サイト内本文

PRISM:非構造環境におけるローバー航法のためのマルチモーダル地形マッピング

PRISMは、熱画像・光学カメラ・深度センサを融合し、新しいビジョントランスフォーマーネットワークOmniUnetを用いて非構造環境の地形セグメンテーションと走行可能マップを生成するシステムです。2つの新しいデータセットで検証され、組み込みコンピュータ上で自律航法を実現します。

  • PRISMはRGB、深度、熱画像を統合し、地形認識を向上。
  • 中核のOmniUnetはビジョントランスフォーマーに基づくマルチモーダルセマンティックセグメンテーションネットワーク。
サイト内本文

HyperDCM: 双曲空間における動的クラスタメモリリプレイによる連続ロボットナビゲーション

視覚ナビゲーションにおける破滅的忘却に対処するため、研究者らは構造認識型メモリ機構HyperDCMを提案する。大規模視覚言語モデルを用いてシーン三つ組を抽出し、R-GCNでシーングラフ埋め込みに符号化し、双曲空間に投影して構造的分離性を高める。動的クラスタリングと構造に敏感な更新戦略により代表サンプルを選択してリプレイし、知識の多様性を維持する。マルチシーンデータセットでの実験により、ベースラインと比較して優れた保持と一般化を示した。

  • シーングラフモデリングとメモリリプレイを組み合わせて拡散ポリシーナビゲーションを強化するHyperDCMを提案。
  • 大規模視覚言語モデルとR-GCNを用いてシーン意味情報を抽出・符号化。
サイト内本文

部分ラベル付きマルチタスク顔表情認識のための共有潜在変数

部分ラベル付きマルチタスク顔表情認識において、変分ボトルネックを用いた共有潜在変数アプローチを提案。s-Aff-Wild2データセットで表情認識マクロF1を0.403から0.446に向上させ、2つ目のバックボーンで行動ユニット上限を突破。

  • 部分ラベル付きマルチタスク学習を共有感情潜在変数への周辺化として定式化し、変分ボトルネックが3つのタスクデコーダを調整。
  • s-Aff-Wild2では、全ラベルを持つフレームは37%のみ。提案手法により表情マクロF1が0.403から0.446に向上。
サイト内本文

MAC 2026:マイクロアクション分析の細粒度理解への発展

第3回マイクロアクション分析グランドチャレンジ(MAC 2026)はACM Multimedia 2026と併催され、マルチモーダル大規模言語モデルを用いて評価される新しいタスクを導入し、マイクロアクション分析を認識から細粒度理解へと進化させます。本論文では、データセット、プロトコル、競技結果、およびこの新興分野の将来方向について詳述します。

  • MAC 2026はマルチモーダルLLMを用いた細粒度マイクロアクション理解タスクを導入。
  • 従来の認識・検出を超え、微細な人間行動の深い解釈を目指す。
サイト内本文

GenSyn10: 画像分類のベンチマークのためのマルチ生成AIデータセット

GenSyn10は、CIFAR-10に対応した6万枚の合成画像データセットで、3つの異なるアーキテクチャの生成モデルを使用して作成され、AI生成画像検出の研究を推進します。評価では、モデルは既知の生成器では良好に機能するが、未知の生成器では性能が大幅に低下し、OOD汎化の限界が明らかになりました。

  • GenSyn10は10クラス、32x32の6万枚の合成画像で構成され、FLUX.2-dev、HunyuanImage-3.0、Qwen-Image-2512の3モデルで生成。
  • CIFAR-10訓練モデルはゼロショットで96.86%の精度を達成し、微調整後は99.88%に上昇。
サイト内本文

人間のように動く:ミリワット級ハードウェアでのリアルタイム空中人物追跡のための自己運動正規化時間特徴

本論文では、ドローン上でのリアルタイムフォロー・ミー人物追跡を低電力ハードウェアで実現するEMTS-Detシステムを提案。自己運動正規化残差運動チャネルを用いて人物を検出し、22kパラメータの軽量ネットワークでRaspberry Pi Zero 2W上で31.85 FPSを達成し、YOLOv8nを大幅に上回る性能を示す。

  • EMTS-Detは22kパラメータ、7.6 MFLOPの計算量でリソース制約のあるデバイス上でリアルタイム人物追跡を実現。
  • 自己運動正規化残差運動チャネルにより、10-60ピクセルの小さなターゲットを背景から効果的に識別。
サイト内本文

3D FaceShell: VLM防御メカニズムとしての3Dフェースアバターにおける属性転送

研究者らは、3D顔アバターに微妙な摂動を加えて視覚言語モデル(VLM)が機密属性を推測するのを誤らせつつ、視覚的アイデンティティを保持するフレームワーク「3D FaceShell」を提案する。

  • 3D FaceShellは学習可能なガウスシェルを3Dアバターに適用し、プライバシーを保護する。
  • 人間が認識可能な外観を変えずにVLMの属性推論を誘導する。
サイト内本文

JEPA予測器:隠蔽特徴補完のための転移可能な演算子

Joint-Embedding Predictive Architectures(JEPA)は、エンコーダと共に予測器を訓練するが、下流タスクでは予測器を破棄する。本研究では、JEPA予測器が隠蔽特徴補完のための転移可能な演算子として機能し、線形投影を介して異なるエンコーダファミリに適応可能であり、隠蔽分類精度を大幅に向上させることを示す。

  • JEPA予測器は可視コンテキスト特徴からマスク位置への特徴を学習する演算子であり、エンコーダファミリ間で転移可能。
  • I-JEPAおよびV-JEPA 2の凍結予測器を、500枚のImageNet画像で閉形式適合した線形投影を介して非JEPAホスト(CLIP、DINOv3、DINOv2、MAE)に適応。
サイト内本文

言語モデルは努力しても誤る:自己修正科学生成のためのコンフォーマル予測

本研究は、科学的推論の妥当性に統計的保証を提供するグラフ構造のコンフォーマル予測フレームワーク「Scientific Feasibility Control (SFC)」を提案する。SFCは科学的推論を原子的な事実単位に分解し、科学的違反が検出された際に動的分岐を用いて修正する。PhyXベンチマークで50.1%の精度を達成し、DeepSeek-R1やGPT-4を上回り、科学法則違反を73%削減、α=0.10で91.7%の妥当性保証を提供する。

  • SFCはコンフォーマル予測を用いて論理的依存関係を近似導出グラフとしてモデル化する。
  • 科学的違反が検出されると動的分岐が別の生成経路に切り替える。
サイト内本文

算術ヒューリスティックニューロンは形式不変か?LLMにおける記号、テキスト、コードのメカニズム分析

本研究では、Llama-3モデルにおける記号計算、自然言語文章題、Pythonコードの3形式での算術計算をメカニズム解釈可能性手法で分析。3形式に共通するコンパクトなニューロンセットを発見し、形式間の失敗は異なる回路ではなく活性化状態に起因することを示し、ニューロンレベルでの形式不変性を実証した。

  • 帰属パッチと活性化パッチを組み合わせた2段階パイプラインで算術ヒューリスティックニューロンを特定。
  • 記号、テキスト、コードの3形式で共有されるコンパクトなニューロンセットを発見。
サイト内本文

SpecLA: 線形注意モデルのための効率的な投機的デコード

本論文は、状態を持つ線形注意モデルのための投機的デコードランタイムSpecLAを提案する。トポロジ認識カーネルを用いたチェーンとツリーの検証、検証中に生成されたコンパクト因子を保存して受理状態を復元、信頼度枝刈りとターゲット調整済みEAGLEスタイルのドラフターを使用する。NVIDIA H100上の公開GDN-1.3Bターゲットで、自己回帰デコードと比較して最大1.70倍のエンドツーエンド高速化を達成。

  • 線形注意モデルはKVキャッシュをリカレント状態に置き換えるが、デコードは依然としてトークン単位。
  • 既存の投機的デコードシステムはTransformer KVキャッシュを前提。
サイト内本文

OpenLanguageModel: 教育と研究のための読みやすく構成可能な小言語モデルの事前学習

OpenLanguageModel (OLM) は、小規模言語モデルの構築と事前学習を可能にするオープンソースのPyTorchライブラリであり、その内部機構を可視化します。モデルコードはアーキテクチャを直接反映し、Block、Residual、Repeat、Parallelなどのコンポーネントが配線を記述します。OLMは、トークナイザ、データセット、最適化、混合精度、コールバック、チェックポイント、ハードウェア対応実行を統合し、教育用ノートブックから本格的な事前学習へのシームレスな移行を実現します。ライブラリは9つのモデルファミリーにわたる27のプリセットを備え、LM基礎からアーキテクチャ研究までカバーするドキュメントが付属します。検証では、独立したリファレンス実装との高い一致、348Mパラメータモデルにおける4GPUでの90.6%の弱スケーリング効率、そして良好なユーザビリティ結果が示されています。OLMはMITライセンスで提供され、PyPI、GitHub、およびドキュメントサイトから利用可能です。

  • OLMはアーキテクチャを直接反映した読みやすいモデルコードを提供し、教育と研究に適しています。
  • 教育用ノートブックから本格的な事前学習までシームレスに移行可能な統合パイプラインを備えています。
サイト内本文

記憶からスキルへ:エビデンスに基づく長期LLMエージェントの共進化ガバナンス

既存の長期LLMエージェントのメモリシステムは、過去のトレースを受動的なコンテキストとして取得するだけで、実行可能な能力に変換していません。本論文では、トレーニング不要のメモリ・スキル共進化フレームワークMSCEを提案し、エージェントの経験をグラウンディングされたステップトレース、再利用可能な手続きポリシー、宣言的環境認知に整理します。MSCEは証拠に基づくL2ポリシーを呼び出し可能なスキルに結晶化し、反射加重値バックフィリングを導入します。実験では、MSCEが最先端の手法を大幅に上回ります。

  • MSCEはエージェントの経験をステップトレース、手続きポリシー、宣言的認知に整理する。
  • 反射加重値バックフィリングにより、疎な終端フィードバックを密な自己反射に伝播させる。
サイト内本文

NOWJ@COLIEE 2026: 法的検索と推論のための適応パイプライン

本論文は、COLIEE 2026コンペティションの5つのタスクすべてにおけるNOWJチームの方法論と結果を紹介する。法的ケース検索、法的ケース含意、法令検索と含意、法的テキスト含意、法的判決予測の各タスクに対して、適応パイプラインと深層学習モデルを提案している。

  • 法的ケース検索のための4段階パイプライン(候補フィルタリング、高密度検索、交差エンコーダ再ランキング、適応カットオフ予測)
  • 法的ケース含意はBM25フィルタリング、T5再ランキング、LLM含意検証を組み合わせる
サイト内本文

脳波信号をエンコードして言語モデルの人間らしい次語予測行動を調査

この研究では、脳波(EEG)記録から得られる事象関連電位(ERP)を用いて人間と言語モデルの次語予測を比較し、「驚き度(surprisal)」のみが言語処理ERPと相関することを発見した。特に意味内容の豊かな開放クラス語で顕著であり、モデルのスケーリングは必ずしも人間らしい認知処理をもたらさないことを示唆している。

  • 言語モデルは次語予測精度において人間に近づくが、高精度が読解の認知シグナルを反映するとは限らない。
  • トップ1予測と驚き度の2つの情報指標を用いてERPパターンをモデル化し、LMsの認知妥当性を分析。
サイト内本文

推論前のコミットメント:オープンウェイトLLMにおける回答事前決定の行動再現と予備的な活性化レベルの証拠

新しい研究は、簡単な洗車の質問を用いて、言語モデルが推論の前に答えを先に決め、論理的に正しい結論を導けないことを明らかにした。Qwen3-8B実験では、システム的な誤り(「運転」が唯一の正解なのに「歩く」を推奨)が観察された。活性化レベル分析では、出力前に隠れ状態が誤った答えに傾いており、最終的に正答する場合も同様である。この発見はLLMにおける推論前の決定バイアスを示している。

  • Qwen3-8Bは単純な論理課題で85~100%のサンプリング出力で「歩く」を誤って推奨。
  • 隠れ状態分析により、回答生成前から「歩く」への事前コミットメントバイアスを検出(正答出力でも同様)。
サイト内本文

RIMS:小型言語モデル検索拡張生成のための平滑化マルチペア選好最適化

小型言語モデルは検索拡張生成においてノイズの多い証拠に非常に敏感です。本論文では、合成思考連鎖選好データ生成、微分可能な平滑集約メカニズム、選好最適化からなる3段階フレームワークRIMSを提案します。実験では、マルチホップQAベンチマークで一貫した改善を示しています。

  • RIMSフレームワークは平滑化マルチペア集約により小型LMの選好学習を最適化
  • ターゲットSLM自身を用いた拒否サンプリングによる合成選好データ生成
サイト内本文

混合専門家モデルにおける一貫した専門家選択のためのマルチレベルコンテキストモデリング

混合専門家モデル(MoE)は、トークンを少数の専門家にルーティングすることでTransformerモデルを効率的にスケーリングする。しかし、既存のルーターは浅いまたは孤立したトークン表現に基づいて専門家を選択するため、不安定で意味的に一貫しないルーティング決定を生じる。本稿では、表現の観点から専門家選択を再検討し、クロスレイヤーの意味的集約と局所トークンレベルの相互作用からの補完的信号を統合してコンテキスト認識表現を構築するMCF-MoEを提案する。実験により、MCF-MoEがルーティングの一貫性と下流性能を向上させることが示された。

  • 既存のMoEルーターはコンテキストの不完全性により不整合な選択を生じる。
  • MCF-MoEはクロスレイヤーの意味情報と局所トークン信号を融合する。
サイト内本文

乳がんサブタイプ分類と生存予測のためのトークンレベルクロスモーダルトランスフォーマーと対照的多タスク学習

本研究は、ゲノムデータと臨床データを統合し、乳がんサブタイプ分類と生存予測を共同最適化するために、トークンレベルのクロスモーダルトランスフォーマーと対照的多タスク学習を提案する。既存手法のモダリティ相互作用の粗さ、融合の単純さ、独立最適化という限界を克服する。

  • 既存手法は各モダリティを単一の特徴ベクトルとして扱い、細かいトークンレベルの相互作用を妨げている。
  • トークンレベルのクロスモーダルトランスフォーマーによる構造化トークン交換を提案。
サイト内本文

重みから言葉へ:自然言語での選好モデル推論の表現と編集

本論文は「重みから言葉へ」手法を提案する。これは、選択データから自然言語で記述された選好次元を自動的に発見し、選好学習における過少決定性と不透明性に対処する。実験では予測精度が向上し、ユーザーがリアルタイムでモデル推論を検査・編集できることを示した。

  • 自然言語による選好次元を自動抽出する「重みから言葉へ」手法を提案。
  • 道徳的ジレンマ、映画、ワイン、LLM応答の4領域で汎用性を実証。
サイト内本文

オペレータ認識型混合精度許容差キャリブレーションのテンソルカーネルへの適用

本論文では、累積されたクラウドGPU実行データを活用し、テンソルカーネルの正確性テストのための絶対許容差を自動的に決定するオペレータ認識型混合精度許容差キャリブレーション手法を提案する。手動で選ばれた許容差よりもはるかに厳しく、バグ検出の再現率を大幅に向上させる。

  • 現在のテンソルカーネルテストは手動で選ばれ、ほとんど更新されない固定許容差に依存している。
  • 提案手法はクラウドGPU実行の誤差分布を分析し、オペレータごとに許容差を調整する。
サイト内本文

サイバー防御のためのLLMアンラーニング:手法、課題、新たな脅威に関する調査

大規模言語モデル(LLM)はセキュリティ重要システムに広く使われるが、忘却能力の欠如がプライバシーや安全リスクを生む。本調査は勾配ベースのアンラーニング手法を中心に、知識の真の除去か単なる抑制かを問い、課題を分析する。

  • LLMアンラーニングは再学習なしに標的知識を除去し、プライバシーとセキュリティリスクに対処する。
  • 勾配ベース手法が主流だが、真の忘却ではなく抑制に留まる可能性がある。
サイト内本文

オンデバイス機械学習のためのフルセンサー対応スマートアイウェアプラットフォーム

本論文では、STM32N6マイクロコントローラとその内蔵NPUを活用し、クラウド依存を排除してレイテンシを最小化しプライバシーを保護するスマートアイウェアプラットフォームARGOを提案する。ハードウェア、ファームウェア、AIの全体最適設計により、最適化されたYOLOv11モデルを展開し、実時間都市障害物認識を実現。NPU効率実行のためのHead-wise Parallel Attention (HPA)を導入し、厳格なメモリ制約下でmAP50-95 24、メモリフットプリント2.483 MBを達成。マルチモーダルセンサーを統合し、10 FPSで動作、200 mAhバッテリで約113分間の連続動作を実証した。

  • ARGOスマートアイウェアはSTM32N6 MCUとNPUを使用し、クラウド非依存のオンデバイスMLを実現
  • Head-wise Parallel Attention (HPA)によりYOLOv11モデルをNPU向けに最適化、メモリ制限下でmAP50-95 24を達成
サイト内本文

DocOCR-Eval: 教師データなしでOCRツールを選択するための補正ベースフレームワーク

本論文では、手動アノテーションなしでOCRツールの評価と選択を自動化するフレームワークDocOCR-Evalを提案する。3段階の補正とランキング戦略により、正解ラベルなしでアノテーションベースのツール順序を近似する。実験では、複数のMLLMを集約することで人間によるランキングとの整合性が向上し、ラベルが限られた状況でも信頼性の高いツール選択が可能になることを示している。

  • DocOCR-Evalは手動アノテーションなしでOCRツールを評価する。
  • 3段階の補正とランキング戦略で真の順序を近似する。
サイト内本文

わずか8トークン:補助分岐による弱から強へのオフポリシー強化学習

弱い補助モデルを使用してLLMの推論経路に短いセグメントを注入する新しい強化学習手法W2SPOは、数学的推論タスクで性能を向上させ、トレーニングを高速化します。

  • 標準のRLはLLMでセマンティックな冗長性とサポート制限に悩まされる
  • W2SPOは中間軌道に短い補助セグメント(最小8トークン)を注入する
サイト内本文

マスク拡散言語モデルは強力で制御可能なテキストベースの世界モデル:エージェント強化学習に向けて

強化学習の発展に伴い、多様な訓練環境が必要とされている。世界モデルは環境をシミュレートできるが、自己回帰モデルには左から右へのバイアスがある。マスク拡散言語モデル(MDLM)は双方向のアンカー認識ノイズ除去によりこれを克服し、4倍のパラメータサイズのLLMよりも高いコヒーレンスと多様性を達成。GRPO訓練フレームワークを導入し、ゼロショット転移で最大47%の絶対的な性能向上を示した。研究はオープンソースとして公開されている。

  • MDLMはテキストベース世界モデルにおいて、自己回帰LLMよりもコヒーレンスと多様性で優れる。
  • 双方向アンカー認識ノイズ除去により、グローバルな状態アンカーへの条件付けが可能。
サイト内本文

生成的オントロジー誘導:大規模言語モデルを用いた文書コーパスからのドメイン非依存スキーマ発見

本論文では、生成的オントロジー誘導(GOI)を提案する。これは、サンプルコーパスからエンティティ、次元、プロパティ、関係、制約からなる生成ブループリントを誘導し、YAML/JSON形式の型付きグラフ(6ノード型、7エッジ型)として出力するドメイン非依存フレームワークである。新しい評価指標としてノードカバレッジスコアを導入。4つの多様なオントロジーでの検証により、GOIプロンプティングでは95-100%のカバレッジを示し、汎用テンプレートは未知のドメインで大幅に低下することが明らかになった。

  • GOIはLLMを活用して文書コーパスからスキーマを発見するドメイン非依存のオントロジー誘導フレームワーク。
  • 6ノード型、7エッジ型の型付きグラフをYAML/JSON形式で出力し、ダウンストリームパイプラインで利用可能。
サイト内本文

AIエージェントシステムのための決定論的リプレイフレームワーク

大規模言語モデルと外部ツールを組み合わせたAIエージェントシステムは本質的に非決定論的です。arXiv論文はagreplフレームワークを提案し、MITMプロキシで外部インタラクションを記録し、分離環境で再生することで、完全な再現忠実度(F=1.0)と98.3%のレイテンシ削減を実現します。

  • LLMサンプリング分散や外部API状態によりAIエージェント実行は非決定論的。
  • agreplはMITMプロキシで全外部通信を傍受し、構造化トレースとして保存・再生。
サイト内本文

PlanFlip:計画フェーズのプロンプトインジェクションによるマルチエージェントLLMシステムへの攻撃

新しい研究論文が、マルチエージェントLLMシステムの計画フェーズを標的とした4種類のプロンプトインジェクション攻撃フレームワーク「PlanFlip」を紹介。GPT-5のような強力なモデルほど脆弱であり、同質のバックボーンは相関エージェントの盲点を生み出す一方、DeepSeek-R1のような推論強化モデルは攻撃に耐性を示す。提案された2つの防御手法は最大1.00の検出率を達成。

  • PlanFlipはマルチエージェントシステムの計画フェーズを狙った4つのプロンプトインジェクション攻撃を導入。
  • GPT-5などの強力なモデルほど攻撃成功率が高く、能力=安全性という仮定に反する。
サイト内本文

いくつかの大規模言語モデルは一貫したリスク態度を示す

新しい研究は、不確実性下での大規模言語モデル(LLM)のリスク態度をテストするためのクロスドメインフレームワークを導入し、ほとんどのモデルがタスク内およびタスク間で安定した一貫したリスク選好を示し、その分布は人間よりも制限されていることを発見しました。

  • フレームワークは文脈的リスク信念とカテゴリ的決定を分離し、6つのLLMと100人の人間をテスト。
  • ほとんどのLLMはタスク内一貫性とタスク間順位安定性を示す。
サイト内本文

柔らかなぬいぐるみコンパニオンにおける感情触覚分類のための軽量1D CNNの設計と検証

本研究は、ソフトなインタラクティブコンパニオンにおける感情触覚認識のためのコンパクトな深層学習モデルのオープンソースMATLABフレームワークを提案する。468のCNNモデルを系統的に探索し、13.2kパラメータの拡張1D CNNがテスト精度75%、Leave-One-Subject-Out交差検証精度85%を達成した。ヒューリスティックフィルタリングとCNN分類を組み合わせたハイブリッドパイプラインは、マイクロコントローラ上で20Hzのリアルタイム動作を可能にし、プライバシー保護された感情触覚解釈を実現する。

  • 25名の参加者から収集した1,326のジェスチャーシーケンスからなるFAIR準拠データセットを公開。
  • 最良の13.2kパラメータ1D CNNはテスト精度75%、LOSO交差検証精度85%を達成。
サイト内本文

Concentrate: LLMゲートウェイ

Concentrateは、主要プロバイダーから130以上のモデルにアクセスできる統合APIを提供するマネージドLLMゲートウェイです。モデルルーティング、支出追跡、セキュリティ制御、フォールバック冗長性などの機能を備えており、AIプロダクションを拡大するチーム向けに設計されています。

  • OpenAI、Anthropic、Googleなどのプロバイダーから130以上のモデルに単一APIでアクセス。
  • データ編集、ゼロデータ保持、監査ログ、SSO、RBACなどのセキュリティ機能を内蔵。
サイト内本文

オープンウェイトAIは減速主義か?

OpenAIの戦略的未来責任者ディーン・ボール氏は、オープンウェイトモデルが本質的に減速主義的であり、設備投資を阻害すると主張する。本稿では、中国のAIインフラ投資能力、訓練パラダイムの変化、バリューチェーンにおける価値の所在など、この主張の経済的論理を検証する。結論として、オープンウェイトモデルはコストを下げ参加を広げることで、既存のビジネスモデルを破壊しても加速主義的に働く可能性があると示唆する。

  • ディーン・ボール氏はオープンウェイトモデルが設備投資を減らすため減速主義的と主張。
  • 中国は補助金による過剰生産能力でこの傾向を強める可能性。
サイト内本文

Colibrì概念実証:25GBメモリで1.5TBのAIモデルを実行

イタリアのエンジニアVincenzo(別名JustVugg)は、Colibrìという概念実証を開発しました。これは、わずか25GBのRAMと1GB/sのNVMeを搭載した控えめなCPU上で、7440億パラメータのGLM-5.2モデル(1.5TB)を実行します。速度は極めて遅い(平均0.05~0.1トークン/秒)ものの、Mixture-of-Experts(MoE)アーキテクチャを活用してトークンごとにエキスパートをロードし、最先端レベルの回答品質を実現します。このプロジェクトはオープンソースであり、コンシューマーハードウェア上での大規模モデル実行の可能性を探ることを目的としています。

  • Colibrìは最小限のハードウェアで1.5TBのAIモデルを0.05~0.1トークン/秒で実行。
  • MoEアーキテクチャによりトークンごとにエキスパートをロード/アンロードし、限られたメモリ内で動作。
サイト内本文

GPT-5.6 Sol vs. Kimi K3 が『Kerbal Space Program』でライブスピードラン対決

Twitchライブ配信で、GPT-5.6 SolとKimi K3が『Kerbal Space Program』のスピードランで対戦。複雑なゲームにおけるAIのリアルタイム意思決定能力を示します。

  • GPT-5.6 SolとKimi K3がTwitchで『Kerbal Space Program』のスピードラン対決。
  • 競技はAIのリアルタイム計画と操作スキルをテスト。
サイト内本文

AlibabaのTongyi Lab、16言語対応のホスト型テキスト読み上げモデル「Qwen-Audio-3.0-TTS」をFlashおよびPlusの2段階で公開

AlibabaのTongyi Labは、プロダクション向けテキスト読み上げ(TTS)システム「Qwen-Audio-3.0-TTS」を発表しました。Flash(リアルタイム対話向け)とPlus(高品質生成向け)の2つのバリエーションがあり、Alibaba Cloud Model Studioを通じてホスト型モデルとして提供されます。16言語と20の中国方言をカバーし、自然言語によるスタイル制御と86種類の細粒度インラインタグを備え、Artificial Analysisのリーダーボードで首位を獲得しました。

  • Qwen-Audio-3.0-TTSはFlash(約300ミリ秒の初回パケット遅延)とPlus(品質優先)の2段階で提供され、いずれもAPIホスト型モデルです。
  • PlusはArtificial Analysisアリーナで約1236 Eloを記録し、100万文字あたり約27.59ドルと低価格ながら、スループットは約16文字/秒と控えめです。
サイト内本文

リバースエンジニアリングは今や安価

コーディングエージェントを使った家庭用デバイスのリバースエンジニアリングと自動化の事例が増えている。コード作成コストの低下がもたらす影響を示している。以前はリバースエンジニアリングは可能だったが、ROIが低く、不安定なAPIのメンテナンスリスクがあった。コーディングエージェントはその方程式を変え、初期作業と失敗のコストを下げ、将来のメンテナンスの心理的負担を軽減した。

  • コーディングエージェントがリバースエンジニアリングと自動化のハードルを下げた
  • 以前はコストとメンテナンスリスクから価値がなかったプロジェクトが実現可能に
サイト内本文

中国のモデルを誰が恐れるのか?

ベン・トンプソン氏は、トレーニングデータの収集をフェアユースと明確にし、蒸留を禁止する利用規約を禁止する米国の法律を提案している。これにより、米国のオープンモデルが中国のモデルとより効果的に競争できるようになる可能性がある。また、アリババがQwen 3.8 Maxをオープンウェイトで公開した決定は、習近平主席のオープンソースを奨励する最近の演説に影響された可能性がある。

  • ベン・トンプソン氏は、トレーニングデータの収集をフェアユースとし、蒸留禁止条項を禁止する米国法律を提案。
  • 蒸留(APIのクエリ)は阻止がほぼ不可能であり、米国はそれを活用すべき。
サイト内本文

Kimi K3:オープンウェイトのエスカレーション

Moonshot AIが最新フラッグシップモデルKimi K3をリリース。2.8TパラメータのMoEモデルで、7月27日にウェイトを公開予定。K3は複数のベンチマークで上位に入り、最強のオープンモデルとなる。記事では、米中AIモデルの性能差縮小、中国のオープンソース戦略、オープンモデルの経済的影響、中国の効率性優位性について議論している。

  • Kimi K3は2.8TパラメータのMoEモデルで、ウェイトを公開し、フロンティア性能に迫る。
  • 中国のAIラボは単なるフォロワーではなく、独自の革新能力を示す。
サイト内本文

Adobeの「自然な外観」カメラアプリが生成AIを取り入れる

Adobeの実験的なカメラアプリIndigoは、当初はiPhone写真に自然な一眼レフ風の外観を提供するために開発されましたが、今回「AI Playground」スイートによって生成AI編集機能が追加されました。GoogleのNano Bananaモデルを使用し、スタイル、オブジェクト編集、写真ガイダンス、カスタム編集などの機能を提供。少数のユーザーに無料でテスト提供され、人気が出れば有料化の可能性もあります。

  • AdobeのIndigoアプリに生成AI編集機能「AI Playground」が追加。
  • Adobe独自のFireflyではなくGoogleのNano Bananaモデルを採用。
サイト内本文

Inertia-1:統一モーション基盤モデルへのオープンな探求

Inertia-1は、モーションデータセットの断片化に対処する統一モーション基盤モデルです。大規模な自己教師あり学習を手首の加速度計データに適用し、身体のさまざまな位置やセンサータイプに一般化する表現を生成し、現実世界のパフォーマンスに影響を与える主要な設計選択を明らかにします。

  • 1800万時間以上の加速度計データでの大規模自己教師あり学習により、ラベル不要で汎用的な表現を獲得。
  • 手首での事前学習モデルは、再トレーニングなしで他の身体部位やセンサータイプに一般化可能。
サイト内本文

主要AIモデル、制限的な指導者や政府への批判を拒否する傾向

Metaの監視委員会の調査によると、米国企業が開発した主要なAIシステムは、制限的な指導者や政府を批判する要求を拒否する傾向が強く、表現の自由に対する国家の影響力が拡大する懸念が生じている。

  • ClaudeやChatGPTなどのAIモデルは、サウジアラビア、中国、タイの指導者に対する批判的なコンテンツ生成を拒否した。
  • この研究は、AIが政府のネット上の言論統制を強化する可能性を示唆している。
サイト内本文

トピック

モデル AI ニュース | AI News Hub