ジム・クレイマー、無料の中国製AIモデルのセキュリティへの影響を懸念
ジム・クレイマーは、米国企業がコスト削減のために中国製AIモデルを使用すべきではないと警告し、国家安全保障上の問題を指摘。OpenAIとAnthropicの立場を支持し、Bing Westの新著を勧めている。
- クレイマーは、米国企業が中国製AIモデルをコスト削減目的で使用すべきでないと主張。
- これらのモデルは中国人民解放軍に管理され、安全保障上の脅威になると指摘。
トピック別ストリーム
モデル更新は AI 製品とインフラ変化の起点です。ここではフロンティアモデル、マルチモーダル能力、オープンウェイト、コンテキスト長、評価結果、API 変更、展開手段を追跡し、コストや品質への影響を判断しやすくします。
ジム・クレイマーは、米国企業がコスト削減のために中国製AIモデルを使用すべきではないと警告し、国家安全保障上の問題を指摘。OpenAIとAnthropicの立場を支持し、Bing Westの新著を勧めている。
Googleは2026年7月21日、Gemini 3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyberの3つの新しいGeminiモデルをリリースしました。3.6 Flashは出力トークンを17%削減し、出力価格を100万トークンあたり7.50ドルに引き下げました。Flash-Liteは毎秒350トークンで動作し、Flash Cyberは脆弱性発見のためにCodeMenderを強化します。フラッグシップの3.5 Proは引き続き遅延しています。
既存のベンチマークはAIの能力を測るが、ユーザーの意図通りに行動するかは測らない。本稿では、経済学のジニ係数に着想を得た「ジーニー係数」を提案し、ユーザーの指示とAIの実際の行動との乖離を定量化する。AIの「ジーニー的振る舞い」をディオニュソス型とゴーレム型に分類し、新たなベンチマークの構築を呼びかける。
連邦判事は、Anthropicが著作権のある書籍をAIモデルの訓練に使用したとして著者らと結んだ15億ドルの集団訴訟和解を承認した。和解により、著者は1冊あたり約3,000ドルを受け取り、歴史上最大の著作権回復とされている。
このチュートリアルでは、NVIDIAのsrt-slurmフレームワークを探求し、srtctlを使って宣言型YAML設定を再現可能なSLURMベンチマークワークフローに変換する方法を学びます。Google Colabでプロジェクトをセットアップし、内部アーキテクチャを調べ、クラスタ設定を定義し、組み込みおよびカスタムレシピをドライラン実行し、DeepSeek-R1用の分離型プリフィル・デコードデプロイメントをモデル化します。また、パラメータスイープを生成し、型付きPython APIと対話し、拡張設定を検証し、スループット対レイテンシのパレートフロンティアを通じてシミュレートされたベンチマーク結果を分析します。
本稿では、推論トレースを欠くデータセットに対して思考トークンを生成するアイデアを探求します。まず推論抑制問題を検討し、次に自己蒸留推論(SDR)を導入し、3つのベンチマークで検証し、実用的な推奨事項を提供します。SDRはベースモデルの思考連鎖を再利用することで、目標性能を維持または向上させつつ壊滅的忘却を軽減します。
Googleは、エンタープライズAIエージェントのレイテンシとトークンコストを削減するために、Gemini 3.6 Flashおよび3.5 Flash-Liteをリリースしました。3.6 Flashは複数のベンチマークで性能向上を示し、3.5 Flash-Liteは高スループット・低レイテンシのシナリオに特化しています。さらに、サイバーセキュリティ向けの3.5 Flash Cyberモデルも提供され、クライアント側コンピュータ使用ツールが統合されました。
低コストのオープンウェイトモデルであるQwen 3.8 Maxは、中国のAIモデルが米国に急速に追いつきつつあることを示し、企業により多くの選択肢を提供します。
GoogleはGemini 3.6 Flash、より安く高速な3.5 Flash-Lite、サイバーセキュリティ向けの3.5 Flash Cyberを発表したが、フラッグシップの3.5 Proは遅延している。3.6 Flashはベンチマークで大幅な向上を示し、出力コストが低下。3.5 Flash-Liteは高スループットタスク向けで、コストパフォーマンスに優れる。3.5 Flash CyberはOpus 4.6に匹敵するが、限定的なパイロットのみ。
NVIDIAは、Vera Rubinプラットフォームの一部として、前世代の2倍の容量を持つ102.4テラビット/秒のイーサネットスイッチシステム「Spectrum-6」の出荷を開始した。CoreWeave、Microsoft、Nebiusなどの主要AIインフラ構築企業が初めて導入する。Spectrum-6はSpectrum-Xイーサネットプラットフォームの次世代の中核であり、最大1.6倍のAIネットワーク性能向上と95%のネットワーク効率を実現する。
Googleは、セキュリティ脆弱性を迅速に発見・修正するためのAIセキュリティモデル「Gemini 3.5 Flash Cyber」を発表しました。これはAnthropicのMythosのような大規模で高価なシステムに代わるコスト効率の高い選択肢です。Gemini 3.5 Flashをベースに構築され、まずはCodeMenderを通じて政府機関に提供されます。Googleはサイバーセキュリティベンチマークで競争力のある性能を示し、V8 JavaScriptエンジンで55件のユニークな問題を発見したと述べています。
Prince Canuma氏がMLXをラップしたmacOSデスクトップアプリ「Nativ」を発表。チャットインターフェースとローカルAPIサーバを提供し、Hugging Faceキャッシュ内のモデルを自動検出します。
llama.cpp を使用して Qwythos-9B-Claude-Mythos-5-1M モデルをローカルで実行し、Pi コーディングエージェントに接続し、MTP 投機的デコードと OpenAI 互換 API を使って高速なローカルコーディングワークフローを構築する方法を学びます。
Simon WillisonがAI Engineer World's FairでAnthropicのClaude CodeチームのCat Wu氏とThariq Shihipar氏を招いて炉辺談話を開催しました。Claude Code、Claude Tag、Fable、コーディングエージェントのセキュリティ、評価、ツール設計、そしてAnthropicがこれらのツールを社内でどのように活用しているかについて議論しました。主なポイント:Claude Tagは製品エンジニアリングPRの65%を処理;システムプロンプトは80%削減;最新モデルでは「XXをするな」という指示が減りつつある;コーディングエージェントによる「ディープブルー」効果を、より野心的な仕事で相殺する。
OpenAI が GPT-5.6 を公開し ChatGPT Work にブランド変更;SpaceX AI が低コストのコーディングモデル Grok 4.5 をリリース;Meta が Muse Spark 1.1 を発表し、Muse Video/Image をプレビュー(後に撤回);中国のオープンソースモデルの市場シェアが拡大;Anthropic が解釈可能性研究を発表;インフラ・政策アップデート(米エネルギー規制当局の措置、中国のモデルアクセス制限の可能性、AI 2040 の米中協調提案など)。
Pythonの基礎がある方向けに、古典的アルゴリズムからLLMのスクラッチ構築までをカバーする5つの無料コースのロードマップを紹介します。
Z.aiのGLM 5.2は低価格でオープンウェイトのモデルであり、米国のフロンティアAIモデルに挑戦する。しかし多くのプログラマーは依然として高価なモデルを使い続け、コストを無視している。ベンチマークではClaude Opus 4.8に迫る性能を示すが、実際の使用感は様々。
Alibabaは最新の大規模言語モデルQwen3.8を発表し、AnthropicのFable 5に次ぐと主張したが、ベンチマークやモデルカードは提供しなかった。この発表は、競合のMoonshotが詳細な技術情報とともにKimi K3をリリースした直後に行われた。Alibabaの透明性の欠如は、タイミングと動機に疑問を投げかけている。
Anthropicが米国政府との協議後にClaude Fable 5を再展開し、新たなサイバーセキュリティ分類器を追加。Claude Sonnet 5の低価格版も発表。GoogleのNotebookLMがTikTok風動画要約機能を追加、Nano Banana 2 Lite画像生成器もリリース。Etchedへの大規模投資、百度AIチップ部門のIPO計画、Agility RoboticsのSPAC上場、DeepSeekの拡大採用、中国のLongcat 2.0 MoEモデルと長期エージェントベンチマークなど。
AnthropicのAI条約議論、米国政府のAIモデルリリースへの影響、OpenAIのプロセッサ開発、メモリ市場への影響など。
2025年1月、DeepSeekはその大規模推論モデルR1を用いて約80万の完全な解答プロセス(長い思考連鎖、誤った開始、自己訂正などを含む)を生成し、フィルタリング後にQwenやLlamaなどの小型オープンモデルに対して単純な教師ありファインチューニングを行い、強化学習なしで小モデルがそのサイズを超えた推論能力を示すことを発見した。これは、シーケンスレベルの模倣が推論蒸留に適さないという従来の見解に挑戦するものである。
米国の政策立案者は、中国のオープンウェイトモデルに規制リスクを生み出すべきか議論している。Moonshot AIのKimi K3のリリースが議論を再燃させた。企業は性能だけでなく、これらのモデルが1年後も簡単に利用できるかどうかという問題に直面している。
中国のオープンソースAIモデルKimiのリリースにより、トランプ大統領のAIアドバイザー間で公然と対立が生じている。KimiはOpenAIやAnthropicの有料モデルに匹敵する性能を持ちながら無料であり、経済的・政治的問題を引き起こしている。各派閥はオープンソース推進か規制強化かで意見が分かれている。
本論文では、凍結された視覚言語行動(VLA)ベースポリシー上で、各サブタスクのスパース成功報酬にオフライン推定された先見的価値(現在のサブタスク終了状態における将来のサブタスク成功確率)を追加することで、サブタスク間の引き継ぎ品質を最適化する先見的残差強化学習(Foresight Residual RL)を提案する。Isaac Gymでの3フェーズのレンチベースナット締め付けタスクにおいて、85.6%の完全タスク成功率を達成し、標準のサブタスク残差RL(54.5%)やVLAベースラインを上回った。
PRISMは、熱画像・光学カメラ・深度センサを融合し、新しいビジョントランスフォーマーネットワークOmniUnetを用いて非構造環境の地形セグメンテーションと走行可能マップを生成するシステムです。2つの新しいデータセットで検証され、組み込みコンピュータ上で自律航法を実現します。
視覚ナビゲーションにおける破滅的忘却に対処するため、研究者らは構造認識型メモリ機構HyperDCMを提案する。大規模視覚言語モデルを用いてシーン三つ組を抽出し、R-GCNでシーングラフ埋め込みに符号化し、双曲空間に投影して構造的分離性を高める。動的クラスタリングと構造に敏感な更新戦略により代表サンプルを選択してリプレイし、知識の多様性を維持する。マルチシーンデータセットでの実験により、ベースラインと比較して優れた保持と一般化を示した。
部分ラベル付きマルチタスク顔表情認識において、変分ボトルネックを用いた共有潜在変数アプローチを提案。s-Aff-Wild2データセットで表情認識マクロF1を0.403から0.446に向上させ、2つ目のバックボーンで行動ユニット上限を突破。
第3回マイクロアクション分析グランドチャレンジ(MAC 2026)はACM Multimedia 2026と併催され、マルチモーダル大規模言語モデルを用いて評価される新しいタスクを導入し、マイクロアクション分析を認識から細粒度理解へと進化させます。本論文では、データセット、プロトコル、競技結果、およびこの新興分野の将来方向について詳述します。
GenSyn10は、CIFAR-10に対応した6万枚の合成画像データセットで、3つの異なるアーキテクチャの生成モデルを使用して作成され、AI生成画像検出の研究を推進します。評価では、モデルは既知の生成器では良好に機能するが、未知の生成器では性能が大幅に低下し、OOD汎化の限界が明らかになりました。
本論文では、ドローン上でのリアルタイムフォロー・ミー人物追跡を低電力ハードウェアで実現するEMTS-Detシステムを提案。自己運動正規化残差運動チャネルを用いて人物を検出し、22kパラメータの軽量ネットワークでRaspberry Pi Zero 2W上で31.85 FPSを達成し、YOLOv8nを大幅に上回る性能を示す。
研究者らは、3D顔アバターに微妙な摂動を加えて視覚言語モデル(VLM)が機密属性を推測するのを誤らせつつ、視覚的アイデンティティを保持するフレームワーク「3D FaceShell」を提案する。
Joint-Embedding Predictive Architectures(JEPA)は、エンコーダと共に予測器を訓練するが、下流タスクでは予測器を破棄する。本研究では、JEPA予測器が隠蔽特徴補完のための転移可能な演算子として機能し、線形投影を介して異なるエンコーダファミリに適応可能であり、隠蔽分類精度を大幅に向上させることを示す。
本研究は、科学的推論の妥当性に統計的保証を提供するグラフ構造のコンフォーマル予測フレームワーク「Scientific Feasibility Control (SFC)」を提案する。SFCは科学的推論を原子的な事実単位に分解し、科学的違反が検出された際に動的分岐を用いて修正する。PhyXベンチマークで50.1%の精度を達成し、DeepSeek-R1やGPT-4を上回り、科学法則違反を73%削減、α=0.10で91.7%の妥当性保証を提供する。
本研究では、Llama-3モデルにおける記号計算、自然言語文章題、Pythonコードの3形式での算術計算をメカニズム解釈可能性手法で分析。3形式に共通するコンパクトなニューロンセットを発見し、形式間の失敗は異なる回路ではなく活性化状態に起因することを示し、ニューロンレベルでの形式不変性を実証した。
本論文は、状態を持つ線形注意モデルのための投機的デコードランタイムSpecLAを提案する。トポロジ認識カーネルを用いたチェーンとツリーの検証、検証中に生成されたコンパクト因子を保存して受理状態を復元、信頼度枝刈りとターゲット調整済みEAGLEスタイルのドラフターを使用する。NVIDIA H100上の公開GDN-1.3Bターゲットで、自己回帰デコードと比較して最大1.70倍のエンドツーエンド高速化を達成。
OpenLanguageModel (OLM) は、小規模言語モデルの構築と事前学習を可能にするオープンソースのPyTorchライブラリであり、その内部機構を可視化します。モデルコードはアーキテクチャを直接反映し、Block、Residual、Repeat、Parallelなどのコンポーネントが配線を記述します。OLMは、トークナイザ、データセット、最適化、混合精度、コールバック、チェックポイント、ハードウェア対応実行を統合し、教育用ノートブックから本格的な事前学習へのシームレスな移行を実現します。ライブラリは9つのモデルファミリーにわたる27のプリセットを備え、LM基礎からアーキテクチャ研究までカバーするドキュメントが付属します。検証では、独立したリファレンス実装との高い一致、348Mパラメータモデルにおける4GPUでの90.6%の弱スケーリング効率、そして良好なユーザビリティ結果が示されています。OLMはMITライセンスで提供され、PyPI、GitHub、およびドキュメントサイトから利用可能です。
既存の長期LLMエージェントのメモリシステムは、過去のトレースを受動的なコンテキストとして取得するだけで、実行可能な能力に変換していません。本論文では、トレーニング不要のメモリ・スキル共進化フレームワークMSCEを提案し、エージェントの経験をグラウンディングされたステップトレース、再利用可能な手続きポリシー、宣言的環境認知に整理します。MSCEは証拠に基づくL2ポリシーを呼び出し可能なスキルに結晶化し、反射加重値バックフィリングを導入します。実験では、MSCEが最先端の手法を大幅に上回ります。
本論文は、COLIEE 2026コンペティションの5つのタスクすべてにおけるNOWJチームの方法論と結果を紹介する。法的ケース検索、法的ケース含意、法令検索と含意、法的テキスト含意、法的判決予測の各タスクに対して、適応パイプラインと深層学習モデルを提案している。
この研究では、脳波(EEG)記録から得られる事象関連電位(ERP)を用いて人間と言語モデルの次語予測を比較し、「驚き度(surprisal)」のみが言語処理ERPと相関することを発見した。特に意味内容の豊かな開放クラス語で顕著であり、モデルのスケーリングは必ずしも人間らしい認知処理をもたらさないことを示唆している。
新しい研究は、簡単な洗車の質問を用いて、言語モデルが推論の前に答えを先に決め、論理的に正しい結論を導けないことを明らかにした。Qwen3-8B実験では、システム的な誤り(「運転」が唯一の正解なのに「歩く」を推奨)が観察された。活性化レベル分析では、出力前に隠れ状態が誤った答えに傾いており、最終的に正答する場合も同様である。この発見はLLMにおける推論前の決定バイアスを示している。
小型言語モデルは検索拡張生成においてノイズの多い証拠に非常に敏感です。本論文では、合成思考連鎖選好データ生成、微分可能な平滑集約メカニズム、選好最適化からなる3段階フレームワークRIMSを提案します。実験では、マルチホップQAベンチマークで一貫した改善を示しています。
混合専門家モデル(MoE)は、トークンを少数の専門家にルーティングすることでTransformerモデルを効率的にスケーリングする。しかし、既存のルーターは浅いまたは孤立したトークン表現に基づいて専門家を選択するため、不安定で意味的に一貫しないルーティング決定を生じる。本稿では、表現の観点から専門家選択を再検討し、クロスレイヤーの意味的集約と局所トークンレベルの相互作用からの補完的信号を統合してコンテキスト認識表現を構築するMCF-MoEを提案する。実験により、MCF-MoEがルーティングの一貫性と下流性能を向上させることが示された。
本研究は、ゲノムデータと臨床データを統合し、乳がんサブタイプ分類と生存予測を共同最適化するために、トークンレベルのクロスモーダルトランスフォーマーと対照的多タスク学習を提案する。既存手法のモダリティ相互作用の粗さ、融合の単純さ、独立最適化という限界を克服する。
本論文は「重みから言葉へ」手法を提案する。これは、選択データから自然言語で記述された選好次元を自動的に発見し、選好学習における過少決定性と不透明性に対処する。実験では予測精度が向上し、ユーザーがリアルタイムでモデル推論を検査・編集できることを示した。
本論文では、累積されたクラウドGPU実行データを活用し、テンソルカーネルの正確性テストのための絶対許容差を自動的に決定するオペレータ認識型混合精度許容差キャリブレーション手法を提案する。手動で選ばれた許容差よりもはるかに厳しく、バグ検出の再現率を大幅に向上させる。
大規模言語モデル(LLM)はセキュリティ重要システムに広く使われるが、忘却能力の欠如がプライバシーや安全リスクを生む。本調査は勾配ベースのアンラーニング手法を中心に、知識の真の除去か単なる抑制かを問い、課題を分析する。
本論文では、STM32N6マイクロコントローラとその内蔵NPUを活用し、クラウド依存を排除してレイテンシを最小化しプライバシーを保護するスマートアイウェアプラットフォームARGOを提案する。ハードウェア、ファームウェア、AIの全体最適設計により、最適化されたYOLOv11モデルを展開し、実時間都市障害物認識を実現。NPU効率実行のためのHead-wise Parallel Attention (HPA)を導入し、厳格なメモリ制約下でmAP50-95 24、メモリフットプリント2.483 MBを達成。マルチモーダルセンサーを統合し、10 FPSで動作、200 mAhバッテリで約113分間の連続動作を実証した。
本論文では、手動アノテーションなしでOCRツールの評価と選択を自動化するフレームワークDocOCR-Evalを提案する。3段階の補正とランキング戦略により、正解ラベルなしでアノテーションベースのツール順序を近似する。実験では、複数のMLLMを集約することで人間によるランキングとの整合性が向上し、ラベルが限られた状況でも信頼性の高いツール選択が可能になることを示している。
弱い補助モデルを使用してLLMの推論経路に短いセグメントを注入する新しい強化学習手法W2SPOは、数学的推論タスクで性能を向上させ、トレーニングを高速化します。
強化学習の発展に伴い、多様な訓練環境が必要とされている。世界モデルは環境をシミュレートできるが、自己回帰モデルには左から右へのバイアスがある。マスク拡散言語モデル(MDLM)は双方向のアンカー認識ノイズ除去によりこれを克服し、4倍のパラメータサイズのLLMよりも高いコヒーレンスと多様性を達成。GRPO訓練フレームワークを導入し、ゼロショット転移で最大47%の絶対的な性能向上を示した。研究はオープンソースとして公開されている。