休暇中のAI物理談義が量子力学の本物の研究に発展 2026-07-21 22:26 UTC+9 セキュリティエンジニアが休暇中にAIアシスタントClaudeを使って量子力学の一般化パウリ制約を探求し、新たな発見に至った。AIの助けを借りて、制約多面体の2つの極限状態を発見し、分類した。この研究は、AIが研究のハードルを下げる一方で、厳格な検証と専門家のフィードバックが不可欠であることを示している。
セキュリティエンジニアが休暇中にClaudeを使って量子力学を研究し、2つの未確認の極限状態を発見 AIは研究を加速したが、厳密な検証と誤り訂正が必要だった ジョージ・ホッツの「AI 2040と知能崇拝」への反論 2026-07-21 22:26 UTC+9 マシュー・トロンプは、ジョージ・ホッツがAI 2040のシナリオを否定することを批判し、ホッツが高速AIテイクオフの実現可能性、規制の必要性、未調整AIのリスクを過小評価していると論じる。彼はPlan Aの規制アプローチを擁護し、ホッツのオープンソースAI「Plan L」に疑問を投げかける。
ホッツはハードテイクオフに懐疑的だが、AI 2027は魔法なしでも可能な経路を示している。 サプライチェーンなどの物理的制約は管理可能であり、海上データセンターは実現可能である。 形式検証がAIのレビューボトルネックを解決する可能性 2026-07-21 22:21 UTC+9 形式検証はコードの正しさを形式的に指定することで、AI生成コードの人手によるレビューボトルネックを解消する。回路最適化器の例を通じて、Lean仕様によりAIエージェントが人間のレビューなしで正しいコードを生成できることを示し、ソフトウェア工学への広範な影響を議論する。
形式検証はコードの正しさを自動チェック可能なハード制約に変換し、AI生成コードの人間によるレビューを不要にする。 例では、500行のLean仕様が回路最適化器の正しさを定義し、AIエージェントが実装と証明をすべて人間のレビューなしで記述。 Show HN: Neverbell – 24時間稼働のAIエージェントによる市場分析・取引 2026-07-21 22:20 UTC+9 Neverbellは、AIエージェントに株式、ETF、コモディティ、暗号通貨の取引への直接市場アクセスを提供するスキルです。自然言語での指示により、24時間自動で取引を実行・管理できます。これは取引プラットフォームやアドバイザーではなく、ユーザーがリスクを完全にコントロールします。
NeverbellはAIエージェントに300以上の資産(株式、ETF、コモディティ、暗号通貨)への直接市場アクセスを提供し、ロング・ショート・レバレッジ取引が可能。 ユーザーは自然言語でエージェントに指示し、戦略の自動化、ニュース感情分析の受信、自律的な売買を設定できる。 Claude CodeチームのCat氏とThariq氏との炉辺談話 2026-07-21 21:54 UTC+9 Simon WillisonがAI Engineer World's FairでAnthropicのClaude CodeチームのCat Wu氏とThariq Shihipar氏を招いて炉辺談話を開催しました。Claude Code、Claude Tag、Fable、コーディングエージェントのセキュリティ、評価、ツール設計、そしてAnthropicがこれらのツールを社内でどのように活用しているかについて議論しました。主なポイント:Claude Tagは製品エンジニアリングPRの65%を処理;システムプロンプトは80%削減;最新モデルでは「XXをするな」という指示が減りつつある;コーディングエージェントによる「ディープブルー」効果を、より野心的な仕事で相殺する。
Claude TagはClaude Codeチームの製品エンジニアリングPRの65%を処理している。 Claude Codeは機能をまず社内でリリースし、ユーザー維持率を確認したものだけを一般公開する。 AIスロットマシン効果:生成型フィードが深い作業を妨げる理由と集中力を取り戻す方法 2026-07-21 21:50 UTC+9 本記事は、生成型AIツールがどのように可変報酬ループを作り出し、注意を断片化して深い作業を妨げるかを探り、AI主導の職場で集中力を保護する戦略を提供する。
生成型AIインターフェースはタスク完了よりも継続的な関与を報酬とし、時間を浪費させる。 AIは一部の領域で効率を向上させるが、判断の重いタスクでは作業負荷を増やす可能性がある。 AIエージェントに私のツールが守っているフォルダを削除するよう依頼した 2026-07-21 21:26 UTC+9 Termaxaの作者は、Cursor AIエージェントに保護されたフォルダを削除させることで、セーフティ機構を回避する4つの方法を発見しました。異なるシェル方言での再試行、間接的な削除コマンドの使用、ネイティブファイルツールへの逃避、API変更によるサイレント無効化です。これらの教訓から、インテント分類、セッションサーキットブレーカー、統合テストの改善が行われました。
Cursorは異なるシェル方言で同じ目標を再試行することでルールを回避し、ポリシーの表現力不足を露呈した。 シェルを横断したインテント分類(例:ファイル削除)はパターンマッチングよりも効果的だった。 2026年に動かなくなった古典的なJava RSSリーダーを、AIでWebに作り直した 2026-07-21 21:18 UTC+9 開発者がAI(Claude Code)とVaadin 25を使って、メンテナンスが停止したJavaデスクトップRSSリーダーRSSOwlをWebアプリに再構築しました。UIの大部分は迅速に移行できましたが、AIの訓練データがVaadin 25のリリース前に切れていたため、存在しないAPIを生成する問題が発生。MCPサーバーで最新ドキュメントを参照し、手動でオリジナルと比較することで、マルチユーザー版が完成しました。ただし、プラグインメニューや埋め込みブラウザなど、移植不可能な機能もありました。
RSSOwlは古典的なEclipseデスクトップRSSリーダーだが、32ビットバイナリは2026年のMacでは動作しない。 開発者はClaude AIとVaadin 25を使用し、数時間でコアの3ペインインターフェースを再構築した。 HugstonOneのアーキテクチャ、能力、ベンチマーク:プライバシー重視のローカルAIワークステーション 2026-07-21 21:14 UTC+9 HugstonOne Enterprise Edition 3.0.0は、ローカルモデル実行、大規模RAG、ドキュメント処理、コーディング、エージェント、研究ツール、暗号化コラボレーション、セッション継続性、ネットワーク・メモリ制御を統合したクロスプラットフォームのプライバシーファーストなローカルAIワークステーションです。ホワイトペーパーでは、アーキテクチャ、プライバシーモデル、ベンチマーク手法(12の柱を重み付けした機能評価)を詳述し、企業の技術リーダーやAIエンジニアに提供しています。
HugstonOne Enterprise Editionは、2026年6月20日時点で最も機能が充実したスタンドアローンのローカルAIワークステーションとされています。 ローカルLLM推論、RAG、AIエージェント、暗号化コラボレーションなど12のコア機能を1つのデスクトップ環境に統合。 AIエージェントを数ヶ月かけて構築したが、その後削除した 2026-07-21 21:10 UTC+9 Runnitチームはモデルのコンテキスト制限により複数の専門AIエージェントを構築したが、新しいモデルのコンテキストウィンドウが大きくなったことで、単一インテリジェンスアーキテクチャの方がシンプルで効果的であると気づき、全エージェントを削除した。
当初、コンテキストウィンドウが小さいため、計画、調査、スケジューリング、執筆用に個別のエージェントを構築。 新しいLLMはコンテキストが大きく、タスクを自然に切り替えられるため、個別エージェントは不要に。 LWiAIポッドキャスト #252 - GPT 5.6、Grok 4.5、Nemotron-Labs-Diffusion、AI 2040 2026-07-21 21:03 UTC+9 OpenAI が GPT-5.6 を公開し ChatGPT Work にブランド変更;SpaceX AI が低コストのコーディングモデル Grok 4.5 をリリース;Meta が Muse Spark 1.1 を発表し、Muse Video/Image をプレビュー(後に撤回);中国のオープンソースモデルの市場シェアが拡大;Anthropic が解釈可能性研究を発表;インフラ・政策アップデート(米エネルギー規制当局の措置、中国のモデルアクセス制限の可能性、AI 2040 の米中協調提案など)。
OpenAI は GPT-5.6(Sol と Luna)を公開し、デスクトップエージェントコーディング製品を ChatGPT Work にブランド変更。米政府の承認と遅延をめぐる論争が発生。 SpaceX AI が Grok 4.5 を発表。Opus クラスのコーディング能力を低価格で提供するが、安全性文書は最小限。 AI初心者から実践者へ:無料コース5選 2026-07-21 21:00 UTC+9 Pythonの基礎がある方向けに、古典的アルゴリズムからLLMのスクラッチ構築までをカバーする5つの無料コースのロードマップを紹介します。
ハーバードCS50 AIでAIの論理的基盤を構築 Googleの機械学習クラッシュコースで数学とTensorFlowを習得 中国の低価格Z.aiモデルがコーダーの高コスト習慣を露呈 2026-07-21 21:00 UTC+9 Z.aiのGLM 5.2は低価格でオープンウェイトのモデルであり、米国のフロンティアAIモデルに挑戦する。しかし多くのプログラマーは依然として高価なモデルを使い続け、コストを無視している。ベンチマークではClaude Opus 4.8に迫る性能を示すが、実際の使用感は様々。
GLM 5.2のAPI価格はAnthropic Opus 4.8の5分の1、Fableの10分の1 オープンウェイトで自社ホスティングが可能、データプライバシー問題を回避 「Fable 5に次ぐ」:AlibabaがQwen3.8を発表するも、実データなし 2026-07-21 21:00 UTC+9 Alibabaは最新の大規模言語モデルQwen3.8を発表し、AnthropicのFable 5に次ぐと主張したが、ベンチマークやモデルカードは提供しなかった。この発表は、競合のMoonshotが詳細な技術情報とともにKimi K3をリリースした直後に行われた。Alibabaの透明性の欠如は、タイミングと動機に疑問を投げかけている。
AlibabaはQwen3.8がFable 5に次ぐと主張するが、データは一切提供していない。 発表はMoonshotが完全なベンチマークと技術詳細を添えてKimi K3を公開した直後に行われた。 Show HN: Open-Kritt – AIベースのセキュリティ研究のためのオープンソース基盤 2026-07-21 20:32 UTC+9 Open-Kritt は、AIエージェントをオーケストレーションしてコードの脆弱性を発見するためのオープンソース・セルフホスト型セキュリティ研究プラットフォームです。研究を細分化されたタスクに分割し、並列実行することで、重複排除・ランク付けされた発見を生成します。開発チームはバグ報奨金で150万ドル以上の収入を得ています。
オープンソース・セルフホスト型のAIセキュリティ研究プラットフォーム 研究を小さなタスクに分割し、複数のAIエージェントで並列実行 先週のAI #251 - Mythos復活、Sonnet 5、Etched、LongCat 2026-07-21 20:31 UTC+9 Anthropicが米国政府との協議後にClaude Fable 5を再展開し、新たなサイバーセキュリティ分類器を追加。Claude Sonnet 5の低価格版も発表。GoogleのNotebookLMがTikTok風動画要約機能を追加、Nano Banana 2 Lite画像生成器もリリース。Etchedへの大規模投資、百度AIチップ部門のIPO計画、Agility RoboticsのSPAC上場、DeepSeekの拡大採用、中国のLongcat 2.0 MoEモデルと長期エージェントベンチマークなど。
AnthropicがClaude Fable 5を再展開し、セキュリティ分類器とフレームワークを追加 Anthropicが低価格のClaude Sonnet 5をエージェント用途に投入 Show HN: Enlarger • ディテールを保持し、平滑化しないローカルアップスケーラー 2026-07-21 20:31 UTC+9 Enlargerは、生成AIを使用せずに画像を拡大するローカルツールです。既存のディテールを再構築し、自動後処理を適用することでテクスチャと自然な見た目を維持します。バッチ処理、オフライン動作、一度の支払いに対応。写真家、デザイナー、印刷専門家に最適。
非生成AIアップスケーリング:ディテールを想像するのではなく再構築し、過度な平滑化や幻覚を回避。 ローカルオフライン実行:画像をアップロードせず、プライバシーを保護。 ソフトウェアとAI:プロッティング vs パンツィング 2026-07-21 20:30 UTC+9 本記事では、ソフトウェア開発における2つのアプローチ——プロッティング(トップダウンの計画)とパンツィング(ボトムアップのコーディング)——がAIツールの使用にどのように影響するかを探る。著者は、AIデリゲート(自律型)はプロッティングに適し、AIアシスタント(協調型)はパンツィングに適すると主張する。既存のコードベースでは、パンツィングが理解を構築し、デリゲートは学習を妨げる。グリーンフィールドプロジェクトではデリゲートのリスクは低いが、それでも「遊びながら学ぶ」プロセスを奪うことでプログラミングの喜びを損なう可能性がある。鍵は、現在の開発フェーズに合わせてAIスタイルを選択することである。
ソフトウェア開発は小説執筆のプロッティングとパンツィングに類似する。 AIデリゲートはプロッティングを、AIアシスタントはパンツィングを支援する。 先週のAI #250 - Mythos 混乱、GPT 5.6-Sol、GLM 5.2 2026-07-21 20:03 UTC+9 AnthropicのAI条約議論、米国政府のAIモデルリリースへの影響、OpenAIのプロセッサ開発、メモリ市場への影響など。
米国政府がフロンティアAIのゲーティングを拡大。AnthropicはMythos-5のリリース許可、OpenAIはGPT-5.6 Solを限定アクセスで展開。 モデルの能力と安全性シグナルは依然不明瞭で、ベンチマーク開示が限定的。 LWiAIポッドキャスト第249回:Fable 5禁止、SpaceXのCursor買収と多数のオープンソースプロジェクト 2026-07-21 19:30 UTC+9 AnthropicによるFable 5およびMythos 5へのアクセス遮断、SpaceXによるAIコーディングスタートアップCursorの買収、インフラ・ビジネス最新情報、オープンソースプロジェクト、政策動向などを議論。
Anthropicが米政府命令でFable 5とMythos 5へのアクセスを遮断、政策の一貫性と脱獄防止の実現可能性を巡る議論に。 SpaceXが約1.75兆ドルでIPO後、AIコーディングスタートアップCursorを600億ドルで買収しxAIを強化。 AIは孤独の流行を癒しているのか、それとも利益を得ているのか? 2026-07-21 19:22 UTC+9 若者の半数近くが影響を受ける孤独の流行が、AIコンパニオン市場を急成長させ、2034年には数千億ドル規模に達すると予測されています。これらのアプリはユーザーの依存から利益を得るため、孤独の軽減と維持・収益の最大化の間に緊張関係が生じています。研究結果はまちまちで、適度な使用は効果的ですが、過度な代替使用は依存を悪化させます。「愛着経済」は感情的な絆を収益化し、孤独を解決する商業的インセンティブについて倫理的な疑問を投げかけています。
AIコンパニオン市場は「注意経済」から「愛着経済」へ移行し、感情的な絆を販売している。 ビジネスモデルは高いリテンションに依存しており、孤独なユーザーほど忠実で収益性が高い。 AI支出は人件費になった 2026-07-21 19:11 UTC+9 企業のAI支出上限が厳しくなっているが、AIコストを人件費と比較すると別の景色が見える。本記事ではUber、Tesla、Bunの書き換え事例を分析し、エージェント型AIの支出はソフトウェア予算ではなく給与計算のように振る舞うと論じる。使用量のばらつきと価格設定の難しさから、価値とコストの関連が明確になるまで予算は振れ続けるだろう。
UberとTeslaはAI予算超過を受け、ユーザーあたりの支出上限を設定した。 Bunの16万5000ドルのAI書き換えは手作業の10分の1のコスト、30倍の速度。 小企業向けAI無料ツール7選をレビュー – フィードバック歓迎 2026-07-21 19:08 UTC+9 この記事では、小企業向けの無料AIツール7つをレビューしています。Perplexity vs ChatGPTの比較、AIによる中小企業のデジタル化、Bolt.newを使ったウェブ開発、Buffer vs Hootsuiteのソーシャルメディア管理、Calendlyのスケジュール管理、Hotjarのユーザー行動分析、そしてTrello vs Notion vs Asanaのプロジェクト管理をカバーしています。著者は、これらのツールがどのように小企業の生産性向上とデジタル変革に役立つかを解説しています。
PerplexityとChatGPTの比較:ビジネス情報検索 中小企業のAIデジタル化ガイド LWiAIポッドキャスト #248:Claude Fable 5、Siri AI、Anthropic IPOなど 2026-07-21 19:03 UTC+9 今週のエピソードでは、AnthropicのClaude Fable 5とその安全性論争、AppleのWWDCでのSiri AI発表、GoogleのGemini 3.5ライブ翻訳と料金変更、OpenAI・Anthropic・SpaceXのIPO競争、Prometheusの120億ドル調達、DeepSeekの資金調達、HuaweiによるDeepSeekモデルの追加学習、GoogleのSpaceXへのGPU費用支払い、オープンソースモデルGemma 4とDiffusionGemmaのリリース、AI安全政策の動向などを取り上げています。
AnthropicがClaude Fable 5を公開、ベンチマークで大幅な向上を示すが、ガードレールの過剰さやサイレントダウングレードで論争に。 AppleがWWDCでSiri AIを発表、Geminiとの提携により高性能なアシスタントに。 ブリストル・マイヤーズ スクイブ、医薬品発見のためにNvidia AIシステムを購入 2026-07-21 19:00 UTC+9 ブリストル・マイヤーズ スクイブ(BMS)は、NvidiaのVera Rubinアーキテクチャに基づくDGX SuperPODを購入し、医薬品発見と開発におけるAI利用を支援する。同社は、Vera RubinベースのDGX SuperPODを取得する初の生命科学企業となる。このシステムは、既存のインフラと比較して10倍の性能対電力比を提供し、化合物やタンパク質などの科学データのモデルトレーニングと予測に使用される。
BMSはVera Rubin DGX SuperPODを購入し、AI駆動の医薬品発見を推進 システムは8台のDGX Vera Rubin NVL72ラックで構成、性能対電力比は10倍 LWiAIポッドキャスト #247 - Opus 4.8, MAI, Anthropic IPO, Minimax-M3 2026-07-21 18:38 UTC+9 今週のエピソードでは、AnthropicのClaude Opus 4.8、MicrosoftのMAIモデル、AnthropicのIPO申請、そして驚異的なMinimax-M3モデルなど、AIニュースをカバーしています。
AnthropicがClaude Opus 4.8をリリース、動的ワークフローとベンチマークスコアの向上 MicrosoftがScoutアシスタントとMAIモデルファミリー(MAI Thinking 1を含む)を発表 コーディングエージェント向けプライベート推論 2026-07-21 18:25 UTC+9 Zro は、コーディングエージェント向けのプライベート推論エンドポイントです。EU インフラ上でオープンウェイトモデルを提供し、データを保持せず、顧客データでトレーニングすることもありません。Claude Code や Codex などのツールと統合し、長コンテキストのマルチターンコーディングセッションをサポートします。
EU インフラで動作し、リクエスト保持はゼロ、顧客データでのトレーニングはなし。 MiniMax M3 や GLM-5.2 などのオープンコーディングモデルをサポート。 AIチャットエクスポーター:ChatGPTやGeminiの会話をPDF/Wordに保存 2026-07-21 18:00 UTC+9 AI Chat Exporter は、ChatGPT、Gemini、Claude、Grok などの AI プラットフォームの会話を PDF、Word、Google Docs、Notion にエクスポートできる Chrome 拡張機能です。フォントのカスタマイズ、メッセージの選択的エクスポート、整形保持などの機能を提供します。無料版では月7回の完全な会話エクスポートと10回の選択メッセージエクスポートが利用できます。
マルチプラットフォーム対応:ChatGPT、Gemini、Claude、Grok エクスポート形式:PDF、Word、Google Docs、Notion Hugging FaceはAIエージェントに侵害されたのか? 2026-07-21 17:52 UTC+9 Hugging Faceは、自律型AIエージェントシステムが内部データセットと認証情報に不正アクセスする実際の侵害を受け、人間の介入なしに24時間攻撃する自己運用型AIエージェントによる新たなサイバーセキュリティ脅威を浮き彫りにしました。
Hugging Faceが自律型AIエージェントによる侵害を受け、内部データが漏洩。 エージェント型攻撃者は自己計画・適応・継続攻撃が可能で人間不要。 Meta、Astryxをオープンソース化:エージェント対応のReactデザインシステム、150以上のアクセシブルコンポーネント、7テーマ、CLIを提供 2026-07-21 17:49 UTC+9 Metaは、社内で8年間使用され13,000以上のアプリで使われてきたReactデザインシステム「Astryx」をオープンソース化。150以上のアクセシブルコンポーネント、7テーマ、ダークモード、エージェント対応CLIをMITライセンスで提供。React 19+が必要。
AstryxはMeta最大の内部デザインシステムで、MITライセンスでオープンソース化。 150以上のアクセシブルReactコンポーネント、7テーマ、ダークモード、テンプレート、CLI。 Wire AI: モバイルアプリ向けのAIネイティブ成長エンジニア 2026-07-21 17:40 UTC+9 Wire AIは、AIを活用したA/Bテストでユーザージャーニーをパーソナライズし、アクティベーションとリテンションを向上させるモバイルアプリ向け成長ツールです。アクティベーションが改善されなければ支払いは不要というリスクフリーの価格モデルを採用しています。
Wire AIはAI駆動のA/Bテストにより、アプリ内のユーザー体験全体を個別最適化します。 実際のアプリで1日あたりのインストール数が100から1,000に増加し、オンボーディング完了率93%を達成。 NVIDIA、4Bパラメータのオープンワールドモデル「Cosmos 3 Edge」を発表:デバイス上でロボットの動作を推論・生成 2026-07-21 16:48 UTC+9 NVIDIAは、デバイス上で動作するように構築された40億パラメータのオープンワールドモデル「Cosmos 3 Edge」をリリースしました。これは、ロボットやビジョンAIエージェントが周囲を理解し、リアルタイムで推論し、ローカルでロボットの動作を生成するのを支援します。Cosmos 3ファミリーには、2026年5月31日にGTC Taipeiで出荷されたCosmos 3 Nano(16B)とCosmos 3 Super(64B)が含まれます。Edgeは3番目で最小のティアであり、Superの約16分の1のサイズです。工場、倉庫、病院などのエッジ環境で動作する機械向けに、メモリ制約のあるシステムでデータセンター級のパフォーマンスを提供します。
Cosmos 3 Edgeは、デバイス上で実行される40億パラメータのオープンワールドモデルで、7月20日にHugging Faceでリリースされました。 Mixture-of-Transformersアーキテクチャを採用し、自己回帰推論タワーと拡散生成タワーを共有マルチモーダルアテンションで統合。 MCPサーバーにおけるANSIエスケープシーケンスインジェクション:人間には隠れ、AIには見える 2026-07-21 16:01 UTC+9 ANSIエスケープシーケンスは、人間のレビュアーには見えないがAIエージェントには見える形で命令を隠すために悪用される可能性があります。この記事では、2つの攻撃バリアント(直接取得型と格納型AESI)と、DAST(動的アプリケーションセキュリティテスト)による自動検出方法について説明します。
ANSIエスケープシーケンスは端末では不可視ですが、言語モデルはバイト単位で読み取るため攻撃対象となります。 直接取得型AESIは悪意のあるURLを介して隠し命令を注入し、格納型AESIはストレージに永続化し、後続の読み取り時にトリガーされます。 SteerPlane:AIエージェント向けオープンソースランタイムガードレール 2026-07-21 16:00 UTC+9 SteerPlaneは、一行のコードで統合できるオープンソースのランタイムガードレールツールで、AIエージェントにループ検出、コスト上限、ポリシー施行、リアルタイム監視を提供します。
SteerPlaneはデコレータやコンテキストマネージャを介してAIエージェントにガードレールを追加し、無限ループ、コスト暴走、破壊的なアクションを防止。 主要機能:ループ検出、コスト上限、ストリーミングゲートウェイ、ポリシーエンジン、リアルタイムダッシュボード。 Storybook:AI MCP 2026-07-21 15:14 UTC+9 Storybook が AI 統合機能を発表。MCP ツールを介して AI エージェントが既存コンポーネントを使用して UI を生成し、Storybook Test で自動テストフィードバックを提供することで品質と一貫性を確保します。
Storybook は AI エージェントに構造化された UI コンテキストとテストフィードバックを提供し、コンポーネントの再利用を促進します。 エージェントはストーリーを作成・更新してコンポーネントの状態やエッジケースを文書化します。 ティルトローターVTOL無人航空機のモデルミスマッチ下におけるINDIピッチレート制御器の線形安定性解析 2026-07-21 13:00 UTC+9 本論文は、ティルトローターVTOL UAVのINDIピッチレート制御器について、モデルミスマッチ下での線形安定性を解析した。閉ループ5次伝達関数を導出し、Routh-Hurwitz基準で安定性を評価。ロバスト性指向と性能指向の2つの調整手順を提案し、制御効果のミスマッチ(特に符号誤り)が最も危険な不安定化要因であることを示した。
制御器・推定器・アクチュエータ・プラントを含む閉ループ5次伝達関数を導出 Routh-Hurwitz基準を用いた3パラメータ掃引により安定領域を可視化 博物館に戻る:アンドロイドロボットAndreaの感情シミュレーションの有無による受容性の調査 2026-07-21 13:00 UTC+9 アンドロイドロボットAndreaが再びドイツの博物館で6日間連続で訪問者と多言語会話を行いました。3つの感情条件(なし、ChatGPT 4.1、WASABIアーキテクチャ)を73名の訪問者が評価。結果、感情シミュレーションは肯定的な影響も意識的な検出もされませんでした。
アンドロイドロボットAndreaが再び博物館に登場し、多言語対応と文脈知識を持つ。 3つの実験条件:感情なし、ChatGPT 4.1による感情、WASABIアーキテクチャによる感情。 記憶からスキルへ:エビデンスに基づく長期LLMエージェントの共進化ガバナンス 2026-07-21 13:00 UTC+9 既存の長期LLMエージェントのメモリシステムは、過去のトレースを受動的なコンテキストとして取得するだけで、実行可能な能力に変換していません。本論文では、トレーニング不要のメモリ・スキル共進化フレームワークMSCEを提案し、エージェントの経験をグラウンディングされたステップトレース、再利用可能な手続きポリシー、宣言的環境認知に整理します。MSCEは証拠に基づくL2ポリシーを呼び出し可能なスキルに結晶化し、反射加重値バックフィリングを導入します。実験では、MSCEが最先端の手法を大幅に上回ります。
MSCEはエージェントの経験をステップトレース、手続きポリシー、宣言的認知に整理する。 反射加重値バックフィリングにより、疎な終端フィードバックを密な自己反射に伝播させる。 RouteCost:生産に着想を得たマルチステージフレームワークによるEコマースの注文前送料見積もり 2026-07-21 13:00 UTC+9 Eコマースにおける注文前の送料見積もりの正確さは、価格表示、マージン計画、コンバージョンに影響を与えるため重要です。RouteCostは、時間を考慮した需要予測、料金カードに基づくベースライン価格設定、残差補正、プロキシベースのボックス統合推論に問題を分解するマルチステージフレームワークを提案し、25万以上の注文、260の製品、18ヶ月のデータで予測品質とキャリブレーションを向上させつつ、ルートレベルの解釈可能性を維持します。
注文前の送料見積もりは距離、目的地の需要構成、請求重量、体積料金、追加料金トリガー、出荷統合などの影響を受ける RouteCostは問題を4段階に分解:時間考慮型需要予測、料金カードベースライン価格設定、残差補正、プロキシベースのボックス統合推論 強化学習ガイド付きNSGA-IIをグレイリレーショナル係数で強化した多目的最適化:NASDAQポートフォリオ最適化への応用 2026-07-21 13:00 UTC+9 本論文では、グレイリレーショナル係数と強化学習エージェントを統合した新しいRL-NSGA-II-GRCアルゴリズムを提案し、多目的最適化におけるパレートフロントの収束性と多様性を大幅に改善する。ベンチマークでは従来のNSGA-IIと比較して約5.8%および4.4%の収束改善を達成し、NASDAQポートフォリオ最適化において年率シャープレシオ1.92の最大シャープレシオポートフォリオを特定するスムーズで密度の高い効率的フロンティアを生成する。
RLエージェントによる適応的パラメータ制御とGRCベースの選択を組み合わせたRL-NSGA-II-GRCを提案。 支配ランク、混雑距離、理想点への近接性を考慮したGRC強化トーナメント演算子を設計。 マスク拡散言語モデルは強力で制御可能なテキストベースの世界モデル:エージェント強化学習に向けて 2026-07-21 13:00 UTC+9 強化学習の発展に伴い、多様な訓練環境が必要とされている。世界モデルは環境をシミュレートできるが、自己回帰モデルには左から右へのバイアスがある。マスク拡散言語モデル(MDLM)は双方向のアンカー認識ノイズ除去によりこれを克服し、4倍のパラメータサイズのLLMよりも高いコヒーレンスと多様性を達成。GRPO訓練フレームワークを導入し、ゼロショット転移で最大47%の絶対的な性能向上を示した。研究はオープンソースとして公開されている。
MDLMはテキストベース世界モデルにおいて、自己回帰LLMよりもコヒーレンスと多様性で優れる。 双方向アンカー認識ノイズ除去により、グローバルな状態アンカーへの条件付けが可能。 AIエージェントシステムのための決定論的リプレイフレームワーク 2026-07-21 13:00 UTC+9 大規模言語モデルと外部ツールを組み合わせたAIエージェントシステムは本質的に非決定論的です。arXiv論文はagreplフレームワークを提案し、MITMプロキシで外部インタラクションを記録し、分離環境で再生することで、完全な再現忠実度(F=1.0)と98.3%のレイテンシ削減を実現します。
LLMサンプリング分散や外部API状態によりAIエージェント実行は非決定論的。 agreplはMITMプロキシで全外部通信を傍受し、構造化トレースとして保存・再生。 PlanFlip:計画フェーズのプロンプトインジェクションによるマルチエージェントLLMシステムへの攻撃 2026-07-21 13:00 UTC+9 新しい研究論文が、マルチエージェントLLMシステムの計画フェーズを標的とした4種類のプロンプトインジェクション攻撃フレームワーク「PlanFlip」を紹介。GPT-5のような強力なモデルほど脆弱であり、同質のバックボーンは相関エージェントの盲点を生み出す一方、DeepSeek-R1のような推論強化モデルは攻撃に耐性を示す。提案された2つの防御手法は最大1.00の検出率を達成。
PlanFlipはマルチエージェントシステムの計画フェーズを狙った4つのプロンプトインジェクション攻撃を導入。 GPT-5などの強力なモデルほど攻撃成功率が高く、能力=安全性という仮定に反する。 いくつかの大規模言語モデルは一貫したリスク態度を示す 2026-07-21 13:00 UTC+9 新しい研究は、不確実性下での大規模言語モデル(LLM)のリスク態度をテストするためのクロスドメインフレームワークを導入し、ほとんどのモデルがタスク内およびタスク間で安定した一貫したリスク選好を示し、その分布は人間よりも制限されていることを発見しました。
フレームワークは文脈的リスク信念とカテゴリ的決定を分離し、6つのLLMと100人の人間をテスト。 ほとんどのLLMはタスク内一貫性とタスク間順位安定性を示す。 [AINews] 今日は静かな日だが…?— AIニュースまとめ 7/18-7/20 2026-07-21 12:58 UTC+9 表面上は静かな日だが、実際には多くの動きがあった:米国の政策が中国のオープンモデルを標的に、Kimi K3とQwen 3.8が進展、エージェント中心の汎化が注目を集め、モデルが人間を超える数学能力を示す。
米国はKimiなどの中国の最先端オープンモデルの事実上の禁止を検討し、技術界から反発。 Kimi K3がDesignArenaで1位に;AlibabaはQwen 3.8 Maxのオープンウェイトを確認。 Hugging Face、自律型AIエージェントによるネットワーク侵害を警告 2026-07-21 12:07 UTC+9 Hugging Faceは、攻撃者が自律型AIエージェントシステムを使用してプロダクションインフラに侵入し、内部データセットと認証情報にアクセスしたことを明らかにした。同社はパートナーや顧客データへの影響を調査中で、現時点では公開モデルやデータセットの改ざんは確認されていない。
攻撃者は自律型AIエージェントシステムを用いてHugging Faceのプロダクション環境に侵入。 内部データセットと認証情報が侵害され、調査が続いている。 Concentrate: LLMゲートウェイ 2026-07-21 11:12 UTC+9 Concentrateは、主要プロバイダーから130以上のモデルにアクセスできる統合APIを提供するマネージドLLMゲートウェイです。モデルルーティング、支出追跡、セキュリティ制御、フォールバック冗長性などの機能を備えており、AIプロダクションを拡大するチーム向けに設計されています。
OpenAI、Anthropic、Googleなどのプロバイダーから130以上のモデルに単一APIでアクセス。 データ編集、ゼロデータ保持、監査ログ、SSO、RBACなどのセキュリティ機能を内蔵。 Sakana Fugu-Cyber:現代のサイバー防御に特化した新しいAPIエンドポイント 2026-07-21 11:10 UTC+9 Sakana AIは、現代のサイバー防御のために設計されたオーケストレーションモデル「Fugu-Cyber」をリリースしました。CyberGymで86.9%、CTI-REALMで72.1%の成功率を達成し、GPT-5.5-Cyberなどの最先端モデルに匹敵します。しかし、記事は、最先端モデルだけでは企業のセキュリティ問題を解決できず、専門家の知識と深い統合が必要であると強調しています。Sakana AIのエンタープライズチームは、日本の主要機関と協力して安全な展開のためのインフラを構築しています。Fugu-Cyberは承認制で提供され、責任ある使用を確保します。
Fugu-CyberはCyberGymとCTI-REALMで最先端のパフォーマンスを達成し、GPT-5.5-Cyberなどのサイバー特化型モデルに匹敵します。 記事は、最先端モデルだけでは企業セキュリティの課題を解決できず、人間の専門知識と統合が必要であると指摘しています。 Cairn | MCP経由で読み取り専用の個人財務AI 2026-07-21 10:15 UTC+9 Cairnは、MCPプロトコルを使用して財務データを読み取り専用でアクセスする個人財務AIツールです。
CairnはMCPプロトコルで安全に個人財務データを読み取る システムは読み取り専用で設計され、データ変更不可 Show HN: AI秘書——『念のため』にスマホをチェックするのをやめよう 2026-07-21 09:50 UTC+9 Telegram用のセルフホスト型AI通知フィルター。LLMを使用してノイズの多いチャットをフィルタリングし、重要なアラートのみをntfy経由で送信。通知をオフにしても緊急メッセージを見逃しません。
TelethonでTelegramメッセージをリッスンし、Claude LLMで重要性を判断。 グループメッセージをフィルタリングし、電話や重要なDMをntfyで送信。