AI News HubLIVE

AI ニュース速報

リアルタイム監視

今日の AI で最も重要な変化

105 件の信頼できるソースから抽出。最終更新 2026-05-31 16:48 UTC+9。

リアルタイム監視

最新ニュース

信頼できる情報源、出典、権限、サイト内閲覧を保ちながら、AI の変化を読める情報に圧縮します。

最新ニュース

リセット
AI検索エージェントは実際にウェブを調査するのではなく、既に知っていることを確認していることが多い

GPT-5.4やKimi K2.6などの最先端AI検索エージェントは、確立されたベンチマークで実際の調査を行わず、トレーニングで得た知識を確認するためだけにウェブを使用していることが新しい研究で明らかになった。ハルビン工科大学の研究者らは、過去90日間の出来事のみを尋ねる時間ベースのベンチマーク「LiveBrowseComp」を導入し、モデルが記憶に頼れなくなるとパフォーマンスが崩壊し、既存のランキングが大きく変動することを示した。

The Decoderモデル / Agent / 研究サイト内本文
τ0-WM:最大規模の事前学習済みオープンソース具身世界モデルが登場

5Bパラメータのオープンソース具身世界モデルτ0-WMが公開された。約3万時間のデータで事前学習され、うち1.78万時間は実機遠隔操作データ。テスト時計算を導入し、ロボットが行動前に複数の候補をシミュレート・評価することで、長期的な精密操作タスクで最高性能を達成。

量子位モデル / Agent / チップサイト内本文
UCバークレー法学院、2026年夏からAI全面禁止

2026年夏より、UCバークレー法学院は学生がコースワークや試験で人工知能(AI)を使用することを禁止します。概念化、アウトライン作成、起草、修正、編集、翻訳などの活動が対象で、学生の認知スキルと職業倫理の育成を目的としています。

Hacker News AI政策 / 研究サイト内本文
Show HN: GoodSender – メイカーとAIエージェントのためのメールAPI

GoodSenderは、インディー開発者、AIスタートアップ、小規模チーム向けのメールAPIで、許可ベースのマーケティング、エンゲージメント追跡、手頃な価格を重視しています。毎月10万通までの無料枠があり、以降は10万通あたり1ドル。マーケティングメールは受信者の同意が必要で、トランザクションメールは事前承認済み。エンゲージメントスコアリングとリストの自動クレンジング機能を内蔵。まもなくMCP統合を予定。

Hacker News AIAgent / 政策サイト内本文
プロダクションAIエージェント構築の標準(インストール可能なClaude Codeスキル付き)

プロダクショングレードのエージェンティック製品を構築するための実証済み標準です。自律性ラダー、5つの構成パターン、7層ハーネス、そしてClaude Codeスキルセットを含み、エディタで直接活用できます。Anthropic、OpenAIなどの主要ラボや実践者の手法から抽出されました。

Hacker News AIAgent / 研究サイト内本文
オープンモデルはクローズドモデルに4ヶ月遅れる

Epochの内部能力指標(ECI)によると、オープンウェイトモデルがクローズドモデルの最先端性能に追いつくまでに平均4ヶ月かかります。ECIは多くのベンチマークをカバーする複合指標です。

Hacker News AI研究サイト内本文
AIネイティブ時代、エージェントに人間を模倣させるのではなく、世界をエージェントに適応させる | 香港大 黄超 @AIGC2026

香港大学准教授の黄超氏は、2026年中国AIGC産業サミットで、エージェント時代にはデジタル世界のインフラを再設計し、ソフトウェアがAIの言語(CLI)を話すようにすべきだと提唱。彼のチームが公開した軽量エージェントnanobotは20万ダウンロードを突破し、CLI-Anythingなどの革新を示した。エージェントの自己進化はスキル蓄積による外部進化が重要だと強調した。

量子位Agent / チップサイト内本文
Show HN: OWASP Agent Memory Guard – AIエージェントメモリポイズニングを阻止

OWASP Agent Memory Guard は、AIエージェントのメモリへの読み取りと書き込みをすべて検査し、プロンプトインジェクション、秘密情報漏洩、整合性改ざんをブロックするランタイム防御層です。OWASP ASI06: メモリポイズニングのリファレンス実装であり、LangChain、OpenAI Agents、AutoGenなどをサポートします。ベンチマーク: 再現率92.5%、偽陽性率0%。

Hacker News AIAgent / 政策サイト内本文
アメリカはパングラム問題に直面している

AI検出ツールPangramは高い精度で知られるが、誤検出のリスクや悪用の懸念がある。教育現場やメディアでの依存が進む中、新たな問題を生み出す可能性がある。

Hacker News AI研究サイト内本文
コントロールが失われる感覚

AIエージェントやボットの普及により、人間は受動的になり、オンライン体験の信頼が損なわれている。この記事は、AI生成コンテンツがもたらす文化的・心理的影響、主体性の危機、そして能動的な参加から受動的な消費への移行を探る。

Hacker News AIAgent / 研究サイト内本文
Trajectory、継続学習のための同時マルチLoRAトレーニングスタックを発表、実験スループット2.81倍向上

TrajectoryはUC Berkeley Sky LabおよびAnyscaleと協力し、継続学習のための同時マルチLoRAトレーニングスタックを構築しました。各RL実験を常時稼働エンジン上の専用LoRAアダプターにマッピングし、シングルテナントベースラインと比較してエンドツーエンドの実験スループットが2.81倍向上し、報酬の低下はありません。コードはNovaSky-AI/SkyRLでオープンソース化されています。

MarkTechPostAgent / チップサイト内本文
ニュージーランド住宅賃貸法のRAGデモ

32,000件以上のニュージーランドの賃貸審判所の判例を無料で検索できるAI駆動ツールで、賃貸権利の理解を支援します。

Hacker News AI政策 / 研究サイト内本文
AIブームがあなたの裏庭にやってくる [動画]

このYouTube動画ページはAIブームが地域に影響を与えることを示唆していますが、提供されている説明は標準的なYouTubeメタデータのみで実質的な情報はありません。

Hacker News AI政策サイト内本文
Grok Imagine Video 1.5 プレビューがImage-to-Video Arenaで首位に

xAIのGrok Imagine Video 1.5 プレビューがImage-to-Video Arenaのリーダーボードでスコア1473を獲得し、ByteDanceのDreamina Seedance 2.0や他の40モデルを抑えてトップに立った。このランキングは115万以上の投票に基づいており、AI動画生成分野の最新競争状況を示している。

Hacker News AIツールサイト内本文
トークン無制限から全員エージェントへ:MiniMaxのAIネイティブ組織進化の実践

MiniMaxはマルチモーダルモデルに特化したAIスタートアップで、2026年1月に香港証券取引所に上場しました。同社は大規模モデルとアプリケーションの並行開発、ToCとToBの両輪戦略を堅持しています。社内では全従業員に無制限のトークンを提供し、エージェントを使ってワークフローを自動化。人間が嫌がる高価値タスクに焦点を当て、効率を大幅に向上させ、組織をフラット化しています。今後2~3年でAIはさまざまな産業と深く融合するでしょう。

量子位Agent / チップサイト内本文
SkillNetを使用したスキル拡張AIエージェントの構築:検索、評価、グラフ分析、タスク計画

このチュートリアルでは、SkillNetフレームワークを使用して再利用可能なAIスキルを発見、インストール、検査、評価、整理する方法を紹介します。SDKとRESTフォールバックを備えたクライアントのセットアップ、キーワード検索とセマンティック検索の比較、GitHubからのスキルのインストール、メタデータの検査、品質ゲートの適用、スキル間の関係のグラフ可視化、そして複雑な目標をサブタスクに分解し実行パイプラインを組み立てるスキル拡張エージェントプランナーの構築までをカバーします。

MarkTechPostAgent / 政策サイト内本文
Vercel BotID で AI エンドポイントを保護する方法

Vercel BotID は、各リクエストにクライアントサイドチャレンジを付与し、サーバーサイドの checkBotId() で検証することで、確認済みのリクエストのみが推論を実行できるようにする不可視の CAPTCHA です。本ガイドでは、インストール、設定、Deep Analysis の有効化、信頼済みボットの許可について説明します。

Hacker News AIAgent / 研究サイト内本文
AIハードウェア市場分析:メモリボトルネックと各層のソリューション

本記事では、AIハードウェア市場におけるメモリボトルネックの問題を深く掘り下げる。GPUのテンソル演算速度はメモリ帯域幅をはるかに上回り、デコードフェーズではほとんどの演算ユニットがアイドル状態になる。チップ層(Groq、Cerebrasなど)、推論エンジン層(RadixArk、Inferact)、KVキャッシュ基盤(TensorMesh/LMCache)、パッケージング・相互接続層(CoWoS)など、各層の異なるアプローチを分析し、持続可能な企業はスタック内の他の部分に内部化できないコントロールポイントを掌握する必要があると指摘する。

Hacker News AIチップ / スタートアップサイト内本文
Show HN: HermesBench – 個人AIエージェント向けワークフロー信頼性評価

HermesBenchは、プロンプト、モデル、ツール、メモリなどを含む完全な個人AIエージェント設定の信頼性を評価するベンチマークです。現在、27のワークフローレシピでベースラインスコア78.2を達成しており、トレースは公開されています。このベンチマークはエビデンス駆動型のスコアリングを重視し、早期フィードバックを求めています。

Hacker News AIAgent / 政策サイト内本文
スターバックス、数えられないAI在庫管理ツールをわずか9ヶ月で廃止

ロイター通信の報道によると、スターバックスはAIを活用した在庫管理ツールをわずか9ヶ月で使用停止にしました。最も基本的な誤りを犯したためです。これに先立ち、他のAIツールも深刻なミスを報告されており、例えばピザハットのフランチャイズ店が、効率化を目的としたシステムが約1億ドルの売上損失を引き起こしたとして親会社を訴えたケースがあります。

Hacker News AI政策サイト内本文
アンドアの制作者トニー・ギルロイ、自身の作品が訓練データになることを望まず

『アンドア』のショーランナーであるトニー・ギルロイは、脚本がAIの訓練データに使われることを懸念し、1,500ページのコレクションを公開する計画を中止した。この決定は、クリエイティブ業界におけるAIへの懸念の高まりを反映しており、ハリウッドの労働組合のストライキや法的闘争にもつながっている。

Hacker News AI政策 / 研究サイト内本文
Show HN: Thaw – 実行中のLLMのGitブランチ(エージェントのフォーク、プリフィルスキップ)

Thawは、実行中のLLMセッションを複数のブランチにフォークし、高コストなプリフィルフェーズをスキップすることでAIエージェントの並列探索を可能にするオープンソースツールです。H100 GPU上でサブ秒のフォーク時間(中央値0.88秒)を達成し、コールドブートの約340秒と比較して約400倍の高速化を実現します。vLLM/SGLangと連携し、エージェント分岐、RLトレーニング、並列コーディングエージェント、セッション移行などのユースケースに対応します。

Hacker News AIモデル / Agent / チップサイト内本文
製品全体でClaudeを隔離する方法

Anthropicは、Claude.ai、Claude Code、Cowork全体でさまざまなサンドボックス技術をどのように使用してAIエージェントの動作を制限し、セキュリティ境界を設定しているかについての詳細な概要を公開しました。

Simon Willison's Weblogモデル / Agentサイト内本文
AIは思いやりを持てない

人工知能が本当の思いやりを持てない理由を探る。シミュレーションはできても、真の感情は欠如している。

Hacker News AIツールサイト内本文
Pyodide + Service Worker でブラウザ上でPython ASGIアプリを実行

Simon Willison氏の研究プロジェクトは、ブラウザ内でPyodideとService Workerを使用してPython ASGIアプリケーションを完全に実行し、以前のWeb Workers方式の欠点(JavaScript実行不可)を克服。FastAPIとDatasetteのデモで汎用性を確認し、今後のアップグレードが予定されている。

Simon Willison's Weblogモデル / 研究サイト内本文