GPT-5.4やKimi K2.6などの最先端AI検索エージェントは、確立されたベンチマークで実際の調査を行わず、トレーニングで得た知識を確認するためだけにウェブを使用していることが新しい研究で明らかになった。ハルビン工科大学の研究者らは、過去90日間の出来事のみを尋ねる時間ベースのベンチマーク「LiveBrowseComp」を導入し、モデルが記憶に頼れなくなるとパフォーマンスが崩壊し、既存のランキングが大きく変動することを示した。
AI ニュース速報
リアルタイム監視
最新ニュース
信頼できる情報源、出典、権限、サイト内閲覧を保ちながら、AI の変化を読める情報に圧縮します。
最新ニュース
5Bパラメータのオープンソース具身世界モデルτ0-WMが公開された。約3万時間のデータで事前学習され、うち1.78万時間は実機遠隔操作データ。テスト時計算を導入し、ロボットが行動前に複数の候補をシミュレート・評価することで、長期的な精密操作タスクで最高性能を達成。
2026年夏より、UCバークレー法学院は学生がコースワークや試験で人工知能(AI)を使用することを禁止します。概念化、アウトライン作成、起草、修正、編集、翻訳などの活動が対象で、学生の認知スキルと職業倫理の育成を目的としています。
GoodSenderは、インディー開発者、AIスタートアップ、小規模チーム向けのメールAPIで、許可ベースのマーケティング、エンゲージメント追跡、手頃な価格を重視しています。毎月10万通までの無料枠があり、以降は10万通あたり1ドル。マーケティングメールは受信者の同意が必要で、トランザクションメールは事前承認済み。エンゲージメントスコアリングとリストの自動クレンジング機能を内蔵。まもなくMCP統合を予定。
プロダクショングレードのエージェンティック製品を構築するための実証済み標準です。自律性ラダー、5つの構成パターン、7層ハーネス、そしてClaude Codeスキルセットを含み、エディタで直接活用できます。Anthropic、OpenAIなどの主要ラボや実践者の手法から抽出されました。
Ghostbaseは、ユーザーが簡単な英語でタスクを記述するだけで、AIエージェントを自動生成して実行するプラットフォームです。300以上のアプリと連携し、LLMを活用。無料枠と有料プランを提供。現在アーリーアクセス中。
Epochの内部能力指標(ECI)によると、オープンウェイトモデルがクローズドモデルの最先端性能に追いつくまでに平均4ヶ月かかります。ECIは多くのベンチマークをカバーする複合指標です。
香港大学准教授の黄超氏は、2026年中国AIGC産業サミットで、エージェント時代にはデジタル世界のインフラを再設計し、ソフトウェアがAIの言語(CLI)を話すようにすべきだと提唱。彼のチームが公開した軽量エージェントnanobotは20万ダウンロードを突破し、CLI-Anythingなどの革新を示した。エージェントの自己進化はスキル蓄積による外部進化が重要だと強調した。
OWASP Agent Memory Guard は、AIエージェントのメモリへの読み取りと書き込みをすべて検査し、プロンプトインジェクション、秘密情報漏洩、整合性改ざんをブロックするランタイム防御層です。OWASP ASI06: メモリポイズニングのリファレンス実装であり、LangChain、OpenAI Agents、AutoGenなどをサポートします。ベンチマーク: 再現率92.5%、偽陽性率0%。
AI検出ツールPangramは高い精度で知られるが、誤検出のリスクや悪用の懸念がある。教育現場やメディアでの依存が進む中、新たな問題を生み出す可能性がある。
AIエージェントやボットの普及により、人間は受動的になり、オンライン体験の信頼が損なわれている。この記事は、AI生成コンテンツがもたらす文化的・心理的影響、主体性の危機、そして能動的な参加から受動的な消費への移行を探る。
TrajectoryはUC Berkeley Sky LabおよびAnyscaleと協力し、継続学習のための同時マルチLoRAトレーニングスタックを構築しました。各RL実験を常時稼働エンジン上の専用LoRAアダプターにマッピングし、シングルテナントベースラインと比較してエンドツーエンドの実験スループットが2.81倍向上し、報酬の低下はありません。コードはNovaSky-AI/SkyRLでオープンソース化されています。
32,000件以上のニュージーランドの賃貸審判所の判例を無料で検索できるAI駆動ツールで、賃貸権利の理解を支援します。
Anthropicは、過去28日間の消費ベース売上を13倍し、月額サブスクリプション収入を12倍して年間経常収益を算出する独自の方法を用いており、AI企業の収益報告の透明性に疑問を投げかけている。
このYouTube動画ページはAIブームが地域に影響を与えることを示唆していますが、提供されている説明は標準的なYouTubeメタデータのみで実質的な情報はありません。
SnapName は、バンドルされたローカルAIモデル(Gemma 4)を使用してスクリーンショットのファイル名を自動的に変更するmacOSアプリで、画像がMacから外部に送信されないためプライバシーが保護されます。
xAIのGrok Imagine Video 1.5 プレビューがImage-to-Video Arenaのリーダーボードでスコア1473を獲得し、ByteDanceのDreamina Seedance 2.0や他の40モデルを抑えてトップに立った。このランキングは115万以上の投票に基づいており、AI動画生成分野の最新競争状況を示している。
MiniMaxはマルチモーダルモデルに特化したAIスタートアップで、2026年1月に香港証券取引所に上場しました。同社は大規模モデルとアプリケーションの並行開発、ToCとToBの両輪戦略を堅持しています。社内では全従業員に無制限のトークンを提供し、エージェントを使ってワークフローを自動化。人間が嫌がる高価値タスクに焦点を当て、効率を大幅に向上させ、組織をフラット化しています。今後2~3年でAIはさまざまな産業と深く融合するでしょう。
このチュートリアルでは、SkillNetフレームワークを使用して再利用可能なAIスキルを発見、インストール、検査、評価、整理する方法を紹介します。SDKとRESTフォールバックを備えたクライアントのセットアップ、キーワード検索とセマンティック検索の比較、GitHubからのスキルのインストール、メタデータの検査、品質ゲートの適用、スキル間の関係のグラフ可視化、そして複雑な目標をサブタスクに分解し実行パイプラインを組み立てるスキル拡張エージェントプランナーの構築までをカバーします。
Vercel BotID は、各リクエストにクライアントサイドチャレンジを付与し、サーバーサイドの checkBotId() で検証することで、確認済みのリクエストのみが推論を実行できるようにする不可視の CAPTCHA です。本ガイドでは、インストール、設定、Deep Analysis の有効化、信頼済みボットの許可について説明します。
シンプルなビジュアルと日常の例えを使って、32のAI概念を基礎から信頼性まで解説するGitHubリポジトリ。技術者から初心者まで誰でも理解できる。
TypeaheadはMacアプリで、AIを活用して全アプリにまたがるオートコンプリート機能を提供し、入力効率を向上させます。
本記事では、AIハードウェア市場におけるメモリボトルネックの問題を深く掘り下げる。GPUのテンソル演算速度はメモリ帯域幅をはるかに上回り、デコードフェーズではほとんどの演算ユニットがアイドル状態になる。チップ層(Groq、Cerebrasなど)、推論エンジン層(RadixArk、Inferact)、KVキャッシュ基盤(TensorMesh/LMCache)、パッケージング・相互接続層(CoWoS)など、各層の異なるアプローチを分析し、持続可能な企業はスタック内の他の部分に内部化できないコントロールポイントを掌握する必要があると指摘する。
HermesBenchは、プロンプト、モデル、ツール、メモリなどを含む完全な個人AIエージェント設定の信頼性を評価するベンチマークです。現在、27のワークフローレシピでベースラインスコア78.2を達成しており、トレースは公開されています。このベンチマークはエビデンス駆動型のスコアリングを重視し、早期フィードバックを求めています。
ロイター通信の報道によると、スターバックスはAIを活用した在庫管理ツールをわずか9ヶ月で使用停止にしました。最も基本的な誤りを犯したためです。これに先立ち、他のAIツールも深刻なミスを報告されており、例えばピザハットのフランチャイズ店が、効率化を目的としたシステムが約1億ドルの売上損失を引き起こしたとして親会社を訴えたケースがあります。
『アンドア』のショーランナーであるトニー・ギルロイは、脚本がAIの訓練データに使われることを懸念し、1,500ページのコレクションを公開する計画を中止した。この決定は、クリエイティブ業界におけるAIへの懸念の高まりを反映しており、ハリウッドの労働組合のストライキや法的闘争にもつながっている。
Thawは、実行中のLLMセッションを複数のブランチにフォークし、高コストなプリフィルフェーズをスキップすることでAIエージェントの並列探索を可能にするオープンソースツールです。H100 GPU上でサブ秒のフォーク時間(中央値0.88秒)を達成し、コールドブートの約340秒と比較して約400倍の高速化を実現します。vLLM/SGLangと連携し、エージェント分岐、RLトレーニング、並列コーディングエージェント、セッション移行などのユースケースに対応します。
Anthropicは、Claude.ai、Claude Code、Cowork全体でさまざまなサンドボックス技術をどのように使用してAIエージェントの動作を制限し、セキュリティ境界を設定しているかについての詳細な概要を公開しました。
人工知能が本当の思いやりを持てない理由を探る。シミュレーションはできても、真の感情は欠如している。
Simon Willison氏の研究プロジェクトは、ブラウザ内でPyodideとService Workerを使用してPython ASGIアプリケーションを完全に実行し、以前のWeb Workers方式の欠点(JavaScript実行不可)を克服。FastAPIとDatasetteのデモで汎用性を確認し、今後のアップグレードが予定されている。