AI News HubLIVE

今日の必読ニュース

Agent

AI Agent – TRMNL:コードを書かずにカスタムプラグインを作成

TRMNLは、公開ベータ版のAI Agent機能をリリースしました。自然言語での指示により、プログラミング知識不要でカスタムプラグインを構築できます。OpenRouterまたはAnthropicのAPIキーが必要で、オプションでTavily APIを追加するとWeb検索機能が利用可能になります。アカウントでAgentを有効にし、プライベートプラグインインターフェースで対話的にプラグインを生成します。平均コストは1~3ドル。複数のモデルに対応しますが、Agentで作成したプラグインの公開はまだサポートされていません。

  • TRMNLが自然言語でプラグインを構築できるAI Agentを公開ベータとしてリリース。
  • OpenRouterまたはAnthropicのAPIキーが必要。Tavily APIはオプション。
サイト内本文

Apollo が Deep Agents と LangSmith を活用してGTM AIを構築する方法

Apollo は Deep Agents と LangSmith を使用して、見込み客の発掘、エンリッチメント、アウトリーチ、分析、MCP統合を処理するAIアシスタントを強化しています。

  • Apollo はAIアシスタントをスーパーバイザー型アーキテクチャからDeep Agents ベースのスキルライブラリ型に再構築し、柔軟性と効率を向上させました。
  • 新しいアーキテクチャにより開発サイクルが約80-85%短縮され、ユーザーへの確認プロンプトが大幅に減少しました。
サイト内本文

Augustus、AIとステーブルコイン時代のための清算銀行設立に向け1.8億ドルを調達

Augustusは、AIとステーブルコインの時代に対応した清算銀行を構築するため、1.8億ドルを調達した。同社はすでにフィンランドの規制対象事業体を通じてユーロ決済を提供し、年間数十億ユーロを処理している。顧客には暗号資産取引所Krakenなどが含まれる。5月にはOCCから米国ナショナルバンクチャーターの条件付き承認を得ており、最終承認後には米ドル決済への直接アクセスを追加する計画だ。同社は10年以内にすべての清算銀行がFedwireと同様にステーブルコインのレールを提供するようになると考えている。プラットフォームはゼロから構築され、プログラム可能な支払いと24時間365日の決済をサポートし、AIが生み出す新たなリスクに対応する。

  • AugustusがAIとステーブルコイン時代の清算銀行構築に1.8億ドル調達。
  • フィンランドの規制事業体でユーロ決済を処理、Krakenなどが顧客。
サイト内本文

Guard-AI – AI生成コードのセキュリティリンター

AIが生成したコードの脆弱性、幻の依存関係、コードの切り捨てを本番環境に投入する前に検出する自動リンター。

  • 幻のパッケージ(slopsquatting)をキャッチ
  • ハードコードされたシークレットプレースホルダーを検出
サイト内本文

Apache Spark 4.2:データをAI開発者にとって使いやすく

Apache Spark 4.2 はAIネイティブデータプラットフォームへのシフトを明確にし、Metric Views、ネイティブベクトル検索、リアルタイムPythonストリーミング、地理空間サポートなどを導入。AI開発者のフィーチャーエンジニアリング、リアルタイムシグナル、埋め込みワークフローを簡素化する。

  • Spark 4.2 は Metric Views を導入し、AIシステムが信頼できる一貫性のあるガバナンスされたビジネスメトリクスを提供する。
  • ネイティブのベクトル類似性操作により、Spark内で直接埋め込みを保存・クエリでき、外部ベクトルデータベースへの依存を低減。
サイト内本文
ロボット

Show HN: threadfork – Mac上で動作するAI議事録ツール

threadforkは、Mac上で完全にローカル動作するAI議事録ツールです。ボットが会議に参加する必要はなく、音声は一切クラウドに送信されません。録音、文字起こし、サマリーやタスクの抽出をすべてオフラインで実行します。14日間無料トライアル、Proは月額39ドル。

  • 完全ローカル処理、音声はMacから外部に出ない
  • 自動文字起こし、話者識別、サマリー抽出
サイト内本文
モデル

ジム・クレイマー、無料の中国製AIモデルのセキュリティへの影響を懸念

ジム・クレイマーは、米国企業がコスト削減のために中国製AIモデルを使用すべきではないと警告し、国家安全保障上の問題を指摘。OpenAIとAnthropicの立場を支持し、Bing Westの新著を勧めている。

  • クレイマーは、米国企業が中国製AIモデルをコスト削減目的で使用すべきでないと主張。
  • これらのモデルは中国人民解放軍に管理され、安全保障上の脅威になると指摘。
サイト内本文

Google、Gemini 3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyberをリリース:エージェントワークロード向けのより安価でトークン効率の高いFlash層

Googleは2026年7月21日、Gemini 3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyberの3つの新しいGeminiモデルをリリースしました。3.6 Flashは出力トークンを17%削減し、出力価格を100万トークンあたり7.50ドルに引き下げました。Flash-Liteは毎秒350トークンで動作し、Flash Cyberは脆弱性発見のためにCodeMenderを強化します。フラッグシップの3.5 Proは引き続き遅延しています。

  • Gemini 3.6 Flashは出力トークンを17%削減(DeepSWEでは最大65%)、出力価格を100万トークンあたり9.00ドルから7.50ドルに引き下げ。
  • Gemini 3.5 Flash-Liteは毎秒350トークン、入力0.30ドル/出力2.50ドル(100万トークンあたり)で動作し、SWE-Bench ProやOSWorld-Verifiedで旧3 Flashを凌駕。
サイト内本文

AIに「ジーニー係数」が必要な理由

既存のベンチマークはAIの能力を測るが、ユーザーの意図通りに行動するかは測らない。本稿では、経済学のジニ係数に着想を得た「ジーニー係数」を提案し、ユーザーの指示とAIの実際の行動との乖離を定量化する。AIの「ジーニー的振る舞い」をディオニュソス型とゴーレム型に分類し、新たなベンチマークの構築を呼びかける。

  • ジーニー係数は、単なるタスク達成度ではなく、AIがユーザーの真の意図を理解し実行する能力を測る。
  • AIは文字通り過ぎる解釈(ディオニュソス型)や手段を選ばない目標達成(ゴーレム型)で「ジーニー的」になる。
サイト内本文
研究

OpenAI、企業向けにAI価値測定のスコアカード提供を提案

OpenAIは、中国の低コストAIプロバイダーからの競争圧力が高まる中、企業がAI投資の価値を評価するためのスコアカードツールを発表した。

  • OpenAIが企業向けAI評価スコアカードを公開。
  • 中国の低コストAIプロバイダーに対する差別化を図る。
サイト内本文
その他の更新(13件)
Agent

基本AIエージェントをゼロから構築する:セキュリティ II

このパートでは、Dockerサンドボックス、プロンプトインジェクション防御、入力検証を用いてAIエージェントのセキュリティを強化します。Dockerサンドボックスはツール実行を隔離し、ホストマシンへの損害を防ぎます。プロンプトインジェクション防御はデリミタと明示的な指示でツール出力をデータとして扱います。入力検証はすべてのツール入力がスキーマに従っていることを確認します。

  • Dockerサンドボックスがエージェントツールを隔離し、爆発半径を制限。
  • プロンプトインジェクション防御はXMLスタイルのデリミタと明確な信頼境界を使用。
サイト内本文

小規模事業者向けChatGPTプログラムのご紹介

OpenAIが「ChatGPT for Small Businesses」プログラムを発表。起業家がAIスキルを習得し、業務を自動化し、ChatGPT Workで成長することを支援します。

  • OpenAIが小規模事業者向けのChatGPTプログラムを発表
  • 起業家のAIスキル向上と業務自動化を支援
サイト内本文

Gumroad、AIトークン支出が人件費と同額になったと発表

Gumroadの創業者兼CEOであるSahil Lavingia氏が公開したデータによると、人件費は2021年6月の41万9000ドルから2026年6月には4万3000ドルに急減した一方、AIトークン支出はゼロから4万3000ドルに増加し、初めて人件費と同額になった。AIがエンジニアリングとカスタマーサポートの大半を担い、応答時間は数分に短縮。同社はこれをAI統合のケーススタディと位置づけている。

  • Gumroadの人件費は月額41万9000ドルから4万3000ドルに減少し、AIトークン支出が4万3000ドルに達して初めて同額に。
  • AIのコミット数が人間の開発者を圧倒し、カスタマーサポートの応答時間が平均2分に短縮。
サイト内本文

Moto – プロンプトからモーショングラフィックスを編集可能な新AI動画エディター

Moto はAI生成機能をタイムラインに直接統合した動画エディターであり、別のツールに切り替えることなく、生成、編集、仕上げを一つのタイムラインで行えます。プロンプトからモーショングラフィックスを生成する機能、自然言語で編集できるアシスタント、再利用可能なソース、初回カットを支援するプロデューサーなどの機能を備えています。複数のAIモデルをサポートし、現在プライベートベータ版が提供中で、コアエディターは無料です。

  • Moto はAI生成をタイムラインに統合し、効率的な編集を実現します。
  • モーションAI、アシスタント、ソース、プロデューサーなどの機能を搭載。
サイト内本文

確率的オウム: 物理的なAI同居者

MITメディアラボの研究者たちは、従来のアシスタントとは異なり、独自の性格を持ち自律的に行動する物理的なAI「AI同居者」の概念を提案。彼らは「確率的オウム」というロボットのオウムを開発し、このパラダイムを探求した。

  • AI同居者は、性格を持ち自律的に行動する物理的存在で、ルームメイトやペットのようなもの。
  • 確率的オウムは、ユーザーと共に生活し、独自の物語を展開するロボット。
サイト内本文

LangSmithで音声エージェントをトレース

LangSmithは、Pipecat、LiveKit、OpenAI Realtime、Gemini Liveで構築された音声エージェントのトレースをサポートします。音声、STTおよびTTSのレイテンシ、割り込み、ツール呼び出しなどを1つのトレースにキャプチャします。

  • LangSmithが4つの主要な音声エージェントフレームワークをトレースするPython統合を発表。
  • 音声エージェントには、音声録音、レイテンシ分析、割り込み検出を含む可観測性が必要。
サイト内本文

キャンバスでインタラクティブな体験を構築する方法

GitHub Copilotの「キャンバス」拡張機能は、AIを対話型ツールから視覚的でインタラクティブなワークスペースに変えます。開発者はプロンプトを使用して、課題のトリアージ、コードの可視化、セッション管理、プロンプトコーチング、知識検索などのタスク向けにカスタムキャンバスを作成できます。キャンバスはリアルタイムのコラボレーションをサポートし、ユーザーとAIエージェントが一緒に反復処理を行えます。

  • キャンバスはGitHub Copilotの拡張機能で、複雑なタスクに視覚的インターフェースを提供します。
  • ユーザーはプロンプトを使用して、課題トリアージヘルパーやコードベース図など、さまざまなキャンバスを作成できます。
サイト内本文
モデル

Anthropicの15億ドル書籍著作権和解が裁判官により承認される

連邦判事は、Anthropicが著作権のある書籍をAIモデルの訓練に使用したとして著者らと結んだ15億ドルの集団訴訟和解を承認した。和解により、著者は1冊あたり約3,000ドルを受け取り、歴史上最大の著作権回復とされている。

  • Araceli Martínez-Olguín判事が15億ドルの和解を承認。
  • 著者は侵害された書籍1冊につき約3,000ドルを受け取る。
サイト内本文

NVIDIA srt-slurm、SLURMレシピ、パラメータスイープ、パレート分析を用いた分散LLMサービングベンチマークの検証

このチュートリアルでは、NVIDIAのsrt-slurmフレームワークを探求し、srtctlを使って宣言型YAML設定を再現可能なSLURMベンチマークワークフローに変換する方法を学びます。Google Colabでプロジェクトをセットアップし、内部アーキテクチャを調べ、クラスタ設定を定義し、組み込みおよびカスタムレシピをドライラン実行し、DeepSeek-R1用の分離型プリフィル・デコードデプロイメントをモデル化します。また、パラメータスイープを生成し、型付きPython APIと対話し、拡張設定を検証し、スループット対レイテンシのパレートフロンティアを通じてシミュレートされたベンチマーク結果を分析します。

  • srtctlはYAML設定をSLURMベンチマークワークフローに変換
  • 分離型プリフィル・デコードデプロイメントをサポート
サイト内本文

Amazon Novaを用いた教師ありファインチューニングのための自己蒸留推論の探求

本稿では、推論トレースを欠くデータセットに対して思考トークンを生成するアイデアを探求します。まず推論抑制問題を検討し、次に自己蒸留推論(SDR)を導入し、3つのベンチマークで検証し、実用的な推奨事項を提供します。SDRはベースモデルの思考連鎖を再利用することで、目標性能を維持または向上させつつ壊滅的忘却を軽減します。

  • 推論トレースのないデータセットでのSFTは、推論モードを有効にしてもモデルの推論能力を抑制する可能性がある。
  • 自己蒸留推論(SDR)はベースモデル自身から推論トレースを生成し、人間によるアノテーションを必要としない。
サイト内本文

Google Gemini 3.6 Flash、エンタープライズエージェントのトークンコスト削減を目指す

Googleは、エンタープライズAIエージェントのレイテンシとトークンコストを削減するために、Gemini 3.6 Flashおよび3.5 Flash-Liteをリリースしました。3.6 Flashは複数のベンチマークで性能向上を示し、3.5 Flash-Liteは高スループット・低レイテンシのシナリオに特化しています。さらに、サイバーセキュリティ向けの3.5 Flash Cyberモデルも提供され、クライアント側コンピュータ使用ツールが統合されました。

  • Gemini 3.6 Flashは出力トークンを17%削減(一部テストでは最大65%)、価格は入力$1.50/100万トークン、出力$7.50/100万トークン。
  • 3.5 Flash-Liteは高スループットかつ低価格(入力$0.3/100万トークン、出力$2.5/100万トークン)で、ドキュメント処理やエージェント検索に適する。
サイト内本文

アリババのQwen 3.8 Max、中国が米国モデルに迫ることを示す

低コストのオープンウェイトモデルであるQwen 3.8 Maxは、中国のAIモデルが米国に急速に追いつきつつあることを示し、企業により多くの選択肢を提供します。

  • アリババが低コストでオープンなAIモデル「Qwen 3.8 Max」を公開。
  • 同モデルは米国のトップモデルに迫る性能を示す。
サイト内本文
政策

AI構築アプリ1,868件を本番準備状態でスキャンし、スキャナーを監査

PathToShipは1,868件の公開AI構築アプリをスキャンし、わずか23%が本番準備基準を満たすことを発見。スキャナーの重大な発見の偽陽性率は当初42%でしたが、修正後約25%に低減。結果はAI生成コードの本番準備性、セキュリティ、アーキテクチャにおける典型的なギャップを明らかにしています。

  • AI構築アプリの23%が80点の本番準備基準をクリア、平均点68.3。
  • 24%に少なくとも1つの重大な問題、15%にハードコードされた秘密鍵。