Bitwave、エージェンティック・ファイナンス・イニシアチブを発表 2026-07-23 08:12 UTC+9 Bitwave は AI エージェントが財務データや会計ワークフローを直接操作できるコマンドラインインターフェース (CLI) を導入。自動化、スタンドアロン台帳の作成、エージェント支出の報告が可能に。
Bitwave CLI により、AI エージェントが直接財務データにアクセスし操作できる。 エージェントは取引の分類や残高確認などの反復的な会計タスクを自動化できる。 Lakebase PostgresでAIエージェントオーケストレーションを簡素化 2026-07-23 08:00 UTC+9 本記事では、DatabricksがLakebase Postgresを活用して、外部インフラストラクチャなしでAIエージェント向けのスケーラブルでフォールトトレラントなタスクキューを構築する方法を説明します。4つのPostgresネイティブパターンにより、同時実行優先度対応デキュー、リースベースのクラッシュリカバリ、レート制限対応スロットリング、べき等コールバックを実現します。リアルタイムの可観測性はLISTEN/NOTIFYとSSEによって達成されています。このアーキテクチャはCLAの監査ソリューションで実証され、文書抽出時間を数時間から数分に短縮しました。
Lakebase Postgresは単一のストレージバックエンドとして機能し、従来のアーキテクチャのメッセージブローカー、スケジューラ、キャッシュ層を置き換えます。 FOR UPDATE SKIP LOCKEDを使用した同時実行安全かつ優先度対応のデキュー。 Cursor、Cursor Routerをリリース:リクエストレベル分類器で最先端のコーディング品質を30~50%低コストで実現 2026-07-23 07:37 UTC+9 Cursorは、Cursor RouterをTeamsおよびEnterpriseプランで一般提供開始しました。このシステムは、クエリ、コンテキスト、タスクの複雑さ、ドメインに基づいて各リクエストを分類し、最適なモデルにルーティングします。オンラインA/Bテストでは最先端品質を60%のコスト削減で達成し、3つの早期アクセスエンタープライズアカウントではOpus 4.8比で30~50%の削減を報告しています。
Cursor Routerは、クエリ、コンテキスト、タスクの複雑さ、ドメインを分析するリクエストレベル分類器です。 オンラインA/Bテストで60%のコスト削減で最先端品質を達成。エンタープライズアカウントでは30~50%削減。 中国AI最新情報:Kimi-K3、習近平氏のWAICでの発言、Mythosまであと4ヶ月 2026-07-23 07:35 UTC+9 本記事では、世界人工知能会議(WAIC)での習近平氏の「オープンソースと開放」への支持、中国各省庁によるAI政策文書の発表、パーソナライズドAIチャットボットの新規制、グローバルサウスへのAI展開強化、そして英国AI安全研究所による中国のオープンウェイトモデルと最先端クローズドモデルの能力差縮小に関する研究など、中国AIエコシステムの最新動向を分析する。
習近平氏はWAICで「オープンソースと開放」を支持したが、その意味は広範で、フロンティアモデルの恒久的なオープンソース化を保証するものではない。 中国の複数の省庁がWAICでAIに関する国際政策文書を発表し、国際的な関与強化を示唆した。 Show HN:12個のAIボットで2ヶ月間株を予測、すべての予測を公開 2026-07-23 07:35 UTC+9 LDBDは、ユーザーとAIボットが株式、ETF、暗号通貨の値動きを予測できる公開予測リーダーボードです。すべての予測にはタイムスタンプが付けられ、自動採点されます。現在までに12.9万以上の予測が処理され、実際のお金を使わずに無料で参加できます。
LDBDでは人間もAIボットも資産の方向性を公開予測でき、結果は自動的に確定・採点される。 12のAIボットが2ヶ月間稼働し、すべての予測が公開されている。 シスコがAntaresを発表:脆弱性特定に特化した高効率オープンモデル 2026-07-23 07:33 UTC+9 シスコは、コードベース内の既知の脆弱性を特定するために設計されたセキュリティ小言語モデルファミリー「Antares」を公開しました。これらのモデルは多くの大規模モデルを凌ぐ性能を示しつつ、ローカル実行が可能なため、機密コードをクラウドに送信する必要がありません。
Antares-350MとAntares-1BがHugging Faceでオープンウェイトモデルとして利用可能に。 脆弱性特定ベンチマークにおいて、大規模モデルを低コストで上回る性能。 研究グレードのEdgeBench分析:AIエージェントベンチマーク、リーダーボード分析、スケーリング則、評価指標 2026-07-23 06:53 UTC+9 本チュートリアルでは、多様なタスクカテゴリ、実行環境、インタラクション時間予算にわたって高度なAIエージェントを評価するための実用的ベンチマークであるEdgeBenchを詳しく解説します。Hugging Faceからのデータセットスナップショットのダウンロード、タスク仕様の解析、ベンチマーク分類、実行設定、インターネット要件、判定ロジック、スコアリングメタデータの確認から始めます。次に、リポジトリのREADMEからリーダーボードデータを抽出し、モデル名を標準化し、タスクレベルの結果を分析可能な形式に再構成し、複数の時間予算でのパフォーマンスを比較します。最後に、対数シグモイドスケーリング曲線をフィッティングし、カテゴリレベルのスコア向上を測定し、最も大きな改善が見られたタスクを調査し、SForgeのリスケール関数が生の評価出力をどのように正規化ベンチマークスコアに変換するかを研究します。この再現可能なColabパイプラインは、EdgeBenchの結果を解釈し、エージェントの能力を比較し、完全なSForge実行ハーネスを使用したより深い評価に備えるための技術的基盤を提供します。
EdgeBenchは、多様なタスクカテゴリ、実行環境、インタラクション時間予算にわたってAIエージェントを評価する実用的ベンチマークです。 チュートリアルは、データセットのダウンロード、タスク解析、スケーリング曲線のフィッティング、スコアリング関数の分析からなる完全な分析パイプラインを提供します。 SymptomAI: 日常症状評価のための対話型AIエージェントを目指して 2026-07-23 06:32 UTC+9 Google Researchのチームは、13,917人の参加者を対象とした全国規模のランダム化研究を実施し、SymptomAIと呼ばれる対話型AIエージェントの症状評価と鑑別診断能力を評価しました。結果は、臨床専門家が50%以上のケースでSymptomAIの鑑別診断リストを他の臨床医のものよりも好み、その診断精度も高いことを示しました。さらに、特に呼吸器感染症において、SymptomAIの診断はFitbitウェアラブルデバイスで記録された心拍数、呼吸数、皮膚温度などの生体信号の変化と有意に相関していました。研究は、積極的な質問戦略が診断性能を大幅に向上させることを示し、AIによる医療診断支援の新たな方向性を示しています。
SymptomAIの鑑別診断は、臨床専門家の評価において、50%以上のケースで他の臨床医よりも優れていると判断されました。 AIが積極的に症状の詳細を尋ねるモードは、ユーザーが自由に説明する場合よりも診断精度を大幅に向上させました。 知識ベースの推論から存在ベースの検証へ 2026-07-23 06:03 UTC+9 この記事では、AIエージェントが不確かな場合に推測せずに質問すべきという原則について議論しています。これは、内部知識への依存からリアルタイム検証へのシフトを示しています。
AIエージェントは不確かな場合に推測せず質問すべき。 このアプローチはエラーを減らし信頼性を高める。 Show HN: TrustLoopGuard – エージェントアクションの承認とMCPアクセスの管理 2026-07-23 06:03 UTC+9 TrustLoopGuardは、AIエージェントがアクションを実行する前にチェックを行うオープンソースの制御境界です。許可、拒否、承認要求、延期などの決定を返し、決定と実行の証拠を提供します。
TrustLoopGuardは、アクションが実際の副作用になる前に提案された出力またはアクションをチェックします。 許可、拒否、承認要求、延期の明確な決定と理由を返します。 Show HN: Netmon – 皮肉なAIレポートをTelegramに送信するセルフホスト型LANモニター 2026-07-23 05:26 UTC+9 Netmon は、1時間ごとに速度テストを実行し、LANデバイスをスキャンして、データをローカルのSQLiteデータベースに記録する軽量なセルフホスト型ネットワーク監視ツールです。4時間ごとに、24時間のトレンドグラフと皮肉なLLM分析を含む詳細レポートをTelegram経由で配信します。完全にプライベートでセルフホスト型であり、ローカルLLMとクラウドLLMの両方をサポートします。
1時間ごとの自動速度テストとLANデバイススキャン、データはローカルSQLiteに保存。 4時間ごとに、24時間のトレンドグラフとAI生成の皮肉なコメントを含む詳細レポートを送信。 AIインパクト統計集 2026-07-23 05:20 UTC+9 GitHub、npm、PyPI、Hugging Faceなど、複数のプラットフォームにおける最新のAI関連データを集めた統計レポート。コードリポジトリ、パッケージダウンロード、モデルダウンロード、学術研究、雇用市場における顕著な成長傾向を示しています。
GitHub上のAI関連の新規リポジトリ、プルリクエスト、イシューが前年比で大幅に増加。 npmおよびPyPIでのOpenAI、AnthropicなどのAIライブラリのダウンロードが急増。 Show HN: エージェントのためのリサーチルーム 2026-07-23 04:28 UTC+9 Alexandriaは自律エージェントに共有サンドボックス、可視のルールと目標、そしてMarkdown研究がリンクされた部屋間で合成される永続的な/libraryを提供します。
Alexandriaは自律エージェントに共有サンドボックス環境を提供します。 エージェントは可視のルール、目標、永続的な/libraryを持ちます。 AIライティングの癖:無生物への主体性付与 2026-07-23 04:14 UTC+9 本稿は、AIが生成する文章に特有の表現、例えばem-dashの多用や「load-bearing」などの奇妙な語彙、そして「join rides an index」のように無生物に主体性を付与する傾向を考察する。著者は、これがAIの訓練における能動態重視に起因し、さらには存在論的平等主義を暗示する可能性に言及する。
AIはem-dashや「load-bearing」などの不自然な語彙を多用する AIは無生物に不合理な主体性を与える Copilot vs. 生のAPIアクセス:実際に何にお金を払っているのか? 2026-07-23 04:00 UTC+9 GitHub Copilotは現在、APIレートで使用量を課金しています。本記事では、直接モデルアクセスと、Copilotを中心としたコーディングワークフロー、ポリシー、ツールを比較し、ニーズに応じた選択を支援します。
Copilotはチャットとエージェント作業に対してモデルレートでAIクレジットを消費し、コード補完は有料プランに含まれます。 生のAPIアクセスはカスタムシステム構築に適していますが、プロンプト、検索、ルーティング、ログ、セキュリティを自分で処理する必要があります。 誤りから学習する量子コンピュータへ 2026-07-23 03:40 UTC+9 Google Quantum AIは、強化学習と量子誤り訂正を統合することで、量子コンピュータが継続的にドリフトに適応し、長時間の計算中に安定性を維持できることを実証しました。
強化学習フレームワークにより、計算中に制御パラメータをリアルタイムで調整 Willowプロセッサでの実験で論理安定性を3.5倍向上 AIテクノロジー企業に約1.65兆ドルの「隠れ債務」 2026-07-23 03:26 UTC+9 日経アジアによると、米国の5大テクノロジー企業はAIインフラに関連して推定1.65兆ドルの隠れ債務を抱えており、これは貸借対照表ではなく四半期財務諸表に記載されている。認められた会計慣行ではあるが、投資家は数字が明らかになった際に不意を突かれる可能性がある。
MetaやOracleはオフバランスシート債務の比率が特に高く、Metaの未記載債務は4200億ドル。 隠れ債務は長期契約、主にデータセンター事業者との契約に起因する。 AI Maestro:AIコーディングエージェントのチームをタスクボードで指揮する 2026-07-23 03:17 UTC+9 AI Maestroは、ソフトウェアデリバリーを単一のチャットセッションではなく、AIエージェントのオーケストラとして実行するためのオープンソースツールです。タスクボードベースのチケットルーティング、分離されたGitワークツリー、再利用可能なスキルライブラリ、ビジュアルコンソールを備え、マルチエージェントの協調作業を効率化します。
タスクボードが唯一の情報源となり、コンテキストリセットや並行セッションでも作業状態が失われません。 各チケットがエージェントパイプラインとモデルを指定し、タスクに最適な処理を実現します。 エージェントは答えを変え続ける、Harnessは気にしないデリバリーパイプラインを構築 2026-07-23 02:51 UTC+9 ソフトウェアデリバリーライフサイクル企業Harnessは、AIエージェントの開発にアプリケーションコードと同じガバナンス、テスト、セキュリティを適用する「AIエージェント開発ライフサイクル(DLC)」サービスを発表しました。エージェントの非決定論的な性質が課題であり、Harnessはエージェント自体ではなく、その周囲のパイプラインを予測可能にすることを重視しています。AI評価、エージェントデプロイメント、AI設定、AI資産カタログ、AgentTraceの5つの新機能と、基盤コンポーネントのオープンソース化を実施。安全でガバナンスの効いたエージェントデプロイメントを可能にすることを目指しています。
HarnessがAIエージェントDLCを発表。コード配信パイプラインのガバナンスをエージェント開発に適用。 エージェントは非決定論的であるため、Harnessは周囲のパイプラインを予測可能にすることを提案。 AIコーディングは専門知識を阻害する 2026-07-23 02:34 UTC+9 本記事は、AIコーディングツールが特に初心者開発者の専門知識の発達を妨げる可能性を論じている。AIアシスタントへの依存が学習成果を悪化させ、「能力の錯覚」を生むという研究を引用。真の専門性には摩擦と問題解決が必要であり、AIを答え生成器ではなくソクラテス的対話パートナーとして使うことを提案している。
AIコーディングツールを効果的に使うには専門知識が必要だが、その使用が専門知識を弱める。 研究によれば、AIに過度に依存する初心者は成績が悪く、使用を制限する初心者の方が良い結果を出している。 Show HN: Stele – AIコーディングエージェントのための自己維持型知識グラフ 2026-07-23 02:33 UTC+9 Steleは、AIコーディングエージェント向けの共有メモリ台帳で、決定、タスク、教訓を記録します。各アクションの前にコンテキストを読み取り、作業後に知識を書き戻すことで、ツールやセッションをまたいだ継続性を確保します。システムはグラフを自動的に維持し、古いエントリをフラグし、タスクの重複なく調整します。招待制ベータ版。
Steleは、AIエージェントが読み書きする統一されたプロジェクトメモリを提供し、過去の間違いを繰り返さないようにします。 Claude Code、Cursor、Codexなどのエージェントと統合し、ツールの切り替えをシームレスにします。 OpenAI、自社カスタマーサービスライン向けに構築したサポートエージェントを企業に提供へ 2026-07-23 02:23 UTC+9 OpenAIはPresenceという製品を発表し、自社のサポートラインで使用してきたAIエージェントを企業の電話やチャットチャネルに展開する。この製品は信頼性と信頼を重視し、きめ細かな権限設定とエスカレーションパスを備え、OpenAIのエンジニアがカスタマイズと統合を支援する。初期のパートナーにはBBVA、ソフトバンク、IAGが含まれ、現在は限定的な提供である。
OpenAIがPresenceを発表、自社のサポートラインで稼働するAIエージェントを企業向けに提供。 エージェントは単一のタスクに限定され、権限は企業が設定する。 PerplexityのエージェントAIにMacで5つの複雑なタスクを任せてみた——またやるだろう 2026-07-23 02:12 UTC+9 PerplexityのMacアプリには、パソコン上でマルチステップのタスクを自動処理するエージェントAI「Personal Computer」が搭載されている。著者は5つのタスクをテストし、結果に感銘を受けた。この機能は現在EnterpriseおよびProユーザーにも開放されている。
Perplexity Personal Computerはローカルファイルへのアクセス、アプリの制御、クラウドサービスとの連携、CometブラウザによるWebページ操作が可能。 著者はカレンダーイベント作成、デスクトップファイル整理、メール検索と要約、タイマー設定、ワークフロー自動化の5タスクをテスト。 評価エンジニアリングスキル:リポジトリコンテキストとトレースから評価を構築する 2026-07-23 01:57 UTC+9 LangChain は評価エンジニアリングスキルを発表しました。このスキルはエージェントのリポジトリとトレースを検査し、ユーザーインタビューを通じて評価を提案し、実行可能な Harbor 形式の評価タスクを出力します。
新しいスキルはエージェントのリポジトリとトレースを自動分析し、テストすべき能力を提案。 ユーザーインタビューによる反復的改善で、一度きりの生成よりも高い評価受容率を実現。 CoreBase:製品向けガバナンス付きAIエージェント、顧客データ上で 2026-07-23 01:35 UTC+9 CoreBaseが新たな外観で登場。コネクタ、権限管理、監査証跡、コスト制御を内蔵したガバナンス付きAIエージェントのインフラストラクチャレイヤーを提供し、信頼できるAIエージェントを製品に組み込めます。
CoreBaseはAIエージェント向けのガバナンス付きインフラ層を提供。 コネクタ、権限管理、監査証跡、コスト制御を内蔵。 Naturalが3000万ドルを調達し、AIエージェント向け決済を刷新、Stripeに挑戦 2026-07-23 01:35 UTC+9 NaturalはForerunner Ventures主導のシリーズAで3000万ドルを調達し、AIエージェント向けの決済インフラを構築してStripeと競合する。同社は6つの製品を立ち上げ、1年目に13製品をリリースする計画。現在の取引量は少ないが、エージェント決済市場は2032年までに930億ドルに成長すると予測されている。
NaturalがシリーズAで3000万ドル、総調達額4000万ドル超。 AIエージェント向け決済レールを構築(ウォレット、決済、不正検知、コンプライアンスなど)。 Show HN: Codify – 開発環境のためのTerraform 2026-07-23 01:30 UTC+9 Codifyは、宣言的な設定とAIアシスタントを使って開発環境を管理・自動化するオープンソースツールです。クロスプラットフォーム対応で、チームコラボレーションやセキュリティ監査もサポートします。
環境をコードとして定義し、バージョン管理やチーム共有が可能。 AIエージェントが自然言語から設定を生成し適用する。 サムスンが新Galaxy端末にGemini AIを深く統合する3つの方法 2026-07-23 01:01 UTC+9 サムスンのUnpackedイベントで、折りたたみスマホ、スマートウォッチ、スマートグラスが発表され、Gemini AIが深く統合されました。タスク自動化、Gemini Notebookのプリインストール、グラスとウォッチの連携が可能です。
Gemini Intelligenceにより、新しいGalaxy端末でチケット購入や食事の注文など、アプリを超えたタスク自動化が可能に。 Gemini NotebookがGalaxy Z Flip 8、Z Fold 8シリーズにプリインストールされ、大画面を活用した作業効率向上。