Artemisは、各脳領域に独立に介入し、領域固有の交絡因子表現を学習することで、加齢や性別などの人口統計学的要因による交絡を除去し、脳疾患診断や分類におけるGNNのロバスト性と解釈可能性を向上させる領域レベル因果フレームワークである。
AI ニュース速報
リアルタイム監視
最新ニュース
信頼できる情報源、出典、権限、サイト内閲覧を保ちながら、AI の変化を読める情報に圧縮します。
最新ニュース
CODEBLOCKは、コード用大規模言語モデルの微調整のための構造認識型スパース監視フレームワークです。孤立したトークンではなく構造的に完全なコードブロックを選択し、6つのベンチマークで平均pass@1を向上させ、監視トークンはわずか1.9%しか使用しません。
強化学習におけるエージェントの能力向上に伴い、固定タスク分布は飽和し、単純な合成生成では無効または簡単すぎるタスクが生じる。PROPELフレームワークは、軽量な活性化プローブを用いてソルバーの成功率を予測し、直接評価を回避することで、学習可能フロンティアに位置するタスクを効率的に生成する。数学、コード、ソフトウェア工学の各領域で、目標成功率でのタスク生成割合が大幅に向上した。
ガウス混合注意(GMA)は、K個の学習されたガウス混合成分を介したルーティングにより、標準的なO(N²)の代わりにO(NK)のメモリスケーリングを実現する新しい注意機構です。実験では、GMAは長文脈分類タスクで注意ベースラインと競合し、因果GMAはWikiText-103で線形/ランダム特徴注意を上回りますが、最適化された因果SDPAやMambaには及びません。GMAは確率的で解釈可能な固定K線形時間注意の代替手段を提供します。
ProfiLLMは、ライドヘイリングディスパッチのためにユーティリティ調整されたユーザープロファイルを作成するエージェント型LLMデータパイプラインです。ツール拡張グローバル知識マイニングとユーティリティ調整プロファイル探索を使用してスケーリングの課題を克服します。DiDiに導入され、予測AUC、GMV、完了率の大幅な改善を達成しました。
R2D-RLは、RoboCup 2Dサッカーシミュレーション(RCSS2D)とPythonベースのMARLを共有メモリとサイクルレベル同期で接続し、フルフィールド/シナリオトレーニング、設定可能な対戦相手、ハイブリッドアクション空間、EPV報酬形成、並列実行をサポートします。
新しい論文は、複数の環境と目標にわたって準最適に行動するための汎用AIエージェントのメモリ要件を形式的に説明しています。研究によれば、類似した観測ボトルネックを共有しながらも互換性のない最適行動を必要とする2つのドメインでは、どのような均一に準最適なポリシーでもそのボトルネックで異なるメモリ分布を誘導しなければなりません。分離定理は、成功するエージェントは現在の状態観測のみに依存できず、ドメイン関連情報をメモリに保存する必要があることを示しています。さらに、メモリに関連目標の価値を推定するのに十分な情報が含まれている場合、そのメモリを使用してエージェントの局所的な遷移ダイナミクスを近似的に再構築できます。これらの結果は、メモリをドメイン識別、遷移モデル再構築、計画を支える基質として特徴付けています。
研究者らは、戦略ゲーム「Freeciv」を基盤としたシミュレーション世界の予測ベンチマーク「ForecastBench-Sim」を発表。現実世界のベンチマークが抱える結果確定の遅さ、テールイベントの希少性、反実仮想の評価困難性を克服する。
DeFAbは、40年にわたる公的資金による知識ベースを可敗北的アブダクションのベンチマークに変換するデータセットと生成パイプラインです。ルールベースの論理ソルバーは50マイクロ秒未満で100%の精度を達成し、最良のフロンティア言語モデルは65%に達し、ロバスト評価では23.5%に低下します。このベンチマークは多項式時間で検証可能なチェックにより論理的厳密性を測定し、創造性を評価します。372,648以上のインスタンスに加え、より難しいバリアントとLean 4/Mathlibを使用した創造的推論バリアントも公開されています。
CEO-Benchは、スタートアップを500日間運営するシミュレーションを通じて、言語モデルエージェントの長期的で不確実なタスクにおける能力を評価する新しいベンチマークです。最先端モデル(Claude Opus 4.8やGPT-5.5)でも、初期資金100万ドルを辛うじて上回る程度で、安定した利益を上げるには至りません。
本研究では、Collaborative Gym環境とDiscoveryBenchタスクを用いて、共有ワークスペースにおける人間とAIエージェントのチーム協力を調査した。結果、調整構造がない場合、協力者を追加するとパフォーマンスが低下することが分かった。一方、共有グループメモリとシミュレートされたヒューマン・イン・ザ・ループ(HITL)ゲートを組み合わせた足場設計は、特に3人チームにおいて平均パフォーマンスを大幅に向上させた。
CaVe-VLM-CoTは、5段階の閉ループパイプラインを通じて視覚言語モデルの幻覚を低減する、モジュール型の反射的エージェントRAGフレームワークです。正確性、引用精度/再現率、帰属、証拠の根拠を測定するCaVeScoreを中心とした23のメトリクスを導入します。アーキテクチャの変更なしに、ScienceQAで87.1%の精度、MMMUで55.2%の精度を達成します。
本論文は、低軌道宇宙船に展開されたソフトウェアシステムNAVI-Orbitalを紹介する。2026年4月16日、NAVI-Orbitalは、視覚言語モデルが完全にオンボードで自律的なマルチモーダル推論を実行する初の軌道上実証を達成した。Gemma 3モデルを使用して各シーンを分類し、テキスト記述を生成し、自然言語対話でオペレーターに応答する。グラフベースのステートマシン(LangGraph)によって調整される。地上ベンチマークで88.16%の精度を達成し、軌道上でも未校正のYAM-9画像を処理。セマンティック圧縮により帯域幅プロファイルを逆転させる可能性を示す。
ParcleはAIエージェント向けの共有メモリ層です。過去のコンテキストをインデックス化し、毎回同じ情報を再読み込みする無駄を省くことで、トークン消費を中央値で約30%、最大70%削減します。タスク完了時間も約2倍高速化します。
dolfynはサービス業向けのAI音声エージェントです。24時間365日電話対応し、リードを獲得し、スケジュールを管理します。未回答の通話による収益損失を削減します。ビジネスごとにカスタム構築され、月額179ドルから、契約は不要です。
2026年のAI in Design Reportによると、デザイナーの91%が毎週AIを使用(2025年は54%)、平均ツール数は3から7に倍増、50%がAI生成コードを本番環境にデプロイし、デザイナー自身がツールを構築しています。レポートは喜びと不安の分裂、採用基準のAIリテラシー、システム思考、戦略的スキルへのシフトを強調しています。
Genie Mentions は、あなたとあなたの大切な人々を理解するAIソーシャルプロダクトです。友達の動き、旅行、夢を追跡し、最新情報を届けます。
Midjourney CEOのDavid Holz氏は、同社初のハードウェア製品「The Midjourney Scanner」を公開しました。これは超音波ベースの全身スキャナーで、40個のButterfly超音波モジュールを使用し、約60秒で全身をスキャン、MRIに匹敵する画質を実現します。同社はサンフランシスコにスパを開設し、10台のスキャナーを設置する計画で、初期段階ではFDAの診断承認を必要としない体組成マップを提供します。Holz氏は将来的に、このスキャナーが放射線や強力な磁石を使わず、MRIを超える可能性があると述べています。
本記事の著者である小規模ソフトウェア企業の創業者は、ローカルモデル(Qwenなど)の実体験を共有している。ベンチマークでは最先端モデルに劣るものの、プライバシー、固定費、ベンダーリスク回避において独自の価値があると主張する。一方で、無限ループや幻覚といった限界にも率直に言及し、無監督の長期的なタスクへの使用を警告している。
x86 エコシステム諮問グループが、x86 アーキテクチャ向けの AI コンピュート拡張 (ACE) 仕様を発表しました。
OpenAIが発表したLifeSciBenchは、173人のPhD科学者が作成した750タスク、7つのワークフロー、7つの生物学領域にわたって、フロンティアAIが実際の生命科学研究を処理できるかを評価する。19,020のルーブリック基準を使用し、単なる想起ではなく推論と判断を採点する。最良モデルGPT-Rosalindでも通過率は36.1%にとどまり、人工物、正確な出力、運用判断には大きな改善余地がある。
BrandScreen.aiは、商標、ドメイン、事業法人、ソーシャルハンドル、検索競合を同時にスクリーニングし、0~100のブランドリスクスコアを生成するツールです。無料ツールとAI名前生成機能を備え、起業家がブランドの所有可能性と防御力を迅速に検証できます。
本稿では、単一のAWS c6i.metalインスタンス上で1500の完全KVM分離された仮想マシンを同時に実行し、AIエージェントタスクを行った際の主要パフォーマンス指標(起動時間、メモリ密度、DNSキャッシュ、ネットワークレイテンシ、TLSセッション再利用、スループット)を紹介し、軽量分離アーキテクチャの実際のコストと利点を示す。
Epiq SolutionsがVNX+開発プラットフォームを発表。完全自己完結型のRFペイロードで、CPUとGPUを統合し、AI/MLをすぐにデプロイ可能。10MHz~6GHz、4送受信チャンネル、50MHz IBW、消費電力40W、重量2.5kg。DeepSigのOmniSIGと連携し、AI駆動の信号分類や方向探知を実現。電子戦、SIGINT、ドローン検出などに最適。
PII GUI は Tauri 2 ベースのデスクトップアプリで、PDF、Markdown、テキストファイル内の個人識別情報(PII)をローカルで検出・編集します。すべての処理はデバイス上で行われ、オプションのモデルダウンロードのみネットワークアクセスが必要です。正規表現とONNXバックエンド、カスタムルール、レビューワークフロー、タスク履歴の永続化をサポートします。
TineはMacのノッチに常駐する第2のカーソルで、画面のアクティブなアプリや選択内容をリアルタイムに理解し、Slackへの投稿やメモ作成、フォーム入力などのタスクをアプリ間で実行します。透明性、許可、即時割り込みの原則に基づき、デバイス上で動作し、すべての操作を記録し、マウスを動かすと制御を戻します。
RichIntoは、クリエイターやフリーランサー向けに、AIツールのROI、価格設定、スポンサー料金、ソフトウェアコスト、デジタルプロダクト利益を見積もる無料計算機を提供し、データに基づく意思決定を支援します。
LegalRabbitがClaude CoworkとCodex向けのDOCXプラグインを発表。ローカルでDOCXファイルの読み取り、作成、編集が可能で、トラックチェンジやコメントもサポート。トークン消費はAnthropic公式スキルの1/2~1/5。
ソブリンAI(データ、モデル、インタラクション層を所有すること)は、国家だけでなくあらゆる規模の組織にとって戦略的必須事項になりつつある。この記事はフルスタックの制御を主張し、汎用モデルよりも小型ドメイン特化モデルの利点を強調し、ブランドの一貫性やコンプライアンスなどの障壁に触れている。リーダーはデータを主権資産として扱い、構成可能な小型モデルを優先し、ユーザーインターフェースを所有するよう求められている。
Mindgardの研究により、ChatGPTの画像生成機能が簡単に操作され、ユーザーが直接要求していないにもかかわらず、暴力的で露骨な性的コンテンツを生成できることが明らかになった。この発見は、不十分なコンテンツフィルターを備えたAIツールへの広範なアクセスが現実世界に影響を及ぼすこと、およびなぜそのような画像がトレーニングデータに含まれているのかという疑問を提起する。