Gigatoken:Rust製BPEトークナイザー、24.53 GB/sでテキストをエンコード、HuggingFace Tokenizers比989倍高速 2026-07-23 17:01 UTC+9 Gigatokenはスタンフォード大学の博士課程学生Marcel Rød氏がMITライセンスで公開したRust製BPEトークナイザーで、144コアのAMD EPYC 9565上でGPT-2トークン化を24.53 GB/sで実行。HuggingFace tokenizers比989倍、tiktoken比681倍の高速化を達成。高速化の要因は、手書きのSWARプリトークナイザーとプリトークンキャッシュであり、BPEマージループの改善ではない。23のトークナイザーファミリーをサポートするが、SentencePiece語彙では7~22倍の高速化にとどまる。互換モードでは正確な出力を維持しつつ約200~300倍の高速化。
Gigatokenは144コアEPYC上でGPT-2を24.53 GB/sで処理し、HuggingFace tokenizers比989倍、tiktoken比681倍の高速化。 高速化の要因は手書きSWARプリトークナイザーとプリトークンキャッシュによるもので、BPEマージループの改良ではない。 再帰的自己改善の経済学 2026-07-23 16:36 UTC+9 Parker氏とTom氏を含む9人の経済学者が共同執筆した論文「再帰的自己改善の経済学」では、AIがAI研究開発を加速する仕組みを簡単なモデルで分析。RSIの定義の違い、フィードバック効果の強さが能力加速に与える影響、ラボがさらなるデータを公開すべき点などを論じている。
RSIの定義は様々で、論文は技術的な使用を避け、フィードバックの強さと自己持続的加速に焦点を当てている。 能力加速はフィードバック効果の強さに依存し、アルゴリズム進歩の応答が最も不確実。 Show HN: Ours.network – AIエージェント同士を直接つなぐ 2026-07-23 16:01 UTC+9 Ours.networkは、AIエージェントが人間の介入なしに直接通信できるツール「ours-mcp」を発表しました。インストール可能なMCPサーバーにより、ワンタイム招待状を使ってエージェントを接続し、手動でのコピー&ペーストを不要にします。エンドツーエンド暗号化、プライバシー保護のためのブラインドリレー、完全な人間による制御を特徴としています。現在は初期アルファ版で、ソースコードは公開されており、Claude CodeやCodexなどの異なるランタイム間でのエージェント間通信を目的としています。
ours-mcpは、AIエージェント間の直接回線を確立し、人間がメッセージを中継する必要をなくします。 セットアップは迅速で、MCPサーバーのインストール、招待状の生成、エージェントの接続まで約2分です。 AIチャットボットは感情サポートにおいて人間と同等以上に効果的である可能性 2026-07-23 14:05 UTC+9 マンチェスター大学とダラム大学の研究により、AIチャットボットは日常的な感情サポートにおいて人間と同等か、場合によってはそれを上回ることが判明。特に怒りや恐怖の状況で効果が高く、具体的で実行可能なアドバイスが鍵であることが強調されている。
AIチャットボットは怒りや恐怖の状況で人間より効果的であり、悲しみの状況では同等だった。 具体的で実行可能な提案(呼吸法、思考の再構成など)が感情の改善に重要。 妻のために作った、広告なしでファクトチェックとバイアス検出を行うニュースブリーフ 2026-07-23 13:55 UTC+9 BeamWireは、メールとポッドキャストで毎日配信されるパーソナライズされた広告なしのニュースブリーフで、ファクトチェック、バイアス検出、カスタマイズ可能なトピックを備えています。様々な関心に応じたニュースや特集の「ビーム」、AIアンカー、トーンカスタマイズを提供します。料金は無料から始まります。
BeamWireは、広告や偏りを排除した毎日厳選されたニュースブリーフをメールとポッドキャストで提供します。 ユーザーは既成のビーム(トピック)を選択したり、カスタムビームを作成したりでき、AIアンカーやトーンのオプションもあります。 PyPI、14日以上経過したリリースへの新規ファイルアップロードを拒否 2026-07-23 13:50 UTC+9 Python Package Index (PyPI) は、14日以上経過したリリースへの新規ファイルアップロードを拒否する新たなセキュリティ対策を導入しました。これは、公開トークンやワークフローの漏洩によるサプライチェーン攻撃を防ぐためのものです。
PyPI は14日以上経過したリリースへの新規ファイルアップロードを拒否。 古い安定リリースが悪意のあるコードによって汚染されるのを防ぐ。 AIエージェントのアクションに対する公開検証可能なレシート(Bitcoinにアンカー) 2026-07-23 13:10 UTC+9 Orphograph は、AIエージェントの重要なアクションごとに Bitcoin ブロックチェーンにアンカーされたレシートを生成し、記録の存在時刻と改ざん防止を証明します。検証にはオペレーターへの信頼は不要です。
自己報告ログは後から編集可能なため証拠として不十分。 アクション記録のハッシュを Bitcoin ブロックチェーンにアンカーすることで、タイムスタンプと改ざん防止を実現。 Show HN: Searchdesk — AIを活用した求人検索、履歴書とカバーレターを自動調整 2026-07-23 13:07 UTC+9 Searchdeskは、実際の求人をリサーチし、事実に基づいた応募書類を作成し、すべての機会をプライベートワークスペースで管理するAI搭載の求人検索ツールです。ユーザーはすべてのドラフトを確認でき、自動応募は行われません。現在アルファ版で、フィードバックを募集中です。
公開求人をリサーチし、ユーザーの情報に基づいて履歴書とカバーレターをカスタマイズ。 ユーザーが最終判断を下し、AIが自動で応募することはありません。 VQ-Transplant: 事前学習済みビジュアルトークナイザのための効率的なVQモジュール統合 2026-07-23 13:00 UTC+9 VQ-Transplantは、新しいベクトル量子化モジュールを凍結済みの事前学習済みトークナイザにプラグアンドプレイで統合する軽量フレームワークを提案する。ImageNet-1kでわずか5エポック学習する軽量デコーダ適応戦略により量子化ミスマッチを緩和し、VARなどの産業レベルのモデルで最先端に近い再構成品質を達成しながら、トレーニングコストを95%削減する。これにより量子化研究の民主化が進み、リソース制約下でも新しいVQ技術の探索が可能になる。
エンコーダ・デコーダを再学習せずにVQモジュールを交換可能。 ImageNet-1kで5エポックのみの軽量デコーダ適応。 ChronoStitch:長期間の時間的推論のための訓練不要なビジュアルKVメモリの構成 2026-07-23 13:00 UTC+9 本論文では、長尺動画の質問応答における時間的推論を可能にするため、独立して保存されたビジュアルKVメモリを構成する訓練不要の手法ChronoStitchを提案する。保存されたポストロータリーキーをグローバルな3軸マルチモーダルRoPE座標系に再ベースし、高偏差のビジュアルトークンを選択的に再計算することで、単純な結合による時間位相の衝突と内容のギャップを克服する。Qwen2.5-VL-3BおよびTempCompassの時間的分割における実験では、イベント順序付けの精度が向上し、完全なジョイント再プリフィルと比較して3.3倍の高速化を達成した。
長尺動画QAでは時間経過に伴う視覚証拠の保存が必要であり、KVキャッシュは実用的だが単純な結合ではグローバルな順序が失われる。 ChronoStitchはキーをグローバルなRoPE座標系に再ベースし、高偏差のトークンを選択的に再計算することで訓練不要の構成を実現する。 合成および派生トレーニング画像を用いたキャンパス廃棄物検出:YOLOv8nによるマルチシード評価 2026-07-23 13:00 UTC+9 本研究では、合成画像および派生画像がYOLOv8n検出器の性能向上に寄与するかを評価した。148枚のキャンパス写真からなる実データセットを用いた実験では、すべての合成拡張構成が実画像のみのベースライン(平均[email protected] : 0.691)を超えられなかった。手と前腕の複合実験はテストセットの汚染により無効となり、再構築後も有意な効果は見られなかった。テストセットの規模が小さいため、結論には限界がある。
実画像のみのYOLOv8nモデルは平均[email protected] が0.691であり、合成データ構成はいずれもこのベースラインを超えられなかった。 背景置換、孤立物体画像、完全拡張プールはいずれも検出精度を低下させた。 D3VL:言語モデルを用いた3D時系列データとビデオからの運転シーン理解 2026-07-23 13:00 UTC+9 本論文は、2Dおよび3D時系列データを統合する新しいマルチモーダル大規模言語モデルフレームワークD3VLを提案し、KITTI QAデータセットでベースライン比11%向上、多様な運転条件をカバーするWaymo QA拡張データセットも導入する。
D3VLは2Dと3D時系列データを単一アーキテクチャに統合した初のMLLMフレームワーク。 KITTI質問応答データセットで11%の性能向上。 Crowd4D:シーン認識型単眼4D群衆再構築 2026-07-23 13:00 UTC+9 Crowd4Dは、単眼RGBビデオから群衆とシーンを共同最適化する初のシーン認識型4D群衆再構築フレームワークである。人-シーン相互作用プロキシ(HSIP)を導入してスケールと位置の整合を解決し、群衆構造コヒーレンス正則化(CSCR)により遮蔽下での時間的安定性を向上させ、複雑な大規模シーンで既存手法を凌駕する。
単眼4D再構築で群衆とシーンを共同最適化する初のフレームワーク。 人-シーン相互作用プロキシ(HSIP)を中間表現として導入。 早期に検出、稀にエスカレーション:圧縮ビットストリームからのAI生成ビデオの随時検出 2026-07-23 13:00 UTC+9 本論文は、ピクセルにデコードする代わりに圧縮ビットストリームを分析することで、AI生成ビデオをリアルタイムで検出する新しいアプローチを提案します。コーデックがすでに書き込んだモーションフィールドを利用したストリーミング知覚フレームワークを導入し、単一の調整済み閾値で随時検出を可能にします。この手法はGenVidBenchで0.64のAUCを達成し、ピクセルベースCNNよりも5桁少ない計算量で動作し、15%のクリップを延期することで精度を0.75から0.78に向上させ、計算量を7倍削減します。
AIビデオ検出を圧縮ビットストリームからのストリーミング知覚として再定義 コーデックのモーションフィールドを利用し、ピクセルデコードではなくパースのみで動作 依存関係グラフと近接特徴を用いた歴史新聞からの軽量な人物-場所関係抽出 2026-07-23 13:00 UTC+9 HIPE-2026共有タスクでは、多言語歴史新聞からの人物-場所関係抽出が新たな評価トラックとして導入された。DS@GT HIPEチームは、事前学習言語モデルを使用せずに軽量で解釈可能なシステムの性能限界を調査した。依存関係解析から文書レベルのグラフを構築し、近接性と品詞の特徴を抽出、小型のscikit-learnアンサンブルまたはコンパクトなグラフ注意ネットワーク(パラメータ数847K未満)で分類。公式評価では、最高実行でマクロ再現率0.5142を達成、効率性で3位、精度で中位だった。主な知見:最小文字距離が信号の大部分を捉え、追加の工学的特徴は一貫性のない利益をもたらすこと、文書グループ化交差検証がデータ漏洩防止に不可欠であること。
事前学習言語モデルなしの軽量アプローチ、847Kパラメータ未満。 最小文字距離が主要信号、追加特徴は不安定な利益。 SLPO:サロゲートポリシーによる潜在推論のスケーリング 2026-07-23 13:00 UTC+9 強化学習は明示的Chain-of-Thought推論器でテスト時スケーリングを実現したが、計算コストが高い。潜在推論は連続ベクトルで中間計算を行い、効率的だが模倣学習に留まる。本論文では、サロゲート潜在ポリシー最適化(SLPO)を提案し、軌跡レベルのクレジット割り当てのためのサロゲートポリシー密度と可変ホライゾンポリシーに洗練される正解監視停止ヘッドを介して、自己回帰潜在推論器に結果報酬RLをもたらす。SLPOは並列サンプリングでPass@kを向上させ、難しいインスタンスにより長い潜在計算を割り当てる。
潜在推論は効率的だが結果報酬RLの訓練が不足。 SLPOはサロゲートポリシー密度と停止ヘッドにより潜在推論器の結果報酬最適化を実現。 マルチマスク拡散言語モデルによる少数ステップ生成 2026-07-23 13:00 UTC+9 マスク拡散モデル(MDM)の少数ステップ生成における終端エントロピー欠如問題に対し、複数のマスク状態を導入したマルチマスク拡散モデル(MultiMDM)を提案し、高品質な少数ステップテキスト生成を実現。
従来のMDMは全前方軌跡が単一全マスク状態に収束し、少数ステップ生成に必要な終端エントロピーが不足。 MultiMDMは各クリーントークンを指定マスクへ押し出し、その後マスク集合上で混合することで、逆過程に下書き能力を付与。 オープンエンドな質問応答における推論の参照不要評価 2026-07-23 13:00 UTC+9 LLM生成の推論過程をセグメントに分解し、NLIとハイパーグラフを用いて監査する参照不要フレームワークを提案。数学と医療の推論タスクでLLM判定より高信頼性を示す。
推論トレースをセグメント化し、NLIで前提-目標関係をラベル付け 臨床症例からのLLM推論ベンチマークUroReasonを新規構築 適応的降伏:脆弱性コンテキストにおけるLLM応答の構造的障害モード 2026-07-23 13:00 UTC+9 新しい論文は、「適応的降伏」と呼ばれるLLMの障害モードを特定しました。これは、モデルがユーザーの感じる社会的不公正を最初に認め、その後、名目上は推奨していない獲得を詳細に促進するというものです。この研究は、3つの商用LLMに対して900セッションのテストを実施し、最小再帰属十分性(MRS)を設計原則として提案しています。
感情的に敏感なコンテキストにおけるLLM応答の構造的三重苦を説明 「適応的降伏」という未記録の障害モードを特定 タスク能力は指示追従ではない:小規模言語モデルにおける指示競合行動の評価 2026-07-23 13:00 UTC+9 小規模言語モデルはタスク能力が高い一方で、指示が標準的なタスク行動と競合する場合、非標準指示を無視する傾向があることが示された。モデル規模が大きくなると標準精度と指示追従能力は向上するが、両者のギャップは依然として存在する。タスク完遂能力と指示追従は別個の能力であることが証明された。
小規模モデルは競合指示下でもタスク正解率を維持するが、非標準指示をしばしば無視する。 大規模モデルでは標準指示と非標準指示の性能に明確な差が見られる。 大規模言語モデルにおけるハイパーネットワークベースの知識注入のスケーリング法則 2026-07-23 13:00 UTC+9 研究者らは、ハイパーネットワークを用いた学習時知識注入を大規模言語モデルに適用し、ハイパーネットワークアーキテクチャのスケーリング挙動を初めて体系的に調査した。実験では、損失、推論精度、OOD汎化において冪乗則スケーリングが確認され、規模拡大に伴いOOD汎化が信頼性を増し、LoRAや完全ファインチューニングを上回る性能を示した。また、数千万のマルチホップQAサンプルを含むMegaWikiQAデータセットを構築した。
ハイパーネットワークは訓練時に固定LoRAアダプタを生成し、対象モデルに知識を注入できる。 注入容量と対象モデルの汎用能力を分離する設計により、スケーリング法則の厳密な研究が可能に。 構造的一般化の計算複雑性について 2026-07-23 13:00 UTC+9 本論文は構造的一般化を初めて形式的に定義し、標準的な計算複雑性の仮定の下で、純粋なTransformerは構造的一般化を学習できず、ニューロシンボリックシステムが意味投影をハードコードすることで高得点を達成することを示す。
構造的一般化の形式的な数学的定義を提供し、構成構造と非有界一般化を数学言語に変換する。 純粋なTransformerの学習可能な上限はTC0であり、構造的一般化にはNC1が必要であるため学習不可能であることを証明。 推論が手を狭める:LLMゲームプレイにおける多様性の崩壊 2026-07-23 13:00 UTC+9 研究により、教師ありファインチューニング(SFT)が大規模言語モデルを下流タスクに適応させる際、特に逐次的意思決定において行動の多様性を著しく低下させることが明らかになった。三目並べの変種などの確定論的ボードゲームを用いた制御実験を通じて、著者らは推論モードの生成がしばしば行動の多様性を抑制し、標準的なSFTは精度向上に必要以上に早期の多様性崩壊を引き起こすことを示した。行動拡張(各状態におけるすべての最適行動を訓練する)はこの効果を部分的に緩和する。
教師ありファインチューニング(SFT)はLLMの意思決定において早期に行動の多様性を失わせる。 推論モードの生成は必ずしも精度を向上させずに行動の多様性を抑制する。 マルチターンLLMシステムのためのステートフルガードレール:会話リスク蓄積フレームワーク 2026-07-23 13:00 UTC+9 既存の大規模言語モデル(LLM)の安全ガードレールは各プロンプトと応答のペアを個別に評価するため、会話中に無害なターンが蓄積して害を生じる失敗を見逃します。本論文では、会話リスク蓄積(CRA)の概念と、セマンティックドリフト、感度重み付き情報蓄積グラフ、コンプライアンス勾配を追跡するセッション層フレームワークを提案します。CRA-Benchベンチマークと評価プロトコルも公開します。
意図のドリフト、禁止命令の断片的組み立て、感度蓄積からなる会話リスク蓄積(CRA)を定義。 セマンティックドリフト、情報蓄積グラフ、コンプライアンス勾配を追跡するセッション層フレームワークを提案。 2次元中性子束推定のためのニューラルオペレーターサロゲート 2026-07-23 13:00 UTC+9 この研究は1次元の単一スイープニューラルオペレーター研究を2次元に拡張し、フーリエニューラルオペレーター(FNO)とU字型ニューラルオペレーター(UNO)を使用して高忠実度スカラー束を近似します。3つのサロゲート(FNO直接マッピング、UNO直接マッピング、単一スイープ近似を追加入力とするFNO)を調査。3つのランダムシードで訓練し、変動性を評価。単一スイープ入力と対数束訓練が精度を向上させるかどうかを検討。
1次元ニューラルオペレーター法の2次元中性子束推定への拡張 FNOとUNOの直接マッピングサロゲートの比較 非構造メッシュ上のカオス力学のスケール認識学習:ビン分割スペクトル損失による 2026-07-23 13:00 UTC+9 本研究は、非構造メッシュ上のサロゲートモデリングのためのビン分割スペクトル損失関数を拡張し、フーリエバンドをグラフラプラシアン周波数バンドに置き換え、スケーラブルなチェビシェフ多項式フィルタとマルチレベル近似を導入することで、長期的なロールアウトの忠実度を向上させる。結果は、非構造メッシュ上の乱流予測において、決定論的ベースラインよりも優れていることを示している。
グラフラプラシアンに基づくビン分割スペクトル損失により、不規則グリッド上のスケール認識学習が可能に。 チェビシェフ多項式フィルタとGLEAMは、完全なスペクトル分解のスケーラブルな代替を提供する。 速く構築し、ゆっくり評価:パイプライン選択が自動解釈可能性スコアの分散を支配する 2026-07-23 13:00 UTC+9 この研究は、スパースオートエンコーダの自動解釈可能性スコアがアーキテクチャの違いよりも評価パイプラインの選択によって大きく左右されることを示し、論文間の比較がパイプラインの違いを反映する可能性があると指摘する。
方法論的分散はすべての指標とモデルでアーキテクチャ的分散を上回る 検出指標が最も安定で、ファジングは信頼性が低い STN-TGAT: 事前誘導グラフアテンションと学習可能なソフトしきい値スパーシフィケーションによるトップKポートフォリオ構築 2026-07-23 13:00 UTC+9 本論文は、現実的な投資設定での株式ランキングとポートフォリオ構築のために、時間的Transformerとグラフアテンションネットワークを組み合わせ、NMI事前グラフとソフトしきい値スパーシフィケーションを導入したSTN-TGATモデルを提案し、実データでベンチマークを上回る成績を示した。
STN-TGATは時間的TransformerとGATを統合し、長期パターンと動的な株式間関係を捕捉。 NMIベースの事前グラフとソフトしきい値スパーシフィケーションでノイズ相関を抑制し、有益な接続を保持。 SUM:連合クラス増分学習のための時空間適応ベクトルに対する統一幾何手術 2026-07-23 13:00 UTC+9 本論文では、集約中に適応ベクトルに対して幾何手術を実行することで、連合クラス増分学習における空間的干渉と時間的干渉の両方を軽減し、追加のクライアント側計算や通信なしで最大22%の改善を達成するサーバーサイドフレームワークSUMを提案する。
連合クラス増分学習(FCIL)は空間的および時間的干渉が結合し、破滅的忘却を引き起こす。 SUMはFCILを統一マルチタスク学習問題として再解釈し、サーバー側で幾何手術を行う。 時系列予測における継続学習の説明可能性の課題 2026-07-23 13:00 UTC+9 本研究は、適応的時系列予測における継続学習の理解のための重要なツールとして説明可能性を調査する。経験再生戦略を用い、PatchMixer、PatchTST、DLinearなどのニューラル予測アーキテクチャを注意に基づくサンプリング機構で拡張して研究。注意展開やGrad-CAMなどの説明可能性手法を用いて、継続学習フレームワーク内での予測行動とサンプリング戦略を分析。実世界の地下水位時系列データを用いた実験により、非定常予測シナリオにおける説明可能性活用の課題と機会を明らかにする。
説明可能性が適応的時系列予測における継続学習の理解に役立つことを示す。 経験再生、注意展開、Grad-CAMなどの手法を採用。 Air Quality Arena: 時系列基盤モデルを用いた大気質予測のための大規模マルチリージョン地上監視データセットとベンチマーク 2026-07-23 13:00 UTC+9 大気汚染は年間約790万人の早期死亡を引き起こし、正確な予測は公衆衛生上の重要課題です。既存のベンチマークは地理的範囲や汚染物質のカバレッジが狭く、最新の時系列基盤モデル(TSFM)を実世界大規模データで評価していません。本研究では、7カ国・4大陸、6主要汚染物質、3年間、14,000以上の観測点-汚染物質系列をカバーする大規模マルチ国・マルチ汚染物質データセットとベンチマーク「Air Quality Arena(AQA)」を提案します。11の主要時系列基盤モデルと古典的ベースラインを評価した結果、TSFMはゼロショット予測で有効であり、古典的ベースラインを一貫して上回り、最良モデルは視覚基盤モデルを活用したクロスモーダルアーキテクチャを採用しています。AQAは公開されています。
AQAデータセットは7カ国4大陸、6主要汚染物質、3年間のデータを含み、14,000以上の観測点-汚染物質系列をカバー。 11の時系列基盤モデルと古典的ベースラインを短期大気質予測でベンチマーク。 CruiseBench:実飛行に合わせたN-CMAPSSエンジンRUL予測ベンチマーク 2026-07-23 13:00 UTC+9 CruiseBenchは航空機エンジンの残存寿命予測のための巡航段階ベンチマークであり、固定プロトコルによりN-CMAPSSデータセットを簡略化し、モデル比較の再現性を向上させる。
CruiseBenchはN-CMAPSSから巡航段階データを抽出し、運転状態の変動を低減する。 CPM-N-CMAPSSマスクは共通高度法で巡航区間を識別する。 モデル選択のためのベイズ風洞 2026-07-23 13:00 UTC+9 本研究は、トランスフォーマーがデータから正しい仮説クラスを特定するベイズモデル選択を実行できるかを調査する。制御された「ベイズ風洞」環境で、小型トランスフォーマーは関係タスクでほぼ最適な性能を示すが、算術タスクでは不透明記号で完全に失敗し、その境界は112倍のスケーリング後も持続する。最先端LLMは定性的なベイズ行動を示すが、較正に大きなギャップがある。
閉形式の真の事後確率を提供するモデル選択ベイズ風洞を導入。 280万パラメータのトランスフォーマーが不動点自由対合でベイズ最適と0.01ビットのエントロピー一致を達成。 入力依存の長い畳み込みによるネイティブ多次元二次未満演算子 2026-07-23 13:00 UTC+9 本論文では、暗黙的にパラメータ化された大域的・入力依存の多次元畳み込みカーネルを用いて、多次元データのネイティブな幾何構造に直接作用する二次未満・大域的・入力依存演算子HyenaNDを提案する。CUDA実装nSubQはFFT畳み込みパスを融合し、O(L log L)スケーリングを実用的な高速化に変換する。長文脈ゲノミクス、コンピュータビジョン、医用画像、PDEモデリングにおいて、純粋なHyenaNDスタックは強力な注意ベースラインに匹敵し、注意層とインターリーブしたハイブリッド構成は純粋な注意や強い再帰ハイブリッドを上回る。
HyenaNDは多次元データをラスタライズせずに直接処理し、空間構造を保存する。 暗黙的な大域的・入力依存畳み込みカーネルにより二次未満スケーリングを実現。 LLMエージェントのためのプロファイルグラフメモリ:ナラティブプロファイルによる暗黙的なクロスエンティティトラバーサル 2026-07-23 13:00 UTC+9 新しい論文では、マルチホップメモリベンチマークMemHopと、プロファイル拡張と圧縮残差を組み合わせた2層メモリアーキテクチャProGraphを提案し、LLMエージェントの長期記憶を改善。ProGraphはMemHopとLoCoMoの両方で既存手法を上回る結果を示した。
マルチホップメモリベンチマークMemHopを導入。1000の質問、10のソーシャルネットワークシナリオ、ホップ深さ1-5、証拠付き。 2層メモリアーキテクチャProGraphを提案:プロファイル拡張(暗黙的エンティティトラバーサル)と圧縮残差(ゼロコストで正確な詳細抽出)。 LISA: 効率的な長文脈推論のための線形インデックス付きスパース注意機構 2026-07-23 13:00 UTC+9 長い思考連鎖推論モデルにおける自己注意の二次複雑性問題に対処するため、本論文ではLISA(線形インデックス付きスパース注意)を提案する。これはプラグアンドプレイで動作し、線形注意とLightning Indexerを並列に統合し、ゲート機構で融合することで推論複雑性をO(n²)からO(nM)に削減する。DeepSeek蒸留Qwenモデルでの実験では、16Kトークンコンテキストで50%の推論高速化、AIMEやMATH-500などのベンチマークで平均5.6%の性能向上を達成した。
LISAは自己注意の複雑性をO(n²)からO(nM)(M << n)に低減。 線形注意(長距離記憶)とLightning Indexer(重要トークン選択)の並列コンポーネントを備える。 多目的生成型レコメンダシステムのための確率的原始双対デコーディング 2026-07-23 13:00 UTC+9 本論文では、自己回帰型生成レコメンダシステムを再学習することなく多目的スレート生成を可能にする、軽量な推論時デコーディング層を提案する。デコーディングをオンライン制約最適化問題として定式化し、確率的原始双対近似法を用いて関連性と補助目的(公平性など)のトレードオフを動的に調整する。制約違反と後悔に関する理論的保証を提供し、大規模オフライン実験と実システムでのオンラインA/Bテストにより、ユーザ満足度を犠牲にすることなく補助目的を1.8%改善するなど、一貫した多目的トレードオフの向上を示した。
再学習不要で生成レコメンダを多目的制約に対応させる軽量な推論時デコーディング層を提案。 確率的原始双対近似を用いて関連性と補助目的(例:公平性)のバランスをリアルタイムに調整。 大規模言語モデルにおける情報識別 2026-07-23 13:00 UTC+9 新しい研究により、大規模言語モデル(LLM)が外部情報を統合する際に重大な欠陥を持つことが明らかになった。信頼できる情報源とそうでないものの区別、および真実に向かって信念を更新する能力がほぼ偶然のレベルである。Learn2Discernフレームワークを用いて13のモデル、約67万回の試行でテストした結果、モデルは信頼性の2倍、情報源の人気に依存し、主張が正確性を向上させるか悪化させるかに関わらず同程度に更新することが示された。ユーザー調査(n=299)では、これらの欠陥が信頼と使用意図を低下させることが確認された。単純な推論時介入により、両方の識別能力を部分的に改善できる。
LLMは情報源と真実の識別においてほぼ偶然のレベル。 モデルは信頼性の2倍、情報源の人気に依存。 FormulaSPIN: 自然言語から表計算式生成のための自己対戦ファインチューニング 2026-07-23 13:00 UTC+9 FORMULASPINは、追加データなしで反復的自己改善を可能にする自己対戦フレームワークを提案。式の実行可能性を利用して矛盾する勾配を解決し、ExecVoteメカニズムで複数の有効な式を扱う。NL2FORMULAベンチマークで74.9%の完全一致、87.1%の実行精度を達成。
自己対戦フレームワークは教師ありファインチューニングの限界を突破し、追加データなしで自己改善を実現。 式の実行可能性を活用し、意味エラーとスタイルのバリエーションを分離して、元のSPINの矛盾する勾配問題を解決。 Intel TDX上でのNVIDIA H100における機密GPU推論のベンチマーク 2026-07-23 13:00 UTC+9 新しい研究では、Intel TDX環境下のNVIDIA H100 GPUで機密コンピューティングを有効にした場合の大規模言語モデル推論のパフォーマンスコストを評価。Mistral-7BとQwen3-30B-A3Bモデルを使用し、機密モードでは最初のトークンまでの時間が21.8%〜27.8%増加し、グローバルトークンスループットが17.7%〜21.1%低下した。大規模モデルはより早く飽和に達し、キャパシティ計画の調整が必要であることが示された。
機密コンピューティングはAI推論の実用的な要件になりつつあるが、パフォーマンスコストが生じる。 Intel TDX機密インスタンス内のH100 GPUで2つのLLMをテスト。 ハイブリッドLSTM-グラフニューラルフレームワークによる堅牢な金融詐欺検出と敵対的耐性 2026-07-23 13:00 UTC+9 本論文では、金融詐欺検出における極端なデータ不均衡(詐欺率0.13%)と進化する敵対的回避戦略に対処するため、LSTMネットワークと手作りのグラフトポロジー特徴を統合したハイブリッドフレームワークFraudShield AIを提案する。PageRank中心性、入度ダイナミクス、カスタムフロー比率などのネットワーク中心特徴を設計することで、システムは孤立したトランザクション分析からネットワークレベルのフォレンジックへと検出パラダイムをシフトする。クラス不均衡に対処するためにFocal Lossを、低額スマイミング攻撃に対する耐性を向上させるために動的しきい値メカニズムを導入する。PaySimデータセットでの実験評価では、提案モデルがロジスティック回帰やXGBoostベースラインを精度、再現率、F1スコアで大幅に上回り、特に検出が困難なマイクロトランザクション詐欺パターンで顕著な性能を示す。アブレーション研究により、時間的要素とトポロジー的要素の相補的な寄与が確認された。
FraudShield AIはLSTMとグラフトポロジー特徴を組み合わせ、ネットワークレベルでのフォレンジックを実現。 Focal Lossと動的しきい値でデータ不均衡と低額攻撃に対処。 FineServe: グローバルLLMサービングワークロードの細粒度データセットと特性評価 2026-07-23 13:00 UTC+9 大規模言語モデル(LLM)の常時オンラインサービス化に伴い、効率的なLLMサービングが重要な課題となっています。既存研究はプロキシトレースや粗粒度の特性評価に依存し、マルチモデルプラットフォームの多様性を捉えきれていません。FineServeは、グローバルな商業マーケットプレイスから収集した実環境のマルチモデルLLMサービングワークロードデータセットであり、異種モデルやタスクにわたる細粒度の特性評価を可能にします。到着ダイナミクスとトークン行動の分析により、モデルアーキテクチャ、規模、タスク意図に応じた変動パターンを明らかにし、構成可能なワークロード生成器を開発しました。
FineServeデータセットは、マルチモデルLLMサービングワークロードの細粒度データを提供します。 解析により、モデルアーキテクチャ、規模、タスク意図に応じた到着パターンとトークン消費の変動が明らかになりました。 AIは本当にデータパイプラインを構築できるのか?Apache SeaTunnel AI CLIを用いた7つの主要LLMの100タスクベンチマーク 2026-07-23 12:57 UTC+9 本稿では、Apache SeaTunnel AI CLIを用いて、7つの主要な大規模言語モデルを100のETLタスクで評価した階層型ベンチマークを紹介する。静的構成検証(L1)、CLIおよびルールベース検証(L2)、Docker化環境でのランタイム検証(L3)の3層検証フレームワークを採用。結果、静的検証の高パフォーマンスがランタイム成功率に直結しないことが示され、AI支援ETLの実用的評価の重要性を強調している。
ベンチマークは100のETLタスク(バッチ処理、CDC、複雑DAG等)を対象とし、静的検証、CLI検証、ランタイム検証の3層で実施。 静的検証の高スコアはランタイム成功を保証せず、AI生成構成の評価には実環境での実行検証が不可欠。 インディーゲームスタジオは生成AIを愛するはずなのに、なぜ25人の開発者が避けるのか? 2026-07-23 12:06 UTC+9 生成AIはゲーム開発の効率化とコスト削減を約束するが、多くのインディー開発者はこれに反対している。創造性の喪失、法的リスク、ジュニア職の消失、そして人間味の欠如を懸念している。一部の開発者はコーディングサポートとしての利用を認めるが、大半は否定的だ。
インディー開発者は生成AIが創造性や人間らしさを損なうと感じている。 AIがジュニアレベルの仕事を奪い、スキル習得を妨げるという懸念が広がっている。 NVIDIA AIスーパーコンピュータが海軍大学院で稼働開始 2026-07-23 11:00 UTC+9 NVIDIAの創業者兼CEOであるジェンセン・フアン氏は、カリフォルニア州モントレーの海軍大学院(NPS)でNVIDIA DGX GB300システムの稼働開始式を行い、世界で最も強力なAIプラットフォームの1つを1500人以上の学生と600人の教職員に提供しました。このシステムは、天気予報、サイバーセキュリティ、災害対応などの分野でのモデルトレーニングや推論に使用され、NPSとNVIDIAの協力関係の新たな節目となります。
ジェンセン・フアン氏が、米軍の旗艦大学院である海軍大学院でDGX GB300スーパーコンピュータの稼働開始式を行った。 このシステムは、天気予報、サイバーセキュリティ、災害対応などのNPSのAI研究を支援する。 ベンチマークは死んだ(少なくとも我々にとっては) 2026-07-23 09:34 UTC+9 Poetiq は、その再帰的自己改善(RSI)ループが、あらゆるタスクに対して最先端のハーネスを自動構築し、6つの多様なベンチマークで人間の介入なしにSOTAを達成したと発表した。同社は、静的ベンチマークは真に自己改善するAIシステムを評価するには不十分であり、トレーニングで攻略できない動的な「生きているベンチマーク」への移行を提唱している。
Poetiq のメタシステムはRSIループにより自動でベンチマーク用ハーネスを構築し、SOTAを達成。 ArXivMath、Haladir、ToolathlonなどのベンチマークでClaude Fable 5などの最先端モデルを凌駕。 Thomas Ptacekの引用 2026-07-23 08:59 UTC+9 Thomas Ptacekは、2025年のオープンウェイトモデルとペンテストハーネスを組み合わせれば、サンドボックスエスケープを行い、ほとんどのネットワークに侵入できると述べています。これは、OpenAIのサンドボックスがより堅牢であると想定しているから驚くのであって、実際にはそうではない可能性を示唆しています。
オープンウェイトモデルはペンテストに十分な能力を持つ サンドボックスエスケープが可能 米国エネルギー省:中小企業向けAI資金提供機会 2026-07-23 08:52 UTC+9 米国エネルギー省は、SBIR/STTRフェーズIで1000万ドルの資金提供を発表。創世記ミッションを支援する中小企業向けで、AI、量子、バイオテクノロジー、先端材料が対象。さらに約1.47億ドルのフェーズII機会も。
米国エネルギー省が中小企業向けにSBIR/STTR第1段階で1000万ドルの資金提供を開始。 創世記ミッションを支援し、バイオテクノロジー、量子システム、AI駆動の自動実験室、先端材料に焦点。 AIラボは「ペリカンマキシング」しているのか? 2026-07-23 08:01 UTC+9 Dylan Castillo氏が、7つのAIモデルが様々な動物と乗り物の組み合わせを描く能力を系統的にテストし、AIラボがSimon Willison氏の非公式ベンチマーク(ペリカンが自転車に乗る画像)に応じてモデルを意図的に訓練しているかどうかを調査した。結果は「ペリカンマキシング」の証拠は見られなかった。
8種類の動物×6種類の乗り物=48のプロンプトを7つのモデルで各3回テスト。 ペリカンが他の動物より上手に描かれているわけでも、自転車が他の乗り物より上手に描かれているわけでもない。 Cursor、Cursor Routerをリリース:リクエストレベル分類器で最先端のコーディング品質を30~50%低コストで実現 2026-07-23 07:37 UTC+9 Cursorは、Cursor RouterをTeamsおよびEnterpriseプランで一般提供開始しました。このシステムは、クエリ、コンテキスト、タスクの複雑さ、ドメインに基づいて各リクエストを分類し、最適なモデルにルーティングします。オンラインA/Bテストでは最先端品質を60%のコスト削減で達成し、3つの早期アクセスエンタープライズアカウントではOpus 4.8比で30~50%の削減を報告しています。
Cursor Routerは、クエリ、コンテキスト、タスクの複雑さ、ドメインを分析するリクエストレベル分類器です。 オンラインA/Bテストで60%のコスト削減で最先端品質を達成。エンタープライズアカウントでは30~50%削減。