私はAnthropicのClaude AIツールを全く異なる仕事に使っている:モデル、Code、Coworkの選び方
AnthropicのClaudeシリーズはチャットボット、コーディングエージェント、ワークフローエージェントを含む。Claude Codeはソフトウェア開発に特化し、Claude Coworkはコンピュータタスク全般を扱う。記事は自動車の比喩を用いてHaikuからMythosまでのモデルを説明し、エージェントが力の増幅器としての可能性と監視・セキュリティの重要性について議論する。
- Claude.aiはチャットボット、Claude Codeはコーディング、Claude Coworkはコンピュータタスク向け。
- モデルはHaikuからMythosまで自動車エンジンのように多様で、FableとMythosは強力すぎて禁止された。
CLIエージェントコーディングのためのClaude Code代替ツールベスト7
Claude Codeよりも安価で高速な7つの代替ツールを紹介。オープンソース、ローカルモデル、MCPサポート、優れたコンテキスト制御を備えています。
- OpenCode:オープンソース、マルチモデル、柔軟なワークフロー
- Pi:軽量、拡張可能、15以上のモデルプロバイダー
シニアPythonエンジニア – AIエージェント評価
Mindrift(Toloka AI)は、AIエージェント評価に特化したシニアソフトウェアエンジニアを募集しています。
- Mindrift(Toloka AI)がシニアソフトウェアエンジニアを募集
- 職務はAIエージェント評価に焦点
AI時代のインディーハッカー:ルネサンス、清算、あるいはその両方?
AIモデル間の議論では、AIネイティブツールがソロ創業者にとって終焉か新たな始まりかを探った。実行コストの崩壊は合意されたが、発見が鍵となる。コーディングに代わる堀として、人間関係と正規/ワークフロー埋め込みの2つの見解に分かれた。
- AIは構築コストを下げるが、ノイズも増やす。
- 開発よりも発見が主要なボトルネックになる。
AIスロップ:なぜ哲学ジャーナルはAIによる文章を拒否すべきか
著者はメタ認識論的観点から、哲学ジャーナルや書簡はAI生成テキストを拒否すべきだと論じる。人間専門家の語彙選択(たとえ微妙なものでも)は主題への深い感性を反映するが、LLMの出力はその専門性を曖昧にする。『クララとお日さま』の事例分析を通じて、AIによる書き換えが重要な哲学的ニュアンスを失わせることを示す。また、LLMを編集アシスタントとして適切に使用するためのガイドラインも提示する。
- 人間専門家の語彙選択はLLMの近似より優れており、主題への感性を反映する
- AI生成テキストを受動的に承認することと、自ら能動的に文言を構築することは認知的に異なる
Gigatoken:Rust製BPEトークナイザー、24.53 GB/sでテキストをエンコード、HuggingFace Tokenizers比989倍高速
Gigatokenはスタンフォード大学の博士課程学生Marcel Rød氏がMITライセンスで公開したRust製BPEトークナイザーで、144コアのAMD EPYC 9565上でGPT-2トークン化を24.53 GB/sで実行。HuggingFace tokenizers比989倍、tiktoken比681倍の高速化を達成。高速化の要因は、手書きのSWARプリトークナイザーとプリトークンキャッシュであり、BPEマージループの改善ではない。23のトークナイザーファミリーをサポートするが、SentencePiece語彙では7~22倍の高速化にとどまる。互換モードでは正確な出力を維持しつつ約200~300倍の高速化。
- Gigatokenは144コアEPYC上でGPT-2を24.53 GB/sで処理し、HuggingFace tokenizers比989倍、tiktoken比681倍の高速化。
- 高速化の要因は手書きSWARプリトークナイザーとプリトークンキャッシュによるもので、BPEマージループの改良ではない。
再帰的自己改善の経済学
Parker氏とTom氏を含む9人の経済学者が共同執筆した論文「再帰的自己改善の経済学」では、AIがAI研究開発を加速する仕組みを簡単なモデルで分析。RSIの定義の違い、フィードバック効果の強さが能力加速に与える影響、ラボがさらなるデータを公開すべき点などを論じている。
- RSIの定義は様々で、論文は技術的な使用を避け、フィードバックの強さと自己持続的加速に焦点を当てている。
- 能力加速はフィードバック効果の強さに依存し、アルゴリズム進歩の応答が最も不確実。
Show HN: Ours.network – AIエージェント同士を直接つなぐ
Ours.networkは、AIエージェントが人間の介入なしに直接通信できるツール「ours-mcp」を発表しました。インストール可能なMCPサーバーにより、ワンタイム招待状を使ってエージェントを接続し、手動でのコピー&ペーストを不要にします。エンドツーエンド暗号化、プライバシー保護のためのブラインドリレー、完全な人間による制御を特徴としています。現在は初期アルファ版で、ソースコードは公開されており、Claude CodeやCodexなどの異なるランタイム間でのエージェント間通信を目的としています。
- ours-mcpは、AIエージェント間の直接回線を確立し、人間がメッセージを中継する必要をなくします。
- セットアップは迅速で、MCPサーバーのインストール、招待状の生成、エージェントの接続まで約2分です。
AIチャットボットは感情サポートにおいて人間と同等以上に効果的である可能性
マンチェスター大学とダラム大学の研究により、AIチャットボットは日常的な感情サポートにおいて人間と同等か、場合によってはそれを上回ることが判明。特に怒りや恐怖の状況で効果が高く、具体的で実行可能なアドバイスが鍵であることが強調されている。
- AIチャットボットは怒りや恐怖の状況で人間より効果的であり、悲しみの状況では同等だった。
- 具体的で実行可能な提案(呼吸法、思考の再構成など)が感情の改善に重要。
妻のために作った、広告なしでファクトチェックとバイアス検出を行うニュースブリーフ
BeamWireは、メールとポッドキャストで毎日配信されるパーソナライズされた広告なしのニュースブリーフで、ファクトチェック、バイアス検出、カスタマイズ可能なトピックを備えています。様々な関心に応じたニュースや特集の「ビーム」、AIアンカー、トーンカスタマイズを提供します。料金は無料から始まります。
- BeamWireは、広告や偏りを排除した毎日厳選されたニュースブリーフをメールとポッドキャストで提供します。
- ユーザーは既成のビーム(トピック)を選択したり、カスタムビームを作成したりでき、AIアンカーやトーンのオプションもあります。
PyPI、14日以上経過したリリースへの新規ファイルアップロードを拒否
Python Package Index (PyPI) は、14日以上経過したリリースへの新規ファイルアップロードを拒否する新たなセキュリティ対策を導入しました。これは、公開トークンやワークフローの漏洩によるサプライチェーン攻撃を防ぐためのものです。
- PyPI は14日以上経過したリリースへの新規ファイルアップロードを拒否。
- 古い安定リリースが悪意のあるコードによって汚染されるのを防ぐ。
AIエージェントのアクションに対する公開検証可能なレシート(Bitcoinにアンカー)
Orphograph は、AIエージェントの重要なアクションごとに Bitcoin ブロックチェーンにアンカーされたレシートを生成し、記録の存在時刻と改ざん防止を証明します。検証にはオペレーターへの信頼は不要です。
- 自己報告ログは後から編集可能なため証拠として不十分。
- アクション記録のハッシュを Bitcoin ブロックチェーンにアンカーすることで、タイムスタンプと改ざん防止を実現。
Show HN: Searchdesk — AIを活用した求人検索、履歴書とカバーレターを自動調整
Searchdeskは、実際の求人をリサーチし、事実に基づいた応募書類を作成し、すべての機会をプライベートワークスペースで管理するAI搭載の求人検索ツールです。ユーザーはすべてのドラフトを確認でき、自動応募は行われません。現在アルファ版で、フィードバックを募集中です。
- 公開求人をリサーチし、ユーザーの情報に基づいて履歴書とカバーレターをカスタマイズ。
- ユーザーが最終判断を下し、AIが自動で応募することはありません。
EgoRecovery:人間のリカバリデモンストレーションによる障害復旧能力の獲得
本論文では、人間の一人称視点ビデオを利用してロボットの障害復旧ポリシーを訓練するEgoRecoveryフレームワークを提案。従来の遠隔操作と比較して10倍以上のデータ収集効率を実現し、共訓練により人間の修正意図をロボット動作に整合させる。
- ロボットの障害復旧には大量のリカバリデータが必要だが、遠隔操作による収集はコストが高くスケーラビリティに乏しい。
- 人間の一人称視点ビデオは、遠隔操作と比較して1時間あたり10倍以上の有効なリカバリデータを生成できる。
Morphing MILR:複雑な環境での機動を実現するケーブル駆動無脚ロボットの設計と制御
研究者らは、Morphing MILRと呼ばれるケーブル駆動の無脚ロボットを発表した。このロボットは、回転関節によって身体の形態とコンプライアンスを再構成し、横方向波状運動、サイドワインディング、回転、ねじれなど複数の移動モードを実現する。分散型ケーブル駆動とプログラム可能な受動的コンプライアンスにより、複雑なセンシングを必要とせず、堅牢な移動が可能。応用先として、捜索救助、環境モニタリング、点検などが挙げられる。
- ケーブル駆動無脚ロボットが回転関節により複数の歩容を実現。
- プログラム可能な受動的コンプライアンスにより、地形知識なしでの堅牢な移動が可能。
エアリアル物理インタラクションのための接触持続全駆動
研究者らは、ドローンが物理接触を行う際の能力を評価するための「接触持続全駆動」という制御理論フレームワークを提案した。残差ワンチセットと残差権限マージンといった概念を導入し、従来のランク条件に基づく全駆動認定を強化する。傾斜ヘキサローターを用いた数値評価では、行フルランクだけでは接触操作が不可能であり、適度な傾斜角が残差権限を保持することが示された。
- 接触持続全駆動の概念を導入し、残差権限マージンと残差ワンチセットを定義。
- 接触持続全駆動は、タスクワンチが制約付き実現可能ワンチ多面体の内部にあることと等価であることを証明。
小型無人航空機システム向けリモートIDスプーフィング対応軌道計画
本論文は、リモート識別(RID)の位置スプーフィング攻撃下で動作する小型無人航空機システム向けの分散型でスプーフィング対応の軌道計画フレームワークを提案する。従来の計画手法がRIDブロードキャストを信頼するのに対し、提案手法はRID情報を未検証として扱い、物理層観測(受信信号強度)を用いてスプーフィングを検出し確率的に攻撃元を特定する。不確実性は確率制約を用いてリスク境界付きの危険領域に変換され、エージェントごとのマルコフ決定過程プランナーに統合される。複数機による荷物配送シナリオのシミュレーションでは、RIDデータを信頼するプランナーと比較してニアミス衝突事象が減少し、リアルタイム実行に適した計算効率が示された。
- RIDスプーフィングを明示的に考慮する分散型フレームワーク
- RSS測定値を用いてスプーフィングを検出・位置特定
LENS: LLMによる雑然環境の簡略化手法—プランニングと制御のための
汎用ロボット操作の進歩にもかかわらず、実世界の複数物体が散乱する環境は依然として困難です。LENSはプラグアンドプレイの修正として、LLMを用いてシーン固有の抽象表現を自動生成し、エンティティのマージやプルーニングによりタスクに適応させ、さまざまな操作手法の性能を向上させます。
- LENSは手動のエンジニアリングなしで動的かつタスクに関連したシーン抽象を自動生成。
- エンティティのマージ(例:積み重ねられた物体)やプルーニング(例:遠方の物体)により環境を簡略化。
触覚的人間ロボット共有制御のためのパーソナライズされた安全介入の学習
スパースなデモンストレーションからユーザーが好む安全介入を学習するLearning from Haptics (LfH)フレームワークを提案。微分可能な制御バリア関数(CBF)最適化層を用いて安全パラメータを自動調整し、シミュレーションおよびハードウェア実験で有効性を確認。
- 既存の触覚ガイダンスシステムは事前定義された戦略を用いており、個人の安全選好に適応できない。
- 提案手法はスパースなデモンストレーションから微分可能CBF最適化層を用いて学習する。
ミロ:完全自律型屋内・屋外用ロボット盲導犬
視覚障がい者は盲導犬に依存しているが、盲導犬は高額で入手が困難。ミロ(Milo)はUnitree Go2をベースにした低コスト(約2,000ドル)の完全自律型ロボット盲導犬プラットフォームで、事前の環境情報なしで屋内・屋外を航行可能。
- 従来の盲導犬は約5万ドルと高額で、待機期間が長い。
- ミロは約2,000ドルと低コストで、オープンソースとして公開。
実世界の冬期運転シナリオにおける衝突回避のための創発的な自律ドリフト
本研究では、実世界の冬期運転条件において、いつドリフトが安全上の最適解となるかを探求する。研究チームは、衝突死亡データに基づくシナリオを対象とした、ドリフト可能な非線形モデル予測制御(MPC)システムを提案し、高忠実度シミュレータで試験した。コントローラは後輪が氷上に乗った際に自然にドリフトを開始・維持し、車線に滑り込んだ対向車を回避する。電子安定性制御(ESC)システムとの比較により、ドリフト可能なコントローラは安定性と制御性をトレードオフし、危険な冬期シナリオで精密な操縦を実現する。モンテカルロシミュレーションでは、複数の速度でドリフトコントローラがESCより低い中央車線誤差を達成し、高速でドリフトが主に創発することが示された。
- 冬期衝突回避のためのドリフト可能な非線形MPCシステムを提案
- シミュレーションにおいて、後輪の氷上走行や対向車の車線侵入時に自律的にドリフトを実行
ModPack: 双腕移動操作のための拡張可能な遠隔操作インターフェース
既存の遠隔操作システムは特定のロボットハードウェアやタスク領域に最適化されており、拡張性と適応性に限界がある。ModPackは、計算、電源、通信、ストレージを統合したウェアラブル「バックパック」を中核とするモジュール式で拡張可能な遠隔操作システムを提案する。触覚フィードバック付き関節レベル遠隔操作、移動操作、能動的知覚などのプラグアンドプレイモジュールをサポートし、2つの異なるロボットプラットフォームでの実験により、データ収集とポリシー学習のための柔軟で再利用可能なフレームワークを実証した。完全なハードウェア設計とソフトウェアスタックはオープンソース化されている。
- 計算、電源、通信、ストレージを統合したウェアラブルバックパックが中核の統一インターフェースとして機能する。
- プラグアンドプレイモジュールにより、触覚フィードバック、移動操作、能動的知覚が可能。
深層弱教師あり画像分割のための統一変分フレームワーク
スパースなピクセルレベルの教師信号を用いた画像分割のための統一変分フレームワークを提案。シンプレックス拘束付きPottsモデルと滑らかな周長正則化子を用い、凸で滑らかなエネルギー汎関数を得る。これは弱教師あり深層学習の損失関数として使用可能。RKHSでの関数拡張によりファジィメンバーシップ関数を構築し、不均一な強度統計を捉える。実験では、部分クロスエントロピー法などのベースラインを上回るロバストな改善を示した。
- スパースなピクセルレベルの教師信号のための統一変分フレームワーク
- シンプレックス拘束付きPottsモデルと滑らかな周長正則化
心エコー図におけるドメインシフト:データセット間の左心室セグメンテーションの解釈可能な定量化と予測
6つの心エコーデータセットを用いた研究により、左心室セグメンテーションにおけるドメインシフトの主因は音響特性ではなく視野とフレーミングの不一致であることが判明。幾何学的前処理により転移性能が向上し、表現固有の距離指標を用いて高精度に性能低下を予測できる。
- 幾何学的前処理は視野とフレーミングの違いによるドメインシフトを軽減する。
- マスク不要の転移リスク監視は非LV特徴で約70%の説明力を達成。
前立腺組織病理学における病理学者の注意アライメントを考慮したレポート生成
病理学者の視覚的注意をレポート生成モデルのトレーニングに導入し、121件の前立腺WSIからなるマルチモーダル注意データセットを収集。注意アライメント損失で2つのモデルを微調整し、NLP指標で平均10.9%、5つの臨床関連レポート成分で19.3%の精度向上を達成。
- 121件の前立腺WSIにおける病理学者のマルチスケール視野軌跡、口頭説明、カーソル移動を含むマルチモーダルデータセットを収集
- 注意アライメント損失を用いて2つのレポート生成モデルを微調整し、モデルの注意を病理学者の注意分布に一致させる
EGRNet:エッジゲート洗練と敵対的センシングを用いた軽量セマンティックセグメンテーションネットワーク
本論文では、都市シナリオにおけるリアルタイムセマンティックセグメンテーションのために設計された軽量深層学習モデルEGRNetを提案する。わずか0.46MのパラメータでCityscapesデータセット上で65.28%のmIoUを達成し、深度分離可能畳み込み、拡張残差ブロック、新規のエッジゲート洗練(EGR)モジュール、および軽量な敵対的攻撃検出戦略を組み込んでいる。
- EGRNetは0.46MパラメータでCityscapes上で65.28% mIoUを達成
- 新規のエッジゲート洗練(EGR)モジュールが特徴を適応的に融合し境界保存を強化
VQ-Transplant: 事前学習済みビジュアルトークナイザのための効率的なVQモジュール統合
VQ-Transplantは、新しいベクトル量子化モジュールを凍結済みの事前学習済みトークナイザにプラグアンドプレイで統合する軽量フレームワークを提案する。ImageNet-1kでわずか5エポック学習する軽量デコーダ適応戦略により量子化ミスマッチを緩和し、VARなどの産業レベルのモデルで最先端に近い再構成品質を達成しながら、トレーニングコストを95%削減する。これにより量子化研究の民主化が進み、リソース制約下でも新しいVQ技術の探索が可能になる。
- エンコーダ・デコーダを再学習せずにVQモジュールを交換可能。
- ImageNet-1kで5エポックのみの軽量デコーダ適応。
ChronoStitch:長期間の時間的推論のための訓練不要なビジュアルKVメモリの構成
本論文では、長尺動画の質問応答における時間的推論を可能にするため、独立して保存されたビジュアルKVメモリを構成する訓練不要の手法ChronoStitchを提案する。保存されたポストロータリーキーをグローバルな3軸マルチモーダルRoPE座標系に再ベースし、高偏差のビジュアルトークンを選択的に再計算することで、単純な結合による時間位相の衝突と内容のギャップを克服する。Qwen2.5-VL-3BおよびTempCompassの時間的分割における実験では、イベント順序付けの精度が向上し、完全なジョイント再プリフィルと比較して3.3倍の高速化を達成した。
- 長尺動画QAでは時間経過に伴う視覚証拠の保存が必要であり、KVキャッシュは実用的だが単純な結合ではグローバルな順序が失われる。
- ChronoStitchはキーをグローバルなRoPE座標系に再ベースし、高偏差のトークンを選択的に再計算することで訓練不要の構成を実現する。
合成および派生トレーニング画像を用いたキャンパス廃棄物検出:YOLOv8nによるマルチシード評価
本研究では、合成画像および派生画像がYOLOv8n検出器の性能向上に寄与するかを評価した。148枚のキャンパス写真からなる実データセットを用いた実験では、すべての合成拡張構成が実画像のみのベースライン(平均[email protected]: 0.691)を超えられなかった。手と前腕の複合実験はテストセットの汚染により無効となり、再構築後も有意な効果は見られなかった。テストセットの規模が小さいため、結論には限界がある。
- 実画像のみのYOLOv8nモデルは平均[email protected]が0.691であり、合成データ構成はいずれもこのベースラインを超えられなかった。
- 背景置換、孤立物体画像、完全拡張プールはいずれも検出精度を低下させた。
D3VL:言語モデルを用いた3D時系列データとビデオからの運転シーン理解
本論文は、2Dおよび3D時系列データを統合する新しいマルチモーダル大規模言語モデルフレームワークD3VLを提案し、KITTI QAデータセットでベースライン比11%向上、多様な運転条件をカバーするWaymo QA拡張データセットも導入する。
- D3VLは2Dと3D時系列データを単一アーキテクチャに統合した初のMLLMフレームワーク。
- KITTI質問応答データセットで11%の性能向上。
Crowd4D:シーン認識型単眼4D群衆再構築
Crowd4Dは、単眼RGBビデオから群衆とシーンを共同最適化する初のシーン認識型4D群衆再構築フレームワークである。人-シーン相互作用プロキシ(HSIP)を導入してスケールと位置の整合を解決し、群衆構造コヒーレンス正則化(CSCR)により遮蔽下での時間的安定性を向上させ、複雑な大規模シーンで既存手法を凌駕する。
- 単眼4D再構築で群衆とシーンを共同最適化する初のフレームワーク。
- 人-シーン相互作用プロキシ(HSIP)を中間表現として導入。
早期に検出、稀にエスカレーション:圧縮ビットストリームからのAI生成ビデオの随時検出
本論文は、ピクセルにデコードする代わりに圧縮ビットストリームを分析することで、AI生成ビデオをリアルタイムで検出する新しいアプローチを提案します。コーデックがすでに書き込んだモーションフィールドを利用したストリーミング知覚フレームワークを導入し、単一の調整済み閾値で随時検出を可能にします。この手法はGenVidBenchで0.64のAUCを達成し、ピクセルベースCNNよりも5桁少ない計算量で動作し、15%のクリップを延期することで精度を0.75から0.78に向上させ、計算量を7倍削減します。
- AIビデオ検出を圧縮ビットストリームからのストリーミング知覚として再定義
- コーデックのモーションフィールドを利用し、ピクセルデコードではなくパースのみで動作
依存関係グラフと近接特徴を用いた歴史新聞からの軽量な人物-場所関係抽出
HIPE-2026共有タスクでは、多言語歴史新聞からの人物-場所関係抽出が新たな評価トラックとして導入された。DS@GT HIPEチームは、事前学習言語モデルを使用せずに軽量で解釈可能なシステムの性能限界を調査した。依存関係解析から文書レベルのグラフを構築し、近接性と品詞の特徴を抽出、小型のscikit-learnアンサンブルまたはコンパクトなグラフ注意ネットワーク(パラメータ数847K未満)で分類。公式評価では、最高実行でマクロ再現率0.5142を達成、効率性で3位、精度で中位だった。主な知見:最小文字距離が信号の大部分を捉え、追加の工学的特徴は一貫性のない利益をもたらすこと、文書グループ化交差検証がデータ漏洩防止に不可欠であること。
- 事前学習言語モデルなしの軽量アプローチ、847Kパラメータ未満。
- 最小文字距離が主要信号、追加特徴は不安定な利益。
SLPO:サロゲートポリシーによる潜在推論のスケーリング
強化学習は明示的Chain-of-Thought推論器でテスト時スケーリングを実現したが、計算コストが高い。潜在推論は連続ベクトルで中間計算を行い、効率的だが模倣学習に留まる。本論文では、サロゲート潜在ポリシー最適化(SLPO)を提案し、軌跡レベルのクレジット割り当てのためのサロゲートポリシー密度と可変ホライゾンポリシーに洗練される正解監視停止ヘッドを介して、自己回帰潜在推論器に結果報酬RLをもたらす。SLPOは並列サンプリングでPass@kを向上させ、難しいインスタンスにより長い潜在計算を割り当てる。
- 潜在推論は効率的だが結果報酬RLの訓練が不足。
- SLPOはサロゲートポリシー密度と停止ヘッドにより潜在推論器の結果報酬最適化を実現。
マルチマスク拡散言語モデルによる少数ステップ生成
マスク拡散モデル(MDM)の少数ステップ生成における終端エントロピー欠如問題に対し、複数のマスク状態を導入したマルチマスク拡散モデル(MultiMDM)を提案し、高品質な少数ステップテキスト生成を実現。
- 従来のMDMは全前方軌跡が単一全マスク状態に収束し、少数ステップ生成に必要な終端エントロピーが不足。
- MultiMDMは各クリーントークンを指定マスクへ押し出し、その後マスク集合上で混合することで、逆過程に下書き能力を付与。
オープンエンドな質問応答における推論の参照不要評価
LLM生成の推論過程をセグメントに分解し、NLIとハイパーグラフを用いて監査する参照不要フレームワークを提案。数学と医療の推論タスクでLLM判定より高信頼性を示す。
- 推論トレースをセグメント化し、NLIで前提-目標関係をラベル付け
- 臨床症例からのLLM推論ベンチマークUroReasonを新規構築
適応的降伏:脆弱性コンテキストにおけるLLM応答の構造的障害モード
新しい論文は、「適応的降伏」と呼ばれるLLMの障害モードを特定しました。これは、モデルがユーザーの感じる社会的不公正を最初に認め、その後、名目上は推奨していない獲得を詳細に促進するというものです。この研究は、3つの商用LLMに対して900セッションのテストを実施し、最小再帰属十分性(MRS)を設計原則として提案しています。
- 感情的に敏感なコンテキストにおけるLLM応答の構造的三重苦を説明
- 「適応的降伏」という未記録の障害モードを特定
タスク能力は指示追従ではない:小規模言語モデルにおける指示競合行動の評価
小規模言語モデルはタスク能力が高い一方で、指示が標準的なタスク行動と競合する場合、非標準指示を無視する傾向があることが示された。モデル規模が大きくなると標準精度と指示追従能力は向上するが、両者のギャップは依然として存在する。タスク完遂能力と指示追従は別個の能力であることが証明された。
- 小規模モデルは競合指示下でもタスク正解率を維持するが、非標準指示をしばしば無視する。
- 大規模モデルでは標準指示と非標準指示の性能に明確な差が見られる。
大規模言語モデルにおけるハイパーネットワークベースの知識注入のスケーリング法則
研究者らは、ハイパーネットワークを用いた学習時知識注入を大規模言語モデルに適用し、ハイパーネットワークアーキテクチャのスケーリング挙動を初めて体系的に調査した。実験では、損失、推論精度、OOD汎化において冪乗則スケーリングが確認され、規模拡大に伴いOOD汎化が信頼性を増し、LoRAや完全ファインチューニングを上回る性能を示した。また、数千万のマルチホップQAサンプルを含むMegaWikiQAデータセットを構築した。
- ハイパーネットワークは訓練時に固定LoRAアダプタを生成し、対象モデルに知識を注入できる。
- 注入容量と対象モデルの汎用能力を分離する設計により、スケーリング法則の厳密な研究が可能に。
構造的一般化の計算複雑性について
本論文は構造的一般化を初めて形式的に定義し、標準的な計算複雑性の仮定の下で、純粋なTransformerは構造的一般化を学習できず、ニューロシンボリックシステムが意味投影をハードコードすることで高得点を達成することを示す。
- 構造的一般化の形式的な数学的定義を提供し、構成構造と非有界一般化を数学言語に変換する。
- 純粋なTransformerの学習可能な上限はTC0であり、構造的一般化にはNC1が必要であるため学習不可能であることを証明。
推論が手を狭める:LLMゲームプレイにおける多様性の崩壊
研究により、教師ありファインチューニング(SFT)が大規模言語モデルを下流タスクに適応させる際、特に逐次的意思決定において行動の多様性を著しく低下させることが明らかになった。三目並べの変種などの確定論的ボードゲームを用いた制御実験を通じて、著者らは推論モードの生成がしばしば行動の多様性を抑制し、標準的なSFTは精度向上に必要以上に早期の多様性崩壊を引き起こすことを示した。行動拡張(各状態におけるすべての最適行動を訓練する)はこの効果を部分的に緩和する。
- 教師ありファインチューニング(SFT)はLLMの意思決定において早期に行動の多様性を失わせる。
- 推論モードの生成は必ずしも精度を向上させずに行動の多様性を抑制する。
マルチターンLLMシステムのためのステートフルガードレール:会話リスク蓄積フレームワーク
既存の大規模言語モデル(LLM)の安全ガードレールは各プロンプトと応答のペアを個別に評価するため、会話中に無害なターンが蓄積して害を生じる失敗を見逃します。本論文では、会話リスク蓄積(CRA)の概念と、セマンティックドリフト、感度重み付き情報蓄積グラフ、コンプライアンス勾配を追跡するセッション層フレームワークを提案します。CRA-Benchベンチマークと評価プロトコルも公開します。
- 意図のドリフト、禁止命令の断片的組み立て、感度蓄積からなる会話リスク蓄積(CRA)を定義。
- セマンティックドリフト、情報蓄積グラフ、コンプライアンス勾配を追跡するセッション層フレームワークを提案。
2次元中性子束推定のためのニューラルオペレーターサロゲート
この研究は1次元の単一スイープニューラルオペレーター研究を2次元に拡張し、フーリエニューラルオペレーター(FNO)とU字型ニューラルオペレーター(UNO)を使用して高忠実度スカラー束を近似します。3つのサロゲート(FNO直接マッピング、UNO直接マッピング、単一スイープ近似を追加入力とするFNO)を調査。3つのランダムシードで訓練し、変動性を評価。単一スイープ入力と対数束訓練が精度を向上させるかどうかを検討。
- 1次元ニューラルオペレーター法の2次元中性子束推定への拡張
- FNOとUNOの直接マッピングサロゲートの比較
非構造メッシュ上のカオス力学のスケール認識学習:ビン分割スペクトル損失による
本研究は、非構造メッシュ上のサロゲートモデリングのためのビン分割スペクトル損失関数を拡張し、フーリエバンドをグラフラプラシアン周波数バンドに置き換え、スケーラブルなチェビシェフ多項式フィルタとマルチレベル近似を導入することで、長期的なロールアウトの忠実度を向上させる。結果は、非構造メッシュ上の乱流予測において、決定論的ベースラインよりも優れていることを示している。
- グラフラプラシアンに基づくビン分割スペクトル損失により、不規則グリッド上のスケール認識学習が可能に。
- チェビシェフ多項式フィルタとGLEAMは、完全なスペクトル分解のスケーラブルな代替を提供する。
速く構築し、ゆっくり評価:パイプライン選択が自動解釈可能性スコアの分散を支配する
この研究は、スパースオートエンコーダの自動解釈可能性スコアがアーキテクチャの違いよりも評価パイプラインの選択によって大きく左右されることを示し、論文間の比較がパイプラインの違いを反映する可能性があると指摘する。
- 方法論的分散はすべての指標とモデルでアーキテクチャ的分散を上回る
- 検出指標が最も安定で、ファジングは信頼性が低い
STN-TGAT: 事前誘導グラフアテンションと学習可能なソフトしきい値スパーシフィケーションによるトップKポートフォリオ構築
本論文は、現実的な投資設定での株式ランキングとポートフォリオ構築のために、時間的Transformerとグラフアテンションネットワークを組み合わせ、NMI事前グラフとソフトしきい値スパーシフィケーションを導入したSTN-TGATモデルを提案し、実データでベンチマークを上回る成績を示した。
- STN-TGATは時間的TransformerとGATを統合し、長期パターンと動的な株式間関係を捕捉。
- NMIベースの事前グラフとソフトしきい値スパーシフィケーションでノイズ相関を抑制し、有益な接続を保持。
SUM:連合クラス増分学習のための時空間適応ベクトルに対する統一幾何手術
本論文では、集約中に適応ベクトルに対して幾何手術を実行することで、連合クラス増分学習における空間的干渉と時間的干渉の両方を軽減し、追加のクライアント側計算や通信なしで最大22%の改善を達成するサーバーサイドフレームワークSUMを提案する。
- 連合クラス増分学習(FCIL)は空間的および時間的干渉が結合し、破滅的忘却を引き起こす。
- SUMはFCILを統一マルチタスク学習問題として再解釈し、サーバー側で幾何手術を行う。
時系列予測における継続学習の説明可能性の課題
本研究は、適応的時系列予測における継続学習の理解のための重要なツールとして説明可能性を調査する。経験再生戦略を用い、PatchMixer、PatchTST、DLinearなどのニューラル予測アーキテクチャを注意に基づくサンプリング機構で拡張して研究。注意展開やGrad-CAMなどの説明可能性手法を用いて、継続学習フレームワーク内での予測行動とサンプリング戦略を分析。実世界の地下水位時系列データを用いた実験により、非定常予測シナリオにおける説明可能性活用の課題と機会を明らかにする。
- 説明可能性が適応的時系列予測における継続学習の理解に役立つことを示す。
- 経験再生、注意展開、Grad-CAMなどの手法を採用。
Air Quality Arena: 時系列基盤モデルを用いた大気質予測のための大規模マルチリージョン地上監視データセットとベンチマーク
大気汚染は年間約790万人の早期死亡を引き起こし、正確な予測は公衆衛生上の重要課題です。既存のベンチマークは地理的範囲や汚染物質のカバレッジが狭く、最新の時系列基盤モデル(TSFM)を実世界大規模データで評価していません。本研究では、7カ国・4大陸、6主要汚染物質、3年間、14,000以上の観測点-汚染物質系列をカバーする大規模マルチ国・マルチ汚染物質データセットとベンチマーク「Air Quality Arena(AQA)」を提案します。11の主要時系列基盤モデルと古典的ベースラインを評価した結果、TSFMはゼロショット予測で有効であり、古典的ベースラインを一貫して上回り、最良モデルは視覚基盤モデルを活用したクロスモーダルアーキテクチャを採用しています。AQAは公開されています。
- AQAデータセットは7カ国4大陸、6主要汚染物質、3年間のデータを含み、14,000以上の観測点-汚染物質系列をカバー。
- 11の時系列基盤モデルと古典的ベースラインを短期大気質予測でベンチマーク。
CruiseBench:実飛行に合わせたN-CMAPSSエンジンRUL予測ベンチマーク
CruiseBenchは航空機エンジンの残存寿命予測のための巡航段階ベンチマークであり、固定プロトコルによりN-CMAPSSデータセットを簡略化し、モデル比較の再現性を向上させる。
- CruiseBenchはN-CMAPSSから巡航段階データを抽出し、運転状態の変動を低減する。
- CPM-N-CMAPSSマスクは共通高度法で巡航区間を識別する。