シニアPythonエンジニア – AIエージェント評価
Mindrift(Toloka AI)は、AIエージェント評価に特化したシニアソフトウェアエンジニアを募集しています。
- Mindrift(Toloka AI)がシニアソフトウェアエンジニアを募集
- 職務はAIエージェント評価に焦点
トピック別ストリーム
研究動向は次の製品能力とインフラ需要を示します。ここでは論文、ベンチマーク、データセット、実験システム、研究機関の発表、オープンな再現を追跡し、モデル学習や Agent、ロボット、開発者ツールへの影響を見ます。
Mindrift(Toloka AI)は、AIエージェント評価に特化したシニアソフトウェアエンジニアを募集しています。
AIモデル間の議論では、AIネイティブツールがソロ創業者にとって終焉か新たな始まりかを探った。実行コストの崩壊は合意されたが、発見が鍵となる。コーディングに代わる堀として、人間関係と正規/ワークフロー埋め込みの2つの見解に分かれた。
著者はメタ認識論的観点から、哲学ジャーナルや書簡はAI生成テキストを拒否すべきだと論じる。人間専門家の語彙選択(たとえ微妙なものでも)は主題への深い感性を反映するが、LLMの出力はその専門性を曖昧にする。『クララとお日さま』の事例分析を通じて、AIによる書き換えが重要な哲学的ニュアンスを失わせることを示す。また、LLMを編集アシスタントとして適切に使用するためのガイドラインも提示する。
Gigatokenはスタンフォード大学の博士課程学生Marcel Rød氏がMITライセンスで公開したRust製BPEトークナイザーで、144コアのAMD EPYC 9565上でGPT-2トークン化を24.53 GB/sで実行。HuggingFace tokenizers比989倍、tiktoken比681倍の高速化を達成。高速化の要因は、手書きのSWARプリトークナイザーとプリトークンキャッシュであり、BPEマージループの改善ではない。23のトークナイザーファミリーをサポートするが、SentencePiece語彙では7~22倍の高速化にとどまる。互換モードでは正確な出力を維持しつつ約200~300倍の高速化。
Parker氏とTom氏を含む9人の経済学者が共同執筆した論文「再帰的自己改善の経済学」では、AIがAI研究開発を加速する仕組みを簡単なモデルで分析。RSIの定義の違い、フィードバック効果の強さが能力加速に与える影響、ラボがさらなるデータを公開すべき点などを論じている。
Ours.networkは、AIエージェントが人間の介入なしに直接通信できるツール「ours-mcp」を発表しました。インストール可能なMCPサーバーにより、ワンタイム招待状を使ってエージェントを接続し、手動でのコピー&ペーストを不要にします。エンドツーエンド暗号化、プライバシー保護のためのブラインドリレー、完全な人間による制御を特徴としています。現在は初期アルファ版で、ソースコードは公開されており、Claude CodeやCodexなどの異なるランタイム間でのエージェント間通信を目的としています。
マンチェスター大学とダラム大学の研究により、AIチャットボットは日常的な感情サポートにおいて人間と同等か、場合によってはそれを上回ることが判明。特に怒りや恐怖の状況で効果が高く、具体的で実行可能なアドバイスが鍵であることが強調されている。
BeamWireは、メールとポッドキャストで毎日配信されるパーソナライズされた広告なしのニュースブリーフで、ファクトチェック、バイアス検出、カスタマイズ可能なトピックを備えています。様々な関心に応じたニュースや特集の「ビーム」、AIアンカー、トーンカスタマイズを提供します。料金は無料から始まります。
Python Package Index (PyPI) は、14日以上経過したリリースへの新規ファイルアップロードを拒否する新たなセキュリティ対策を導入しました。これは、公開トークンやワークフローの漏洩によるサプライチェーン攻撃を防ぐためのものです。
Orphograph は、AIエージェントの重要なアクションごとに Bitcoin ブロックチェーンにアンカーされたレシートを生成し、記録の存在時刻と改ざん防止を証明します。検証にはオペレーターへの信頼は不要です。
Searchdeskは、実際の求人をリサーチし、事実に基づいた応募書類を作成し、すべての機会をプライベートワークスペースで管理するAI搭載の求人検索ツールです。ユーザーはすべてのドラフトを確認でき、自動応募は行われません。現在アルファ版で、フィードバックを募集中です。
本論文では、人間の一人称視点ビデオを利用してロボットの障害復旧ポリシーを訓練するEgoRecoveryフレームワークを提案。従来の遠隔操作と比較して10倍以上のデータ収集効率を実現し、共訓練により人間の修正意図をロボット動作に整合させる。
研究者らは、Morphing MILRと呼ばれるケーブル駆動の無脚ロボットを発表した。このロボットは、回転関節によって身体の形態とコンプライアンスを再構成し、横方向波状運動、サイドワインディング、回転、ねじれなど複数の移動モードを実現する。分散型ケーブル駆動とプログラム可能な受動的コンプライアンスにより、複雑なセンシングを必要とせず、堅牢な移動が可能。応用先として、捜索救助、環境モニタリング、点検などが挙げられる。
研究者らは、ドローンが物理接触を行う際の能力を評価するための「接触持続全駆動」という制御理論フレームワークを提案した。残差ワンチセットと残差権限マージンといった概念を導入し、従来のランク条件に基づく全駆動認定を強化する。傾斜ヘキサローターを用いた数値評価では、行フルランクだけでは接触操作が不可能であり、適度な傾斜角が残差権限を保持することが示された。
本論文は、リモート識別(RID)の位置スプーフィング攻撃下で動作する小型無人航空機システム向けの分散型でスプーフィング対応の軌道計画フレームワークを提案する。従来の計画手法がRIDブロードキャストを信頼するのに対し、提案手法はRID情報を未検証として扱い、物理層観測(受信信号強度)を用いてスプーフィングを検出し確率的に攻撃元を特定する。不確実性は確率制約を用いてリスク境界付きの危険領域に変換され、エージェントごとのマルコフ決定過程プランナーに統合される。複数機による荷物配送シナリオのシミュレーションでは、RIDデータを信頼するプランナーと比較してニアミス衝突事象が減少し、リアルタイム実行に適した計算効率が示された。
汎用ロボット操作の進歩にもかかわらず、実世界の複数物体が散乱する環境は依然として困難です。LENSはプラグアンドプレイの修正として、LLMを用いてシーン固有の抽象表現を自動生成し、エンティティのマージやプルーニングによりタスクに適応させ、さまざまな操作手法の性能を向上させます。
スパースなデモンストレーションからユーザーが好む安全介入を学習するLearning from Haptics (LfH)フレームワークを提案。微分可能な制御バリア関数(CBF)最適化層を用いて安全パラメータを自動調整し、シミュレーションおよびハードウェア実験で有効性を確認。
視覚障がい者は盲導犬に依存しているが、盲導犬は高額で入手が困難。ミロ(Milo)はUnitree Go2をベースにした低コスト(約2,000ドル)の完全自律型ロボット盲導犬プラットフォームで、事前の環境情報なしで屋内・屋外を航行可能。
本研究では、実世界の冬期運転条件において、いつドリフトが安全上の最適解となるかを探求する。研究チームは、衝突死亡データに基づくシナリオを対象とした、ドリフト可能な非線形モデル予測制御(MPC)システムを提案し、高忠実度シミュレータで試験した。コントローラは後輪が氷上に乗った際に自然にドリフトを開始・維持し、車線に滑り込んだ対向車を回避する。電子安定性制御(ESC)システムとの比較により、ドリフト可能なコントローラは安定性と制御性をトレードオフし、危険な冬期シナリオで精密な操縦を実現する。モンテカルロシミュレーションでは、複数の速度でドリフトコントローラがESCより低い中央車線誤差を達成し、高速でドリフトが主に創発することが示された。
既存の遠隔操作システムは特定のロボットハードウェアやタスク領域に最適化されており、拡張性と適応性に限界がある。ModPackは、計算、電源、通信、ストレージを統合したウェアラブル「バックパック」を中核とするモジュール式で拡張可能な遠隔操作システムを提案する。触覚フィードバック付き関節レベル遠隔操作、移動操作、能動的知覚などのプラグアンドプレイモジュールをサポートし、2つの異なるロボットプラットフォームでの実験により、データ収集とポリシー学習のための柔軟で再利用可能なフレームワークを実証した。完全なハードウェア設計とソフトウェアスタックはオープンソース化されている。
スパースなピクセルレベルの教師信号を用いた画像分割のための統一変分フレームワークを提案。シンプレックス拘束付きPottsモデルと滑らかな周長正則化子を用い、凸で滑らかなエネルギー汎関数を得る。これは弱教師あり深層学習の損失関数として使用可能。RKHSでの関数拡張によりファジィメンバーシップ関数を構築し、不均一な強度統計を捉える。実験では、部分クロスエントロピー法などのベースラインを上回るロバストな改善を示した。
6つの心エコーデータセットを用いた研究により、左心室セグメンテーションにおけるドメインシフトの主因は音響特性ではなく視野とフレーミングの不一致であることが判明。幾何学的前処理により転移性能が向上し、表現固有の距離指標を用いて高精度に性能低下を予測できる。
病理学者の視覚的注意をレポート生成モデルのトレーニングに導入し、121件の前立腺WSIからなるマルチモーダル注意データセットを収集。注意アライメント損失で2つのモデルを微調整し、NLP指標で平均10.9%、5つの臨床関連レポート成分で19.3%の精度向上を達成。
本論文では、都市シナリオにおけるリアルタイムセマンティックセグメンテーションのために設計された軽量深層学習モデルEGRNetを提案する。わずか0.46MのパラメータでCityscapesデータセット上で65.28%のmIoUを達成し、深度分離可能畳み込み、拡張残差ブロック、新規のエッジゲート洗練(EGR)モジュール、および軽量な敵対的攻撃検出戦略を組み込んでいる。
VQ-Transplantは、新しいベクトル量子化モジュールを凍結済みの事前学習済みトークナイザにプラグアンドプレイで統合する軽量フレームワークを提案する。ImageNet-1kでわずか5エポック学習する軽量デコーダ適応戦略により量子化ミスマッチを緩和し、VARなどの産業レベルのモデルで最先端に近い再構成品質を達成しながら、トレーニングコストを95%削減する。これにより量子化研究の民主化が進み、リソース制約下でも新しいVQ技術の探索が可能になる。
本論文では、長尺動画の質問応答における時間的推論を可能にするため、独立して保存されたビジュアルKVメモリを構成する訓練不要の手法ChronoStitchを提案する。保存されたポストロータリーキーをグローバルな3軸マルチモーダルRoPE座標系に再ベースし、高偏差のビジュアルトークンを選択的に再計算することで、単純な結合による時間位相の衝突と内容のギャップを克服する。Qwen2.5-VL-3BおよびTempCompassの時間的分割における実験では、イベント順序付けの精度が向上し、完全なジョイント再プリフィルと比較して3.3倍の高速化を達成した。
本研究では、合成画像および派生画像がYOLOv8n検出器の性能向上に寄与するかを評価した。148枚のキャンパス写真からなる実データセットを用いた実験では、すべての合成拡張構成が実画像のみのベースライン(平均[email protected]: 0.691)を超えられなかった。手と前腕の複合実験はテストセットの汚染により無効となり、再構築後も有意な効果は見られなかった。テストセットの規模が小さいため、結論には限界がある。
本論文は、2Dおよび3D時系列データを統合する新しいマルチモーダル大規模言語モデルフレームワークD3VLを提案し、KITTI QAデータセットでベースライン比11%向上、多様な運転条件をカバーするWaymo QA拡張データセットも導入する。
Crowd4Dは、単眼RGBビデオから群衆とシーンを共同最適化する初のシーン認識型4D群衆再構築フレームワークである。人-シーン相互作用プロキシ(HSIP)を導入してスケールと位置の整合を解決し、群衆構造コヒーレンス正則化(CSCR)により遮蔽下での時間的安定性を向上させ、複雑な大規模シーンで既存手法を凌駕する。
本論文は、ピクセルにデコードする代わりに圧縮ビットストリームを分析することで、AI生成ビデオをリアルタイムで検出する新しいアプローチを提案します。コーデックがすでに書き込んだモーションフィールドを利用したストリーミング知覚フレームワークを導入し、単一の調整済み閾値で随時検出を可能にします。この手法はGenVidBenchで0.64のAUCを達成し、ピクセルベースCNNよりも5桁少ない計算量で動作し、15%のクリップを延期することで精度を0.75から0.78に向上させ、計算量を7倍削減します。
HIPE-2026共有タスクでは、多言語歴史新聞からの人物-場所関係抽出が新たな評価トラックとして導入された。DS@GT HIPEチームは、事前学習言語モデルを使用せずに軽量で解釈可能なシステムの性能限界を調査した。依存関係解析から文書レベルのグラフを構築し、近接性と品詞の特徴を抽出、小型のscikit-learnアンサンブルまたはコンパクトなグラフ注意ネットワーク(パラメータ数847K未満)で分類。公式評価では、最高実行でマクロ再現率0.5142を達成、効率性で3位、精度で中位だった。主な知見:最小文字距離が信号の大部分を捉え、追加の工学的特徴は一貫性のない利益をもたらすこと、文書グループ化交差検証がデータ漏洩防止に不可欠であること。
強化学習は明示的Chain-of-Thought推論器でテスト時スケーリングを実現したが、計算コストが高い。潜在推論は連続ベクトルで中間計算を行い、効率的だが模倣学習に留まる。本論文では、サロゲート潜在ポリシー最適化(SLPO)を提案し、軌跡レベルのクレジット割り当てのためのサロゲートポリシー密度と可変ホライゾンポリシーに洗練される正解監視停止ヘッドを介して、自己回帰潜在推論器に結果報酬RLをもたらす。SLPOは並列サンプリングでPass@kを向上させ、難しいインスタンスにより長い潜在計算を割り当てる。
マスク拡散モデル(MDM)の少数ステップ生成における終端エントロピー欠如問題に対し、複数のマスク状態を導入したマルチマスク拡散モデル(MultiMDM)を提案し、高品質な少数ステップテキスト生成を実現。
LLM生成の推論過程をセグメントに分解し、NLIとハイパーグラフを用いて監査する参照不要フレームワークを提案。数学と医療の推論タスクでLLM判定より高信頼性を示す。
新しい論文は、「適応的降伏」と呼ばれるLLMの障害モードを特定しました。これは、モデルがユーザーの感じる社会的不公正を最初に認め、その後、名目上は推奨していない獲得を詳細に促進するというものです。この研究は、3つの商用LLMに対して900セッションのテストを実施し、最小再帰属十分性(MRS)を設計原則として提案しています。
小規模言語モデルはタスク能力が高い一方で、指示が標準的なタスク行動と競合する場合、非標準指示を無視する傾向があることが示された。モデル規模が大きくなると標準精度と指示追従能力は向上するが、両者のギャップは依然として存在する。タスク完遂能力と指示追従は別個の能力であることが証明された。
研究者らは、ハイパーネットワークを用いた学習時知識注入を大規模言語モデルに適用し、ハイパーネットワークアーキテクチャのスケーリング挙動を初めて体系的に調査した。実験では、損失、推論精度、OOD汎化において冪乗則スケーリングが確認され、規模拡大に伴いOOD汎化が信頼性を増し、LoRAや完全ファインチューニングを上回る性能を示した。また、数千万のマルチホップQAサンプルを含むMegaWikiQAデータセットを構築した。
本論文は構造的一般化を初めて形式的に定義し、標準的な計算複雑性の仮定の下で、純粋なTransformerは構造的一般化を学習できず、ニューロシンボリックシステムが意味投影をハードコードすることで高得点を達成することを示す。
研究により、教師ありファインチューニング(SFT)が大規模言語モデルを下流タスクに適応させる際、特に逐次的意思決定において行動の多様性を著しく低下させることが明らかになった。三目並べの変種などの確定論的ボードゲームを用いた制御実験を通じて、著者らは推論モードの生成がしばしば行動の多様性を抑制し、標準的なSFTは精度向上に必要以上に早期の多様性崩壊を引き起こすことを示した。行動拡張(各状態におけるすべての最適行動を訓練する)はこの効果を部分的に緩和する。
既存の大規模言語モデル(LLM)の安全ガードレールは各プロンプトと応答のペアを個別に評価するため、会話中に無害なターンが蓄積して害を生じる失敗を見逃します。本論文では、会話リスク蓄積(CRA)の概念と、セマンティックドリフト、感度重み付き情報蓄積グラフ、コンプライアンス勾配を追跡するセッション層フレームワークを提案します。CRA-Benchベンチマークと評価プロトコルも公開します。
この研究は1次元の単一スイープニューラルオペレーター研究を2次元に拡張し、フーリエニューラルオペレーター(FNO)とU字型ニューラルオペレーター(UNO)を使用して高忠実度スカラー束を近似します。3つのサロゲート(FNO直接マッピング、UNO直接マッピング、単一スイープ近似を追加入力とするFNO)を調査。3つのランダムシードで訓練し、変動性を評価。単一スイープ入力と対数束訓練が精度を向上させるかどうかを検討。
本研究は、非構造メッシュ上のサロゲートモデリングのためのビン分割スペクトル損失関数を拡張し、フーリエバンドをグラフラプラシアン周波数バンドに置き換え、スケーラブルなチェビシェフ多項式フィルタとマルチレベル近似を導入することで、長期的なロールアウトの忠実度を向上させる。結果は、非構造メッシュ上の乱流予測において、決定論的ベースラインよりも優れていることを示している。
この研究は、スパースオートエンコーダの自動解釈可能性スコアがアーキテクチャの違いよりも評価パイプラインの選択によって大きく左右されることを示し、論文間の比較がパイプラインの違いを反映する可能性があると指摘する。
本論文は、現実的な投資設定での株式ランキングとポートフォリオ構築のために、時間的Transformerとグラフアテンションネットワークを組み合わせ、NMI事前グラフとソフトしきい値スパーシフィケーションを導入したSTN-TGATモデルを提案し、実データでベンチマークを上回る成績を示した。
本論文では、集約中に適応ベクトルに対して幾何手術を実行することで、連合クラス増分学習における空間的干渉と時間的干渉の両方を軽減し、追加のクライアント側計算や通信なしで最大22%の改善を達成するサーバーサイドフレームワークSUMを提案する。
本研究は、適応的時系列予測における継続学習の理解のための重要なツールとして説明可能性を調査する。経験再生戦略を用い、PatchMixer、PatchTST、DLinearなどのニューラル予測アーキテクチャを注意に基づくサンプリング機構で拡張して研究。注意展開やGrad-CAMなどの説明可能性手法を用いて、継続学習フレームワーク内での予測行動とサンプリング戦略を分析。実世界の地下水位時系列データを用いた実験により、非定常予測シナリオにおける説明可能性活用の課題と機会を明らかにする。
大気汚染は年間約790万人の早期死亡を引き起こし、正確な予測は公衆衛生上の重要課題です。既存のベンチマークは地理的範囲や汚染物質のカバレッジが狭く、最新の時系列基盤モデル(TSFM)を実世界大規模データで評価していません。本研究では、7カ国・4大陸、6主要汚染物質、3年間、14,000以上の観測点-汚染物質系列をカバーする大規模マルチ国・マルチ汚染物質データセットとベンチマーク「Air Quality Arena(AQA)」を提案します。11の主要時系列基盤モデルと古典的ベースラインを評価した結果、TSFMはゼロショット予測で有効であり、古典的ベースラインを一貫して上回り、最良モデルは視覚基盤モデルを活用したクロスモーダルアーキテクチャを採用しています。AQAは公開されています。
CruiseBenchは航空機エンジンの残存寿命予測のための巡航段階ベンチマークであり、固定プロトコルによりN-CMAPSSデータセットを簡略化し、モデル比較の再現性を向上させる。
本研究は、トランスフォーマーがデータから正しい仮説クラスを特定するベイズモデル選択を実行できるかを調査する。制御された「ベイズ風洞」環境で、小型トランスフォーマーは関係タスクでほぼ最適な性能を示すが、算術タスクでは不透明記号で完全に失敗し、その境界は112倍のスケーリング後も持続する。最先端LLMは定性的なベイズ行動を示すが、較正に大きなギャップがある。
本論文では、暗黙的にパラメータ化された大域的・入力依存の多次元畳み込みカーネルを用いて、多次元データのネイティブな幾何構造に直接作用する二次未満・大域的・入力依存演算子HyenaNDを提案する。CUDA実装nSubQはFFT畳み込みパスを融合し、O(L log L)スケーリングを実用的な高速化に変換する。長文脈ゲノミクス、コンピュータビジョン、医用画像、PDEモデリングにおいて、純粋なHyenaNDスタックは強力な注意ベースラインに匹敵し、注意層とインターリーブしたハイブリッド構成は純粋な注意や強い再帰ハイブリッドを上回る。