本研究は、LLaDA2.1拡散言語モデルのトークン間(T2T)エディタにおけるトレーニングと推論のミスマッチに対処するため、自己生成T2T法を提案する。この手法では、勾配なしのドラフトパスを実行し、マスクされた位置を予測トークンで埋め、2回目のパスで自己生成された誤りからの回復を監督する。LLaDA2.1-miniにLoRA継続事前学習を適用し、編集強度を低減しながら精度を向上させ、最終桁の転写誤りや過度な自己修正などの失敗モードを軽減する。
AI ニュース速報
リアルタイム監視
最新ニュース
信頼できる情報源、出典、権限、サイト内閲覧を保ちながら、AI の変化を読める情報に圧縮します。
最新ニュース
この研究は、両者が自律型AIエージェントであるオンラインコミュニティにおいても、パラソーシャルインタラクション(PSI)の手がかりが存在するかどうかを調査した。Moltbookの4,434件の投稿と50,338件のコメントをキーワードマッチング、少数ショット大規模言語モデル(LLM)アノテーション、グループ化コンテキストLLMアノテーションの3つの方法で分析した結果、PSIの口語的手がかりが広く見られ、投稿者(OP)の再エンゲージメントや互酬的な返信構造と強く関連していることが明らかになった。二者間持続性テストにより、互酬的オファーが持続的なOP関与の相互再帰パターンと一致することが確認され、インタラクションレベルのPSIスクリプトとリレーションシップレベルの持続的二者パターンを結びつける実証的証拠が得られた。
RepSelectは、重み勾配の主成分を崩壊させることで忘却セット固有の表現を分離し、既存手法よりも4〜50倍優れた逆転耐性を達成する新しいLLMアンラーニング手法です。
PromptMNは、% プレフィックスの指示で自然言語プロンプトに注釈を付け、役割や目標、制約などを明示化し、エージェントワークフローにおける曖昧さを低減する軽量なドメイン固有言語です。非形式的なプロンプトと疑似コードの中間に位置し、逆プロンプトエンジニアリングをサポートし、最先端モデルでファインチューニングなしに検証されています。
MemSlidesは、長期記憶(ユーザープロファイル記憶とツール記憶)を作業記憶から分離する階層型メモリフレームワークを提案し、スライド局所修正と組み合わせることで、タスク間でのユーザー嗜好の維持と複数回の修正にわたる信頼性の高い局所編集を実現する。実験では、パーソナライゼーションの一致度、修正動作、嗜好の持ち越しにおいて改善が示された。
本研究は、マルチエージェントLLMシステムにおける状態共有に起因する並行処理異常に対処し、TLA+を用いて4つの異常タイプを形式化し、機械検証済みの一貫性階層L0~L4を構築した。274のVerus証明義務により、検出器の健全性と完全性が証明された。3つのRustランタイムがL0~L1を実装し、ByteDanceのdeer-flowやLangGraphにおける実際の異常を再現し、検証済みの修正を提供した。
本論文では、地層貯留におけるCO2プルーム移動予測のためのエンドツーエンドのグラフニューラルネットワークサロゲートを提案する。SPE11Aベンチマークで評価され、異方性メッセージパッシングと自己回帰残差定式化により、長期予測でも低い累積誤差を実現する。
本研究は、線形深層ニューラルネットワークにおいて、グルッキング(突然の遅延的汎化)がL2正則化の一次相転移におけるヒステリシスと一致することを示した。低精度の準安定状態に閉じ込められたモデルは、SGDノイズがエネルギー障壁を越えるのに十分なエネルギーを提供する場合にのみ脱出し、脱出時間はアレニウス則に従う。準安定状態の数は学習可能な特徴の数に等しく、より効率的な学習スキームへの道を開く。
混合エキスパートマルチモーダル大規模言語モデル(MoE-MLLMs)は優れた性能を持つが、GPUメモリ消費が大きく、圧縮が不可欠である。既存のエキスパートレベルの混合精度量子化はMoE-MLLMsに適用すると性能が低下する。これはエキスパート重要度推定における2つのバイアスに起因する:クロスモーダルレベルで視覚トークンが支配的であり、テキスト関連エキスパートが覆い隠されること、およびビジョン内部で冗長トークンが頻度統計を歪めること。MODEはモダリティごとに選択頻度を分解し、冗長トークンをフィルタリングし、モダリティごとの量子化感度を評価し、整数線形計画法でエキスパートごとにビット幅を割り当てる。W3A16で平均性能損失を2.9%以内に抑える。
本研究では、2つの実世界商業コホート(IH-BC、IH-NSCLC)を用いて、計算病理学タスクにおける基盤モデル(FM)表現を体系的に評価。画像とオミクス表現が相補的な予測シグナルを持ち、単一モダリティが優位でない場合にマルチモーダル融合が効果的であることを示した。コンフォーマル予測により、点予測が失敗した場合でもほとんどのケースで真の診断が予測セット内に含まれ、不確実性を考慮した推論の臨床支援における価値が強調された。
薬剤監視において、因果的な有害薬物事象(ADE)と偽の相関を区別することは中心的な課題です。InferBERTフレームワークはトランスフォーマーモデルとDo-calculusを統合しますが、その成功は基礎となる分類モデルに依存します。本研究では、XGBoost、ALBERT、BioBERT、Med-LLaMAを2つのベンチマークで比較し、ドメイン特化型事前学習(BioBERT)が最高精度を達成し、大規模LLMのMed-LLaMAは成績が低いことを発見しました。結果は、管理可能なドメイン認識モデルへの投資がモデルサイズの単なる拡大よりも効果的であることを示しています。
大規模言語モデルはプリフィル段階でフィールド条件付きの結論をダウンストリームノートに書き込むため、KVキャッシュが編集可能かつ構成可能になることが明らかになった。チェーン・オブ・ソートを用いたフィールドの編集で計算量約1%で決定を回復し、プリコンパイルされたスキルは位置可搬性を持ち任意のコンテキストに挿入可能で、完全再計算とほぼ同一の出力を最大14.9倍低レイテンシで実現。手法は様々なスケールやキャッシュ種別で検証され、本番ベンチマークで98.5%のプレフィックスキャッシュヒット率を達成。
本論文では、臨床時系列データを生成するための拡散モデルに基づくアプローチを提案し、検査値とその観測パターンを同時にモデル化します。MIMIC-III由来のDACMIベンチマークを使用し、チャート時間を4時間間隔に整列させ、入院データを7日間のウィンドウに分割します。TimeDiffフレームワークを拡張し、連続的な検査値と離散的な欠落パターンを学習します。実験では、生成データが実際の患者軌跡とよく一致し、MNAR様の欠落条件下で臨床的に意味のある依存関係を捉えることが示されました。この研究は、臨床基盤モデル開発の初期コンポーネントとして機能します。
本研究は、長距離(1.5-2.1メートル)単一ショット縞投影プロフィロメトリ(FPP)における学習ベースの深度推定アルゴリズムの形状事前知識ショートカット問題に取り組む。メカニスティック解釈可能性とコンフォーマル不確実性定量化を用いて、UNetベースラインが縞位相復号ではなく物体境界形状事前知識に依存していることを診断。提案するPhiCalNetは、ラップ位相を出力し、固定微分可能校正層を適用することで、物体平均絶対誤差を3.3倍削減し4.46 mmとし、アーキテクチャが重要因子であることを確認した。
新しい研究により、マルチモーダル大規模言語モデル(MLLM)における知識編集で「編集分離失敗」が明らかになった。マルチモーダル入力では知識更新が成功するが、入力を単一モダリティに分割すると古い事実に戻る。研究者らはDECODEを提案し、モダリティ特化ニューロングループを明示的に分離・特定することで、モダリティをまたいだ一貫した知識編集を実現した。
研究者らは、治療効果推定、患者デジタルツイン、強化学習を統合したオンライン適応型フレームワークを提案。ルールベースのモジュールで安全性を確保し、合成および実際の卵巣がんデータセットでベースラインを上回る性能を示し、個別化医療ツールとしての可能性を示した。
本論文は、分散型汎用エージェントネットワークを研究し、階層型アーキテクチャ、および3つの核心メカニズム(意味的アナウンス伝播、検証可能なアイデンティティとマルチトピック評判、意味的勾配メカニズム設計)を提案する。プロトタイプのオーバーヘッドとシミュレーションにより実現可能性を示し、オープンで信頼性がありスケーラブルなエージェント連携のシステム基盤を提供する。
SpeechDxは、12のデータセットと27のタスクを網羅する大規模ベンチマークであり、臨床音声AIを評価する。音声生成段階ごとにタスクを整理し、汎化能力をテストする。12のオーディオエンコーダの評価では、大規模音声モデルが最も優れているが、信頼性の高い汎用表現は存在しない。
MemTraceは知識ポイントを単位としてLLMの長期記憶を評価するベンチマークで、記憶年齢、質問タイプ、証拠条件の3次元で事実を調査する。類似したプール精度が異なる失敗を隠しており、主なボトルネックは検索ではなく証拠の利用であることを明らかにした。
新しい研究では、言語モデルが独立して数学的概念「ゼロ」を発見できるかどうかを調査しています。GPT-2規模のモデルはテスト時に汎化できませんが、少数の例で訓練すると大幅に改善され、言語事前学習により必要な例の数が約50%減少することがわかりました。言語能力がニューラルモデルの数学的発見を支えることを示唆しています。
スキル制約のある生産在庫システムでは、将来の有資格作業能力は今日のトレーニング決定に依存する。生産には認定作業者が必要であり、認定は維持されなければ失効し、トレーニングは生産と同様の限られた作業時間を消費する。提案された閉ループスキル制約付きモデル予測制御器は、各シフトで有限ホライゾンの混合整数計画を解き、生産、在庫、バックログ、トレーニングを最適化する。合成シナリオでの評価では、どのポリシークラスも支配的ではないことが示された。予測制御はボトルネックが予測可能な場合に有効だが、静的保険は予期しないショックや需要-能力境界近くで堅牢である。
研究者らは、パラメータ学習なしでBM25の法律事例検索性能を向上させるため、LLMベースのエージェントが自動的にクエリ書き換えルールを生成する自己進化型フレームワークを提案。中国語ベンチマークLeCaRD-v2での評価では、人間設計ルールや貪欲選択などのベースラインを上回った。
本論文では、エージェント検索における標準的な並列サンプリングの収穫逓減問題に対処するため、最初のターンでクエリを多様化する訓練不要の手法DivInitを提案する。マルチホップQAにおいて、5〜7ポイントの平均改善を達成した。
MITの研究者が開発した新しいロボット用長期記憶フレームワーク「DAAAM」は、環境内の物体を詳細に記述する3Dマップと組み合わせることで、ロボットがリアルタイムで空間記憶を構築し、自然言語による複雑な質問に高精度で回答することを可能にします。精度は既存手法より21〜53%向上し、ロボットや拡張現実への応用が期待されます。
Loomcycleは、アプリケーションと並行して動作する軽量なセルフホスト可能なランタイムで、エージェントループ、マルチプロバイダルーティング、メモリとチャネルプリミティブ、MCPサーバーアイデンティティ、OpenTelemetryトレース、マルチレプリカ調整を提供します。HTTP、gRPC、MCP、TypeScript、Pythonアダプタをサポートし、埋め込みライブラリ、マネージドクラウドサービス、プロキシゲートウェイに次ぐ第4の選択肢をエージェントシステム市場に提供します。
クアラルンプールに本拠を置くカスタマー会話管理ソフトウェア企業Respond.ioは、Camber Partners主導のシリーズBラウンドで6250万ドルを調達しました。同社の年間経常収益(ARR)は3500万ドル、前年同期比169%増、利益率30%です。
SciFigureAI は、テキスト、スケッチ、画像から科学的な図のドラフトをAIで生成し、反復編集とPPTX/SVGエクスポートを可能にし、論文、ポスター、助成金、スライド用の図作成を効率化します。ワークフローは記述、生成、編集、エクスポートの4ステップで、インスピレーションギャラリーと複数のビジュアルスタイルを備えています。
Locofy は、Figma と Cursor、Claude の間に位置するエージェンティックなフロントエンド層を提供し、デザインを直接コードに変換して開発効率を大幅に向上させます。
映画製作者がXPRIZEコンペティションを通じて250万ドルを獲得し、楽観的なSF映画のゴーサインを得るための完全な戦略を公開。
Japanly AEOは、ChatGPT、Gemini、Claudeなどの日本のAI検索があなたのブランドを推奨するかどうかをテストする無料ツールです。引用率、敬語トーン、引用構造の3つの側面をスコア化し、改善点を提供します。