AI News HubLIVE
公開記事 76収集記事 84信頼度 90更新頻度 30 分
稼働状態 正常ソース種別 研究全文利用権限 公式全文最終取り込み 2026-08-07ID apple-ml-research状態 有効

Official research source; confirm reuse terms before enabling full body display.

最新公開記事

翻訳待ち:Arbitrage: Efficient Reasoning via Advantage-Aware Speculation

AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:Modern Large Language Models achieve impressive reasoning capabilities with long Chain of Thoughts, but they incur substantial computational cost during inference, and this motivates techniques to improve the performance-cost ratio. Among these techniques, Speculative Decoding accelerates inference by employing a fast but inaccurate draft model to auto-regressively propose tokens, which are then verified in parallel by a more capable target model. However, due to unnecessary rejections caused by token mismatches in semantically equivalent steps, traditional token-level Speculative Decoding…

  • AI 生成が一時的に利用できないため、ソース内容とフォールバックメタデータを保存しました。
  • Modern Large Language Models achieve impressive reasoning capabilities with long Chain of Thoughts, but they incur substantial computational cost during inference, and this motiva…
サイト内本文

翻訳待ち:Beyond Next-Token Prediction: A Performance Characterization of Diffusion versus Autoregressive Language Models

AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:Large Language Models (LLMs) have achieved state-of-the-art performance on a broad range of Natural Language Processing (NLP) tasks, including document processing and code generation. Autoregressive Language Models (ARMs), which generate tokens sequentially conditioned on all previous tokens, have been the predominant paradigm for LLMs. While these models have achieved high accuracy across a range of downstream tasks, they exhibit low arithmetic intensity due to the inherent sequential dependency in next-token prediction. Recently, Diffusion Language Models (DLMs) have emerged as a promising…

  • AI 生成が一時的に利用できないため、ソース内容とフォールバックメタデータを保存しました。
  • Large Language Models (LLMs) have achieved state-of-the-art performance on a broad range of Natural Language Processing (NLP) tasks, including document processing and code generat…
サイト内本文

翻訳待ち:Scaling Categorical Flow Maps

AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:Continuous diffusion and flow matching models could represent a powerful alternative to autoregressive approaches for language modelling (LM), as they unlock a host of advantages currently reserved for continuous modalities, including accelerated sampling and tilting. Recently, several works have demonstrated the possibility of generating discrete data continuously by a simple flow matching process between a Gaussian and the one-hot encoded data distribution. They have further shown the feasibility of accelerated sampling via Categorical Flow Maps (CFMs), resulting in competitive sample…

  • AI 生成が一時的に利用できないため、ソース内容とフォールバックメタデータを保存しました。
  • Continuous diffusion and flow matching models could represent a powerful alternative to autoregressive approaches for language modelling (LM), as they unlock a host of advantages…
サイト内本文

翻訳待ち:DeepAmbigQA: Ambiguous Multi-hop Questions for Benchmarking LLM Answer Completeness

AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:Large language models (LLMs) with integrated search tools show strong promise in open-domain question answering (QA), yet they often struggle to produce complete answer set to complex questions such as “Which actor from the film Heat won at least one Academy Award?”, which requires (1) distinguishing between multiple films sharing the same title and (2) reasoning across a large set of actors to gather and integrate evidence. Existing QA benchmarks rarely evaluate both challenges jointly. To address this, we introduce DEEPAMBIGQAGEN, an automatic data generation pipeline that constructs QA…

  • AI 生成が一時的に利用できないため、ソース内容とフォールバックメタデータを保存しました。
  • Large language models (LLMs) with integrated search tools show strong promise in open-domain question answering (QA), yet they often struggle to produce complete answer set to com…
サイト内本文

翻訳待ち:Locking Pretrained Weights via Deep Low-Rank Residual Distillation

AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:The quality of open-weight language models has dramatically improved in recent years. Sharing weights greatly facilitates model adoption by enabling their use across diverse hardware and software platforms. They also allow for more open research and testing, to the extent that users can use them as checkpoints, fine-tune them according to their needs, and potentially redistribute them. In some cases, however, concerns on modifying these weights towards unauthorized uses may outweigh the pros of giving users such a freedom. Defending against such adaptation is non-trivial: since an adaptive…

  • AI 生成が一時的に利用できないため、ソース内容とフォールバックメタデータを保存しました。
  • The quality of open-weight language models has dramatically improved in recent years. Sharing weights greatly facilitates model adoption by enabling their use across diverse hardw…
サイト内本文

翻訳待ち:Taming Outlier Tokens in Diffusion Transformers

AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:We study outlier tokens in Diffusion Transformers (DiTs) for image generation. Prior work has shown that Vision Transformers (ViTs) can produce a small number of high-norm tokens that attract disproportionate attention while carrying limited local information, but their role in generative models remains underexplored. We show that this phenomenon appears in both the encoder and denoiser of modern Representation Autoencoder (RAE)-DiT pipelines: pretrained ViT encoders can produce outlier representations, and DiTs themselves can develop internal outlier tokens, especially in intermediate layers…

  • AI 生成が一時的に利用できないため、ソース内容とフォールバックメタデータを保存しました。
  • We study outlier tokens in Diffusion Transformers (DiTs) for image generation. Prior work has shown that Vision Transformers (ViTs) can produce a small number of high-norm tokens…
サイト内本文

翻訳待ち:Understanding Alignment in Multimodal LLMs: A Comprehensive Study

AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:Preference alignment has become a crucial component in enhancing the performance of Large Language Models (LLMs), yet its impact in Multimodal Large Language Models (MLLMs) remains comparatively underexplored. Similar to language models, MLLMs for image understanding tasks encounter challenges like hallucination. In MLLMs, hallucination can occur not only by stating incorrect facts but also by producing responses that are inconsistent with the image content. A primary objective of alignment for MLLMs is to encourage these models to align responses more closely with image information. Recently…

  • AI 生成が一時的に利用できないため、ソース内容とフォールバックメタデータを保存しました。
  • Preference alignment has become a crucial component in enhancing the performance of Large Language Models (LLMs), yet its impact in Multimodal Large Language Models (MLLMs) remain…
サイト内本文

MoMo:時空間アクショントークン化によるロボット操作のモーションモード制御

ロボットはタスクや物体、相互作用環境に応じて動作の仕方を適応させる必要がある。本論文では、時空間アクショントークナイザーと行動クローニングトランスフォーマーからなる二段階模倣学習フレームワークMoMoを提案する。連続的なモーションモード条件を入力とし、6つの実ロボット操作タスクにおいて、安定、動的、および中間の動作を生成できる。単一モードでしか実演されていないタスクに対しても、未見のモードを転移し、タスク成功率をほぼ維持する。

  • MoMoフレームワークは、実行レベルの変化を再利用可能な行動因子として学習する。
  • 連続的なモーションモード条件により、6タスクで安定・動的・中間動作を生成可能。
サイト内本文

次元削減とネットワーク科学の融合:UMAPのkNNグラフによるデータ理解

UMAPは高次元データの探索に広く使われているが、典型的なワークフローは低次元埋め込みに焦点を当て、内部で構築されるk近傍(kNN)グラフを見落としている。このグラフはUMAPの2D投影による歪み前の元の高次元空間のデータ多様体を符号化する。本稿では、PageRank、k-core分解、クラスタリング係数などの標準グラフアルゴリズムをこのグラフに適用することでデータ理解を強化できることを示す。MNISTおよびFashion MNISTでの定量的・定性的評価により、これらのグラフベース分析は実用的であり、専用手法(k-medoids、HDBSCANなど)と競合するか補完的であることが示された。

  • UMAPのkNNグラフは2D埋め込みの歪み前に高次元多様体構造を保持する。
  • PageRank、k-core分解、クラスタリング係数などのグラフアルゴリズムをこのグラフに適用することで新たなデータ探索が可能になる。
サイト内本文

分離された時間深度拡散トランスフォーマーを用いたメモリ効率的な音声合成

Apple は Siri Expressive Voices を発表しました。その背後には、メモリ効率的な音声合成アーキテクチャである「デトークナイザ」があります。このアーキテクチャは、基盤モデルから出力されるセマンティック音声トークンを、Apple Matrix コプロセッサ(AMX)の厳しい計算・メモリ予算内で高忠実度の音声に変換します。ストリーミングエンコーダ、時間デコーダ、深度デコーダの3つのコンポーネントからなり、時間処理と深度処理を体系的に分離します。単一の再利用可能な深度デコーダが拡散トランスフォーマー(DiT)スタイルのステージ条件付けを使用してすべての RVQ レベルを自己回帰的に生成し、従来のマルチデコーダアーキテクチャの専用レベルデコーダを置き換えます。因果的スライディングウィンドウアテンションと固定ウィンドウキーバリューキャッシュにより、メモリ複雑性はシーケンス長に依存せず一定になります。AMX 上で展開されたデトークナイザは、1生成ステップあたり約10ミリ秒(リアルタイム比約16倍高速)を維持し、ピーク実行時メモリは約21MB、オンデバイスアセットは329MBで、20〜320秒の音声を連続ストリーミング合成可能です。このアーキテクチャは Siri Expressive Voices の一部として本番環境に展開され、AFM 3 Core Advanced(10億パラメータ活性化サイズ)内で動作し、従来のオンデバイス音声合成システムと比較して平均オピニオン評点(MOS)を全体で+0.28(4.15 vs. 3.87)、会話音声で+0.42(4.24 vs. 3.82)改善しています。

  • Apple が Siri Expressive Voices を発表。メモリ効率の高いオンデバイス音声合成のための新しいデトークナイザアーキテクチャを採用。
  • 時間処理と深度処理を分離し、単一の深度デコーダで全 RVQ レベルを生成、メモリ使用量は一定。
サイト内本文

GH-ESD:インスタンスレベルの視覚タスクのための仮説駆動型エラースライス発見

GH-ESDは、物体検出やセグメンテーションなどのインスタンスレベルの視覚タスクに特化した新しいエラースライス発見フレームワークです。スライス発見を生成・検証プロセスとして再定義し、LLMの事前知識と視覚言語モデルを活用してインスタンスレベルの仮説スライスを発見し、統計的に検証します。実験では、新しいGESDベンチマークでベースラインを大幅に上回る結果を示しています。

  • 既存のスライス発見手法は画像レベルの分類では有効だが、インスタンスレベルのタスクでは文脈や空間パターンによる失敗を捉えられない。
  • GH-ESDはLLMの事前知識と視覚言語モデルを組み合わせた生成・検証フレームワークにより、インスタンスレベルで仮説スライスを発見・検証する。
サイト内本文

LEAD:長期的推論における回復不能なボトルネックを打破する

大規模言語モデル(LLM)による長期的なタスク実行は、高レベルの戦略が与えられても不安定である。本研究では、分解が安定性に不可欠である一方、過度な分解は「回復不能なボトルネック」を生み出し、少数の「困難な」ステップでの一貫したエラーが不可逆になることを示す。この問題に対処するため、短期将来検証と重複ロールアウトの集約を組み合わせたLookahead-Enhanced Atomic Decomposition(LEAD)を提案する。LEADにより、o4-miniモデルはCheckers Jumping問題で複雑度n=13まで解決可能となり、極端な分解ではn=11を超えると失敗する。

  • LLMにおける長期的実行は、高レベル戦略があっても不安定である。
  • 極端な分解は「回復不能なボトルネック」を生み、困難なステップでのエラーが不可逆になる。
サイト内本文

キャリブレーションされたスパース注意によるテキストからビデオ生成の高速化

本論文では、オフラインキャリブレーションで安定したスパースパターンを特定し、推論時に重要でない接続をスキップする訓練不要のスパース注意法CalibAttを提案。最大1.58倍のエンドツーエンド高速化を実現し、品質を維持する。

  • 多くのトークン接続のスコアが無視でき、パターンがクエリ間で繰り返されることを発見
  • CalibAttはオフラインキャリブレーションでスパースパターンを最適化された注意操作にコンパイル
サイト内本文

API呼び出しエージェントのための環境不要な合成データ生成

Appleの研究チームは、実行環境を必要とせず、LLMをデジタルワールドモデルとして利用してAPI仕様のみから高品質な軌跡を生成する手法を提案。AppWorldおよびOfficeBenchでの微調整により顕著な性能向上を達成し、APIエージェント訓練のスケーラブルな解決策を提供する。

  • 従来手法は完全な実行環境が必要で規模拡大が困難
  • LLMがAPI応答をシミュレートして軌跡を生成
サイト内本文

長さ価値モデル:トークンレベルの長さモデリングのためのスケーラブルな価値事前学習

Appleの研究者らは、各デコードステップで残りの生成長を予測するトークンレベルフレームワーク「長さ価値モデル(LenVM)」を提案する。長さモデリングを価値推定問題として定式化し、生成トークンごとに一定の負の報酬を割り当てることで、アノテーション不要で密、不偏、かつスケーラブルな教師信号を提供する。LLMおよびVLMでの実験では、LIFEBenchの正確な長さマッチングタスクにおいて、LenVMを適用した7Bモデルの長さスコアが30.9から64.8に向上し、最先端のクローズドソースモデルを凌駕した。さらに、性能と効率のトレードオフの連続的な制御や、プロンプトからの総生成長の予測も可能にする。

  • LenVMは各ステップで残り生成長を予測するトークンレベルフレームワーク。
  • 価値推定と一定の負の報酬によりアノテーション不要な教師信号を実現。
サイト内本文

LVSum:タイムスタンプ認識型長編ビデオ要約のベンチマーク

LVSumは、長編ビデオ要約における時間的アライメントを評価するための人手アノテーション付きベンチマークです。72本の多様なビデオ(平均16分)を13分野にわたり含み、各ビデオには時間参照を含む最大10個の人手生成要約が付与されています。評価の結果、書き起こしテキストが映像フレームよりも重要であり、モデルと人間の要約には大きなギャップがあり、MLLMは時間的根拠付け、指示遵守、モーダル間一貫性に弱点があることが明らかになりました。

  • LVSumベンチマークを導入。72本の長編ビデオに時間認識型の人手要約を提供。
  • 書き起こしテキストは映像フレームよりも要約品質に大きく寄与。
サイト内本文

例を示せ:画像セットからの視覚概念の推論

視覚言語モデル(VLM)は複雑なテキスト命令に従えるが、純粋な視覚コンテキストからの推論が苦手である。新たに導入されたVisual Concept Inference from Sets(VICIS)タスクはこの能力を評価する。著者らは、画像セットから概念固有の埋め込みを学習する訓練フレームワークとアーキテクチャを提案し、生成の精度と未見の概念やモダリティへの一般化を向上させる。

  • VLMは視覚コンテキストセットから概念を推論できず、偏った生成に陥る。
  • VICISタスクは、コンテキスト定義の概念を新しいクエリ画像に適用する能力をテストする。
サイト内本文

忘れても無料:影響の少ないデータポイントを活用して計算コストを削減

機械学習における忘却(unlearning)の標準的なアプローチに挑戦する新たな論文が発表された。すべての忘却対象データポイントを平等に扱うのではなく、影響関数を分析することでモデル出力への影響が無視できる訓練データのサブセットを特定し、忘却前にデータセットサイズを最大50%削減する効率的なフレームワークを提案。実際のタスクで大幅な計算コスト削減を実現した。

  • 既存の忘却手法はすべての忘却ポイントを等しく扱うが、モデルへの影響が最小限のものがある
  • 影響関数を用いて低影響ポイントを特定し、それらの忘却を安全にスキップできる
サイト内本文

驚くほどシンプルな自己蒸留でコード生成が向上

Appleの研究者は、検証器や教師モデル、強化学習を使わずに、モデル自身の出力のみを利用して微調整するシンプルな自己蒸留(SSD)を提案。LiveCodeBench v6においてQwen3-30B-Instructのpass@1を42.4%から55.3%に改善した。

  • SSDはモデル自身のサンプルで標準的な教師付き微調整を行う
  • 難易度の高い問題で特に効果があり、13ポイントの向上を達成
サイト内本文

テキストとID埋め込みのハイブリッドによるインクリメンタルビデオ検索のパーソナライゼーション

Apple TV検索向けに、テキストベースの多言語エンコーダとIDベースの協調埋め込みを組み合わせたパーソナライゼーションシステムを提案。対照学習とインタラクションデータで微調整された埋め込みをXGBoostランカーに注入。曖昧な短いクエリではNDCG@10が8.63%向上、長い視聴履歴を持つユーザーでは4.37%向上。オンライン実験ではタップスルー率+1.14%、コンバージョン率+1.23%を達成。

  • テキスト埋め込みとID埋め込みのハイブリッドアプローチ
  • 曖昧な短いクエリ(1-3文字)でNDCG@10が8.63%向上
サイト内本文

二重部分線形インタラクティブ近接証明

本稿では、二重部分線形インタラクティブ近接証明(dsIPP)を研究する。これは超大規模入力に対する近似的主張を証明するための超高速証明システムであり、証明者は入力のごく一部(部分線形)のみを読み、検証者はさらに少ない部分を読む。著者らは、定幅1回読み oblivious 分岐プログラム(ROOBP)で判定可能な任意の性質に対してこのような証明を構築し、さらにハミング重みの近似検証と2部グラフ性の緩和のための証明システムも構築した。

  • dsIPPにより、証明生成は部分線形時間で、検証はさらに高速。
  • ROOBPで判定可能な性質に対する汎用 dsIPP を構築。
サイト内本文

LLM関数呼び出しの不確実性定量化

LLMの関数呼び出しにおける不確実性定量化手法を初めて評価し、マルチサンプル手法がシングルサンプル手法に優越しないことを発見。抽象構文木クラスタリングと意味的トークン選択に基づく改善を提案。

  • LLM関数呼び出しにおける不確実性定量化手法の初めての評価
  • マルチサンプルUQ手法は関数呼び出しで優位性なし
サイト内本文

CLaRa:連続潜在推論による検索と生成の橋渡し

CLaRaは、文書を連続ベクトルに圧縮し、リランカと生成器をエンドツーエンドで共同最適化する統一的なRAGフレームワークです。QAとパラフレーズに基づくSCPデータ合成と微分可能なtop-k推定器を導入し、16倍の圧縮率で最先端の性能を達成します。

  • CLaRaは埋め込みベースの圧縮により文書長を削減し、生成器への入力を短縮する。
  • SCPフレームワークはQAとパラフレーズの教師信号を用いて重要情報を保持した圧縮表現を合成する。
サイト内本文

一層で十分:画像生成のための事前学習済みビジュアルエンコーダの適応

FAE(特徴オートエンコーダ)フレームワークを提案。たった一つのアテンション層で事前学習済み視覚表現を低次元生成用潜在空間に適応し、ImageNet 256×256でCFGありFID 1.29、CFGなしFID 1.48とほぼSOTAを達成。再構築と理解情報を保持。

  • FAEは特徴再構築用と画像生成用の2つのデコーダを結合し、わずか一つのアテンション層で動作。
  • DINO、SigLIPなどの自己教師ありエンコーダと拡散モデル、正規化フローの両方に対応。
サイト内本文

Apple Music検索のための多言語セマンティック検索システム

Apple Musicは150以上のストアフロントで数十言語のリスナーにサービスを提供し、毎日数十万の新曲が追加されている。この規模では、スペルミス、音訳、言語横断的なクエリに対する検索リコールがセッション品質の主要な決定要因となる。Appleの研究者は、GTE-multilingual-baseからカリキュラムスケジュールされた多目的トレーニングで微調整された3億500万パラメータのSiameseバイエンコーダに基づく多言語セマンティック検索システムを提案する。このモデルは、密な近傍結果と既存のトークンベースのインデックスを分位分布マッチングでブレンドするハイブリッド検索アーキテクチャを介して検索スタックに統合され、下流のランカーを再トレーニングせずに展開可能。オフラインではHit@10が69%相対改善。全世界のオンラインA/Bテストでは、全体のコンバージョン率(CR)が2.28%向上、無結果率が86%減少し、すべてのストアフロントで改善が見られた。テールクエリではCRが7.93%向上し、ミッドフリークエリの0.89%、ヘッドクエリの0.14%を大きく上回った。

  • Apple Musicが多言語セマンティック検索システムを導入。3億500万パラメータのSiameseバイエンコーダをGTE-multilingual-baseから微調整して構築。
  • ハイブリッド検索アーキテクチャにより、密なベクトルとトークンベースのインデックスを統合し、下流のランカー再トレーニング不要。
サイト内本文

プロアクティブエージェント研究環境:アクティブユーザーのシミュレーションによるプロアクティブアシスタントの評価

研究者は、アプリケーションを有限状態機械としてモデル化することでプロアクティブエージェントの現実的なユーザーシミュレーションを可能にするPareフレームワークを提案し、143のタスクを含むPare-Benchベンチマークを公開しました。

  • 既存の手法はアプリをフラットなツール呼び出しAPIとしてモデル化し、状態的で順序的なユーザーインタラクションを捉えられない。
  • Pareはアプリを状態依存のアクション空間を持つ有限状態機械としてモデル化する。
サイト内本文

行動プライバシー漏洩:エージェント交渉における推論攻撃の形式化とランダム化ポリシーによる緩和

ARES 2026のAI4TCIワークショップで採択された本論文は、自律交渉エージェントにおける行動プライバシー漏洩問題に取り組む。適応的ランダム化ポリシーを設計し、(ε,δ)-差分プライバシー、ほぼ確実な収束、高い効用を同時に実現。3,000回の合成交渉実験では、敵対的推論精度を43-50%削減しつつ、成功率と効用を90%以上に維持した。

  • 譲歩パターンなどの行動的手がかりを利用した推論攻撃の形式化
  • 収束保証付きの差分プライバシーランダム化ポリシー
サイト内本文

オン方針蒸留の解明:どこで役立ち、どこで害になり、その理由

オン方針蒸留は推論モデルの訓練に密集したトークンレベルの監視を提供するが、その有効性は条件によって異なる。本研究では、訓練不要な診断フレームワークを導入し、蒸留信号と理想勾配の一致度をトークンレベルで定量化する。結果、蒸留指導は誤ったロールアウトにおいて正しいものよりも高い一致を示し、最適な蒸留コンテキストは学生モデルの容量とタスクに依存し、普遍的な最適構成は存在しない。

  • 訓練不要の診断フレームワークにより、トークン単位、質問単位、教師単位で蒸留を分析。
  • 勾配一致スコアは蒸留勾配と理想勾配のコサイン類似度を測定。
サイト内本文

再帰的言語モデルと不確実性の出会い:長文脈における自己反省的プログラム検索の驚くべき有効性

本論文では、不確実性シグナル(自己一貫性、推論トレース長、言語化された信頼度)を用いて再帰的言語モデルを強化するSRLMフレームワークを提案する。ベンチマークでRLMを最大22%上回り、再帰そのものが性能の主因ではないことを示す。

  • SRLMは3つの内在的不確実性シグナルで文脈相互作用プログラムを評価
  • 長文脈ベンチマークでRLM比最大22%の改善
サイト内本文

エゴセントリックなビデオ理解モデルにおける時間的認識の促進

マルチモーダル大規模言語モデルは視覚理解で高い性能を示しているが、特にエゴセントリックな設定では時間的認識が不足している。Appleの研究チームは、時間的推論を促進するために強化学習と検証可能な報酬を用いたTemporal Global Policy Optimization(TGPO)アルゴリズムを提案している。

  • マルチモーダル大規模言語モデルはエゴセントリックなビデオ理解において時間認識が不十分
  • 既存の訓練目標は時間的推論を明示的に報酬としていない
サイト内本文

全ソース