一種名為AEM的預訓練框架,通過從視覺-動作歷史中學習緊湊的時間表示,在仿真和現實世界的操作任務中優於基線方法。
AI 新聞即時情報
即時監測
即時更新
即時追蹤可信來源,保留出處、權限和站內閱讀模式,把噪音壓成可讀情報。
即時更新
本文展示了通過模仿學習端到端訓練的視覺-語言-動作(VLA)模型能夠支持協作操作。研究發現,動作分塊策略存在一個失敗模式——演示動作泄露,導致過早的輔助行為。提出了一種推理時轉向方法用於緩解錯誤。16名參與者的人機協作組裝任務實驗表明,轉向方法能夠實現更長的執行視野、更快的協作速度和更少的失敗。
VLADriveBench是一個新框架,用於評估視覺-語言-行動(VLA)模型中思維鏈(CoT)推理與駕駛軌跡之間的相關性、一致性和因果關係。它結合了觀測指標(提及、幻覺、矛盾、行動對齊)和CoT干預協議。應用於三個模型後,發現觀測分析與因果分析可能截然不同:ORION在觀測對齊上得分最高,但其CoT是附帶現象;而Alpamayo v1.5得分較低,但其CoT具有很強的因果性,視覺顯著性調節了CoT的影響程度。
SalArt-VQA是一個用於評估視覺語言模型(VLM)對AI生成圖像中偽影的細粒度理解能力的診斷基準。它包含950張圖像和3681個人工編寫的多選題,覆蓋存在檢測、語義定位、空間定位和基於證據的缺陷識別。通過對20個VLM的測試,該基準揭示了圖像級檢測準確性所隱藏的失敗模式,例如最強模型在偽影圖像上的檢測召回率達到99.37%,但僅有53.26%的圖像能正確回答所有四個偽影相關問題,表明高檢測準確率並不等同於真正的偽影理解。
本文提出高效持續對齊(ECA)方法,用於開放圖像到文本生成中的增量學習。通過引入持續對齊概念和三個核心機制(查詢混合模塊、費舍爾動態擴展、字典回放),ECA在不依賴舊數據的情況下有效緩解災難性遺忘,並在新基準上取得優異性能。
提出一種名為上下文中心特徵融合(CCFF)的新型框架,通過局部上下文融合模塊(LCFM)和全局上下文注意力模塊(GCAM)處理自動駕駛中共同目標的檢測問題。在Cityscapes和BDD100K數據集上,類別級一致性策略(CCS)分別達到0.973和0.969,小目標檢測AP_S提升14.1%,併成功恢復稀有類別如“火車”。框架支持實時處理,僅增加0.2 FPS開銷。
本文提出雙狀態槽注意力(DSSA),一種完全自監督的視頻對象中心學習框架。DSSA將每個槽分解為局部狀態(每幀外觀)和身份狀態(時間穩定對象信息),通過競爭調製聚合(CMA)減少弱匹配槽的虛假更新,從而解決現有方法中因單一槽向量編碼外觀與身份導致的槽交換問題。實驗表明,DSSA在MOVi-C、MOVi-D和YouTube-VIS上持續提升了分割質量和時間一致性,並在下游任務中表現更優。
醫學大型視覺語言模型(LVLMs)在醫學影像任務中表現優異,但仍存在事實不一致、視覺基礎薄弱等問題。現有對齊方法在醫學領域有三大侷限:序列級獎勵信號無法區分關鍵臨牀標記;依賴靜態監督微調導致分佈偏移;缺乏顯式視覺約束。本文提出一種細粒度、在策略的對齊框架,利用雙向逐詞KL正則化器和視覺對比基礎目標,通過最小限度編輯模型輸出構建偏好對,僅糾正臨牀錯誤部分,同時保持語言風格。實驗驗證了該方法的有效性。
少步擴散蒸餾在4-8步生成中已日趨成熟,但進一步推至2步仍具挑戰。本文介紹Z-Image Turbo++,一個從8步Z-Image Turbo教師模型蒸餾而來的高質量2步圖像生成模型,通過三個關鍵設計:分佈對齊對抗學習、步解耦參數化、以及帶有迭代正則化的端到端訓練,顯著縮小了2步與8步生成之間的質量差距。
提出了一種名為HairPort的3D感知髮型遷移框架,能夠處理大姿態和尺度差異,通過顯式分離移除和遷移,並在合成前強制執行幾何一致性。
本文提出一種基於AMD Kria K26 SOM的低功耗、便攜式跌倒預測與檢測系統,利用Intel RealSense D455相機捕獲RGB和深度圖像,通過量化YOLOX、Anchor-to-Joint(A2J)和CNN三級流水線實現隱私保護的實時跌倒檢測。系統在邊緣設備上運行,無需雲端依賴,適用於老年人監護。實驗表明,多線程流水線幀率達4.5 FPS,YOLOX、A2J和CNN精度分別為74%、84.13%和75.85%。
該論文通過多智能體模擬解釋了形態交替(如英語“go”的過去式“went”)的出現和持久性。交替形式源於音系變化或詞彙變體,並通過羣體傳播動態擴散。為評估生成形態的真實性,作者引入了AI歷史語言學家——一個由大語言模型驅動的辯論系統,比較真實與模擬形態。結果表明,無標度社交網絡和隨機伯努利採納有助於產生更合理的形態。三個案例研究驗證了替代歷史情景。
AfriSUD是首個大規模九種非洲語言句法標註樹庫集合,採用SUD框架,由社區推動並由母語者驗證。評估多種模型後發現顯著的句法差距,現有架構難以充分捕捉非洲語言的結構多樣性。
該研究對潛在推理模型(LRM)中的可觀察模式進行了因果與幾何分析,發現如BFS前沿和可解碼算術計算等模式在控制組中也出現,且並非總是因果影響行為。因果乾預揭示潛在思考的利用是分級的,幾何分析顯示效應集中在低秩方向。結論:可觀察模式不能作為內部推理機制的證據,LRM可解釋性需要匹配的控制組和因果測試。
一項新研究提出了MentalMARBERT,這是MARBERT的領域自適應版本,用於從阿拉伯語社交媒體文本中檢測心理健康障礙。採用自適應預訓練和分層微調的兩階段框架,該模型在一個包含50,670條推文(涵蓋六個類別)的新數據集上實現了0.861的宏F1和0.877的準確率,達到了最先進水平。
購物推理基準(Shopping Reasoning Bench)是一個由零售領域專家創建的新基準,包含525個任務(232個單輪、293個多輪)和10863條重要性加權的二元評分標準,旨在評估對話式購物助手在偏好細化、權衡分析和兼容性評估等多輪推理能力。測試結果表明,GPT、Claude和Gemini等頂級模型的整體通過率僅為57-77%,且在多輪任務中表現顯著下降,表明當前模型在提供專家級建議方面仍有較大差距。
本研究將抽象的波斯諺語轉化為富有道德寓意的故事視為一種'約束語義解壓縮'任務,並引入波斯諺語對齊敍事數據集(PAND)。通過混合評估框架,發現當前LLM雖能生成流暢文本,但常無法忠實體現諺語中的道德和因果結構,而顯式推理和迭代細化可部分緩解這一解壓縮差距。
本文提出了一種用於機制級藥物相互作用(DDI)預測的可復現標註與評估協議,包含7家族147亞型分類法和泄漏安全的冷分片策略。並開發了7B參數的MARD模型,融合單令牌KL散度、PRM加權DPO和機制感知檢索通道三項創新。在2026年4月DrugBank數據集上,MARD-7B是32個系統中唯一在藥物對新穎性下保持準確率的模型,比最佳基線高13.9個百分點,比GPT-4o高6.7個百分點,成本僅為前沿API的1%。分析表明其優勢源於結構化藥理推理而非藥物頻率記憶。
EDEN(急診科電子筆記)是一個新的大規模臨牀筆記語料庫,包含約400萬份來自意大利醫院急診科的完全匿名化筆記。其中約六千份筆記由臨牀專家手動標註,涉及呼吸困難和意識喪失兩種患者情況,包含132個條目。該數據集旨在填補意大利語臨牀數據空白,支持大型語言模型在醫療領域的應用。
大型語言模型中的訪問控制需要模塊化機制,但適配器組合時存在干擾。本研究通過DoRA-RBAC框架測試了假設,發現基於幾何感知的合併策略並未優於標準平均,表明干擾主要源於共享非線性表示而非參數空間幾何。
本研究通過直接反向傳播通過偏微分方程結構來診斷損失景觀,發現優化失敗源於平坦高原和陡峭懸崖。當神經網絡固定時,殘差損失產生平滑景觀,避免病態,而神經網絡僅用於補全觀測數據。
本文提出了一種針對伯恩斯坦-舒爾核的新型隨機特徵構造方法,該類核是有限特徵核與完全單調平移不變核的乘積。該方法結合了草圖調製和徑向隨機化,實現了線性特徵維度,同時提供了包括無偏性和算子範數界在內的嚴格理論保證。該方法在核嶺迴歸中提高了效率,旗艦實例是有偏yat核。
MF-Net是一種遞歸動力學模型,將所有變量表示在共享的場狀態中,並通過學習的關係律更新狀態。該模型在已知定律相互作用系統、混沌基準測試、真實神經記錄和生態時間序列中實現了有競爭力的短期和中期預測,同時保留了可檢查的結構化讀出。在40維Lorenz-96測試平台上,八步R²達到0.798±0.018,關係矩陣以19.80±1.00的局部/非局部強度比和1.000±0.000的Precision@K恢復局部耦合支持。
本文論述了在半導體制造等物理約束嚴格的領域中,生成式AI必須從構造上嵌入物理信息,而非事後過濾。綜述了物理信息擴散、PDE約束變分模型、神經算子先驗等架構工具,並提出了包含物理保真度基準、可微分模擬器及多模態基礎模型的研究議程。
ProHiFlo 是一種創新的分層流匹配框架,用於從頭蛋白質生成,通過粗到細的生成、功能引導和自適應 SE(3)-等變架構,在保持精度的同時減少計算成本,並在酶活性位點支架設計上取得了 58.9% 的成功率,顯著優於現有方法。
基於重採樣的統計顯著性評估在數據挖掘中至關重要,但傳統方法需要生成數千個重採樣數據集,計算成本高。本文提出FewRS方法,通過推導檢驗統計量的上確界偏差新界限,僅需極少量重採樣數據集即可保證低誤報率,在模式挖掘和網絡分析任務中將運行時間降低兩個數量級,同時保持高統計功效。
激活引導可以改變大語言模型的行為,但標準評估通常不測試減少奉承行為的引導方向是否也會抑制對事實正確陳述的同意。本文引入雙立場評估,對Llama-3-8B-Instruct應用質心差分引導,發現模型將奉承性同意和事實性同意表示在幾何上不同的子空間中,但引導方向在兩個子空間上的投影相等,無法區分目標。因此,引導同時減少了奉承性陳述和事實正確陳述(如“地球是圓的”)的同意。所有其他靜態屬性均匹配,表明行為分離源於生成動態或殘差流分析無法解析的更精細結構。這一模式揭示了一個普遍差距:從激活中可讀的表徵不一定可通過激活寫入。
本文研究具有二元潛狀態和不完美二元反饋的休眠多臂賭博機問題,受機會頻譜接入中感知誤差的啓發。作者開發了基於部分守恆定律(PCL)的分析與計算框架,用於建立可索引性並計算Whittle指數。該框架通過關聯確定性骨架、更新分解和單詞組合等工具,在多個閾值區域得到了可處理的折扣獎勵和資源指標表達式,完全驗證了PCL-可索引性條件。對於未能完全解析的區域,推導了高效數值方案來計算邊際生產力指數。大量計算實驗表明,該條件在廣泛參數範圍內成立,且MP指數策略通常顯著優於標準基準策略。
該論文提出了一種以部署為中心的評估方法,針對嵌入電子健康記錄的臨牀大語言模型系統,利用查詢內容和部署特定上下文(如提供者類型、科室、所用模型)訓練預響應分類器,預測用户拒絕風險。經過4.5個月的前瞻性分析,模型AUROC達到0.719,證明了利用部署上下文預測用户拒絕的可行性,為觸發防護欄和棄權策略提供了依據。
一篇新預印本論文探討了從人類水平的通用人工智能(AGI)向人工通用超級智能(ASI)的過渡,提出了四種潛在路徑:擴展AGI、AI範式轉變、遞歸改進以及大規模多智能體集體湧現的ASI。論文還討論了這些路徑上的摩擦與瓶頸,並指出AI進步可能加速,導致一系列變革而非單一突破。