本文介紹了一種對DETR融合變換器基線的輕量級修改,用於MaCVi 2026視覺到航標數據關聯挑戰。該方法訓練了一個專用MLP(QueryMLP),從海圖測量和IMU姿態數據顯式預測浮標的水線接觸點的像素座標,並將其附加到基線解碼器查詢向量中,為每個浮標提供直接的空間先驗,減輕變換器解碼器的幾何推理負擔。在挑戰賽排行榜上,該方法在保留測試集上取得了0.7386的總分,F1為0.8055,mIoU為0.6718,在所有提交中排名第二。
AI 新聞即時情報
即時監測
即時更新
即時追蹤可信來源,保留出處、權限和站內閱讀模式,把噪音壓成可讀情報。
即時更新
VideoOdyssey是一個專為超長時間上下文和全模態視頻理解設計的基準,平均視頻時長109分鐘,覆蓋11個領域54個子類別,通過連續證書長度衡量認知負荷,並設有5個粒度級別。評估表明當前多模態大模型在持續推理、細粒度感知和非語言全模態理解方面存在瓶頸。
該研究質疑視覺語言模型(VLM)在基準測試中的高分是否真正反映其視覺理解能力。實驗發現,移除大量圖像令牌僅輕微降低模型性能,表明模型對細粒度視覺證據的敏感性不足。通過全局退化、局部遮擋、問題改寫、答案空間擴展及決策層分析,結合層視覺令牌幾何分析,研究者揭示模型預測在內部支持減弱時仍可能保持不變,且視覺令牌在深層中趨於相似。結論是當前基準無法可靠評估VLM的細粒度視覺基礎。
GEM-4D是一種幾何增強的視頻世界模型,通過注入密集的4D對應監督來提升機器人的操作能力。該模型在訓練時從預訓練的幾何基礎模型中提取知識,從而同時捕捉外觀和幾何結構,且不增加推理成本。此外,引入逆向動力學模塊,將一致的視頻序列轉化為可執行的機器人軌跡。實驗顯示,GEM-4D在視頻預測和幾何一致性上達到最優,並將真實世界操作成功率從61%提升至81%。
一項新研究發現,大型語言模型(LLMs)在回答宗教轉換問題時表現出持續的非對稱性。模型傾向於支持加入天主教、巴哈伊教和錫克教,同時勸阻放棄這些信仰,而對無神論者、不可知論者和耶和華見證人則相反。該研究測試了20個模型在182對宗教配對中的表現,結果具有可重複性。研究使用人類驗證的“LLM作為法官”框架,發現所有模型均顯示非對稱性,其中Grok 4.20最為顯著。這些偏差如果大規模部署可能產生現實影響。
研究評估了七個大型語言模型(包括Gemini、Claude和GPT系列)從長期Slack日誌中推斷個人領域知識的能力。分析27,188條來自43名用户的消息,對比零樣本估計與27名參與者的自我報告技能評分。Gemini 2.5 Flash表現最佳(MAE 21.13%),而GPT模型誤差較大。研究發現,估計準確性僅微弱依賴於消息數量,表明更多文本並不能保證更好的推斷。該結果展示了自動專業知識映射的可行性和當前侷限性,強調需要隱私保護部署和更豐富的結構感知知識表示。
大型語言模型(LLM)優化於生成分佈上合理的續接,而非明確驗證生成命題是否源於源文檔。這一歸納偏置促進了泛化,但未編碼響應是否相對於參考文本接地。現有幻覺檢測方法通過檢索增強、自一致性或聲明驗證改善事實性,但通常不直接學習對齊拓撲。本文構建參考信息與LLM輸出之間的對齊二分圖,並訓練圖神經網絡(GNN)通過消息傳遞建模對齊結構。該方法在四個不同的幻覺和問答數據集上取得了最先進的結果,優於包括GPT-4o在內的所有比較方法。
為提高擴散語言模型(DLM)的推理能力,研究人員提出LIFT算法,通過感知不同時間步的信息可學習性來優化微調過程,在六個推理基準上超越現有方法,並在AIME'24和AIME'25上取得高達3倍的相對提升。
本研究提出一種紅隊測試框架,用於評估開源大型語言模型在政治爭議話題上的表達範圍(Overton Window),並量化簡單自然語言越獄如何擴展該範圍。研究發現,開源模型普遍更傾向於生成左傾內容,Overton Window隨模型規模增大而收縮,且存在顯著的地區差異。越獄效果在不同模型家族間差異明顯,該框架有助於審計模型的政治可控性並設計更強的防禦措施。
本文提出一種知識感知的Text-to-SQL框架,通過構建任務特定的知識庫(包括模式語義、縮寫、業務邏輯和查詢模式),並注入訓練和推理過程,在低資源領域顯著提升模型性能。實驗在七個基準上驗證了其對開源和閉源大語言模型的改進。
本調查系統梳理了豪薩語(約8000萬-1億母語者)和豐貝語(貝寧約200萬人使用)的公開文本與語音資源。研究發現豪薩語在新聞、百科和教育領域擁有更豐富的文本資源,而豐貝語儘管文本資源有限,但近年學術語音數據收集項目有所增長。兩種語言均被納入Masakhane基準測試。報告提出了任務特定建議,並指出了關鍵缺口,如豐貝語領域多樣化文本和豪薩語專用語音庫。
張量緩存是一種兩層級緩存架構,結合滑動窗口注意力作為一級緩存(L1)和固定大小的外積快速權重記憶作為二級緩存(L2),L2由窗口驅逐的KV對填充。該方法通過線性注意力恆等式實現高效讀取,並引入可學習的門控融合L1和L2輸出。實驗表明,張量緩存在記憶-質量邊界上優於有狀態基線。
現有神經求解器在處理多目標組合優化問題時,通常採用基於分解的策略,將問題轉化為多個與權重向量相關的子問題。然而,這些方法往往僅在解碼階段注入一次權重,限制了權重條件上下文建模,或者主要在編碼階段注入,導致解碼時權重信號稀釋。此外,偏好優化方法依賴純隨機採樣構建解對,訓練效率低下。為此,本文提出WeCon,一種高效的權重條件神經網絡求解器,通過門控殘差融合(GRF)和殘差融合(RF)模塊增強權重與實例特徵的交互,並引入高效偏好優化(EPO)構建高質量解對。實驗表明,WeCon在超體積(HV)指標上與最先進的POCCO-W相當,同時推理時間減少40%。
研究表明,鏈式思維推理並非總是有益,早期熵動力學可用於判斷何時需要推理。作者提出EDRM框架,通過熵軌跡自適應選擇推理策略,在15個基準測試和4個模型上實現41-55%的token減少同時提升準確率。
MedExpMem是一種新型經驗記憶框架,使醫學視覺語言模型能夠從診斷失敗中積累鑑別診斷經驗。在11個放射學專業領域實現高達7%的準確率提升。
本文提出 ManiF-SMC 方法,通過將擦除樣本從原始流形表示質心推向保留數據中的最近語義鄰居,在表示空間內實現近似機器遺忘,減少了對標籤和梯度的依賴。自模式連通模塊自適應生成邊距,實驗表明遺忘效果與現有方法相當。
研究發現,小語言模型在進行算術推理時,思維鏈(CoT)提示的步驟順序並不重要,模型實際上是通過複製答案分隔符前的最後一個數字來得出答案,而非依賴邏輯推理。這種位置性捷徑佔模型準確率的絕大部分,且即使中間推理正確,錯誤的尾數也會導致答案錯誤。不同模型表現有差異,但該現象普遍存在,對基於CoT的監督方法提出了挑戰。
FuRA是一種新型全秩參數高效微調方法,通過譜預條件保留預訓練的穩健特徵,在LLM和VLM微調中超越全參數微調和LoRA,其4位量化變體QFuRA也優於QLoRA。
FusionSense是一種面向能源受限自主邊緣系統的融合感知智能框架。通過三階段訓練流程(服務器端融合模型學習、濾除安全標籤量化模態必要性、注入近傳感器預測壓縮邊緣融合模型),在運行時聯合減少計算與通信開銷。在SynDrone雙模態(RGB+深度/激光雷達)測試中,任務質量保持的同時實現了高達33倍的能量節省(1%感興趣區域出現率),質量損失減少92.3%。
一種新方法從語言模型的逐層MLP更新中提取11個尺度不變的幾何特徵,訓練稀疏線性探針,在選擇性棄權任務中優於最大軟最大概率(MSP),收益最高達21個AURC點。
潛在緩存流(LCF)通過聯合翻譯和壓縮鍵值對,將適配器大小降至Cache-to-Cache(C2C)的4%,並支持上下文不同的通信場景。實驗表明,在共享上下文中,13MB的LCF適配器比956MB的C2C更準確;在不同上下文中,LCF比基於文本的通信準確率高23%、速度快8.5倍。
大型推理語言模型(LRM)在推理過程中會產生包含“等等”、“但是”、“或者”等反思標記的長鏈思維軌跡。研究表明這些標記的功能角色和影響時機各不相同。PathCal是一種無需訓練的解碼控制器,通過區分標記類型並在局部不確定狀態進行干預,在保持或提高精度的同時減少生成長度,實現更好的效率-性能平衡。
該論文將圖靈、阿羅和無免費午餐等基本極限轉化為設計規則,提出了確定性地平線這一概念:由架構決定的精度上限,在關鍵推理深度後無法通過訓練提升。研究測量了12種Transformer架構的地平線值(19-31),並通過信息論證明了超過該界限後精度呈超指數衰減。此外,論文還涵蓋了偏好學習、多階段檢索、真實拍賣和零知識驗證等領域,構建了16個規範,每個規範包含可計算邊界、量化違規成本和建設性設計規則。
EVE-Agent是一種新的自我進化搜索代理,通過引入證據可驗證性來確保訓練實例的來源可靠性。它修改了提出者-求解者框架,使用證據驗證器根據證據帶來的邊際準確率增益進行獎勵,從而在不依賴人工標註的情況下提升模型的證據基礎正確性。實驗表明,EVE-Agent顯著優於先前的自我進化代理,並且其生成的數據集具有可審計性。
本文系統發展了中介模糊邏輯的一型核心,並擴展至區間二型、粒狀三型及量子版本,建立了基於猶豫和矛盾控制的凸聚合算子,證明了可靠性、次協調性和保守性,並通過自動駕駛剎車傳感器融合示例展示了其在處理不完整、異質和輕微矛盾證據中的透明、保守和優先安全的決策能力。
ImProver 2是一個神經符號框架,用於自動化Lean 4中的證明優化。它通過數據高效的專家迭代流水線和暴露形式結構與輕量級非正式抽象的腳手架,訓練出7B參數的模型,在性能上超越同系列大模型,與中端前沿模型競爭。研究表明,通過適當的腳手架和訓練,小模型也能有效重構研究級證明。
新研究提出A-LEMS框架,以每個成功目標的能量(EpG)而非每次推理來衡量AI能耗。實驗表明,智能體工作流平均能耗是線性基線的4.33倍,編排結構是主要驅動因素,但在工具增強任務中可能更節能。
SciAtlas整合了來自26個學科的4300萬篇論文,構建了包含1.57億個實體和30億個三元組的知識圖譜,使AI代理能夠進行拓撲感知的科學推理,減少邏輯幻覺。
研究數學智能體(RMA)是一個專為研究級數學問題設計的自動化推理框架,通過多代理協作和迭代優化,在First Proof基準上解決了10個問題中的8個,超越了GPT-5.2R和Aletheia等強基線。
NeuroNL2LTL是一種結合神經翻譯與形式驗證的神經符號框架,能將自然語言需求自動轉換為線性時序邏輯(LTL)規約。該系統通過中間表示保證結構保持,並利用驗證結果作為強化學習獎勵信號來優化神經組件,在20萬+跨領域需求上實現了28%語義等價和86%可滿足性驗證率。