AI News HubLIVE

AI 新聞即時情報

即時監測

今天 AI 世界最重要的變化

來自 105 個可信來源,最近更新 2026-05-25 12:00 UTC+8。

即時監測

即時更新

即時追蹤可信來源,保留出處、權限和站內閱讀模式,把噪音壓成可讀情報。

即時更新

重設
CoMoGen:基於掩碼引導的影片生成實現可控運動動力學與互動

CoMoGen是一種可控影片生成框架,透過輸入影像的二進位制掩碼序列生成逼真的互動動態。它引入輕量級MaskAdapter將掩碼編碼為潛在殘差訊號,並透過餘弦加權排程注入多模態擴散變換器(MMDiT)。透過在MMDiT注意力空間中識別“運動層”,並僅對運動層使用低秩適配(LoRA)進行微調,CoMoGen在不改變架構的情況下降低了計算成本。實驗表明,CoMoGen在運動保真度和感知真實感方面達到了最先進水平。

arXiv Computer Vision模型 / 研究站內正文
透過學習世界到影像的投影改進視覺到航標關聯

本文介紹了一種對DETR融合變換器基線的輕量級修改,用於MaCVi 2026視覺到航標資料關聯挑戰。該方法訓練了一個專用MLP(QueryMLP),從海圖測量和IMU姿態資料顯式預測浮標的水線接觸點的畫素座標,並將其附加到基線解碼器查詢向量中,為每個浮標提供直接的空間先驗,減輕變換器解碼器的幾何推理負擔。在挑戰賽排行榜上,該方法在保留測試集上取得了0.7386的總分,F1為0.8055,mIoU為0.6718,在所有提交中排名第二。

arXiv Computer Vision模型 / 研究站內正文
VideoOdyssey:超長上下文與全模態影片理解基準

VideoOdyssey是一個專為超長時間上下文和全模態影片理解設計的基準,平均影片時長109分鐘,覆蓋11個領域54個子類別,透過連續證書長度衡量認知負荷,並設有5個粒度級別。評估表明當前多模態大模型在持續推理、細粒度感知和非語言全模態理解方面存在瓶頸。

arXiv Computer Vision模型 / 研究 / 創業融資站內正文
視而不見?視覺語言基準真的測試了視覺能力嗎?

該研究質疑視覺語言模型(VLM)在基準測試中的高分是否真正反映其視覺理解能力。實驗發現,移除大量影像令牌僅輕微降低模型效能,表明模型對細粒度視覺證據的敏感性不足。透過全域性退化、區域性遮擋、問題改寫、答案空間擴充套件及決策層分析,結合層視覺令牌幾何分析,研究者揭示模型預測在內部支援減弱時仍可能保持不變,且視覺令牌在深層中趨於相似。結論是當前基準無法可靠評估VLM的細粒度視覺基礎。

arXiv Computer Vision模型 / Agent / 研究站內正文
GEM-4D:用於機器人操作的幾何增強影片世界模型

GEM-4D是一種幾何增強的影片世界模型,透過注入密集的4D對應監督來提升機器人的操作能力。該模型在訓練時從預訓練的幾何基礎模型中提取知識,從而同時捕捉外觀和幾何結構,且不增加推理成本。此外,引入逆向動力學模組,將一致的影片序列轉化為可執行的機器人軌跡。實驗顯示,GEM-4D在影片預測和幾何一致性上達到最優,並將真實世界操作成功率從61%提升至81%。

arXiv Computer Vision模型 / 研究 / 機器人站內正文
當AI在信仰問題上站隊:AI介導的信仰指導中持續存在的非對稱性

一項新研究發現,大型語言模型(LLMs)在回答宗教轉換問題時表現出持續的非對稱性。模型傾向於支援加入天主教、巴哈伊教和錫克教,同時勸阻放棄這些信仰,而對無神論者、不可知論者和耶和華見證人則相反。該研究測試了20個模型在182對宗教配對中的表現,結果具有可重複性。研究使用人類驗證的“LLM作為法官”框架,發現所有模型均顯示非對稱性,其中Grok 4.20最為顯著。這些偏差如果大規模部署可能產生現實影響。

arXiv Computational Linguistics模型 / 研究站內正文
AI能猜出你知道什麼?大型語言模型從溝通日誌中評估人類領域知識的效能比較

研究評估了七個大型語言模型(包括Gemini、Claude和GPT系列)從長期Slack日誌中推斷個人領域知識的能力。分析27,188條來自43名使用者的訊息,對比零樣本估計與27名參與者的自我報告技能評分。Gemini 2.5 Flash表現最佳(MAE 21.13%),而GPT模型誤差較大。研究發現,估計準確性僅微弱依賴於訊息數量,表明更多文本並不能保證更好的推斷。該結果展示了自動專業知識對映的可行性和當前侷限性,強調需要隱私保護部署和更豐富的結構感知知識表示。

arXiv Computational Linguistics模型 / 研究站內正文
圖對齊拓撲作為接地檢測的歸納偏置

大型語言模型(LLM)最佳化於生成分佈上合理的續接,而非明確驗證生成命題是否源於源文件。這一歸納偏置促進了泛化,但未編碼響應是否相對於參考文本接地。現有幻覺檢測方法透過檢索增強、自一致性或宣告驗證改善事實性,但通常不直接學習對齊拓撲。本文構建參考資訊與LLM輸出之間的對齊二分圖,並訓練圖神經網路(GNN)透過訊息傳遞建模對齊結構。該方法在四個不同的幻覺和問答資料集上取得了最先進的結果,優於包括GPT-4o在內的所有比較方法。

arXiv Computational Linguistics模型 / 研究站內正文
可學習性感知的擴散語言模型微調

為提高擴散語言模型(DLM)的推理能力,研究人員提出LIFT演算法,透過感知不同時間步的資訊可學習性來最佳化微調過程,在六個推理基準上超越現有方法,並在AIME'24和AIME'25上取得高達3倍的相對提升。

arXiv Computational Linguistics模型 / 研究站內正文
它們能走多遠?使用大型語言模型進行線上影響力紅隊測試

本研究提出一種紅隊測試框架,用於評估開源大型語言模型在政治爭議話題上的表達範圍(Overton Window),並量化簡單自然語言越獄如何擴充套件該範圍。研究發現,開源模型普遍更傾向於生成左傾內容,Overton Window隨模型規模增大而收縮,且存在顯著的地區差異。越獄效果在不同模型家族間差異明顯,該框架有助於審計模型的政治可控性並設計更強的防禦措施。

arXiv Computational Linguistics模型 / Agent / 研究站內正文
低資源開源文本到SQL模型的知識蒸餾

本文提出一種知識感知的Text-to-SQL框架,透過構建任務特定的知識庫(包括模式語義、縮寫、業務邏輯和查詢模式),並注入訓練和推理過程,在低資源領域顯著提升模型效能。實驗在七個基準上驗證了其對開源和閉源大語言模型的改進。

arXiv Computational Linguistics模型 / 研究站內正文
豪薩語和豐貝語文本與語音資源調查:NLP開發的可用性、質量與差距

本調查系統梳理了豪薩語(約8000萬-1億母語者)和豐貝語(貝南約200萬人使用)的公開文本與語音資源。研究發現豪薩語在新聞、百科和教育領域擁有更豐富的文本資源,而豐貝語儘管文本資源有限,但近年學術語音資料收集專案有所增長。兩種語言均被納入Masakhane基準測試。報告提出了任務特定建議,並指出了關鍵缺口,如豐貝語領域多樣化文本和豪薩語專用語音庫。

arXiv Computational Linguistics模型 / 研究 / 創業融資站內正文
張量快取:用於Transformer的基於驅逐條件的關聯記憶

張量快取是一種兩層級快取架構,結合滑動視窗注意力作為一級快取(L1)和固定大小的外積快速權重記憶作為二級快取(L2),L2由視窗驅逐的KV對填充。該方法透過線性注意力恆等式實現高效讀取,並引入可學習的門控融合L1和L2輸出。實驗表明,張量快取在記憶-質量邊界上優於有狀態基線。

arXiv Machine Learning模型 / 研究站內正文
WeCon:一種高效的多目標組合最佳化問題權重條件神經網路求解器

現有神經求解器在處理多目標組合最佳化問題時,通常採用基於分解的策略,將問題轉化為多個與權重向量相關的子問題。然而,這些方法往往僅在解碼階段注入一次權重,限制了權重條件上下文建模,或者主要在編碼階段注入,導致解碼時權重訊號稀釋。此外,偏好最佳化方法依賴純隨機取樣構建解對,訓練效率低下。為此,本文提出WeCon,一種高效的權重條件神經網路求解器,透過門控殘差融合(GRF)和殘差融合(RF)模組增強權重與例項特徵的互動,並引入高效偏好最佳化(EPO)構建高質量解對。實驗表明,WeCon在超體積(HV)指標上與最先進的POCCO-W相當,同時推理時間減少40%。

arXiv Machine Learning研究站內正文
大型語言模型何時需要推理?基於熵變相變的動力系統視角

研究表明,鏈式思維推理並非總是有益,早期熵動力學可用於判斷何時需要推理。作者提出EDRM框架,透過熵軌跡自適應選擇推理策略,在15個基準測試和4個模型上實現41-55%的token減少同時提升準確率。

arXiv Machine Learning模型 / 研究站內正文
MedExpMem:將經驗記憶用於鑑別診斷

MedExpMem是一種新型經驗記憶框架,使醫學視覺語言模型能夠從診斷失敗中積累鑑別診斷經驗。在11個放射學專業領域實現高達7%的準確率提升。

arXiv Machine Learning模型 / Agent / 研究站內正文
基於自模式連通性引導的流形表示遺忘的近似機器遺忘

本文提出 ManiF-SMC 方法,透過將擦除樣本從原始流形表示質心推向保留資料中的最近語義鄰居,在表示空間內實現近似機器遺忘,減少了對標籤和梯度的依賴。自模式連通模組自適應生成邊距,實驗表明遺忘效果與現有方法相當。

arXiv Machine Learning研究站內正文
讀出捷徑:位置數字複製主導小語言模型的算術思維鏈讀出

研究發現,小語言模型在進行算術推理時,思維鏈(CoT)提示的步驟順序並不重要,模型實際上是透過複製答案分隔符前的最後一個數字來得出答案,而非依賴邏輯推理。這種位置性捷徑佔模型準確率的絕大部分,且即使中間推理正確,錯誤的尾數也會導致答案錯誤。不同模型表現有差異,但該現象普遍存在,對基於CoT的監督方法提出了挑戰。

arXiv Machine Learning模型 / 研究 / 創業融資站內正文
FuRA:基於譜預條件的全秩引數高效微調

FuRA是一種新型全秩引數高效微調方法,透過譜預條件保留預訓練的穩健特徵,在LLM和VLM微調中超越全引數微調和LoRA,其4位量化變體QFuRA也優於QLoRA。

arXiv Machine Learning模型 / 研究站內正文
FusionSense:三階段近感測器學習實現執行時自適應多模態邊緣智慧

FusionSense是一種面向能源受限自主邊緣系統的融合感知智慧框架。透過三階段訓練流程(伺服器端融合模型學習、濾除安全標籤量化模態必要性、注入近感測器預測壓縮邊緣融合模型),在執行時聯合減少計算與通訊開銷。在SynDrone雙模態(RGB+深度/雷射雷達)測試中,任務質量保持的同時實現了高達33倍的能量節省(1%感興趣區域出現率),質量損失減少92.3%。

arXiv Machine Learning模型 / 研究 / 機器人站內正文
從語言模型軌跡中讀取校準的不確定性

一種新方法從語言模型的逐層MLP更新中提取11個尺度不變的幾何特徵,訓練稀疏線性探針,在選擇性棄權任務中優於最大軟最大機率(MSP),收益最高達21個AURC點。

arXiv Machine Learning模型 / 研究站內正文
潛在快取流:無需文本的模型間通訊

潛在快取流(LCF)透過聯合翻譯和壓縮鍵值對,將介面卡大小降至Cache-to-Cache(C2C)的4%,並支援上下文不同的通訊場景。實驗表明,在共享上下文中,13MB的LCF介面卡比956MB的C2C更準確;在不同上下文中,LCF比基於文本的通訊準確率高23%、速度快8.5倍。

arXiv Machine Learning模型 / Agent / 研究站內正文
PathCal:狀態感知的反思標記校準以實現高效推理

大型推理語言模型(LRM)在推理過程中會產生包含“等等”、“但是”、“或者”等反思標記的長鏈思維軌跡。研究表明這些標記的功能角色和影響時機各不相同。PathCal是一種無需訓練的解碼控制器,透過區分標記型別並在區域性不確定狀態進行干預,在保持或提高精度的同時減少生成長度,實現更好的效率-效能平衡。

arXiv AI模型 / 研究站內正文
確定性地平線:將不可能性結果作為可信AI系統的設計規範

該論文將圖靈、阿羅和無免費午餐等基本極限轉化為設計規則,提出了確定性地平線這一概念:由架構決定的精度上限,在關鍵推理深度後無法透過訓練提升。研究測量了12種Transformer架構的地平線值(19-31),並透過資訊理論證明了超過該界限後精度呈超指數衰減。此外,論文還涵蓋了偏好學習、多階段檢索、真實拍賣和零知識驗證等領域,構建了16個規範,每個規範包含可計算邊界、量化違規成本和建設性設計規則。

arXiv AI模型 / Agent / 研究站內正文
EVE-Agent:可驗證證據的自我進化代理

EVE-Agent是一種新的自我進化搜尋代理,透過引入證據可驗證性來確保訓練例項的來源可靠性。它修改了提出者-求解者框架,使用證據驗證器根據證據帶來的邊際準確率增益進行獎勵,從而在不依賴人工標註的情況下提升模型的證據基礎正確性。實驗表明,EVE-Agent顯著優於先前的自我進化代理,並且其生成的資料集具有可審計性。

arXiv AIAgent / 研究站內正文
中介模糊邏輯:從一型基礎到二型、三型及量子擴充套件

本文系統發展了中介模糊邏輯的一型核心,並擴充套件至區間二型、粒狀三型及量子版本,建立了基於猶豫和矛盾控制的凸聚合運算元,證明了可靠性、次協調性和保守性,並透過自動駕駛剎車感測器融合示例展示了其在處理不完整、異質和輕微矛盾證據中的透明、保守和優先安全的決策能力。

arXiv AI政策 / 研究站內正文
ImProver 2:用於神經符號證明最佳化的迭代自改進語言模型

ImProver 2是一個神經符號框架,用於自動化Lean 4中的證明最佳化。它透過資料高效的專家迭代流水線和暴露形式結構與輕量級非正式抽象的腳手架,訓練出7B引數的模型,在效能上超越同系列大模型,與中端前沿模型競爭。研究表明,透過適當的腳手架和訓練,小模型也能有效重構研究級證明。

arXiv AI模型 / 研究站內正文
每個成功目標的能量:面向智慧體AI系統的目標級能量核算

新研究提出A-LEMS框架,以每個成功目標的能量(EpG)而非每次推理來衡量AI能耗。實驗表明,智慧體工作流平均能耗是線性基線的4.33倍,編排結構是主要驅動因素,但在工具增強任務中可能更節能。

arXiv AI模型 / Agent / 研究站內正文