AI News HubLIVE

AI 新聞即時情報

即時監測

今日 AI 世界最重要的變化

來自 105 個可信來源,最近更新 2026-05-27 12:00 UTC+8。

即時監測

即時更新

即時追蹤可信來源,保留出處、權限和站內閱讀模式,把噪音壓成可讀情報。

即時更新

重設
LongAV-Compass:面向分鐘級視聽生成的統一評估框架

LongAV-Compass是一個系統化基準,用於評估分鐘級視聽生成任務,涵蓋文本到視聽、圖像到視聽和視頻到視聽三種模態。包含284個測試案例,集成多模態大模型輔助評估和感知指標,評估超過20個細粒度維度。對11個代表性模型的實驗揭示了當前系統在長時間生成中的侷限性。

arXiv Computer Vision模型 / 研究 / 創業融資站內正文
RoMo:大規模、豐富組織的人體運動生成數據集與語義分類體系

RoMo是一個大規模、高質量的人體運動數據集,通過分類感知過濾管道去除靜態和偽影序列,採用新穎的三級語義分類體系進行標註,支持細粒度評估,訓練模型在保真度和多樣性方面達到最先進水平,併發布了Motion Toolbox以標準化指標和數據轉換。

arXiv Computer Vision模型 / 研究 / 創業融資站內正文
Sentinel:具身協同空間推理與規劃

本文研究城市規模户外環境中分散的具身智能體如何通過自然語言通信協調行動,提出Sentinel Challenge基準和CoSaR框架,結合基礎模型的高層通信與經典空間導航算法,實現更快的聚集、更短的路徑和更高的安全性。

arXiv Computer Vision模型 / Agent / 政策站內正文
DuoGesture:神經啓發與生物力學引導的雙流共語手勢生成

DuoGesture是一種神經啓發、生物力學引導的雙流方法,將共語手勢生成分解為語義流和節拍流。通過語義變分信息瓶頸協調兩流,並用運動接地語義條件增強語義流,慣性節拍先驗提升節拍流的平滑度。實驗表明其優於整體基線。

arXiv Computer Vision模型 / 研究 / 創業融資站內正文
並非所有模態都平等:面向多模態視頻的指令感知門控機制

預訓練視頻大模型在視覺推理上表現出色,但處理帶有音頻、深度圖等輔助流的視頻時,統一融合會導致模態干擾。為此,研究者提出UniMVU框架,通過兩層動態門控(內模態門和模態級門)實現指令感知融合,在六個基準上取得最高13.5 CIDEr的提升,且門控機制與人類可解釋的模態相關性一致。

arXiv Computer Vision模型 / 研究站內正文
多輪文本到SQL的內存架構:基準測試與實證研究

該研究引入EnterpriseMem-Bench,一個多輪Text-to-SQL基準測試,包含300個會話和1400輪查詢。評估五種前沿模型發現:無狀態模型在第三輪準確率歸零;內存複雜度不單調提升性能,工作內存佔主導;Claude Sonnet 4.6在SEC EDGAR上出現代際退化;推理模式下Claude錯誤分佈變為單模態。

arXiv Computational Linguistics模型 / Agent / 研究站內正文
通過潛在激活引導實現大語言模型的文化價值對齊

該論文提出一種可泛化的文化評估與干預框架,通過情境化行為探測和潛在激活引導,在不重新訓練的情況下調整大語言模型的文化價值對齊。實驗發現文化價值存在潛在糾纏現象,表明價值觀以耦合結構編碼。

arXiv Computational Linguistics模型 / 政策 / 研究站內正文
為什麼LLM會在結構化知識上產生幻覺:線性化表示推理的機制分析

一項新研究揭示了大型語言模型(LLM)在處理結構化知識(如圖和表格)時產生幻覺的機制。研究發現,幻覺源於系統性的內部動態,而非隨機噪聲:注意力過度集中於類似捷徑的結構線索,而前饋表示無法將知識接地,導致模型退回到參數記憶。這些模式在不同結構化知識格式中普遍存在,可用於幻覺檢測。

arXiv Computational Linguistics模型 / 研究站內正文
面向檢索增強生成的情境內優化:基於梯度下降的視角

本研究從梯度下降的角度重新審視檢索增強生成(RAG),證明線性自注意力層可以執行統一線性化RAG目標的梯度下降步驟,從而在檢索增強預測與情境內優化之間建立精確對應關係。基於這一發現,作者提出了一種輕量級方法,通過僅前向傳播的更新來優化凍結RAG大語言模型的證據使用接口。在七個問答基準測試中,該方法在保持檢索器和骨幹網絡固定的情況下,顯著提升了基線性能,並能在更低計算成本下接近測試時梯度優化的效果。

arXiv Computational Linguistics模型 / 研究站內正文
RICE-PO:將檢索交互轉化為推理代理的信用信號

檢索正從單次匹配向交互式推理發展,語言代理需迭代檢查證據、重構查詢並再次搜索。訓練此類代理面臨信用分配挑戰:可執行動作(如查詢或摘要)可由檢索器直接評估,而潛在推理步驟無法直接觀察且僅影響未來可執行動作。這種不對稱性使基於最終結果的獎勵分配不可靠。本文提出RICE-PO,一種無需批評者的策略優化框架,將檢索交互轉化為局部學習信號。RICE-PO選擇高不確定性的可執行動作作為錨點,使用檢索指標評估局部反事實分支,並僅在推理到動作的影響強且未來殘餘效應穩定時,將信用傳播給潛在推理步驟。在BRIGHT和BEIR基準上,相同檢索器設置下,RICE-PO一致優於基於提示的代理和基於羣體的強化學習基線。結果表明,代理-環境交互的結構本身可為訓練基於推理的檢索代理提供有效監督。

arXiv Computational LinguisticsAgent / 政策站內正文
每日劑量:用於放射腫瘤學臨牀總結和試驗識別的工作流集成大語言模型自動化

本文介紹了“每日劑量”(TDD)系統,這是一個由大語言模型驅動的自動化臨牀總結和臨牀試驗識別系統,集成到常規放射腫瘤學實踐中。通過混合方法評估,對55名臨牀醫生進行了調查,結果顯示系統具有良好的可用性、滿意度,並有望節省時間。

arXiv Computational Linguistics模型 / Agent / 研究站內正文
CroCo:跨語言對比偏好調優,基於自我生成內容

CroCo方法將對比偏好調優擴展到多語言場景,利用英語獎勵模型為多語言自生成響應排序,無需語言特定偏好標註。實驗表明,在線內策略數據下,該方法在14種語言的結構化與開放生成任務中顯著提升模型性能。

arXiv Computational Linguistics模型 / 政策 / 研究站內正文
SPEAR:代碼增強的智能提示優化

SPEAR(沙盒化主動回滾提示工程師)是一種自由形式的智能優化器,將代碼即行動範式引入自動提示工程。它配備評估、Python、設置提示和完成四個工具,可自主決策如何使用。其獨特之處在於Python沙盒,允許優化器編寫和執行任意Python代碼以進行結構性錯誤分析。兩個防護欄確保單調改進:指標迴歸時自動回滾和可選防護指標下限。在三個工業LLM裁判套件(13個裁判任務)以及7個BBH任務和GSM8K上評估,SPEAR在所有工業任務的主要指標上獲勝,並在BBH-7上平均準確率0.938。消融實驗顯示Python工具是最重要的槓桿。

arXiv Computational Linguistics模型 / Agent / 研究站內正文
自驗證蒸餾:你的語言模型秘密地成為自己的合成數據管道

提出自驗證蒸餾(Self-Verified Distillation, SVD)方法,讓大語言模型僅利用無標籤提示進行自我改進,無需外部教師或工具反饋。在數學、科學和編程三個推理領域,Qwen3模型通過SVD訓練後性能顯著提升。

arXiv Computational Linguistics模型 / 研究站內正文
當規則違反罕見時:面向邏輯異常檢測的奇美拉訓練

本文提出一種神經規則評估器,將邏輯約束編譯為有向無環圖,並引入奇美拉訓練方法以解決訓練中真實異常樣本稀缺的問題。在CLEVRER、OpenImages和VidOR等數據集上,該方法顯著提升了邏輯異常檢測的性能,尤其在組合性和關係性規則方面。

arXiv Machine Learning研究站內正文
通過監督投影流形學習實現李羣嵌入的神經動力學規劃

本文提出李羣嵌入動態神經網絡(LieEDNN),利用伴隨李羣作用解決李羣與加法運算不兼容及動力學在非線性空間中演化的問題,實現穩定可學習的神經動力學,並在SE(3)上以伸縮機械臂為應用驗證。

arXiv Machine Learning模型 / 研究 / 機械人站內正文
基於推送的異步聯邦學習:一種偏差校正聚合方法

提出PushCen-ADFL框架,通過質心表示空間耦合通信、聚合與局部穩定,採用保平均推和混合校正聚合偏差,利用輕量質心正則化緩解異質性和陳舊性引起的模型漂移,並引入有界去重緩衝區提升魯棒性。在視覺數據集上準確率提升高達6%,通信成本降低80%以上。

arXiv Machine Learning研究站內正文
TSFMAudit:時間序列基礎模型預訓練數據污染審計

針對時間序列基礎模型(TSFMs)在預訓練中可能遇到評估數據集導致性能評估過於樂觀的問題,本文首次研究了TSFMs的預訓練數據污染審計。提出TSFMAudit方法,基於探測適應動態,通過微調探測後污染數據集更快的損失下降和更小的骨幹網絡移動來檢測污染。在6個TSFMs和187個數據集上評估,優於10個基線方法。

arXiv Machine Learning模型 / 研究 / 創業融資站內正文
神經貝葉斯順序路由

神經貝葉斯順序路由(NBSR)是一種將神經推理建模為有向無環圖上主動證據累積的框架。它利用狄利克雷-分類共軛框架,通過全局知識庫提取正證據向量,並採用Gumbel-Softmax直通估計器實現硬路徑路由。該框架提供不確定性量化、早期退出、分佈外拒絕和成本感知證據獲取機制。理論證明單調精度增長和有界方差,實驗表明其在多種任務中具有競爭力的性能。

arXiv Machine Learning模型 / Agent / 研究站內正文
AirCast-SR:基於潛在一致性擴散的大氣超分辨率基礎模型,實現公里級分辨率

AirCast-SR是一個基礎模型,能夠將全球AI天氣預報從0.25度(約28公里)分辨率降尺度到1公里水平分辨率,時間分辨率為每小時。它採用三維U-Net結合潛在一致性模型擴散框架,在美國本土的數據上訓練。該模型實現了近乎零偏差,並保留了精細尺度的大氣結構,經過多個季節的驗證,並展示了在無需重新訓練的情況下對印度和德國的零樣本遷移能力。

arXiv Machine Learning模型 / 研究站內正文
約束税:衡量小型語言模型結構化輸出的有效性與正確性權衡

該論文提出“約束税”概念,衡量結構化輸出約束對小型語言模型答案准確性的損失。實驗表明,強制遵循JSON等模式雖提升格式正確性,但顯著降低答案准確性,建議採用“先自由推理,後約束打包”的設計模式。

arXiv Machine Learning模型 / 芯片 / 研究站內正文
GEM:面向最優LLM數據策展的幾何熵混合

本文提出GEM(幾何熵混合)框架,將數據策展重構為超球面上的變分問題,通過混合平衡正則化器克服聚類坍塌,發現歐幾里得啓發式無法識別的平衡語義結構。結合教師-學生蒸餾擴展到網絡規模語料,引入幾何影響分數(GIS)用於可解釋的類別生成。在1.1B參數模型上的實驗表明,GEM集成了DoReMi和RegMix等混合策略,平均下游準確率提升達1.2%,為可預測的數據混合提供了魯棒的座標系統。

arXiv Machine Learning模型 / 政策 / 研究站內正文
JobBench:將代理工作與人類意願對齊

JobBench是一個新的AI代理基準測試,它評估代理在專家認為最值得委派的工作流程上的表現,旨在強調增強而非替代人類。

arXiv AI模型 / Agent / 研究站內正文
OmniToM:通過顯式信念建模評估大語言模型的心智理論

當前評估大語言模型(LLM)心智理論(ToM)的方法多依賴最終答案,無法揭示模型是否真正構建了心理狀態表徵。本研究提出OmniToM基準,通過顯式建模故事中所有角色的信念結構來直接評估。基準包含信念提取與信念標註兩階段,採用七維標籤體系。基於895個故事和22,343個標註信念命題,藉助人類校準的LLM輔助流程構建。零樣本評估表明,LLM在將敍事事實轉化為角色信念和共享心理狀態時存在瓶頸。

arXiv AI模型 / 研究 / 創業融資站內正文
Anchor:緩解智能體基準生成中的工件漂移

AI智能體正開始完成有價值的長期業務運營任務,但企業工作的訓練和評估環境在真實性、可驗證性和規模之間難以平衡。環境與任務創建經常遭受一種稱為“工件漂移”的失敗模式:當指令、環境、預測器和驗證器由鬆散耦合的過程創建時,它們經常對任務要求產生分歧,導致環境不可解、可獎勵篡改或不一致。本文提出Anchor,一種將領域專家的業務流程規範形式化為約束優化程序的任務生成管道。通過單個參數化規範,管道聯合生成自然語言指令、環境配置、求解器認證的真實解決方案和基於狀態的驗證器。通過改變參數,可產生具有可控難度和已知最優解的新任務,生成僅依賴最終狀態業務正確性的與框架無關的環境。作者應用Anchor創建了ERP-Bench,一個包含300個長期任務的基準測試,涵蓋生產級ERP系統中的採購和製造工作流。實驗發現前沿模型在26.1%的試驗中滿足顯式任務約束,但僅17.4%達到完全最優解。總體而言,Anchor和ERP-Bench為構建可審計的評估環境提供了具體方案,用於評估具有經濟價值的智能體工作。

arXiv AI模型 / Agent / 研究站內正文
人工智能在科學中的代理實驗

本文介紹了兩種新穎的自主AI代理框架——DeepTS/DeepCollector和DeepScribe,它們利用混合本地-遠程架構自動化科學工作流程,包括時間序列數據整理和講座報告轉換,並討論了向知識圖譜和高能物理的擴展。

arXiv AI模型 / Agent / 研究站內正文