Plan2Map是一個包含208個案例的多模態基準,用於從英國規劃記錄中重建地理空間邊界。研究人員提出了GeoPlanAgent系統,通過證據提取、定位、地圖配準、邊界分割、投影和驗證等步驟,在基準上實現了0.736的平均IoU和0.904的中位IoU,顯著優於直接VLM方法。
AI 新聞即時情報
即時監測
即時更新
即時追蹤可信來源,保留出處、權限和站內閱讀模式,把噪音壓成可讀情報。
即時更新
研究發現當前最先進的視覺語言模型(VLM)在度量距離查詢中雖然跨視角預測一致,但常出現系統性錯誤,表明模型依賴於先驗知識而非視覺證據。為此,研究者提出ViewDiag基準測試框架,從度量準確性、分佈集中度和潛在特徵探測三個維度評估模型,揭示預測穩定性與準確性脱節的現象。
AVTrack是一個為動態真實世界場景設計的人為中心的音視頻實例分割數據集,包含攝像機運動、視覺遮擋和位置變化等挑戰性條件。評估顯示現有方法性能顯著下降,為穩健的人為中心場景理解提供了基準。
本文提出了COD10K-C基準,基於COD10K數據集,包含8種損壞類型和5個嚴重級別,共計40種條件和81,040個評估對。評估了SINet-v2、PFNet、ZoomNet和輕量級模型RobustCODLite。所有模型在損壞圖像上性能顯著下降,運動模糊和高斯模糊影響最大。RobustCODLite採用損壞增強、頻率先驗分支和不確定性一致性損失,在損壞下保留92.3%的乾淨Dice分數,優於其他模型。該工作將開源以促進魯棒偽裝目標檢測研究。
一項針對Qwen3-14B隱藏狀態的探測研究表明,線性探針在分類推理類型(演繹、歸納、溯因)時達到了100%的準確率,但實際上檢測的是任務格式混淆因素(如來源、選項數量、響應長度),而非真正的推理模式。消除混淆後,準確率降至隨機水平,因果乾預實驗也未發現功能關聯。研究結果呼籲在機械可解釋性中進行常規的任務格式去混淆。
針對大型語言模型代理在決策步驟中生成冗長文本推理的無效性,研究人員提出了自適應潛體代理推理(ALAR)框架。該框架採用雙模式機制:常規步驟使用緊湊潛體推理,僅在需要深入思考時切換到顯式鏈式思維。實驗表明,ALAR在搜索任務中減少高達43.6%的令牌生成,在工具使用中減少84.6%,同時保持可比甚至更好的任務準確性。
受哈耶克市場理論啓發,研究人員提出一種基於拍賣、支付和財富積累的智能體經濟系統,使智能體無需集中控制即可自發形成集體智能。該系統在數學推理、金融研究等任務上超越了傳統單體模型,為多智能體系統設計提供了新思路。
對自然語言到一階邏輯(NL-to-FOL)基準FOLIO和MALLS的系統審計發現,約39%的FOLIO條目和36%的MALLS條目存在錯誤的FOL形式化。作者發佈了修正後的標註,並提出了一個基於LLM的框架,可將人工審查工作量減少70%以上,在審查不到24%的實例後即可達到90%的數據集準確率。
研究人員引入了Padyam2Gadyam數據集,用於將13至17世紀的泰盧固語古典詩歌翻譯成現代泰盧固語和英語散文。該數據集包含600首詩歌及其人工驗證的翻譯。評估了5種大型語言模型的表現,結果表明仍有較大改進空間。
研究顯示,在法律、醫療等高風險場景中,即使單次對話歷史也足以導致LLM輸差異。儘管LLM難以從對話推斷用户社會人口統計信息,但話題可部分代理該信息並不可預測地影響建議。
該研究探討了大語言模型中詞彙重疊對錶徵的影響,發現詞彙效應貫穿模型各層,並在中間層出現語義和詞彙信號同時退化的情況。研究還表明詞彙影響會波及下游任務如摘要生成和模型編輯。
一項研究評估了31個大語言模型在環境態度方面的表現,發現許多模型比普通人類受訪者更支持環保,但存在情境敏感性和諂媚行為等問題。
IdiomX是一個大規模多語言習語基準,包含超過19萬條上下文示例,涵蓋1.2萬多種習語,支持英語、阿拉伯語和法語。它定義了四項任務:習語檢測、上下文到習語檢索、阿拉伯語到英語習語檢索及習語解釋。實驗表明,Transformer模型提升了檢測性能,混合檢索架構增強了跨語言檢索。
本文提出幾何感知表格擴散模型(GATD),通過向擴散去噪器注入列值差異計算的成對角度和長度作為輸入和輔助目標,顯式捕獲表格數據中的列間關係。MLP實例在10個數據集上以平均3.5倍更少參數(分類任務達25倍)達到最先進性能,分別贏得8/10的形狀、7/10的趨勢和9/10的下游效用指標,形狀和趨勢誤差分別降低27%和20%。默認損失權重可遷移至GNN和Transformer去噪器,在27/30和25/30架構-數據集單元上改善形狀和趨勢。消融實驗證明增益來自顯式關係監督而非額外輸入或容量。該工作表明顯式關係監督是表格擴散的可遷移歸納偏置。
大型語言模型(LLM)作為持續演化的服務部署時,基礎模型頻繁更新會導致先前部署的任務特定低秩適配(LoRA)適配器失效。ReLoRA框架通過知識複用實現高效重新適配,快速恢復服務就緒的LoRA適配器,同時保持或提升任務性能。該框架包含自適應LoRA初始化和帶調度正則化的微調兩個關鍵步驟。實驗表明,與基線相比,ReLoRA將準備時間縮短最高8.9倍,準確率提升最高4.6%。
提出StenCE框架,通過對比學習融合心電圖(ECG)與冠狀動脈造影特徵,從ECG中檢測嚴重冠狀動脈狹窄信號,實現無創早期篩查。實驗表明該方法在多種ECG編碼器上均優於現有技術,首次實現高精度嚴重狹窄分類。
本文提出一個確定性氣候風險智能框架,通過整合單一真相源編排、時間異常檢測、不平衡感知集成學習和可解釋性治理,解決ESG數據碎片化和缺乏可審計性的問題。框架包含合成基準、時間漂移分析、SMOTE優化、集成學習、TreeSHAP可解釋性等,並與多種基線方法對比,結果通過分層五折交叉驗證和顯著性測試。該框架旨在建立可重複、可解釋、可操作審計的確定性氣候風險治理基礎設施。
論文提出TopoMamSurv框架,針對全切片圖像生存分析中Transformer計算瓶頸和Mamba對輸入順序敏感的問題,採用拓撲感知排序和雙向Mamba模塊,結合圖卷積網絡,實現高效的長程依賴建模和空間結構利用,在五個TCGA數據集上驗證了性能優勢。
研究表明,在數據集內類別分割評估中,當保留的異常類與正常混合在表示空間重疊時,異常分數可能退化甚至反轉,且最優分數方向依賴於未知的異常類。作者提出了一種免訓練的“鄰域類泄漏”診斷方法,並在多個數據集和特徵空間上驗證了其對分數方向不穩定性的預測能力。結論是,類別分割異常檢測基準應被視為幾何依賴的應力測試,而非無條件的檢測能力證明。
研究人員提出一種輕量級CNN,以防禦針對基於EEG的腦機接口的對抗性攻擊,實驗表明其魯棒性優於現有模型。
該論文提出了譜對齊分解,解釋了神經網絡損失景觀中曲率指數α為何在不同層類型間變化(卷積層約2,Transformer注意力層約1,MLP上投影層小於1)。該分解將α的變化歸因於Kronecker因子特徵基與梯度奇異方向之間的對齊程度。此外,論文推導出一個譜傳遞恆等式s=αγ,通過獨立擬合α和γ可高精度預測Hessian衰減指數s。基於此,研究者提出架構自適應預條件子T(σ;α),並展示Spectral Newton優化器在視覺基準上超越AdamW。
短租市場動態定價面臨財務風險高、需可解釋性、反饋稀疏等挑戰。本文提出人機協同門控情感老虎機(HITL-GB)框架,算法給出價格建議,人類運營人員有權接受、修改或拒絕。研究表明,在審批約束下,歷史定價數據(來自先前確定性策略)在結構上等同於用於初始化情感老虎機後驗的在策略預熱數據,從而避免數週至數月的冷啓動期。在真實短租生產數據(匿名城市市場,2間房,2022年4月至2026年4月,1461個夜間定價場景)上驗證,預熱程序將有效冷啓動從約150個場景壓縮至約30個場景。該方法可推廣至臨牀用藥、信貸發放、內容審核、放射診斷等高風險的監管領域。
本文介紹GAMBLe框架,用於分析AI驅動研究系統(ADRS)。該框架將ADRS行為分解為四個參數(生成器、評估器、發現機制、預算)和一個有效景觀。通過760多次實驗發現,不存在完全的排序,正確的組件選擇可大幅提升性能。
本文提出一種用於嵌入式代理系統的模塊化參考架構,通過分層設計將設備端代理與雲端增強代理解耦,並引入跨層治理層,以解決在資源受限的微控制器上部署大型語言模型(LLM)的挑戰,實現實時控制與自主智能的融合。
大型推理模型通過增加推理步驟提升性能,但研究表明,在獲得正確答案後繼續推理可能導致偏離,引入有害過度思考的概念。通過前綴軌跡評估,發現早期停止正確推理可提升準確率高達21%,而常見效率策略無法緩解有害過度思考。
本文探討了三種基於玩家碰撞信息生成敵人形態的新方法,旨在填補視頻遊戲程序化內容生成中敵人形態生成的空白。研究發現每種方法各有優劣,但均優於或等同於從機器人形態學改編的進化基線。
本文介紹Traj-Evolve,一個自進化的多智能體系統,通過經驗池(ExPool)和多智能體強化學習(MARL)從縱向電子健康記錄中建模患者軌跡,在肺癌預測任務上超越9個強基線。實驗表明,ExPool提升特異性,MARL提升靈敏度,兩者互補。
ChatHealthAI是一個多模態推理框架,通過任務感知重採樣器將預訓練的EHR基礎模型的結構化表示與凍結的大語言模型語義空間對齊,從而在保留預測性能的同時實現可解釋的自然語言臨牀推理。在EHRSHOT基準的三個臨牀預測任務上,該框架在保持競爭性預測性能的同時,顯著提升了推理質量和可解釋性。
一項新研究比較了編碼器 Transformer 和 LSTM 在無測站流域進行上游徑流推斷的性能。結果表明,LSTM 整體表現優於 Transformer,而結合下游信息可令中位數 NNSE 提升超過 60%。研究認為,遞歸記憶架構更適用於此類地形序列推理任務。
AURA-Mem是一種針對機器人策略的恆定大小循環記憶,通過動作門控機制僅在觀察改變未來動作時才寫入,顯著減少內存寫入次數,同時保持準確性。在合成基準和真實機器人任務中,AURA-Mem匹配或超越基線,且內存佔用恆定(4,224字節),遠小於KV緩存。