輝達釋出Cosmos 3,一個全模態世界模型系列,採用混合Transformer架構統一處理語言、影像、影片、音訊和動作序列。該模型在多項理解和生成任務上達到最先進水平,被Artificial Analysis評為最佳開源文生圖和圖生影片模型,被RoboArena評為最佳策略模型。程式碼、模型權重和資料集已開源。
AI 新聞即時情報
即時監測
即時更新
即時追蹤可信來源,保留出處、權限和站內閱讀模式,把噪音壓成可讀情報。
即時更新
人-物互動(HOI)識別在複雜教育環境中自動分析學生行為至關重要。雖然最先進的HOI檢測器在基準資料集上表現良好,但在真實訓練環境中因領域特定物體、遮擋和複雜視覺條件而效能下降。本文提出一個診斷驅動框架,結合三元組級HOI錯誤分類和誤差因素歸因分析,應用於重症監護空運團隊(CCATT)混合現實醫學訓練。透過分析HOI失敗模式及其原因,開發了診斷導向的最佳化策略,將預訓練CDN模型的宏F1分數從48.6提升至90.2。結果突顯了詳細診斷分析在指導HOI模型針對性適應中的價值。
GeoDrive-Bench是一個新的基準測試,用於評估視覺語言模型在不同地區交通規則下的自動駕駛推理能力。它包含來自六個國家的5053個經過人工驗證的多選題,涵蓋感知、預測、規劃和區域推理四個任務。此外,論文提出了一種蒸餾演算法,將區域特定的交通規則知識注入模型內部表徵,實驗表明當前VLM缺乏穩健的區域感知智慧,而基線方法展現了改進的跨區域推理能力。
該研究評估了隨機森林與四種CNN(ResNet-50、ResNet-101、EfficientNet-B4、ConvNeXt-Large)在Sentinel-2影像上0-20米深度範圍內的可遷移衛星測深表現。透過保持空間連續性(連續礁塊而非隨機斑塊)和引入平滑權重函式(SWF)加權RMSE損失,實現了內區域RMSE低至0.26米(淺水區),跨區域RMSE在2.46-2.98米之間。在MagicBathyNet基準上,所提網路以更少引數達到0.19-0.22米RMSE,優於U-Net和專用Transformer。多時相重複影像可降低噪聲,且已釋出最佳化架構與預訓練權重以促進新站點遷移。
MetaWorld是一個新穎的框架,旨在從單視角影片中擴充套件多智慧體影片世界模型,以應對資料稀缺和世界狀態對齊的挑戰。它透過單目世界狀態展開(MWSU)分解相機運動和主體軌跡,利用主題感知世界生成器進行外觀驅動模擬,並透過世界狀態對齊(WSA)確保跨檢視一致性。實驗顯示其優越的跨檢視一致性和身份保真度。
Plan2Map是一個包含208個案例的多模態基準,用於從英國規劃記錄中重建地理空間邊界。研究人員提出了GeoPlanAgent系統,透過證據提取、定位、地圖配準、邊界分割、投影和驗證等步驟,在基準上實現了0.736的平均IoU和0.904的中位IoU,顯著優於直接VLM方法。
研究發現當前最先進的視覺語言模型(VLM)在度量距離查詢中雖然跨視角預測一致,但常出現系統性錯誤,表明模型依賴於先驗知識而非視覺證據。為此,研究者提出ViewDiag基準測試框架,從度量準確性、分佈集中度和潛在特徵探測三個維度評估模型,揭示預測穩定性與準確性脫節的現象。
AVTrack是一個為動態真實世界場景設計的人為中心的音影片例項分割資料集,包含攝像機運動、視覺遮擋和位置變化等挑戰性條件。評估顯示現有方法效能顯著下降,為穩健的人為中心場景理解提供了基準。
本文提出了COD10K-C基準,基於COD10K資料集,包含8種損壞型別和5個嚴重級別,共計40種條件和81,040個評估對。評估了SINet-v2、PFNet、ZoomNet和輕量級模型RobustCODLite。所有模型在損壞影像上效能顯著下降,運動模糊和高斯模糊影響最大。RobustCODLite採用損壞增強、頻率先驗分支和不確定性一致性損失,在損壞下保留92.3%的乾淨Dice分數,優於其他模型。該工作將開源以促進魯棒偽裝目標檢測研究。
一項針對Qwen3-14B隱藏狀態的探測研究表明,線性探針在分類推理型別(演繹、歸納、溯因)時達到了100%的準確率,但實際上檢測的是任務格式混淆因素(如來源、選項數量、響應長度),而非真正的推理模式。消除混淆後,準確率降至隨機水平,因果乾預實驗也未發現功能關聯。研究結果呼籲在機械可解釋性中進行常規的任務格式去混淆。
針對大型語言模型代理在決策步驟中生成冗長文本推理的無效性,研究人員提出了自適應潛體代理推理(ALAR)框架。該框架採用雙模式機制:常規步驟使用緊湊潛體推理,僅在需要深入思考時切換到顯式鏈式思維。實驗表明,ALAR在搜尋任務中減少高達43.6%的令牌生成,在工具使用中減少84.6%,同時保持可比甚至更好的任務準確性。
受哈耶克市場理論啟發,研究人員提出一種基於拍賣、支付和財富積累的智慧體經濟系統,使智慧體無需集中控制即可自發形成集體智慧。該系統在數學推理、金融研究等任務上超越了傳統單體模型,為多智慧體系統設計提供了新思路。
對自然語言到一階邏輯(NL-to-FOL)基準FOLIO和MALLS的系統審計發現,約39%的FOLIO條目和36%的MALLS條目存在錯誤的FOL形式化。作者釋出了修正後的標註,並提出了一個基於LLM的框架,可將人工審查工作量減少70%以上,在審查不到24%的例項後即可達到90%的資料集準確率。
研究人員引入了Padyam2Gadyam資料集,用於將13至17世紀的泰盧固語古典詩歌翻譯成現代泰盧固語和英語散文。該資料集包含600首詩歌及其人工驗證的翻譯。評估了5種大型語言模型的表現,結果表明仍有較大改進空間。
研究顯示,在法律、醫療等高風險場景中,即使單次對話歷史也足以導致LLM輸差異。儘管LLM難以從對話推斷使用者社會人口統計資訊,但話題可部分代理該資訊並不可預測地影響建議。
該研究探討了大語言模型中詞彙重疊對錶徵的影響,發現詞彙效應貫穿模型各層,並在中間層出現語義和詞彙訊號同時退化的情況。研究還表明詞彙影響會波及下游任務如摘要生成和模型編輯。
一項研究評估了31個大語言模型在環境態度方面的表現,發現許多模型比普通人類受訪者更支援環保,但存在情境敏感性和諂媚行為等問題。
IdiomX是一個大規模多語言習語基準,包含超過19萬條上下文示例,涵蓋1.2萬多種習語,支援英語、阿拉伯語和法語。它定義了四項任務:習語檢測、上下文到習語檢索、阿拉伯語到英語習語檢索及習語解釋。實驗表明,Transformer模型提升了檢測效能,混合檢索架構增強了跨語言檢索。
本文提出幾何感知表格擴散模型(GATD),透過向擴散去噪器注入列值差異計算的成對角度和長度作為輸入和輔助目標,顯式捕獲表格資料中的列間關係。MLP例項在10個資料集上以平均3.5倍更少引數(分類任務達25倍)達到最先進效能,分別贏得8/10的形狀、7/10的趨勢和9/10的下游效用指標,形狀和趨勢誤差分別降低27%和20%。預設損失權重可遷移至GNN和Transformer去噪器,在27/30和25/30架構-資料集單元上改善形狀和趨勢。消融實驗證明增益來自顯式關係監督而非額外輸入或容量。該工作表明顯式關係監督是表格擴散的可遷移歸納偏置。
大型語言模型(LLM)作為持續演化的服務部署時,基礎模型頻繁更新會導致先前部署的任務特定低秩適配(LoRA)介面卡失效。ReLoRA框架透過知識複用實現高效重新適配,快速恢復服務就緒的LoRA介面卡,同時保持或提升任務效能。該框架包含自適應LoRA初始化和帶排程正則化的微調兩個關鍵步驟。實驗表明,與基線相比,ReLoRA將準備時間縮短最高8.9倍,準確率提升最高4.6%。
提出StenCE框架,透過對比學習融合心電圖(ECG)與冠狀動脈造影特徵,從ECG中檢測嚴重冠狀動脈狹窄訊號,實現無創早期篩查。實驗表明該方法在多種ECG編碼器上均優於現有技術,首次實現高精度嚴重狹窄分類。
本文提出一個確定性氣候風險智慧框架,透過整合單一真相源編排、時間異常檢測、不平衡感知整合學習和可解釋性治理,解決ESG資料碎片化和缺乏可審計性的問題。框架包含合成基準、時間漂移分析、SMOTE最佳化、整合學習、TreeSHAP可解釋性等,並與多種基線方法對比,結果透過分層五折交叉驗證和顯著性測試。該框架旨在建立可重複、可解釋、可操作審計的確定性氣候風險治理基礎設施。
論文提出TopoMamSurv框架,針對全切片影像生存分析中Transformer計算瓶頸和Mamba對輸入順序敏感的問題,採用拓撲感知排序和雙向Mamba模組,結合圖卷積網路,實現高效的長程依賴建模和空間結構利用,在五個TCGA資料集上驗證了效能優勢。
研究表明,在資料集內類別分割評估中,當保留的異常類與正常混合在表示空間重疊時,異常分數可能退化甚至反轉,且最優分數方向依賴於未知的異常類。作者提出了一種免訓練的“鄰域類洩漏”診斷方法,並在多個資料集和特徵空間上驗證了其對分數方向不穩定性的預測能力。結論是,類別分割異常檢測基準應被視為幾何依賴的應力測試,而非無條件的檢測能力證明。
研究人員提出一種輕量級CNN,以防禦針對基於EEG的腦機介面的對抗性攻擊,實驗表明其魯棒性優於現有模型。
該論文提出了譜對齊分解,解釋了神經網路損失景觀中曲率指數α為何在不同層型別間變化(卷積層約2,Transformer注意力層約1,MLP上投影層小於1)。該分解將α的變化歸因於Kronecker因子特徵基與梯度奇異方向之間的對齊程度。此外,論文推匯出一個譜傳遞恆等式s=αγ,透過獨立擬合α和γ可高精度預測Hessian衰減指數s。基於此,研究者提出架構自適應預條件子T(σ;α),並展示Spectral Newton最佳化器在視覺基準上超越AdamW。
短租市場動態定價面臨財務風險高、需可解釋性、反饋稀疏等挑戰。本文提出人機協同門控情感老虎機(HITL-GB)框架,演算法給出價格建議,人類運營人員有權接受、修改或拒絕。研究表明,在審批約束下,歷史定價資料(來自先前確定性策略)在結構上等同於用於初始化情感老虎機後驗的在策略預熱資料,從而避免數週至數月的冷啟動期。在真實短租生產資料(匿名城市市場,2間房,2022年4月至2026年4月,1461個夜間定價場景)上驗證,預熱程式將有效冷啟動從約150個場景壓縮至約30個場景。該方法可推廣至臨床用藥、信貸發放、內容稽核、放射診斷等高風險的監管領域。
本文介紹GAMBLe框架,用於分析AI驅動研究系統(ADRS)。該框架將ADRS行為分解為四個引數(生成器、評估器、發現機制、預算)和一個有效景觀。透過760多次實驗發現,不存在完全的排序,正確的元件選擇可大幅提升效能。
本文提出一種用於嵌入式代理系統的模組化參考架構,透過分層設計將裝置端代理與雲端增強代理解耦,並引入跨層治理層,以解決在資源受限的微控制器上部署大型語言模型(LLM)的挑戰,實現即時控制與自主智慧的融合。
大型推理模型透過增加推理步驟提升效能,但研究表明,在獲得正確答案後繼續推理可能導致偏離,引入有害過度思考的概念。透過字首軌跡評估,發現早期停止正確推理可提升準確率高達21%,而常見效率策略無法緩解有害過度思考。