這項研究在視網膜眼底多病種影像資料集(RFMiD)上對12種架構(包括卷積神經網路、視覺Transformer、混合模型和視覺語言模型)進行了基準測試,比較它們在二元篩查和多標籤分類中的效能。結果表明,所有模型在二元篩查中表現良好(AUC>84%),但基於注意力的模型(如SwinTiny、CoAtNet0、MaxViTTiny)在二元和多標籤任務中均最優。視覺語言模型與CNN基線相當,但未超越最佳Transformer和混合模型。在Messidor-2上的外部驗證中,AUC範圍為66.8%-84.7%,混合和Transformer模型表現強勁。
AI 新聞即時情報
即時監測
即時更新
即時追蹤可信來源,保留出處、權限和站內閱讀模式,把噪音壓成可讀情報。
即時更新
VesselSim提出一個兩階段框架,透過隨機幾何驅動模擬生成16,500個解剖學合理的3D血管造影體積,並僅用合成資料訓練3D U-Net。採用測試時自適應策略彌合域差距,在真實MRI和CT資料集上達到與最先進基礎模型競爭的效能,顯著減少對專家標註的依賴。
研究人員提出一種新的情緒表徵——維度分佈情緒狀態(DDES),利用效價和喚醒度預測藝術作品引發的情感反應,輔助博物館策展人設計以情緒為基礎的展覽。
LongAV-Compass是一個系統化基準,用於評估分鐘級視聽生成任務,涵蓋文本到視聽、影像到視聽和影片到視聽三種模態。包含284個測試案例,整合多模態大模型輔助評估和感知指標,評估超過20個細粒度維度。對11個代表性模型的實驗揭示了當前系統在長時間生成中的侷限性。
RoMo是一個大規模、高質量的人體運動資料集,透過分類感知過濾管道去除靜態和偽影序列,採用新穎的三級語義分類體系進行標註,支援細粒度評估,訓練模型在保真度和多樣性方面達到最先進水平,併發布了Motion Toolbox以標準化指標和資料轉換。
本文研究城市規模戶外環境中分散的具身智慧體如何透過自然語言通訊協調行動,提出Sentinel Challenge基準和CoSaR框架,結合基礎模型的高層通訊與經典空間導航演算法,實現更快的聚集、更短的路徑和更高的安全性。
DuoGesture是一種神經啟發、生物力學引導的雙流方法,將共語手勢生成分解為語義流和節拍流。透過語義變分資訊瓶頸協調兩流,並用運動接地語義條件增強語義流,慣性節拍先驗提升節拍流的平滑度。實驗表明其優於整體基線。
預訓練影片大模型在視覺推理上表現出色,但處理帶有音訊、深度圖等輔助流的影片時,統一融合會導致模態干擾。為此,研究者提出UniMVU框架,透過兩層動態門控(內模態門和模態級門)實現指令感知融合,在六個基準上取得最高13.5 CIDEr的提升,且門控機制與人類可解釋的模態相關性一致。
該研究引入EnterpriseMem-Bench,一個多輪Text-to-SQL基準測試,包含300個會話和1400輪查詢。評估五種前沿模型發現:無狀態模型在第三輪準確率歸零;記憶體複雜度不單調提升效能,工作記憶體佔主導;Claude Sonnet 4.6在SEC EDGAR上出現代際退化;推理模式下Claude錯誤分佈變為單模態。
該論文提出一種可泛化的文化評估與干預框架,透過情境化行為探測和潛在啟用引導,在不重新訓練的情況下調整大語言模型的文化價值對齊。實驗發現文化價值存在潛在糾纏現象,表明價值觀以耦合結構編碼。
一項新研究揭示了大型語言模型(LLM)在處理結構化知識(如圖和表格)時產生幻覺的機制。研究發現,幻覺源於系統性的內部動態,而非隨機噪聲:注意力過度集中於類似捷徑的結構線索,而前饋表示無法將知識接地,導致模型退回到引數記憶。這些模式在不同結構化知識格式中普遍存在,可用於幻覺檢測。
本研究從梯度下降的角度重新審視檢索增強生成(RAG),證明線性自注意力層可以執行統一線性化RAG目標的梯度下降步驟,從而在檢索增強預測與情境內最佳化之間建立精確對應關係。基於這一發現,作者提出了一種輕量級方法,透過僅前向傳播的更新來最佳化凍結RAG大語言模型的證據使用介面。在七個問答基準測試中,該方法在保持檢索器和骨幹網路固定的情況下,顯著提升了基線效能,並能在更低計算成本下接近測試時梯度最佳化的效果。
檢索正從單次匹配向互動式推理發展,語言代理需迭代檢查證據、重構查詢並再次搜尋。訓練此類代理面臨信用分配挑戰:可執行動作(如查詢或摘要)可由檢索器直接評估,而潛在推理步驟無法直接觀察且僅影響未來可執行動作。這種不對稱性使基於最終結果的獎勵分配不可靠。本文提出RICE-PO,一種無需批評者的策略最佳化框架,將檢索互動轉化為區域性學習訊號。RICE-PO選擇高不確定性的可執行動作作為錨點,使用檢索指標評估區域性反事實分支,並僅在推理到動作的影響強且未來殘餘效應穩定時,將信用傳播給潛在推理步驟。在BRIGHT和BEIR基準上,相同檢索器設定下,RICE-PO一致優於基於提示的代理和基於群體的強化學習基線。結果表明,代理-環境互動的結構本身可為訓練基於推理的檢索代理提供有效監督。
本文介紹了“每日劑量”(TDD)系統,這是一個由大語言模型驅動的自動化臨床總結和臨床試驗識別系統,整合到常規放射腫瘤學實踐中。透過混合方法評估,對55名臨床醫生進行了調查,結果顯示系統具有良好的可用性、滿意度,並有望節省時間。
CroCo方法將對比偏好調優擴充套件到多語言場景,利用英語獎勵模型為多語言自生成響應排序,無需語言特定偏好標註。實驗表明,線上內策略資料下,該方法在14種語言的結構化與開放生成任務中顯著提升模型效能。
SPEAR(沙盒化主動回滾提示工程師)是一種自由形式的智慧最佳化器,將程式碼即行動正規化引入自動提示工程。它配備評估、Python、設定提示和完成四個工具,可自主決策如何使用。其獨特之處在於Python沙盒,允許最佳化器編寫和執行任意Python程式碼以進行結構性錯誤分析。兩個防護欄確保單調改進:指標迴歸時自動回滾和可選防護指標下限。在三個工業LLM裁判套件(13個裁判任務)以及7個BBH任務和GSM8K上評估,SPEAR在所有工業任務的主要指標上獲勝,並在BBH-7上平均準確率0.938。消融實驗顯示Python工具是最重要的槓桿。
本綜述首次統一了預訓練資料暴露(PDE)框架下的成員推理和資料汙染研究,形式化定義了不同暴露水平,回顧了攻擊與防禦方法,綜合了實證發現,並指出了開放挑戰和未來方向。
提出自驗證蒸餾(Self-Verified Distillation, SVD)方法,讓大語言模型僅利用無標籤提示進行自我改進,無需外部教師或工具反饋。在數學、科學和程式設計三個推理領域,Qwen3模型透過SVD訓練後效能顯著提升。
本文提出一種神經規則評估器,將邏輯約束編譯為有向無環圖,並引入奇美拉訓練方法以解決訓練中真實異常樣本稀缺的問題。在CLEVRER、OpenImages和VidOR等資料集上,該方法顯著提升了邏輯異常檢測的效能,尤其在組合性和關係性規則方面。
本文提出李群嵌入動態神經網路(LieEDNN),利用伴隨李群作用解決李群與加法運算不相容及動力學在非線性空間中演化的問題,實現穩定可學習的神經動力學,並在SE(3)上以伸縮機械臂為應用驗證。
提出PushCen-ADFL框架,透過質心表示空間耦合通訊、聚合與區域性穩定,採用保平均推和混合校正聚合偏差,利用輕量質心正則化緩解異質性和陳舊性引起的模型漂移,並引入有界去重緩衝區提升魯棒性。在視覺資料集上準確率提升高達6%,通訊成本降低80%以上。
針對時間序列基礎模型(TSFMs)在預訓練中可能遇到評估資料集導致效能評估過於樂觀的問題,本文首次研究了TSFMs的預訓練資料汙染審計。提出TSFMAudit方法,基於探測適應動態,透過微調探測後汙染資料集更快的損失下降和更小的骨幹網路移動來檢測汙染。在6個TSFMs和187個資料集上評估,優於10個基線方法。
神經貝葉斯順序路由(NBSR)是一種將神經推理建模為有向無環圖上主動證據累積的框架。它利用狄利克雷-分類共軛框架,透過全域性知識庫提取正證據向量,並採用Gumbel-Softmax直通估計器實現硬路徑路由。該框架提供不確定性量化、早期退出、分佈外拒絕和成本感知證據獲取機制。理論證明單調精度增長和有界方差,實驗表明其在多種任務中具有競爭力的效能。
SilIF透過對孤立森林的路徑長度向量進行聚類並計算輪廓分數,提升無監督異常檢測效能。在IEEE-CIS欺詐檢測基準上,AUC-PR平均提升0.0080,但在Sparkov合成資料集上未見改進。
AirCast-SR是一個基礎模型,能夠將全球AI天氣預報從0.25度(約28公里)解析度降尺度到1公里水平解析度,時間解析度為每小時。它採用三維U-Net結合潛在一致性模型擴散框架,在美國本土的資料上訓練。該模型實現了近乎零偏差,並保留了精細尺度的大氣結構,經過多個季節的驗證,並展示了在無需重新訓練的情況下對印度和德國的零樣本遷移能力。
該論文提出“約束稅”概念,衡量結構化輸出約束對小型語言模型答案准確性的損失。實驗表明,強制遵循JSON等模式雖提升格式正確性,但顯著降低答案准確性,建議採用“先自由推理,後約束打包”的設計模式。
本文提出GEM(幾何熵混合)框架,將資料策展重構為超球面上的變分問題,透過混合平衡正則化器克服聚類坍塌,發現歐幾里得啟發式無法識別的平衡語義結構。結合教師-學生蒸餾擴充套件到網路規模語料,引入幾何影響分數(GIS)用於可解釋的類別生成。在1.1B引數模型上的實驗表明,GEM整合了DoReMi和RegMix等混合策略,平均下游準確率提升達1.2%,為可預測的資料混合提供了魯棒的座標系統。
JobBench是一個新的AI代理基準測試,它評估代理在專家認為最值得委派的工作流程上的表現,旨在強調增強而非替代人類。
當前評估大語言模型(LLM)心智理論(ToM)的方法多依賴最終答案,無法揭示模型是否真正構建了心理狀態表徵。本研究提出OmniToM基準,透過顯式建模故事中所有角色的信念結構來直接評估。基準包含信念提取與信念標註兩階段,採用七維標籤體系。基於895個故事和22,343個標註信念命題,藉助人類校準的LLM輔助流程構建。零樣本評估表明,LLM在將敘事事實轉化為角色信念和共享心理狀態時存在瓶頸。
AI智慧體正開始完成有價值的長期業務運營任務,但企業工作的訓練和評估環境在真實性、可驗證性和規模之間難以平衡。環境與任務建立經常遭受一種稱為“工件漂移”的失敗模式:當指令、環境、預測器和驗證器由鬆散耦合的過程建立時,它們經常對任務要求產生分歧,導致環境不可解、可獎勵篡改或不一致。本文提出Anchor,一種將領域專家的業務流程規範形式化為約束最佳化程式的任務生成管道。透過單個引數化規範,管道聯合生成自然語言指令、環境配置、求解器認證的真實解決方案和基於狀態的驗證器。透過改變引數,可產生具有可控難度和已知最優解的新任務,生成僅依賴最終狀態業務正確性的與框架無關的環境。作者應用Anchor建立了ERP-Bench,一個包含300個長期任務的基準測試,涵蓋生產級ERP系統中的採購和製造工作流。實驗發現前沿模型在26.1%的試驗中滿足顯式任務約束,但僅17.4%達到完全最優解。總體而言,Anchor和ERP-Bench為構建可審計的評估環境提供了具體方案,用於評估具有經濟價值的智慧體工作。