本文提出一種名為IN2R的新框架,透過從離散選擇轉向合成連續軟原型來糾正跨模態檢索中的噪聲對應問題,利用模態內資料的幾何穩定性進行圖推理,在多個資料集上達到最優效能。
AI 新聞即時情報
即時監測
即時更新
即時追蹤可信來源,保留出處、權限和站內閱讀模式,把噪音壓成可讀情報。
即時更新
本文提出SASA方法,一種漂移魯棒的弱監督增量學習語義分割方法。透過可學習令牌的語義錨點保持長期語義身份,結合彈性殘差適應實現例項級微調,並開發空間標籤仲裁機制直接過濾不可靠訊號,強制執行“一個物件,一個類別”約束。實驗表明,SASA在多個標準基準上優於現有方法,尤其在多步增量設定中表現突出。
機器人和導航等具身視覺語言決策任務中,視覺語言模型(VLM)和視覺語言動作模型(VLA)分別擅長長期規劃和反應控制,但都受限於視覺幻覺問題。本文提出SceneDiver,一種從粗到細的焦點計劃生成方法,透過構建場景圖並逐步分解任務,有效減少幻覺。同時設計輕量級介面卡將焦點能力蒸餾至VLA,在保持計算效率的同時顯著提升效能。論文已被ICML 2026接收。
MM-BizRAG 是一種新的多模態檢索增強生成方法,專為企業級問答設計。它透過文件結構感知的分割和方向特定處理管道,顯式提取和表示複雜企業文件的結構,無需微調即可生成更豐富、更準確的答案。在大型企業資料集和兩個公開基準上,MM-BizRAG 的效能比最先進的視覺基線高出高達 32%,尤其是在報告式佈局上。此外,還提出了 FastRAGEval,一種成本更低且與人類對齊更強的 LLM 評估指標。該論文已被 ACL 2026 行業軌道接收。
本研究探討了在不同提示策略下,利用可解釋的語言特徵(詞法多樣性、可讀性和情感特徵)檢測AI生成假新聞的跨提示泛化能力。透過隨機森林分類器在三種不同提示生成的AI文章和真實新聞資料集上進行測試,所有六種訓練-測試組合的AUC值均達0.988至1.000,表明基於特徵的檢測方法對提示變化具有穩健性。
本文介紹了ACAT,一個基於網路的協作標註工具,原生支援四種ABS工作流,並提供自動ETL管道直接計算標註者間一致性指標。在1002條餐廳評論上的初步驗證顯示,中位標註時間為31.58秒,標註者間一致性達0.78-0.86。
一項大規模實證研究分析了284個可解釋語言特徵在27個LLM和10個文本領域中的魯棒性,發現僅基於語言特徵的分類器能可靠區分AI生成與人類文本,但多數特徵依賴上下文,而詞彙豐富度是跨模型和領域的穩健訊號。
這項研究將拒絕引導方法擴充套件到混合專家(MoE)大型語言模型,發現引導效能不受MoE複雜路由模式的影響。作者提出了兩種專家感知的拒絕引導方法,利用拒絕特定的專家路由模式和專家特定的引導方向來抑制正常拒絕行為。結果顯示,基於單個專家的輸出即可有效引導拒絕行為,且拒絕訊號與專家路由行為不同,表明注意力在MoE拒絕行為中起重要作用。
一項大規模研究表明,在生物醫學問答中,檢索增強生成(RAG)帶來的提升很小且不穩定,通常僅為1-2個百分點。骨幹模型的選擇比檢索器或語料庫的選擇影響更大,專家和普通檢索來源表現相似。
SALIMORY是一個新框架,透過訓練單一語言模型管理結構化認知記憶(包括使用者事實、偏好和工作記憶),解決了對話代理長期記憶難題。它引入分層階段過程獎勵和獎勵分解對比細化,端到端監督選擇性過濾、整合和線索驅動回憶等操作。該方法將記憶相關故障減少三分之一,端到端準確率提升超10%,良好個性化率翻倍。
本文回顧了在科學史、科學哲學和科學社會學中,從早期數字方法到大型語言模型(LLM)的計算概念分析方法。文章分為兩部分:第一部分探討了LLM之前的計算概念史,包括早期數字方法、分佈語義方法和詞彙語義變化檢測;第二部分則聚焦LLM時代,介紹LLM在詞彙語義變化檢測中的應用及相關案例研究,並重新審視了語料庫構建、模型選擇、操作化權衡等方法論問題。
一項新研究探討了不同話語角色標籤(如“引用:”、“指令:”、“示例:”)如何影響語言模型對上下文的採納程度。透過在500個MMLU-Pro專案上使用固定內容探針,發現標籤可將誤導採納率改變56-84個百分點。指令和引用等標籤增加採納,而示例標籤抑制採納。研究建議在RAG基準測試中報告並控制包裝器標籤。
POLARIS是一種針對小型開源模型的訓練方法,透過GRPO策略結合LLM裁判和人類參考注入,顯著提升了長文本創作能力。訓練後的9B模型在長度遵循度和質量上可與27B模型媲美,並展現出強大的長度泛化能力。
本文介紹LiftQuant,一種透過“提升-投影”機制實現連續位寬控制的新框架。該方法將低維權重向量近似為高維1位元晶格的投影,實現位寬準連續調節。實驗表明,LiftQuant可將70B模型壓縮至2.4位元,精確適配24GB GPU,效能超越現有2位元模型。該論文已被ICML 2026接收為Spotlight。
本文研究瞭如何將最大更新引數化(μP)擴充套件到門控Delta網路,這是一種高效的線性模型架構。透過嚴格分析前向傳播、門控機制和迴圈狀態動態中的座標大小,作者推匯出了縮放規則。實驗表明,在AdamW和SGD最佳化器下,所提出的配置能夠實現不同模型寬度間的穩定學習率遷移,而標準引數化則無法遷移。
本文為固定監督決策問題定義了“貝葉斯充分表示”。該表示依賴於損失函式,並引入貝葉斯商概念,區分了充分性與最小性。實驗表明,最小化非必需資訊可提升泛化能力。
本研究提出了一種利用深度神經網路代理建模和非引數梯度最佳化進行逆臨界實驗設計的方法,旨在最大化實驗與目標技術之間的中子相似性係數c_k。該方法結合U-Net編碼器-解碼器與新型多群注意力池化層,透過直接最佳化幾何網格材料分配來提升c_k。應用於HALEU燃料運輸容器驗證,對三種配置分別取得0.97757、0.81324和0.93276的高分,展示了深度學習在加速核技術驗證中的潛力。
一篇系統研究查詢-鍵-值(QKV)注意力機制中投影共享的論文,發現共享鍵值投影(Q-K=V)可在僅降低3.1%困惑度的情況下減少50%的KV快取,結合分組查詢注意力(GQA)或多查詢注意力(MQA)可分別減少87.5%和96.9%的快取,實現裝置端推理。該研究透過合成任務、視覺和語言建模實驗驗證,並公開了程式碼。
本文針對耦合梯度下降演算法(常見於雙層最佳化、兩時間尺度隨機逼近和對抗訓練)中的瞬態放大現象,提出了一個尖銳的偽譜分析。作者證明了塊三角雅可比矩陣的Kreiss常數界限,並給出了有限時間迭代複雜度界。該理論揭示了傳統譜分析無法看到的非漸近高維學習動力學區域,線上性二次型問題和神經網路訓練中的實驗證實了該理論。
本文提出,部署在現實世界中的強化學習系統應轉向持續學習正規化,而非傳統的“先訓練再修復”模式。作者識別了部署後四種非平穩性來源,並分析了持續RL的成功案例,倡導社群變革。
IEEE P3109草案標準定義了一組引數化的二進位制浮點格式及相關操作,專注於支援機器學習。這些格式允許在少量位元內高效且一致地表示數值,引數包括位寬、精度、有符號性和無窮大的存在。操作透過將浮點值解碼為閉擴充套件實數集(包含正負無窮和NaN)來定義,明確處理NaN和無窮運算元以確保僅呼叫實數運算。定義了廣泛的舍入和飽和模式,包括隨機舍入。操作無異常,透過返回值(如NaN)傳達異常情況,加速了吞吐量。此外,引入了名為kappa近似的尺度不變度量,用於描述近似實現。標準函式定義和其他屬性透過形式規範進行了機械驗證和生成。
一項新研究利用XGBoost模型和八種常規臨床指標,在ADNI資料集上實現了對正常認知、輕度認知障礙和阿爾茨海默病的高精度三分類檢測,宏AUC達到0.982,並透過SHAP值提供了可解釋性。
本文研究了在長時間任務中何時中斷自主AI智慧體的挑戰。透過使用HEART情感動力學模型,作者評估了四類干預觸發器,並報告了三個主要發現:狀態飽和陷阱(挫敗感指標迅速達到最大值)、LLM法官的能力下限,以及最關鍵的——人類標註者間極低的評分者間信度,這質疑了使用單一標註者F1分數作為最佳化目標的有效性。
這項研究探討了數學家如何利用AI進行數學證明的形式化。透過調查和使用者實驗,發現人們希望AI協助但保留高階控制權,使用AI能提高準確率,並且使用者傾向於使用多種AI工具。
新基準Curation-Bench測試通用編碼智慧體能否自主篩選訓練資料。現成智慧體在十次迭代內達到強基線水平,但傾向於調整區域性策略而非探索新策略族。要求每次迭代引用並改編先前方法的腳手架智慧體,自主發現了一種以十分之一資料預算超越基線的策略,表明結構化方法適應是關鍵。
StepPRM-RTL是一個結合逐步軌跡建模、過程獎勵模型(PRM)和檢索增強微調(RAFT)的框架,用於提升LLM生成RTL程式碼的功能正確性和推理保真度。在基準測試中,功能正確性和推理保真度指標相比最佳先前方法提升超過10%。
多模態大語言模型在複雜推理中表現優秀,但在需要藉助工具進行視覺化輔助時效能下降。為此,研究者提出了VAMPS基準,包含1168道雙語選擇題,源自伊朗大學入學考試,用於評估模型在構造圖形並基於圖形推理方面的能力。實驗表明,直接分析求解方式優於工具輔助的視覺求解。
SMAC-Talk 是星際爭霸多智慧體挑戰(SMAC)的自然語言擴充套件,專為評估基於大語言模型(LLM)的智慧體在協作多智慧體環境中的表現而設計。該環境保留了分散控制、部分可觀測性和長期決策等關鍵特性,並新增了一個自然語言通訊通道,用於探測智慧體的協調與信任。研究設定了包含欺騙性通訊者的場景,並使用 Qwen3.5 系列中的四個模型進行了基準測試,考察了推理結構、記憶和模型規模對協調的影響。SMAC-Talk 已作為開放基準釋出。
大型語言模型正在重塑研究實踐,同時悄然削弱研究者的認識論責任。PEEL框架結合了Voyant Tools的確定性遠讀和Claude的LLM解釋,以皮爾斯符號學和溯因推理為基礎,揭示了AI生成文本中的系統性扭曲。關鍵啟示:確定性工具必須伴隨AI工具,流暢性不等於保真度,認識論權威必須被設計進去。
本文質疑了公眾對AI情感支援的常見假設,指出AI情感支援通常是在通用平臺的任務導向互動中偶然發生,而非使用者刻意尋求。這種偶然的積極體驗會改變人們對AI情感能力的看法,導致未來更傾向於向AI而非人類尋求支援。與OpenAI合作的一項為期28天的縱向研究發現,每天僅5分鐘的AI對話就使得向人類尋求支援的偏好下降10.3%,對AI的偏好上升11.6%。這表明當前針對專用伴侶應用的政策不足,需要監管通用AI系統並關注累積性變化。