該研究提出了Embodied3DBench,一個針對視覺語言模型在3D環境中低層級具身空間智慧的基準測試,包含6個任務類別和超過21000個問答對。評估了13個模型,發現當前模型在高層次空間推理上表現較好,但在互動導向感知方面較弱。為此,他們合成了130萬問答對的訓練資料集,微調後顯著提升了低層級空間智慧。
AI 新聞即時情報
即時監測
即時更新
即時追蹤可信來源,保留出處、權限和站內閱讀模式,把噪音壓成可讀情報。
即時更新
本文提出TRACE框架,一種無需訓練的軌跡約束重建方法,透過耦合相鄰狀態穩定重建路徑,提高成像逆問題的重建質量。
本文透過引入擴散測地線矩(DGM)作為無訓練形狀描述符,對3D形狀檢索中的評估協議進行了審計。實驗表明,基於熱核特徵(HKS)的幾何矩形狀描述符(GMSD-HKS)在FAUST-Reg和TOSCA資料集上取得了最高分數,波核簽名(WKS)仍為強經典訊號,而DGM在稀疏求解或非譜部署場景下更有價值。論文貢獻了可復現的協議級聯分析、跨形狀對齊診斷以及無訓練描述符的設計與報告建議。
GAP3D提出了一種模組化的擴散方法,直接將VLM生成的潛在表示對齊到預訓練影像編碼器的完整補丁級特徵空間,從而在保持空間結構化條件訊號的同時,使凍結的下游生成模型能夠利用VLM作為提示編碼器。該方法主要基於通用域影像-文本對訓練,避免了對大規模3D資料的依賴,並展現出對多模態提示的零樣本能力,儘管目前優先關注高層語義資訊。
提出了一種名為噪聲對齊擴散橋(NADB)的新方法,解決了擴散橋模型在靠近目標端點時的欠擬合問題,改善了影像恢復和翻譯任務。
本文提出S3MEM,一種結構化場景事件記憶框架,用於長時域互動式問答。S3MEM透過結構化記憶單元寫入軌跡、基於錨點的檢索和緊湊的令牌預算感知證據介面,顯著提升了回答早期事件的準確性和效率。在多個環境中的實驗表明,S3MEM在準確性與效率的平衡上優於現有方法。
一項針對14個開源安全護欄模型的全面評估顯示,Qwen Guard(4B引數)以83.97%的召回率位居榜首,而更大的模型如Llama Guard(12B)和GPT-OSS Safeguard(20B)表現保守,漏掉多達75%的不安全內容。研究還發現,模型大小與安全檢測效能無關,通用型護欄模型優於專用模型。
Aryabhata 2是一個針對競爭性STEM考試(如JEE和NEET)最佳化的推理語言模型,基於GPT-OSS-20B透過強化學習後訓練。它利用PhysicsWallah的內部題庫構建高質量課程,並透過逐步增大的rollout組規模來擴充套件探索。實驗表明,Aryabhata 2在多個基準測試中優於基礎模型,同時輸出令牌減少高達64%。
大語言模型在長文本生成中容易出現幻覺,現有檢索增強模型無法保證關鍵資訊靠近輸出。本文提出的微宏檢索(M2R)框架透過宏觀檢索粗粒度證據和微觀檢索關鍵資訊庫,顯著減少了長文本任務中的幻覺,並採用基於課程學習的強化學習策略進行訓練。
本文介紹了一個518M引數的阿拉伯語專用大型語言模型RightNow-Arabic-0.5B-Turbo,基於Qwen2.5-0.5B構建。透過詞彙注入和邊緣優先部署,該模型在阿拉伯語基準測試中達到35.9%的平均準確率,超越了同類開源模型,並在COPA-ar上與1.5B引數量的Falcon-H1-1.5B持平,而體積僅為後者的三分之一。量化後模型僅398 MB,在單塊H100上可實現635 tokens/s的推理速度。所有程式碼和權重均已開源。
一篇新論文分析了17個大型語言模型(引數規模4.1億至1000億以上),發現指令微調系統系統地壓縮了語言熵,尤其是在話語和結構維度上,平均放大效應達1,949%至16,853%,峰值可達5,181%至209,675%。複雜標點符號的使用頻率被抑制到基線的3.2%至23.2%。這些效應在RLHF下並未惡化。弱干預(lambda=1.0)使崩潰加劇240%,而強控制(lambda=5.0)實現了40.5%的改進,儘管規模劣勢達200-1000倍,仍比前沿模型效能高出96.7-98.2%。強控制還帶來了15%更高的distinct-4、27%更高的詞彙多樣性以及78%更低的重複率。研究表明,對齊需要足夠的控制強度,而非僅僅是分佈平滑。
新框架MechELK利用機制可解釋性從大型語言模型中提取隱藏知識。它結合了稀疏自編碼器、因果探針和表徵工程,實現了84.7%的準確率,超越了現有方法。該框架在模型給出錯誤或迴避性回答時尤其有效。
該研究提出了一種模組化框架,用於生成可發音、型別學合理且語義結構清晰的人工詞彙。框架從PHOIBLE資料庫中取樣音位清單,在可互換的音系語法(確定性、OT和MaxEnt)下生成詞形,並透過Swadesh-Leipzig-Jakarta本體分配含義。評估表明,機率語法在音位連貫性和型別學真實性方面始終優於確定性和隨機基線。
隨著大型語言模型(LLM)影響力的擴大,理解其決策過程變得至關重要。本文提出透過構建低成本、可廣泛應用的線性探測工具,檢測LLM嵌入中概念的存在與否,從而揭示模型“思考”的內容。研究展示了概念界定、探測訓練與跨上下文追蹤的完整流程,並在三個LLM上對四個概念進行了驗證,為未來大規模監控模型行為奠定了基礎。
多模態學習常面臨模態不平衡問題,即收斂快的模態主導最佳化,其他模態訓練不足。現有方法大多透過加強弱模態或調整梯度來補償最佳化速率差異,但可能犧牲強模態的最佳化能力。本文提出平衡多模態標籤重塑(BMLR),首次從標籤端設計促進多模態平衡。BMLR重塑跨模態標籤空間以均衡各模態的對映難度,從而促進模態互動併為每個模態注入更豐富的類間資訊。實驗表明,BMLR能持續提升多模態效能,且與多種模型設計相容。
宏基因組分類註釋旨在識別環境樣本中DNA片段的微生物起源。傳統方法依賴序列相似性,受限於微生物多樣性和參考資料庫的不完整性。TaxDistill提出一種知識蒸餾框架,利用500M引數的基因組基礎模型GenomeOcean作為教師網路提取深層語義特徵並生成基於置信度的軟標籤,將軟標籤資訊蒸餾到輕量級學生網路中,有效減少初始檢索工具引入的標籤噪聲。在七個CAMI2資料集上的實驗表明,TaxDistill在多數場景下優於現有基線,例如在胃腸道資料集上將MMseqs2的F1分數從0.763提升至0.941。
PrismFlow提出了一種新的流匹配方法,透過科普曼啟發的動力學專家來修正標準流匹配中的估計器平滑問題,從而恢復時間序列中的高頻率和精細結構。該方法在多個基準測試中取得了最先進效能,Context-FID提升15.6%,判別分數提升38.6%。
本文提出COM方法,透過在初始化和訓練階段引入幾何約束,保留時間序列標記的連續性和序數性,顯著提升基於令牌的時間序列大語言模型(TS-LLM)的效能。實驗表明,COM在多個基準上取得一致改進和強泛化能力。
本研究在四人紙牌遊戲大老二中探索自對弈強化學習框架,對比多種演算法發現PPO優於蒙特卡洛Q近似、SARSA和Q學習。適度的熵正則化可防止策略過於確定,當前策略自對弈比檢查點自對弈或固定對手訓練提供更強的有限預算課程。結果表明大老二是不完全資訊、多人互動、延遲獎勵和可變動作集下深度強化學習的有用受控基準。
提出TRACE,一種軌跡感知的LLM推理代理,用於分子先導最佳化,透過將工具選擇建模為序列決策問題,實現前向最佳化的結構約束改進,在ADMET最佳化任務中取得更高成功率、更大效能提升和更高有效性。
最近研究表明,強化學習(RL)比監督微調(SFT)更能保持大語言模型的先前能力。本文從機制層面延伸,引入差分電路脆弱性度量,衡量微調中電路退化程度。在Qwen2.5-3B-Instruct科學問答實驗中發現,SFT適應目標任務更快,但造成更大的電路破壞和遺忘,而RL保留更多基礎電路,但任務適應較慢。結果表明電路保留有助於解釋RL對災難性遺忘的魯棒性。
本研究利用TradeArena測試平臺,分析大型語言模型(LLM)交易代理在金融決策中的行為對齊與表示動態。研究發現失敗前的可測量跡象:規劃嵌入偏離正常狀態,有效秩收縮。結構化的風險反饋可作為外部對齊訊號,但並非通用效能增強器。此外,51只股票的日內實驗揭示了相關性盲點:LLM理由常證明對耦合資產的集中敞口是合理的。
本文研究知識編輯方法(如ROME和MEMIT)在Transformer模型中的內在機制。作者發現儘管每次編輯修改不同的權重,但所有編輯都依賴於一個共同的權重子集。透過訓練一個緊湊的二進位制掩碼,他們成功逆轉了訓練集上80%的編輯和測試集上超過70%的編輯,驗證了不同編輯共享共有功能結構。掩碼透過消除後期層的過度注意來逆轉編輯,且注入該掩碼會使編輯成功率從98%驟降至38%,表明該機制是編輯成功的必要條件。研究發現編輯實際上抑制而非覆蓋知識,這解釋了ROME和MEMIT無法將更改傳播到相關事實的原因。該發現有助於檢測和防禦未授權編輯。
VFEAgent是一個端到端多智慧體系統,可直接從輸入影像和問題描述自動完成有限元分析(FEA)建模與模擬。它結合了多模態視覺語言多智慧體管道和驗證優先的程式碼合成框架,透過ReAct推理提取結構化FEA規範,並具有自除錯和回退機制以確保可執行性和物理有效性。實驗表明,VFEAgent在生成完整且物理有效的模擬方面成功率很高,在可靠性和正確性上優於基於LLM的基線方法,有望將工程師從繁瑣的手動分析中解放出來。
一項新研究利用Anthropic和OpenAI的五種前沿大語言模型作為智慧體策展人,在自包含工作空間中自動進行表型註釋。實驗表明,這些智慧體的一致性達到了人類策展人的變異範圍,並顯著優於傳統NLP工具,有望解決表型本體註釋中人工依賴強、難以規模化的問題。
本文提出正交概念擦除(OCE),透過乘法引數更新實現精確的概念擦除,同時保持擴散模型的生成能力,支援多概念擦除,速度快。
該論文透過實驗評估了大型語言模型(LLM)生成的科學論文評審與人類評審的對齊程度,發現對齊有限且因提示和模型而異。研究還發現,作者利用LLM評審進行迭代修改可顯著提升論文評分,最多35%的論文分數得到統計顯著提升。
認知範疇變換器(CCT)是一種306M引數的架構,透過在預訓練的GPT-2 Small骨幹網路上新增源自範疇論和認知科學的元件,在WikiText-103上實現了21.27的驗證困惑度,相比微調基線降低2.92(12%)。消融實驗證實,84%的改進來自GT-Full單純訊息傳遞。研究還發現了結構/一致性區分模式。
本文提出行為感知輔助修正,以穩定離線策略時序差分學習。透過用行為貝爾曼矩陣替代輔助協方差矩陣,作者引入BA-TDC和BA-TDRC演算法。理論分析證明了不動點保持和幾乎必然收斂。在標準基準上的實驗表明,行為感知替換可提高效能,但正則化對穩健結果必要。
本文提出了一種名為STHTD-MP的行為誘導映象近端時間差分方法,透過用行為策略貝爾曼矩陣的對稱部分替換協方差度量,改善了離策略預測的收斂速度。理論分析和數值實驗表明,該方法在多項基準測試中優於現有的GTD2-MP方法。