AI News HubLIVE

AI 新聞即時情報

即時監測

今日 AI 世界最重要的變化

來自 105 個可信來源,最近更新 2026-06-05 12:00 UTC+8。

即時監測

即時更新

即時追蹤可信來源,保留出處、權限和站內閱讀模式,把噪音壓成可讀情報。

即時更新

重設
利用神經ODE在黎曼流形上從示範中學習:擴展摘要

本文提出了一種使用神經常微分方程(ODE)在黎曼流形上進行從示範學習(LfD)的新方法。傳統LfD在歐幾里得空間中進行,而機器人狀態(如方向)自然存在於彎曲空間。該方法通過神經ODE高效估計測地線,實現流形上任意兩點間的自然運動生成,並將測地線解碼回任務空間用於機器人部署。仿真實驗驗證了該框架的有效性。

arXiv Robotics研究 / 機械人站內正文
MoDex:用於序列多物體靈巧抓取的擴散策略

MoDex是一種基於擴散模型的策略,使靈巧手能夠在保持已抓取物體的同時,順序抓取多個物體。通過條件化對掌空間和點雲,每次抓取僅使用部分手指自由度。兩階段訓練(模仿學習+強化學習微調)提升了仿真與現實中的成功率。

arXiv Robotics模型 / 政策 / 研究站內正文
VASO:形式化可驗證的物理AI智能體自進化技能

VASO是一個框架,通過形式化驗證引導大語言模型生成的機器人技能合約的自我進化。在Clearpath Jackal和PX4四旋翼任務上,VASO在不到100個優化樣本下達到了97.2%的規範符合度,優於執行反饋、提示優化和微調基線。這是首個將形式化驗證與自進化技能閉環的框架。

arXiv Robotics模型 / Agent / 政策站內正文
李羣中導航向量場距離函數的高效計算方法

針對機器人控制中路徑跟蹤問題,提出了一種在李羣上高效計算點到曲線距離的方法。該方法將曲線表示為G-多項式,通過利用其結構將問題轉化為少量多項式求根計算,顯著降低了計算時間並保持精度。在SE(3)羣上給出了實用公式,並通過機械臂實驗驗證。相關計算包已開源。

arXiv Robotics研究 / 機械人站內正文
一種新型四元數關節纜驅動冗餘機械臂配置及其基於FABRIK和殘差強化學習的控制方法

研究人員提出了一種新穎的4段8關節四元數關節纜驅動冗餘機械臂配置,該配置能在更低硬件成本下實現更廣泛的工作空間。結合殘差強化學習,該控制方法在位置和方向精度上比現有最先進的FABRIK算法提高了三個數量級,且控制實現更簡單,為新型纜驅動機械臂的設計與控制提供了有力工具。

arXiv Robotics研究 / 機械人站內正文
OLIVE:面向高效自適應外骨骼的在線低秩增量學習

提出OLIVE框架,通過低秩殘差分解實現外骨骼控制的在線個性化適應,僅依賴本體傳感器反饋,無需離線軌跡,在多種地形上提升步態平滑度、減少努力並增強穩定性。

arXiv Robotics模型 / 政策 / 研究站內正文
基於OCT和OCT血管成像的深度學習輔助AMD分期

本研究利用深度學習模型,基於OCT和OCTA數據自動對年齡相關性黃斑變性(AMD)嚴重程度進行分期。在271名參與者中,分析了三種模型:基於生物標誌物圖譜的模型、2D en face投影模型和3D體積模型。所有模型均表現良好,其中基於生物標誌物的模型綜合性能最佳,QWK達0.85,尤其在早期AMD檢測方面表現突出。

arXiv Computer Vision芯片 / 研究站內正文
三維視網膜微血管在OCT血管成像中的恢復

提出一種基於深度學習的方法,從單次OCT血管成像(OCTA)體積中恢復毛細血管解剖結構,顯著提升圖像質量,並首次關注三維血管架構。

arXiv Computer Vision研究站內正文
Biomazon:亞馬遜盆地三維森林結構與生物量建模的多模態數據集

Biomazon是一個20米分辨率的多模態基準數據集,覆蓋亞馬遜盆地,結合GEDI RH和AGBD目標與多傳感器預測因子,用於聯合預測整個GEDI RH剖面和地上生物量密度。該數據集提供了標準化的空間劃分和評估協議,並建立了基線框架,通過消融研究評估不同backbone、模態貢獻和輔助嵌入的效果。Biomazon旨在推動熱帶森林結構一致性和結構-生物量建模的研究。

arXiv Computer Vision模型 / 研究 / 創業融資站內正文
從單目視頻中恢復物理合理的人-物交互

本文提出RePHO方法,通過物理引導的重建框架從單目視頻中恢復物理合理的人-物交互。該方法從運動學估計出發,利用強化學習策略在物理模擬器中優化交互,並採用自適應採樣策略處理噪聲估計,在兩個基準測試上顯著提升了物理合理性。

arXiv Computer Vision政策 / 研究站內正文
LightVesselNet:一種用於視網膜血管分割的超輕量級(參數少於10萬)網絡

本文提出LightVesselNet,一種僅含75K參數的高效神經網絡,用於資源受限環境下的視網膜血管分割。該網絡採用緊湊的編碼器-解碼器架構,結合通道和空間注意力機制、瓶頸處的多尺度特徵聚合模塊以及解碼器中的亞像素上採樣策略。專用邊緣殘差連接在解碼過程中保留精細血管細節。在DRIVE、STARE、CHASEDB1、FIVES和HRF五個公開數據集上的實驗結果表明,其靈敏度分別為0.8189、0.8499、0.8640、0.8634、0.8096,Dice係數分別為0.8070、0.8072、0.8181、0.8649、0.7686。與最先進模型相比,LightVesselNet在效率(性能與參數或GFlops之比)上有所提升。跨數據集評估證實了模型的泛化能力。總體而言,LightVesselNet是低資源臨牀環境和移動篩查工具的有力候選。

arXiv Computer Vision研究 / 創業融資站內正文
TopoPult-SSL:基於自蒸餾弱臨牀先驗的無腺體掩膜跨設備瞼板腺分割

本文提出TopoPult-SSL,一種兩階段框架,用於跨設備瞼板腺分割。第一階段無需目標腺體掩膜,僅利用瞼緣輪廓和臨牀元數據作為弱先驗;第二階段當目標腺體掩膜可用時,通過監督自蒸餾將互補的多教師知識壓縮至單一學生模型。在MGD-1k到CAMG基準上,蒸餾模型Dice達0.716,超越UA-MT和集成教師,且僅需單次推理。無腺體掩膜變體精度0.694,顯著優於SAM/MedSAM。

arXiv Computer Vision模型 / 研究站內正文
模型是否共享安全表示?跨模型引導實現安全視覺生成

研究人員提出一種跨模型安全引導框架,通過輕量級對齊,將源大語言模型的安全方向轉移到目標圖像/視頻生成器,無需目標端不安全數據。該方法在降低攻擊成功率的同時,保持了生成質量,並與原生方向效果相當。

arXiv Computer Vision模型 / 政策 / 研究站內正文
個人相機膠捲視覺問答AI助手

該研究提出了個人相機膠捲視覺問答(VQA)設置,構建了包含50名用户、31,476張圖像和2,500個問答對的camroll數據集,並設計了配備分層記憶和高效導航工具的camroll-agent對話AI代理。實驗表明,該代理在長上下文理解方面優於多種基線方法,突顯了個人視覺記憶需要不同於標準文本記憶的新方法。

arXiv Computer VisionAgent / 研究站內正文
NIV:神經軸變化用於可變字體生成

一種名為NIV的新方法通過神經網絡預測每個點的位移,自動將靜態字體轉換為可變字體,實現沿設計軸(如粗細和寬度)的連續變化。該模型能泛化到未見過的風格和複雜字形(包括CJK漢字),並輸出標準的可變字體文件。

arXiv Computer Vision模型 / 研究站內正文
VideoKR:面向知識與推理密集型視頻理解

研究人員推出了VideoKR,這是首個專門用於增強知識和推理密集型視頻理解的大規模訓練語料庫,包含31.5萬個視頻推理示例和14.5萬個新收集的CC許可專家領域視頻。他們開發了人在迴路、面向技能的示例生成管道,並策劃了新的專家註釋基準VideoKR-Eval。實驗表明,在標準SFT→GRPO流程下,基於VideoKR後訓練的模型在知識密集型視頻推理上優於以往方法,同時在通用視頻推理上保持競爭力。

arXiv Computer Vision模型 / 研究站內正文
LANTERN:用於長上下文LLM對話的分層歸檔與時間情景檢索網絡

本文提出LANTERN,一種輕量級記憶層,通過零LLM調用和低延遲的混合檢索,在對話歷史壓縮後恢復關鍵細節。實驗表明,LANTERN在恢復丟失事實方面優於MemGPT,並且將通用LLM的準確率平均提高8.4個百分點。

arXiv Computational Linguistics模型 / 研究 / 創業融資站內正文
面向自然語言推理的多粒度推理

本文提出了一種名為多粒度推理網絡(MGRN)的新方法,用於自然語言推理(NLI)任務。該方法通過顯式利用層次化語義特徵,模擬人類從詞彙匹配到邏輯推理的認知過程,從而捕捉複雜的語義關係。實驗表明,MGRN在多個公開基準上優於強基線模型。

arXiv Computational Linguistics模型 / 研究站內正文
從評分到解釋:評估SHAP和LLM理由在基於量規的教學質量評估中的應用

本研究提出一個通用框架,結合模型無關的Shapley值歸因和大語言模型(LLM)生成的推理,為基於量規的自動評分提供句子級別的可解釋性。在CLASS框架的反饋質量維度上,使用NCTE語料庫評估,發現微調預訓練語言模型(PLM)在預測準確性上優於LLM,但存在向中等分數的標籤壓縮。基於刪除的測試表明,SHAP能更可靠地識別驅動模型預測的句子,產生更大且更一致的預測偏移,而LLM推理影響有限且不一致。跨模型分析顯示SHAP歸因在不同架構間穩健轉移。總體而言,SHAP為基於量規的評分提供了更忠實和可轉移的解釋,該框架為高風險教育環境中的評分模型評估提供了原則性基礎。

arXiv Computational Linguistics模型 / 研究站內正文
MCBench:面向全模態大語言模型的多情境安全評估基準

現有的多模態安全基準僅關注視覺輸入,無法評估處理視覺、音頻和文本的全模態大語言模型(Omni LLMs)。本文提出MCBench,包含1196個場景,涵蓋四個安全類別,每個不安全場景配有一個最小差異的安全版本來評估模型敏感性。評估表明,Omni LLMs在細微或非物理風險上表現困難,但當有顯著視覺或聽覺線索時表現較好。推理軌跡分析顯示,模型雖能提取模態特定信息,但常無法有效整合這些線索進行安全判斷。研究發現當前Omni LLMs在安全關鍵場景中缺乏穩健的跨模態推理,強調了改進架構和訓練策略的必要性。

arXiv Computational Linguistics模型 / 政策 / 研究站內正文
面向電信客服的小語言模型參數高效微調:基於LoRA配置與能耗分析的比較研究

該論文系統研究了使用低秩適應(LoRA)對Qwen2.5-3B進行參數高效微調,以構建電信客服領域的專用對話助手。研究引入了組合式合成數據生成方法,評估了16種LoRA配置,揭示了定量驗證損失與定性人工對齊排名之間的差異,並提供了能耗-性能權衡分析。

arXiv Computational Linguistics模型 / 研究 / 創業融資站內正文
通用三重潛在壓縮與門控聯想檢索

本文研究通用三重潛在序列模型,該模型通過維護運行中的令牌狀態和壓縮的配對記憶路徑來捕獲高階令牌交互,無需特定基準解析。三重潛在族在字節級WikiText-2和基於分詞器的MiniMind語言模型基準上改進了小型Transformer基線,而專注於回憶的門控鍵值檢索擴展提高了聯想回憶能力,但對種子敏感且當前參考實現速度較慢。

arXiv Computational Linguistics模型 / 研究站內正文
通過基於方差感知的評分獎勵與GRPO改進LLMs中專注於心髒的醫學問答

本研究提出了一種採用組相對策略優化(GRPO)結合方差感知獎勵框架的方法,用於後訓練大型語言模型(LLMs)以提升其在心臟相關醫學問答中的表現。該方法將傳統的二元標準聚合和整體Likert評分替換為連續分析獎勵函數,從而提供更豐富的優化信號。在HealthBench的心臟子集上,最佳變體相對於Qwen3-14B基礎模型將準確率從0.362提升至0.502,F1從0.532提升至0.668,性能與GPT-OSS-120B相當。

arXiv Computational Linguistics模型 / 政策 / 研究站內正文
預測與重構:自監督語言表示學習的聯合目標

本研究提出一種結合JEPA潛在空間預測損失與標準掩碼語言建模(MLM)的混合預訓練目標,旨在改進語言表示。實驗表明,該混合編碼器生成的嵌入更均勻、語義-詞彙平衡更優,但下游準確率與純MLM基線相似。

arXiv Computational Linguistics模型 / 芯片 / 研究站內正文
DiffSlack:基於可學習鬆弛變量的非線性不等式約束學習

DiffSlack提出一種可微投影層,通過可學習的鬆弛變量將不等式約束轉化為等式,從而在神經網絡中高效實施非線性不等式約束。該方法在具有200個非線性約束的車輛路徑規劃任務中,相比基線方法實現了更高的規劃成功率和更強的幾何約束滿足能力,並在CARLA仿真和真實車輛實驗中驗證了其軌跡的可執行性。

arXiv Machine Learning模型 / 研究站內正文
可微高效運算符搜索

研究人員提出可微高效運算符搜索框架,自動尋找多模態基礎模型中的令牌縮減最優策略,在視覺令牌大幅壓縮下仍保持精度與效率的平衡。

arXiv Machine Learning模型 / 政策 / 研究站內正文
大步長梯度下降恢復多路徑深度線性網絡中的對稱性

最近對多路徑深度線性網絡的分析使用梯度流預測了“贏家通吃”的專業化,其中路徑對稱性被打破,每個特徵集中在一個路徑上。本文表明,大步長的離散梯度下降(GD)講述了不同的故事。我們證明單路徑解是尖鋭最小值,而將信號分佈到多個路徑上會降低尖鋭度,且降低因子隨路徑數量和深度增加而減小。因此,雖然早期訓練再現了梯度流預測的深度驅動對稱性破壞,但隨後在穩定邊緣的振盪覆蓋了這一趨勢,並將網絡驅動到再平衡階段,信號在路徑間重新分佈。這些結果共同闡明瞭深度如何塑造路徑競爭,並解釋了大步長GD為何有利於共享表示而非持續的單路徑主導。

arXiv Machine Learning研究站內正文
狀態承諾學習:訓練語言模型區分計算與記憶

該研究提出狀態承諾學習,通過反事實擦除強化學習(CERL)訓練語言模型區分臨時計算與持久狀態,在不犧牲準確性的前提下減少答案對隱藏思維的依賴。

arXiv Machine Learning模型 / 研究 / 創業融資站內正文
大型語言模型中的時間偏好概念及其功能

研究人員在一款蒸餾版大型語言模型(Qwen3-4B-Instruct-2507)中定位了負責時間偏好的神經子圖,發現模型對未來折扣的程度遠低於人類,且這種偏好在不同上下文中不穩定,而通過引導向量可以調節時間偏好。

arXiv Machine Learning模型 / 研究站內正文