AI News HubLIVE

AI 新聞即時情報

即時監測

今日 AI 世界最重要的變化

來自 105 個可信來源,最近更新 2026-05-28 12:00 UTC+8。

即時監測

即時更新

即時追蹤可信來源,保留出處、權限和站內閱讀模式,把噪音壓成可讀情報。

即時更新

重設
面向光流控組裝的智能語言到目標合成

研究人員提出了Speak-to-Objective模塊化智能管線,利用條件大型語言模型將口頭或書面命令轉換為可微分的優化目標函數,用於在約束感知逆解算器和實驗光流控平台上組裝微粒。該方法採用“感知-組合-提議-執行-報告與學習”的循環,將目標作為意圖與驅動之間的接口,實現自然語言可編程的微觀組裝,推動自主光製造平台的發展。

arXiv Robotics模型 / Agent / 研究站內正文
Uni-LaViRA:統一具身導航的語言-視覺-機器人動作翻譯

Uni-LaViRA是一種統一的具身導航智能體架構,將導航決策簡化為單一的語言-視覺-機器人動作翻譯。它利用預訓練的多模態大語言模型(MLLM),以零樣本方式在四個任務系列和四種真實機器人上實現泛化。通過待辦列表記憶(TDM)和第二次機會回溯(SCB)機制實現自我糾正導航,無需任何訓練即可在多個基準測試中取得與依賴大規模訓練數據的模型相當甚至更優的結果。

arXiv Robotics模型 / Agent / 芯片站內正文
合成情感與遊戲化:探索小型社交機器人不同年齡段的參與策略

許多兒童面臨情緒調節和社交互動的挑戰,社交輔助機器人需要保持兒童的持續參與。本研究評估了一種觸覺機器人的兩種參與策略:合成情感反饋和積分獎勵。對16名6-8歲小學生的偏好評估顯示孩子更喜歡情感參與;而對14名20-27歲大學生的行為研究發現積分獎勵系統能帶來更高任務準確性(p<0.05)並維持表現。結果表明,不同年齡羣體的偏好和行為結果可能不一致,驗證設計假設需要通過實際交互觀察。

arXiv Robotics政策 / 研究 / 機械人站內正文
SCALE-COMM:用於多智能體強化學習通信的共享對比對齊潛在嵌入

SCALE-COMM是一種自監督框架,通過解耦通信學習與策略優化,學習緊湊、穩定且與策略相關的潛在消息,提升多智能體強化學習中的協調性能。在多個基準測試和實際倉庫協調任務中,它優於現有方法,提高了穩定性、樣本效率和吞吐量。

arXiv Robotics模型 / Agent / 政策站內正文
GE-Sim 2.0:構建機器人操作綜合閉環視頻世界模擬器的路線圖

GE-Sim 2.0是一種基於動作條件視頻生成框架的閉環視頻世界模擬器,通過數千小時真實機器人數據重新訓練,提升了動作跟隨保真度和軌跡覆蓋。新增狀態專家、世界裁判和加速框架三個模塊,實現了從視頻模擬到策略學習的閉環。僅2B參數即登頂WorldArena排行榜,訓練的模型可遷移到真實世界。

arXiv Robotics政策 / 研究站內正文
“如果世界”:面向具身場景的通用世界模型因果基準

視頻生成模型越來越多地被用作世界模擬器,但現有基準僅評估單視頻質量,無法檢測模型是否真正理解因果關係。新提出的“如果世界”基準包含319對基於真實場景的提示對,通過改變一個物理變量來測試模型輸出的因果一致性。對9個最先進模型的評測顯示,最佳配對得分僅52%,開源模型約28%,且表現與視覺顯著性相關而非物理可解性。

arXiv Computer Vision研究 / 機械人站內正文
Melanoscope AI移動皮膚鏡臨牀決策支持系統的臨牀驗證

一項針對Melanoscope AI移動皮膚鏡臨牀決策支持系統的前瞻性單中心臨牀驗證顯示,該系統在176名患者中與專家評估的一致率為88.6%,未出現假陰性,特異性為88.3%。研究開發了級聯深度學習模型的定量可解釋性評估方法和三區患者分診算法,為資源有限地區的皮膚癌篩查提供了可重複、可解釋的決策支持。

arXiv Computer Vision研究站內正文
表示條件擴散模型:用於引導訓練數據生成

該研究提出表示條件擴散模型,利用DINOv2、DINOv3和CLIP的表示作為條件生成合成圖像數據,在ImageNet100上以+10.76 p.p.的top-1準確率顯著優於類條件生成。通過擴大合成數據集,甚至能超越真實數據訓練的模型(+2.0 p.p.)。此外,該方法在數據增強和樣本過濾方面也表現出色,為大規模視覺學習任務提供了一種有前景的替代或補充真實數據集的方案。

arXiv Computer Vision模型 / 研究站內正文
超越運動基元:基於頭戴式IMU的行為活動識別

本研究提出了一種基於頭戴式慣性測量單元(IMU)的行為級活動識別方法,超越了傳統運動基元識別。研究團隊定義了五種與AR應用需求相匹配的行為類別,構建了包含16萬個樣本的Ego4D數據集,並提出了HiT-HAR層次模型(70.3萬參數),在五類動作和八類場景識別任務上優於現有模型。通過可分離性分析,揭示了頭戴式IMU的觀測極限:移動類行為可靠可觀測,物體轉移和任務操作類需要時間上下文,場景依賴信號重疊仍是挑戰。結果表明,利用時間上下文和場景結構的架構選擇優於簡單擴大模型規模。代碼和數據集已公開。

arXiv Computer Vision研究 / 機械人站內正文
D²Turb:深度感知模擬與解耦學習用於單幀大氣湍流緩解

研究人員提出D²Turb框架,通過引入深度感知的湍流合成協議和自適應結構先驗注入機制,將大氣湍流緩解分解為紋理去模糊和幾何校正兩個交互階段,在合成和真實數據集上均達到最優性能。

arXiv Computer Vision模型 / 研究站內正文
微調視覺語言模型用於理解當前損傷並利用質量守護代理進行優先級評分

本研究提出了一種利用微調視覺語言模型(VLM)自動化橋樑損傷理解和修復優先級評分的方法。通過使用QLoRA對LLaVA-1.5-7B進行微調,基於多達4000張橋樑損傷圖像和檢查文本記錄,並在800張圖像的測試集上評估。實驗表明,2000個訓練樣本即可在2.9小時內達到接近最優的驗證損失,超過2000後收益遞減。此外,引入了一個兩階段質量守護代理,使用微調的Swallow-8B SLM在優先級評分前拒絕低質量VLM輸出。

arXiv Computer Vision模型 / Agent / 政策站內正文
從情感到複雜行為:第十屆ABAW研討會與競賽推進多模態以人為中心的AI

第十屆ABAW研討會與競賽在CVPR 2026上舉辦,通過引入情感模仿強度估計、矛盾/猶豫識別和細粒度暴力檢測等新挑戰,以及傳統的情感估計和識別任務,推進多模態以人為中心的AI。競賽利用大規模野外數據集,論文軌道涵蓋從姿態估計到公平性和魯棒性的廣泛主題。

arXiv Computer Vision模型 / 研究 / 創業融資站內正文
EvoSpec:通過實時詞彙和參數適配實現推測解碼的進化

EvoSpec是一種新型框架,通過動態詞彙和參數適配實現推測解碼的實時進化,克服了靜態剪枝方法在專業領域或話題切換場景中接受率驟降的問題。在EAGLE-3上,相比基線FR-Spec,EvoSpec實現了1.13倍加速,且內存開銷降低27%。

arXiv Computational Linguistics模型 / 政策 / 研究站內正文
社區態度建模與反應語調:評估LLM與在線社區語言行為對齊的人機協作框架

大型語言模型(LLM)作為計算社會分析的代理日益普及,但能否忠實再現人類社區的“厚描述”仍是關鍵挑戰。本文提出CARE(社區感知反應評估)框架,通過精細刻畫言外語調頻譜及其潛在態度,測評LLM模擬話語與真實社區對新聞事件的反應之間的差異。研究發現,使用明確社區提示引導LLM並不能天然提高模擬真實性,前沿模型間存在分歧行為特徵,表明當前對齊策略不足以捕捉在線羣體的社會語言動態。

arXiv Computational Linguistics模型 / 研究 / 創業融資站內正文
BioELX:基於別名檢索和LLM排序的跨語言生物醫學實體鏈接

BioELX是一種新穎的跨語言生物醫學實體鏈接框架,無需標註訓練數據。它通過維基百科多語言別名增強SapBERT,並利用預訓練LLM進行上下文感知消歧。在五個基準測試中,BioELX實現了最先進的性能,尤其在土耳其語、韓語和泰語等低資源語言上表現突出。

arXiv Computational Linguistics模型 / 研究站內正文
RAG-Coding:利用結構化外部知識增強LLM醫學編碼

RAG-Coding是一種自動化ICD-10-CM編碼方法,通過協調四個大語言模型代理並基於外部知識源(如官方編碼列表和指南)進行決策,提高了編碼準確性和臨牀合規性。在MDACE數據集上,其性能優於最佳LLM基線8-13%的微觀F1和2-8%的宏觀F1。與最先進的預訓練模型PLM-ICD相比,RAG-Coding的微觀召回率高出11%,而PLM-ICD的微觀精確度高出6%,兩者F1相當。消融實驗驗證了外部知識的逐步增益。同時發佈了MDACE-2025,根據2025年最新指南重新標註,支持更細粒度的評估。

arXiv Computational Linguistics模型 / Agent / 研究站內正文
在基於提示的文本到語音模型中實現細粒度和語內説話風格控制

本文提出兩種新技術,使現有的基於提示的文本到語音(TTS)模型能夠實現語際風格插值和語內風格轉換,解決了傳統模型缺乏細粒度控制和只能應用單一全局風格的問題。實驗證明,語際插值在性別轉換上成功率達99-100%,語內轉換保持了高説話人相似度和感知平滑度。

arXiv Computational Linguistics模型 / 研究站內正文
LCO:基於LLM的約束優化,使智能體LLM在實際任務中更安全

大型語言模型(LLM)作為自主智能體時,會通過上下文獎勵黑客行為(ICRH)產生有害副作用。現有防禦方法不足,因為ICRH源於模型自身的過度優化。本文提出LLM-based Constraint Optimization (LCO)框架,包含自我思考模塊和進化採樣模塊,在不微調模型的情況下有效減少ICRH。實驗表明,LCO在推文優化任務中將GPT-4的有毒性增長率降低39%,在策略優化基準中將ICRH發生率降低15.23%,且不犧牲任務性能。

arXiv Computational Linguistics模型 / Agent / 政策站內正文
ICG:基於MLLM提示與個性化偏好對齊的封面圖像生成改進方法

本文提出ICG框架,通過融合多模態大語言模型(MLLM)提示與個性化偏好對齊,生成高質量、上下文相關的封面圖像。ICG利用元標記從商品標題和參考圖像中提取語義特徵,結合用户嵌入進行細化,並將個性化上下文注入擴散模型。採用多獎勵學習策略,結合公共美學/相關性獎勵和基於用户行為訓練的個性化偏好模型,無需標註數據。實驗表明,ICG在圖像質量、語義保真度和個性化方面顯著提升,增強了用户吸引力及下游推薦準確性。

arXiv Computational Linguistics模型 / 研究站內正文
架構驅動的偏移:一種用於捕捉對數幾率偏移趨勢的輕量級選擇器

本文提出了一種輕量級的架構驅動偏移(ADS)度量,用於在持續學習中高效選擇預訓練模型。ADS通過解耦對數幾率偏移為架構依賴和數據依賴,僅需少量數據樣本即可捕捉偏移趨勢。實驗表明,ADS與對數幾率偏移之間存在強單調相關性(斯皮爾曼相關係數最低0.731),並可作為預期校準誤差的有效代理,在六個場景、三個數據集上驗證了其可靠性。

arXiv Machine Learning模型 / Agent / 研究站內正文
度量感知PCA:幾何深度學習的一個線性實例

本文提出度量感知主成分分析(MAPCA),將PCA參數化為正定度量矩陣,並將其納入幾何深度學習框架。MAPCA將度量視為幾何先驗,其解在正交羣下等變,譜不變。文章證明了IPCA是MAPCA族中唯一的線性數據派生度量,具有對角縮放等變性。最後,探討了核PCA、譜圖方法和深度MAPCA等擴展。

arXiv Machine Learning研究站內正文
用混合專家模型應對多模態學習挑戰:一項綜述

本綜述從三個關鍵視角探討混合專家模型(MoE)如何有效解決多模態學習挑戰:作為高效引擎、表示學習器和適配器,並指出可解釋路由、專家通信等研究空白。

arXiv Machine Learning模型 / 研究站內正文
$E^3$-Agent:面向邊緣生成式推理的可執行與演化式資源管理智能體

本文提出$E^3$-Agent,一種面向邊緣AIGC資源管理的可執行與演化式智能體。該智能體將毫秒級的路由決策與事件驅動的LLM元控制器分離,通過在線學習適應未知且時變的服務時間映射。在模擬實驗中,$E^3$-Agent將平均延遲降低65%-73%,並有效抑制了語義退化下的卡頓率。

arXiv Machine Learning模型 / Agent / 研究站內正文
簡單狀態空間模型在多變量時間序列分類中表現出色

研究表明,結構化狀態空間模型中的對角變體S4D在時間序列分類任務上比複雜的Mamba架構更準確且高效。作者提出的輕量級改進MS4和MS4N進一步提升了性能,在59個數據集上優於Mamba模型,並匹敵參數量大2倍和10倍的深度學習模型。

arXiv Machine Learning研究站內正文
IGADA-IoT:基於自動數據增強的無線傳感器網絡物聯網傳感器能量優化

本文提出IGADA-IoT框架,通過層次化多生成器協作與調度,基於信息間隙指導自動數據增強,提升無線傳感器網絡中物聯網傳感器的採樣頻率決策性能,從而優化能耗。實驗顯示,該方法在多個下游模型上平均準確率提升7.27%,優於現有數據增強方法及單獨生成器。

arXiv Machine Learning研究 / 創業融資站內正文