研究人員提出了Speak-to-Objective模組化智慧管線,利用條件大型語言模型將口頭或書面命令轉換為可微分的最佳化目標函式,用於在約束感知逆解算器和實驗光流控平臺上組裝微粒。該方法採用“感知-組合-提議-執行-報告與學習”的迴圈,將目標作為意圖與驅動之間的介面,實現自然語言可程式設計的微觀組裝,推動自主光製造平臺的發展。
AI 新聞即時情報
即時監測
即時更新
即時追蹤可信來源,保留出處、權限和站內閱讀模式,把噪音壓成可讀情報。
即時更新
Uni-LaViRA是一種統一的具身導航智慧體架構,將導航決策簡化為單一的語言-視覺-機器人動作翻譯。它利用預訓練的多模態大語言模型(MLLM),以零樣本方式在四個任務系列和四種真實機器人上實現泛化。透過待辦列表記憶(TDM)和第二次機會回溯(SCB)機制實現自我糾正導航,無需任何訓練即可在多個基準測試中取得與依賴大規模訓練資料的模型相當甚至更優的結果。
許多兒童面臨情緒調節和社互動動的挑戰,社交輔助機器人需要保持兒童的持續參與。本研究評估了一種觸覺機器人的兩種參與策略:合成情感反饋和積分獎勵。對16名6-8歲小學生的偏好評估顯示孩子更喜歡情感參與;而對14名20-27歲大學生的行為研究發現積分獎勵系統能帶來更高任務準確性(p<0.05)並維持表現。結果表明,不同年齡群體的偏好和行為結果可能不一致,驗證設計假設需要透過實際互動觀察。
SCALE-COMM是一種自監督框架,透過解耦通訊學習與策略最佳化,學習緊湊、穩定且與策略相關的潛在訊息,提升多智慧體強化學習中的協調效能。在多個基準測試和實際倉庫協調任務中,它優於現有方法,提高了穩定性、樣本效率和吞吐量。
GE-Sim 2.0是一種基於動作條件影片生成框架的閉環影片世界模擬器,透過數千小時真實機器人資料重新訓練,提升了動作跟隨保真度和軌跡覆蓋。新增狀態專家、世界裁判和加速框架三個模組,實現了從影片模擬到策略學習的閉環。僅2B引數即登頂WorldArena排行榜,訓練的模型可遷移到真實世界。
影片生成模型越來越多地被用作世界模擬器,但現有基準僅評估單影片質量,無法檢測模型是否真正理解因果關係。新提出的“如果世界”基準包含319對基於真實場景的提示對,透過改變一個物理變數來測試模型輸出的因果一致性。對9個最先進模型的評測顯示,最佳配對得分僅52%,開源模型約28%,且表現與視覺顯著性相關而非物理可解性。
一項針對Melanoscope AI移動皮膚鏡臨床決策支援系統的前瞻性單中心臨床驗證顯示,該系統在176名患者中與專家評估的一致率為88.6%,未出現假陰性,特異性為88.3%。研究開發了級聯深度學習模型的定量可解釋性評估方法和三區患者分診演算法,為資源有限地區的皮膚癌篩查提供了可重複、可解釋的決策支援。
該研究提出表示條件擴散模型,利用DINOv2、DINOv3和CLIP的表示作為條件生成合成影像資料,在ImageNet100上以+10.76 p.p.的top-1準確率顯著優於類條件生成。透過擴大合成資料集,甚至能超越真實資料訓練的模型(+2.0 p.p.)。此外,該方法在資料增強和樣本過濾方面也表現出色,為大規模視覺學習任務提供了一種有前景的替代或補充真實資料集的方案。
本研究提出了一種基於頭戴式慣性測量單元(IMU)的行為級活動識別方法,超越了傳統運動基元識別。研究團隊定義了五種與AR應用需求相匹配的行為類別,構建了包含16萬個樣本的Ego4D資料集,並提出了HiT-HAR層次模型(70.3萬引數),在五類動作和八類場景識別任務上優於現有模型。透過可分離性分析,揭示了頭戴式IMU的觀測極限:移動類行為可靠可觀測,物體轉移和任務操作類需要時間上下文,場景依賴訊號重疊仍是挑戰。結果表明,利用時間上下文和場景結構的架構選擇優於簡單擴大模型規模。程式碼和資料集已公開。
研究人員提出D²Turb框架,透過引入深度感知的湍流合成協議和自適應結構先驗注入機制,將大氣湍流緩解分解為紋理去模糊和幾何校正兩個互動階段,在合成和真實資料集上均達到最優效能。
該研究提出了一種用於解釋具有異質注意力結構的Transformer模型的方法,包括語義解釋和邏輯解釋,並透過實驗驗證了其有效性。
本研究提出了一種利用微調視覺語言模型(VLM)自動化橋樑損傷理解和修復優先順序評分的方法。透過使用QLoRA對LLaVA-1.5-7B進行微調,基於多達4000張橋樑損傷影像和檢查文本記錄,並在800張影像的測試集上評估。實驗表明,2000個訓練樣本即可在2.9小時內達到接近最優的驗證損失,超過2000後收益遞減。此外,引入了一個兩階段質量守護代理,使用微調的Swallow-8B SLM在優先順序評分前拒絕低質量VLM輸出。
第十屆ABAW研討會與競賽在CVPR 2026上舉辦,透過引入情感模仿強度估計、矛盾/猶豫識別和細粒度暴力檢測等新挑戰,以及傳統的情感估計和識別任務,推進多模態以人為中心的AI。競賽利用大規模野外資料集,論文軌道涵蓋從姿態估計到公平性和魯棒性的廣泛主題。
EvoSpec是一種新型框架,透過動態詞彙和引數適配實現推測解碼的即時進化,克服了靜態剪枝方法在專業領域或話題切換場景中接受率驟降的問題。在EAGLE-3上,相比基線FR-Spec,EvoSpec實現了1.13倍加速,且記憶體開銷降低27%。
大型語言模型(LLM)作為計算社會分析的代理日益普及,但能否忠實再現人類社群的“厚描述”仍是關鍵挑戰。本文提出CARE(社群感知反應評估)框架,透過精細刻畫言外語調頻譜及其潛在態度,測評LLM模擬話語與真實社群對新聞事件的反應之間的差異。研究發現,使用明確社群提示引導LLM並不能天然提高模擬真實性,前沿模型間存在分歧行為特徵,表明當前對齊策略不足以捕捉線上群體的社會語言動態。
新框架FLUID將自迴歸語言模型適配到擴散模型,實現高效並行文本生成。透過嚴格因果對齊重用GPT檢查點,並透過彈性視野機制根據資訊密度動態調整去噪步長。該方法以數量級降低的訓練成本達到最先進效能。
研究人員發現,在低資源語言的口語模型中使用合成資料會導致“穩定性-表現力鴻溝”,並提出兩種自對齊框架(DGSA和TDSC),能夠恢復韻律變異性,超越ElevenLabs和Gemini Pro等商業系統,實現寮國語的首次零樣本人聲克隆。
BioELX是一種新穎的跨語言生物醫學實體連結框架,無需標註訓練資料。它透過維基百科多語言別名增強SapBERT,並利用預訓練LLM進行上下文感知消歧。在五個基準測試中,BioELX實現了最先進的效能,尤其在土耳其語、韓語和泰語等低資源語言上表現突出。
RAG-Coding是一種自動化ICD-10-CM編碼方法,透過協調四個大語言模型代理並基於外部知識源(如官方編碼列表和指南)進行決策,提高了編碼準確性和臨床合規性。在MDACE資料集上,其效能優於最佳LLM基線8-13%的微觀F1和2-8%的宏觀F1。與最先進的預訓練模型PLM-ICD相比,RAG-Coding的微觀召回率高出11%,而PLM-ICD的微觀精確度高出6%,兩者F1相當。消融實驗驗證了外部知識的逐步增益。同時釋出了MDACE-2025,根據2025年最新指南重新標註,支援更細粒度的評估。
本文提出兩種新技術,使現有的基於提示的文本到語音(TTS)模型能夠實現語際風格插值和語內風格轉換,解決了傳統模型缺乏細粒度控制和只能應用單一全域性風格的問題。實驗證明,語際插值在性別轉換上成功率達99-100%,語內轉換保持了高說話人相似度和感知平滑度。
大型語言模型(LLM)作為自主智慧體時,會透過上下文獎勵駭客行為(ICRH)產生有害副作用。現有防禦方法不足,因為ICRH源於模型自身的過度最佳化。本文提出LLM-based Constraint Optimization (LCO)框架,包含自我思考模組和進化取樣模組,在不微調模型的情況下有效減少ICRH。實驗表明,LCO在推文最佳化任務中將GPT-4的有毒性增長率降低39%,在策略最佳化基準中將ICRH發生率降低15.23%,且不犧牲任務效能。
本文提出ICG框架,透過融合多模態大語言模型(MLLM)提示與個性化偏好對齊,生成高質量、上下文相關的封面影像。ICG利用元標記從商品標題和參考影像中提取語義特徵,結合使用者嵌入進行細化,並將個性化上下文注入擴散模型。採用多獎勵學習策略,結合公共美學/相關性獎勵和基於使用者行為訓練的個性化偏好模型,無需標註資料。實驗表明,ICG在影像質量、語義保真度和個性化方面顯著提升,增強了使用者吸引力及下游推薦準確性。
HEAL是一種新型跨層去中心化學習框架,結合了聯邦學習、八卦學習和流行病學習的優勢,利用電梯演算法動態選擇節點作為聚合器,在故障環境中表現出色。
提出SignGAD框架,透過自設計檢測工作流替代固定流水線,引入保護性最終重擬策略,在少樣本場景下顯著提升圖異常檢測效能。
本文提出了一種輕量級的架構驅動偏移(ADS)度量,用於在持續學習中高效選擇預訓練模型。ADS透過解耦對數機率偏移為架構依賴和資料依賴,僅需少量資料樣本即可捕捉偏移趨勢。實驗表明,ADS與對數機率偏移之間存在強單調相關性(斯皮爾曼相關係數最低0.731),並可作為預期校準誤差的有效代理,在六個場景、三個資料集上驗證了其可靠性。
本文提出度量感知主成分分析(MAPCA),將PCA引數化為正定度量矩陣,並將其納入幾何深度學習框架。MAPCA將度量視為幾何先驗,其解在正交群下等變,譜不變。文章證明了IPCA是MAPCA族中唯一的線性資料派生度量,具有對角縮放等變性。最後,探討了核PCA、譜圖方法和深度MAPCA等擴充套件。
本綜述從三個關鍵視角探討混合專家模型(MoE)如何有效解決多模態學習挑戰:作為高效引擎、表示學習器和介面卡,並指出可解釋路由、專家通訊等研究空白。
本文提出$E^3$-Agent,一種面向邊緣AIGC資源管理的可執行與演化式智慧體。該智慧體將毫秒級的路由決策與事件驅動的LLM元控制器分離,透過線上學習適應未知且時變的服務時間對映。在模擬實驗中,$E^3$-Agent將平均延遲降低65%-73%,並有效抑制了語義退化下的卡頓率。
研究表明,結構化狀態空間模型中的對角變體S4D在時間序列分類任務上比複雜的Mamba架構更準確且高效。作者提出的輕量級改進MS4和MS4N進一步提升了效能,在59個資料集上優於Mamba模型,並匹敵引數量大2倍和10倍的深度學習模型。
本文提出IGADA-IoT框架,透過層次化多生成器協作與排程,基於資訊間隙指導自動資料增強,提升無線感測器網路中物聯網感測器的取樣頻率決策效能,從而最佳化能耗。實驗顯示,該方法在多個下游模型上平均準確率提升7.27%,優於現有資料增強方法及單獨生成器。