LV-Calib是一種利用可列印平面靶標進行雷射雷達與相機外參標定及雷射雷達邊界響應校準的框架。該框架透過視覺標記和圓形反射率邊界提供特徵點,並採用迭代最佳化方法處理由有限波束足跡和混合強度返回引起的過渡帶失真,實現了亞畫素重投影精度和毫米級雷射雷達特徵一致性。實驗表明該方法能顯著提升里程計效能。程式碼和資料將開源。
AI 新聞即時情報
即時監測
即時更新
即時追蹤可信來源,保留出處、權限和站內閱讀模式,把噪音壓成可讀情報。
即時更新
ViTaL框架利用雙層最佳化結合視覺和觸覺資訊,在推理時引導生成式機器人策略,顯著提高接觸密集型操作任務的成功率。
一項新研究發現,操作員在接觸密集型人機互動中透過增加生理努力(特別是自主神經工作負荷)來抑制熱不適,從而維持任務表現。研究結果推動了生理感知控制架構的發展。
本文提出DynaHMRC,一種去中心化框架,將每個機器人作為角色感知的大語言模型代理,透過四階段閉環流程(自我描述、任務分配與領導權競標、領導者選舉、反思執行)實現異構多機器人團隊的動態任務協作。該框架解決了集中式LLM排程器可擴充套件性差、對動態任務適應不足以及領域資料稀缺等問題。實驗表明,DynaHMRC在成功率和效率上優於強基線方法,並展現出良好的可擴充套件性。
VANDERER是一種新穎的移動代理探索框架,僅使用單目攝像頭資料,透過視覺好奇心模組引導預訓練的擴散策略,無需傳統佔用地圖。在模擬環境中,它平均比NoMaD多探索13.4%的區域,並發現視覺與幾何好奇心在室外環境中的直接相關性。
TacStyle提出了一種新方法,透過結構化潛在表示來學習使用者偏好,並利用基礎模型解釋該空間以選擇所需行為,從而實現對機器人行為的精細控制,減少對大量偏好標籤的依賴。實驗表明,該方法在模擬和真實環境中均能更精確地適應使用者偏好。
研究人員提出了一種流水線,利用合成資料訓練基於Transformer的模型,用於無人機安全著陸區域檢測,彌合了模擬與現實的差距,並消除了手動標註的需求。
一種名為Steady-Forcing的新框架,透過結合視覺錨點、運動記憶、時間編碼等技術,在固定攝像頭的長時序自然影片生成中,有效平衡了場景穩定性與自然流體運動的連續性,顯著提升了背景一致性和成像質量。
本文提出邊界平衡回放網路(BBR-Net),透過邊界感知優先順序和類別平衡選擇回放樣本,保留解剖結構資訊。在CAMUS和CardiacNet資料集上評估,前向任務中效能接近聯合訓練,減少災難性遺忘;反向任務中發現當初始表示來自噪聲資料時結構感知回放失效。結構擾動分析表明回放效果依賴於儲存結構的可靠性。
視覺語言模型在機器人等關鍵領域廣泛應用,但輸出來自不確定性量化至關重要。FUSE 提出一種機率框架,融合來自資料模糊性的偶然嵌入級不確定性和來自模型響應多樣性的認知模型級不確定性,透過貝葉斯機制生成標量不確定性度量,可可靠預測輸出正確性,實現最先進的不確定性校準。
本文提出卷積和自注意力可以透過k近鄰聚合框架統一,並介紹ConvNN,一個能夠精確恢復標準卷積和自注意力的統一框架,支援探索區域性與全域性聚合之間的連續頻譜。
本研究利用AI和計算機視覺技術提升海上安全,透過比較六種深度學習架構(包括CNN、遷移學習模型和Vision Transformer)在6468張影像上的表現,發現Vision Transformer在準確率、錯誤率和處理速度上均達到最優,展示了AI在海上監視、邊境保護和自主導航中的潛力。
RAMS是一種輕量級執行時控制器,用於嵌入式邊緣裝置的目標檢測,透過監控資源壓力並根據檢測結果動態選擇YOLOv8模型(NANO/SMALL/MEDIUM),在保持精度的同時大幅降低延遲。實驗表明,在Jetson Orin上,安全策略2實現了3.41毫秒的平均延遲,比固定MEDIUM模型快5.6倍,並保留了74%的代理精度。檢測條件切換在重負載下使SWAS提升高達47.3%。
ReportQA是一種新型放射學報告評估框架,透過構建知識樹和生成問答對,利用大語言模型作為裁判計算QAScore,解決了傳統指標臨床相關性不足和覆蓋實體有限的問題。實驗表明QAScore與放射科醫生判斷更一致,並揭示了基於報告推理正規化的侷限性。
該研究評估了LSTM、TCN和Transformer等深度學習模型在WESAD資料集上利用手腕和胸部感測器訊號進行多模態情感識別的效果。消融實驗表明,Transformer在多模態設定下準確率最高,TCN在僅手腕資料下表現最佳。整合方法結合三種架構的預測,達到了98.91%的準確率和98.56%的宏F1分數。
該研究在固定推理預算下重新評估網路代理的線上增強模組,發現與使用相同預算進行更多步數的基線模型相比,AWM、ASI和ReasoningBank等模組並未帶來顯著優勢,其表面增益往往消失。研究強調執行間方差應作為核心評估指標。
Nemotron 3 Ultra是NVIDIA釋出的一款550億總引數、55億活躍引數的混合專家語言模型,融合了Mamba和Transformer架構。在20萬億token上預訓練,支援100萬token上下文,推理吞吐量比現有開源LLM高6倍,精度相當。模型開源,適用於長時自主智慧體任務。
提出CoRA框架,基於GRPO強化學習對齊模型置信度與生成理由,減少誤導性高置信度答案。在MedQA等資料集上,對齊誤差降低26.51%,準確率保持且校準改善。
因果Transformer在自迴歸分解下能高效處理從左到右的序列,但難以處理任意條件(如同時依賴過去和未來標記的文本塊)。新提出的AC-GPT透過簡單修改標準因果Transformer,在單次前向傳播中實現對任意條件(包括過去、未來和混合上下文)的評估與取樣,同時保持從左到右的順序和下一個標記預測目標,相容現有LLM微調。實驗表明該方法在建模任意條件上優於基線,且不降低標準從左到右效能。
研究人員提出了一種名為'Telegraph English'的可讀符號格式,用於多跳問答中的上下文壓縮。它以更少的令牌成本將檢索到的段落重寫為結構化的實體-關係語句,從而保留推理證據。在MuSiQue、TwoWiki和HotpotQA上的對照實驗中,它在每個資料集上都優於三種匹配預算的壓縮基線(字元級刪除、截斷和隨機子取樣),F1分數提高了13到20個百分點。在最難的資料集上,它還優於同一編碼器生成的連貫散文摘要。預先註冊的深度互動假設未得到支援:優勢並未隨資料集內推理深度的增加而增加。這些結果表明,在匹配的令牌預算下,可讀符號重新表達比自然語言或連貫摘要更能密集地保留實體內容。
本文首次系統研究證明自動形式化模型在Lean 4中的魯棒性。提出了全域性擾動(改寫風格)和區域性擾動(修改值、符號或步驟)來測試模型的忠信度,發現所有七個評估模型均對全域性擾動敏感,且多數無法忠實反映區域性擾動。
PhoneHarness是一個混合操作基準和執行框架,用於研究可驗證手機工作流程中的手機使用代理。它整合GUI、CLI和主機端工具操作,實現75.0%的透過率,比非PhoneHarness設定高出12.9個百分點,強調操作表面路由和可驗證執行的重要性。
本文提出CILN框架,透過受控輸入汙染生成例項相關噪聲(IDN),使模糊性來源顯式可控。在CIFAR-10、MNIST和Adult上構建了90個基準設定,證明了噪聲結構(而非僅噪聲率)對基準難度和演算法行為的重要影響,並揭示了流行噪聲標籤學習方法(如Co-Teaching和DivideMix)的失敗模式。
本研究利用考試期間收集的生理資料,應用機器學習模型預測考試成績,分析了皮膚電活動、心率和皮膚溫度等壓力指標。實驗比較了多種模型,發現深度學習擅長捕捉複雜關係,但隨機森林等簡單模型在效率和可解釋性上更優。
該研究比較了19種圖神經網路層在自動駕駛軌跡預測中的表現,發現ARMA、Chebyshev和拓撲感知層效果最佳,並提出了設計原則:基於和的聚合優於基於均值、多頭注意力機制增強互動、不同跳距分配不同權重可提高預測精度。
該研究將自主實驗模式重構為基於LangGraph的有狀態ReAct智慧體,透過持久化狀態避免每次迭代重建上下文,在超引數調優和程式碼最佳化任務中分別減少90%和52%的令牌消耗,同時保持最佳化質量。
本文形式化地將嵌入模型路由建模為具有低秩專家的對抗性上下文線性賭博機,提出一種對數二次策略類以實現高效線上學習,並介紹了Hypentropy策略梯度(HPG)演算法,該演算法在避免維度災難的同時實現次線性遺憾。
GRASP是一種新的多源遷移學習方法,透過順序處理、引數梯度對齊和迭代微調,在保持O(1)記憶體消耗的同時實現了優於整合的準確性,適用於資源受限和動態源域場景。
該研究提出α-FISP框架,透過約束最佳化平衡精算公平與團結公平,引入引數α在兩者間連續調節,同時確保償付能力。數值實驗表明該框架計算可行且符合美國各州異質監管要求。
本文提出GRAPE框架,透過漸進式引數空間暴露和基於對抗頻譜利用率的引導機制,在固定計算預算下提升緊湊型神經網路的對抗魯棒性,在CIFAR-10上實現PGD-20魯棒準確率從51.70%提升至56.94%,引數減少21.4%。