在高風險自動化決策中,預測不確定性對用户接受或拒絕預測至關重要。當前不確定性增強(UA)系統的評估方法存在不足,本文提出ECUAS_n度量族,將其表述為適當評分規則,參數n控制錯誤預測成本與不完美不確定性之間的權衡。實驗證明其優勢。
AI 新聞即時情報
即時監測
即時更新
即時追蹤可信來源,保留出處、權限和站內閱讀模式,把噪音壓成可讀情報。
即時更新
本文介紹了幾種生成高質量嵌入的方法,以提升神經網絡在Horn邏輯推理中對選擇進行排序的效率。通過三元組損失訓練,並引入三種新思路:生成更可能包含重複項的錨點、平衡正負例的難易程度、以及在訓練中週期性強調最難樣例。實驗表明這些方法能提高下游推理任務的性能。
AgentCo-op是一種新型檢索驅動合成框架,通過類型化工件傳遞組合可複用技能、工具和外部智能體,並在執行失敗時進行局部修復。在空間轉錄組學和單細胞多組學等開放世界基因組學案例中,它無需重新設計即可協調獨立開發的智能體和工具庫,在六個基準測試中四個取得最優結果,並持續降低任務成本。
一種名為OSCToM的新方法利用強化學習生成對抗樣本,測試大語言模型的心智理論,在FANToM基準上達到76%準確率,效率提升6倍。
提出COSMO-Agent框架,通過工具增強的強化學習教授LLM完成閉環CAD-CAE過程,解決工業設計仿真中的語義鴻溝問題。實驗證明小規模開源模型在可行性、效率和穩定性上超越大模型。
大型語言模型在動態真實環境中面臨概念漂移和高成本梯度適配的瓶頸。本文提出SOLAR,一種自我優化的終身自主推理器,通過參數級元學習和多級強化學習實現持續適應,無需人工標註。SOLAR維護演化知識庫平衡可塑性與穩定性,在常識、數學、醫療、編程、社會和邏輯推理任務上超越強基線,標誌着邁向終身自適應智能體的重要一步。
EvoScene-VLA是一種新的視覺-語言-動作(VLA)策略,它在動作解碼器內部維護一個持續更新的場景信念,以解決分塊機器人控制中因動作導致的場景變化問題。在31個RoboTwin任務和Galaxea R1-Lite真實機器人上,該方法顯著提升了任務成功率。
本文對一種新型線性軟套管執行器(LSSA)進行了解析和實驗力分析。建立了準靜態模型,通過實驗驗證了在125 kPa壓力下出力隨伸長從約112 N降至零,且靜態載荷會延遲並減小出力。結果表明LSSA的力生成受壓力、幾何形狀、位移、載荷和軸向剛度的耦合影響。
本研究提出一種基於漢密爾頓規則的異質多團隊協作資源分配框架,通過動態機器人分配實現團隊間利他協作。該問題被證明是NP難的,為此開發了圖神經網絡策略進行近似優化,在消防場景的仿真和實驗中驗證了其接近最優的性能和可擴展性。
本文提出一種自適應覆蓋策略,通過實時環境模型反饋調整機器人採樣行為,提升未知環境中的遍歷搜索效率。
PGDG是一種新穎的數據生成框架,能夠從單次演示中擴展出物理上合理、多樣化的恢復行為數據集,無需額外人工標註。它通過物理採樣子和數據策展器迭代優化,在雙臂操作任務中顯著優於傳統空間增強方法,並支持GR00T等基礎模型的微調。
該論文研究了微重力環境中多肢機器人的抓取動態運動,提出了參數化運動規劃框架,並通過模擬評估了步態模式、步長、速度和姿態等設計參數的影響。結果表明,擴大接觸反力空間和抑制脈衝式全身動力學可提升運動性能。
研究人員提出了一種閉環模擬到現實強化學習方法,用於控制微纖維在表面上的形狀。該方法在簡化的無摩擦模擬器中訓練策略,並在實際部署中利用實時視覺反饋校正未建模的表面相互作用。使用絲質微纖維進行測試,在24種不同初始配置下實現了平均270微米的形狀誤差,並在多種纖維直徑和長度下保持亞毫米精度,無需重新訓練或調整。
本文提出一種用於無人機蜂羣的分佈式多覆蓋算法,無需全局協調,僅依靠局部感知和通信即可確保每個關鍵資產被多台機器人冗餘覆蓋,且能應對機器人故障。該工作被ANTS 2026會議錄用。
一種基於虛擬現實(VR)的共享控制框架,用於未知環境中的無人機團隊,通過用户引導的運動基元規劃器和導納控制器實現實時避障,實驗表明可降低操作員負擔並提高導航性能。
BEiTScore是一種基於輕量級交叉編碼器的無參考圖像描述評估指標,從視覺問答模型初始化,結合對抗性LLM數據增強,在保持高效性的同時實現了最先進的性能。
AVI-HT是一種自適應視覺-IMU融合方法,通過聯合建模第一人稱視角圖像和手套上的6自由度IMU信號實現3D手部姿態追蹤。在嚴重視覺遮擋的手-物交互場景中,AVI-HT顯著提升了精度和可用性。其核心在於同步多模態訓練數據和跨傳感器深度注意力機制。在DexGloveHOI數據集上的實驗表明,AVI-HT將平均關鍵點誤差降低了16.1%,手腕對齊變體降低了24.2%。
MRecover是一種條件生成模型,通過將常規採集的T1w圖像合成為TSE圖像,並採用自迴歸切片條件化確保體積一致性,從而恢復運動偽影損壞的MR圖像。該模型在7T MRI數據上訓練(n=577),在域內測試中表現高保真度(SSIM=0.84,FSIM=0.94),並良好泛化至3T數據。在ADNI3數據集中,經質量控制後,可分析受試者增加了31.8%(593 vs 450),並提高了海馬亞區萎縮診斷組間差異的效應量。
現有視覺語言模型在超聲圖像問答中表現欠佳,因為它們無法模擬超聲技師主動聚焦病灶的認知過程,且忽略了標註的主觀性。本文提出一種框架,引入“縮放-診斷”範式和基於不確定性的獎勵機制,在GRPO框架下鼓勵模型對清晰病例增強準確預測,對模糊病例保持謹慎。在肝臟、乳腺和甲狀腺數據集上,病灶定位準確率提升39.3%。
本文提出“消融驗證”診斷原則及其具體實現——標記替換測試(TRT),用於檢驗視覺語言模型(VLM)是否真正利用連續潛在標記進行推理。實驗表明,即使標記內容被破壞或替換,VLM仍保留大部分性能提升,準確率提升並不能證明模型使用了這些標記進行推理。
UniVL提出一種統一視覺語言嵌入方法,通過將文本指令渲染到空間掩碼上,消除對獨立文本編碼器的需求,實現高效、可控的圖像生成。在UniVL-ImgGen基準上,FID從14降至11,PSNR從16升至20,推理TFLOPs減少52%,運行時間減少44%。
GenEvolve是一種自我進化的圖像生成框架,通過工具編排的視覺經驗蒸餾,將生成嘗試建模為工具編排軌跡,並比較多次軌跡以提取結構化視覺經驗,提供密集的令牌級監督,幫助智能體更好地進行搜索、知識激活、參考選擇和提示構建。實驗表明,該方法在公共基準和GenEvolve-Bench上達到了最先進性能。
PhysX-Omni是一個統一的框架,用於生成面向仿真的物理3D資產,涵蓋剛體、可變形體和鉸接物體。它提出了一種新穎的幾何表示方法,可直接編碼高分辨率3D結構,無需壓縮,從而顯著提升生成性能。此外,該框架還引入了首個通用仿真就緒3D數據集PhysXVerse,以及全面評估生成和理解能力的基準PhysX-Bench。實驗表明,PhysX-Omni在生成和理解方面均表現優異,在仿真場景生成和機器人策略學習等應用中展現出巨大潛力,有望推動具身智能和物理仿真領域的發展。
JAMtime.ai 是一款創新工具,讓音樂人用自然語言描述想要的音色,AI自動生成可編輯的DSP圖譜,並支持在瀏覽器、DAW(免費VST/AU插件)及未來物理效果器上實時運行。它由資深開發者Jeff Ward打造,完全可編輯、可分享、可派生。
智譜AI發佈GLM-5.1-highspeed高速API,速度達400 tokens/s,成為頂流模型中最快。實測顯示其代碼生成如噴射,可實時交互調參、改變遊戲世界、快速處理萬字內容。背後是推理引擎、調度系統和基礎設施的系統工程優化,推動AI Agent進入快時代。
MovieFlow Studio整合劇本解析、分鏡、生成、剪輯、資產管理和協作於一體,實現80集短劇3天完成,Token消耗降低70%,推動AI影視工業化。
Nugget AI 是一款利用AI從客户訪談中提取痛點、功能請求和情緒,自動合成主題並生成PRD的工具。它新增的MCP服務器讓Claude、ChatGPT等AI代理可以直接查詢訪談內容,基於真實用户反饋而非幻覺來生成規範。價格僅為Dovetail的一半,並提供首年66折優惠。
科技巨頭紛紛向堪培拉示好,希望在澳訓練數據模型。設立人工智能財富基金可讓全民分享利潤。
聯想集團公佈截至2026年3月31日的2025/26財年第四季度及全年業績。第四財季營收近1500億元,同比增長27.1%,創近20個季度最高增速;調整後淨利潤同比翻番。全年營收首次突破5000億元,同比增長20.3%,調整後淨利潤同比增長42.1%。三大業務集團均實現雙位數增長,AI相關業務營收全年同比增長105%。
OpenAI在2026年Gartner企業AI編碼代理魔力象限中被列為領導者,其Codex產品因其創新性和企業級部署能力而獲得認可。