AI News HubLIVE

AI 新聞即時情報

即時監測

今日 AI 世界最重要的變化

來自 105 個可信來源,最近更新 2026-06-02 12:32 UTC+8。

即時監測

即時更新

即時追蹤可信來源,保留出處、權限和站內閱讀模式,把噪音壓成可讀情報。

即時更新

重設
ShadowProtect:AI 代理的 Wireshark

ShadowProtect 是一款專為 AI 代理設計的網絡分析工具,類似於 Wireshark 對傳統網絡的作用,幫助開發者監控、調試和優化代理行為。

Hacker News AIAgent站內正文
Mellum2 開源:適用於 AI 工作流的快速模型

JetBrains 開源了 Mellum2,一個 12B 參數的 MoE 模型,專為快速、高效的 AI 工作流設計,用於路由、問答、子代理等。由於採用 MoE 架構,每 token 僅激活 2.5B 參數,降低了推理成本和延遲。

Hacker News AIAgent / 研究站內正文
粘貼文件編輯器

西蒙·威利森開發了一款原型工具,可將大量文本粘貼自動轉換為文件附件,支持直接打開文件、拖拽上傳,靈感來自Claude的粘貼檢測功能。

Simon Willison's Weblog工具站內正文
RocketSmith:用於高功率火箭設計與製造的代理系統

一種名為RocketSmith的新型代理系統能夠自動化高功率火箭的設計、製造與優化流程,通過子代理和技能實現飛行參數的迭代優化。四枚火箭採用FDM打印機制造並進行了飛行測試,全部穩定發射,兩枚成功回收。飛行仿真與實際數據對比顯示遠地點預測準確率達84%。

arXiv RoboticsAgent / 研究 / 機械人站內正文
物理AI中的靜默故障:自主系統運行時動作授權的文獻綜述

本文綜述了物理AI系統中新興的安全問題——'靜默故障',即黑盒模型看似自信且語義對齊,但產生物理上無效的動作。文章提出了有界問題形式化,定義了靜默物理動作失敗,並給出了運行時護欄功能的分類法。

arXiv Robotics模型 / 政策 / 研究站內正文
預測動力學能在物理世界中存在嗎?

本文提出物理可接受性作為預測控制接口,通過在執行前評估預測動力學是否滿足運動學、動力學和直接到組合水平條件,來驗證物理可執行性。實驗表明,完整門控在Hugging Face LeRobot PushT數據集上達到0.957的AUC,並有效阻止87-89%的無效提議。

arXiv Robotics研究 / 機械人站內正文
基於圖擴散的全身逆運動學

GraphDiff-IK提出了一種結構感知的圖擴散逆運動學框架,能夠在多種機器人形態下準確、穩定地生成關節配置,並支持多解輸出。

arXiv Robotics模型 / 研究 / 機械人站內正文
平衡精度與效率:用於模型預測控制的自適應動力學編排

提出自適應動力學編排(ADO)框架,用於自動駕駛導航中的模型預測控制。ADO動態選擇最適合當前導航上下文的動力學模型,通過在線反事實推演優化模型選擇,從而在保持低延遲的同時接近高保真模型的精度。野外實驗驗證了其在複雜地形中的有效性。

arXiv Robotics政策 / 研究站內正文
非線性粘性流體中的線性運動映射

研究表明,在低雷諾數流體中,線性運動映射擴展到任何冪律粘度流體,而卡拉-安田流體的非線性特性允許通過往復運動實現淨位移,甚至可通過改變速度切換運動方向。

arXiv Robotics政策 / 研究站內正文
強化學習在機電系統參數辨識中的最優實驗設計

該論文提出一種強化學習代理,用於為機電系統的系統辨識生成最優激勵信號,並在Quanser Aero 2測試平台上驗證,實現了高估計精度且僅0.75%的安全違規。

arXiv RoboticsAgent / 政策 / 研究站內正文
從人類視頻到機器人操作:基於人類中心數據的可擴展視覺-語言-動作學習綜述

本綜述系統梳理了利用人類視頻數據訓練視覺-語言-動作(VLA)模型的方法,將其分為潛在動作表示、預測世界模型、顯式2D監督和顯式3D重建四類,並指出視頻結構化、跨實體動作接地和評估協議設計三大挑戰,旨在降低對昂貴機器人演示數據的依賴。

arXiv Robotics模型 / 研究 / 創業融資站內正文
多樣性重於頻率:重新思考視覺思維鏈代理中的工具使用

本文研究了視覺代理在複雜推理任務中工具使用的現象,發現“工具使用崩塌”——模型隨着訓練逐漸停止使用工具但準確性卻提高。作者提出通過熵正則化鼓勵多樣化探索,獲得最佳性能,表明工具應作為訓練時的支架而非最終依賴。

arXiv Computer VisionAgent / 研究站內正文
通過顯式建模數據流形幾何的擴散圖像生成

研究人員提出了MIND(數據流形感知圖像擴散模型),通過將離散補丁標記化集成到連續擴散模型的得分函數中,顯式建模流形幾何。該方法在ImageNet 256×256上實現了FID 2.06(MIND-B,1.3億參數),優於LlamaGen-3B(31億參數)的FID。

arXiv Computer Vision模型 / 研究站內正文
Planktonzilla:用於理解浮游生態系統的多模態數據集與模型

研究人員發佈了Planktonzilla-17M,這是迄今最大最全面的浮游生物圖像數據集,包含1740萬張圖像,涵蓋13種成像系統、602個分類類別。他們發現,使用分類學譜系作為文本的監督分類器在性能上匹配或超越CLIP式訓練,而現有生物基礎模型(如BioCLIP)在浮游生物識別上表現不佳。

arXiv Computer Vision模型 / 研究站內正文
基於流的生成模型優化壓縮感知中的採樣策略

該研究提出了一種任務感知的流式生成框架,通過重新定義流匹配訓練範式,學習最優的子採樣掩碼,從而在圖像分類、重建和MRI加速等壓縮感知應用中顯著提升性能。在CelebA數據集上以5%採樣率達到25.17 dB的PSNR,在fastMRI上實現8倍加速重建的29.24 dB,計算開銷極小。

arXiv Computer Vision模型 / 研究站內正文
改進的視覺任務信念注意力機制

本文在Belief-Attention基礎上提出Belief2-Attention,利用正交投影中的垂直分量和投影分量,並引入額外內積矩陣增強token相關性,在圖像分類和分割任務上驗證了有效性。

arXiv Computer Vision模型 / 研究站內正文
DefocusTrackerAI:一種用於自動檢測離焦粒子圖像的通用框架

DefocusTrackerAI是一個基於深度學習的通用框架,可自動檢測和定位不同光學配置下的離焦粒子圖像。研究比較了Faster R-CNN和YOLOv9,發現YOLOv9在召回率和不確定性方面更優,尤其在高粒子密度下表現突出。該框架適用於散光和非散光圖像,並在多種光照條件下有效。已在真實DPT實驗(包括熒光和陰影圖數據)中驗證,可應用於噴霧和液滴追蹤等傳統DPT之外的任務。預訓練模型已公開,結合深度校準可用於三維離焦粒子追蹤。

arXiv Computer Vision模型 / 研究 / 創業融資站內正文
面向醫療大語言模型安全、魯棒性和公平性評估的多領域紅隊框架

本研究提出了一個多領域紅隊框架,用於評估醫療領域大語言模型在對抗性和倫理複雜場景下的表現。通過對11個當代模型在690個臨牀場景的測試,發現平均得分範圍0.791-0.984,但高性能模型在安全關鍵場景中會出現完全失敗,且公平性任務中人口統計修改導致10-20%的誤差放大。研究強調,性能方差和極端失敗比平均準確率更能反映臨牀可靠性,混合評估方法結合自動化與臨牀醫生監督對安全評估至關重要。

arXiv Computational Linguistics模型 / Agent / 政策站內正文
ART:用於高效大語言模型解碼的注意力運行時終止技術

大語言模型在長上下文解碼時面臨內存帶寬瓶頸,因為需要頻繁訪問龐大的鍵值(KV)緩存。現有方法多在解碼前進行基於鍵的剪枝,但忽視了注意力輸出同時依賴鍵和值。本文提出注意力運行時終止(ART),一種輕量級機制,在內核執行過程中動態跟蹤累積的注意力輸出,當後續貢獻可忽略時提前終止KV塊訪問。ART與現有基於鍵的方法正交,可無縫集成。在LongBench基準測試中,大批量下生成吞吐量提升20%,且精度相當。

arXiv Computational Linguistics模型 / 研究站內正文
TrustLDM:語言擴散模型可信度基準測試

一項名為TrustLDM的新基準測試,全面評估語言擴散模型在安全性、隱私和公平性方面的可信度。研究發現,雖然模型在僅用户提示下表現良好,但附加上下文中的惡意內容會顯著降低其對齊行為。此外,較長的上下文不一定產生更強的影響,解碼順序和生成長度也會影響評估結果。研究還提出了自動評估框架TrustLDM-Auto,系統性地識別脆弱配置。

arXiv Computational Linguistics模型 / 政策 / 研究站內正文
基於強化學習和效率感知獎勵的中文文本修正鏈式推理方法

提出CSRP三階段框架,通過持續預訓練、鏈式推理監督微調和基於效率感知獎勵的組相對策略優化,有效緩解中文語法糾錯中的過度糾正問題。在NACGEC基準上取得SOTA性能,F0.5達50.99,精確率57.17;在CSCD拼寫糾正任務中F1達59.61,超過GPT-4 5.20個百分點。

arXiv Computational Linguistics模型 / 政策 / 研究站內正文