AI News HubLIVE

AI 新聞即時情報

即時監測

今天 AI 世界最重要的變化

來自 105 個可信來源,最近更新 2026-06-02 12:27 UTC+8。

即時監測

即時更新

即時追蹤可信來源,保留出處、權限和站內閱讀模式,把噪音壓成可讀情報。

即時更新

重設
Mellum2 開源:適用於 AI 工作流的快速模型

JetBrains 開源了 Mellum2,一個 12B 引數的 MoE 模型,專為快速、高效的 AI 工作流設計,用於路由、問答、子代理等。由於採用 MoE 架構,每 token 僅啟用 2.5B 引數,降低了推理成本和延遲。

Hacker News AIAgent / 研究站內正文
貼上檔案編輯器

西蒙·威利森開發了一款原型工具,可將大量文本貼上自動轉換為檔案附件,支援直接開啟檔案、拖拽上傳,靈感來自Claude的貼上檢測功能。

Simon Willison's Weblog工具站內正文
RocketSmith:用於高功率火箭設計與製造的代理系統

一種名為RocketSmith的新型代理系統能夠自動化高功率火箭的設計、製造與最佳化流程,透過子代理和技能實現飛行引數的迭代最佳化。四枚火箭採用FDM印表機制造並進行了飛行測試,全部穩定發射,兩枚成功回收。飛行模擬與實際資料對比顯示遠地點預測準確率達84%。

arXiv RoboticsAgent / 研究 / 機器人站內正文
物理AI中的靜默故障:自主系統執行時動作授權的文獻綜述

本文綜述了物理AI系統中新興的安全問題——'靜默故障',即黑盒模型看似自信且語義對齊,但產生物理上無效的動作。文章提出了有界問題形式化,定義了靜默物理動作失敗,並給出了執行時護欄功能的分類法。

arXiv Robotics模型 / 政策 / 研究站內正文
預測動力學能在物理世界中存在嗎?

本文提出物理可接受性作為預測控制介面,透過在執行前評估預測動力學是否滿足運動學、動力學和直接到組合水平條件,來驗證物理可執行性。實驗表明,完整門控在Hugging Face LeRobot PushT資料集上達到0.957的AUC,並有效阻止87-89%的無效提議。

arXiv Robotics研究 / 機器人站內正文
基於圖擴散的全身逆運動學

GraphDiff-IK提出了一種結構感知的圖擴散逆運動學框架,能夠在多種機器人形態下準確、穩定地生成關節配置,並支援多解輸出。

arXiv Robotics模型 / 研究 / 機器人站內正文
平衡精度與效率:用於模型預測控制的自適應動力學編排

提出自適應動力學編排(ADO)框架,用於自動駕駛導航中的模型預測控制。ADO動態選擇最適合當前導航上下文的動力學模型,透過線上反事實推演最佳化模型選擇,從而在保持低延遲的同時接近高保真模型的精度。野外實驗驗證了其在複雜地形中的有效性。

arXiv Robotics政策 / 研究站內正文
非線性粘性流體中的線性運動對映

研究表明,在低雷諾數流體中,線性運動對映擴充套件到任何冪律粘度流體,而卡拉-安田流體的非線性特性允許透過往復運動實現淨位移,甚至可透過改變速度切換運動方向。

arXiv Robotics政策 / 研究站內正文
強化學習在機電系統引數辨識中的最優實驗設計

該論文提出一種強化學習代理,用於為機電系統的系統辨識生成最優激勵訊號,並在Quanser Aero 2測試平臺上驗證,實現了高估計精度且僅0.75%的安全違規。

arXiv RoboticsAgent / 政策 / 研究站內正文
從人類影片到機器人操作:基於人類中心資料的可擴充套件視覺-語言-動作學習綜述

本綜述系統梳理了利用人類影片資料訓練視覺-語言-動作(VLA)模型的方法,將其分為潛在動作表示、預測世界模型、顯式2D監督和顯式3D重建四類,並指出影片結構化、跨實體動作接地和評估協議設計三大挑戰,旨在降低對昂貴機器人演示資料的依賴。

arXiv Robotics模型 / 研究 / 創業融資站內正文
多樣性重於頻率:重新思考視覺思維鏈代理中的工具使用

本文研究了視覺代理在複雜推理任務中工具使用的現象,發現“工具使用崩塌”——模型隨著訓練逐漸停止使用工具但準確性卻提高。作者提出透過熵正則化鼓勵多樣化探索,獲得最佳效能,表明工具應作為訓練時的支架而非最終依賴。

arXiv Computer VisionAgent / 研究站內正文
透過顯式建模資料流形幾何的擴散影像生成

研究人員提出了MIND(資料流形感知影像擴散模型),透過將離散補丁標記化整合到連續擴散模型的得分函式中,顯式建模流形幾何。該方法在ImageNet 256×256上實現了FID 2.06(MIND-B,1.3億引數),優於LlamaGen-3B(31億引數)的FID。

arXiv Computer Vision模型 / 研究站內正文
Planktonzilla:用於理解浮游生態系統的多模態資料集與模型

研究人員釋出了Planktonzilla-17M,這是迄今最大最全面的浮游生物影像資料集,包含1740萬張影像,涵蓋13種成像系統、602個分類類別。他們發現,使用分類學譜系作為文本的監督分類器在效能上匹配或超越CLIP式訓練,而現有生物基礎模型(如BioCLIP)在浮游生物識別上表現不佳。

arXiv Computer Vision模型 / 研究站內正文
基於流的生成模型最佳化壓縮感知中的取樣策略

該研究提出了一種任務感知的流式生成框架,透過重新定義流匹配訓練正規化,學習最優的子取樣掩碼,從而在影像分類、重建和MRI加速等壓縮感知應用中顯著提升效能。在CelebA資料集上以5%取樣率達到25.17 dB的PSNR,在fastMRI上實現8倍加速重建的29.24 dB,計算開銷極小。

arXiv Computer Vision模型 / 研究站內正文
改進的視覺任務信念注意力機制

本文在Belief-Attention基礎上提出Belief2-Attention,利用正交投影中的垂直分量和投影分量,並引入額外內積矩陣增強token相關性,在影像分類和分割任務上驗證了有效性。

arXiv Computer Vision模型 / 研究站內正文
DefocusTrackerAI:一種用於自動檢測離焦粒子影像的通用框架

DefocusTrackerAI是一個基於深度學習的通用框架,可自動檢測和定位不同光學配置下的離焦粒子影像。研究比較了Faster R-CNN和YOLOv9,發現YOLOv9在召回率和不確定性方面更優,尤其在高粒子密度下表現突出。該框架適用於散光和非散光影像,並在多種光照條件下有效。已在真實DPT實驗(包括熒光和陰影圖資料)中驗證,可應用於噴霧和液滴追蹤等傳統DPT之外的任務。預訓練模型已公開,結合深度校準可用於三維離焦粒子追蹤。

arXiv Computer Vision模型 / 研究 / 創業融資站內正文
面向醫療大語言模型安全、魯棒性和公平性評估的多領域紅隊框架

本研究提出了一個多領域紅隊框架,用於評估醫療領域大語言模型在對抗性和倫理複雜場景下的表現。透過對11個當代模型在690個臨床場景的測試,發現平均得分範圍0.791-0.984,但高效能模型在安全關鍵場景中會出現完全失敗,且公平性任務中人口統計修改導致10-20%的誤差放大。研究強調,效能方差和極端失敗比平均準確率更能反映臨床可靠性,混合評估方法結合自動化與臨床醫生監督對安全評估至關重要。

arXiv Computational Linguistics模型 / Agent / 政策站內正文
ART:用於高效大語言模型解碼的注意力執行時終止技術

大語言模型在長上下文解碼時面臨記憶體頻寬瓶頸,因為需要頻繁訪問龐大的鍵值(KV)快取。現有方法多在解碼前進行基於鍵的剪枝,但忽視了注意力輸出同時依賴鍵和值。本文提出注意力執行時終止(ART),一種輕量級機制,在核心執行過程中動態跟蹤累積的注意力輸出,當後續貢獻可忽略時提前終止KV塊訪問。ART與現有基於鍵的方法正交,可無縫整合。在LongBench基準測試中,大批次下生成吞吐量提升20%,且精度相當。

arXiv Computational Linguistics模型 / 研究站內正文
TrustLDM:語言擴散模型可信度基準測試

一項名為TrustLDM的新基準測試,全面評估語言擴散模型在安全性、隱私和公平性方面的可信度。研究發現,雖然模型在僅使用者提示下表現良好,但附加上下文中的惡意內容會顯著降低其對齊行為。此外,較長的上下文不一定產生更強的影響,解碼順序和生成長度也會影響評估結果。研究還提出了自動評估框架TrustLDM-Auto,系統性地識別脆弱配置。

arXiv Computational Linguistics模型 / 政策 / 研究站內正文
基於強化學習和效率感知獎勵的中文文本修正鏈式推理方法

提出CSRP三階段框架,透過持續預訓練、鏈式推理監督微調和基於效率感知獎勵的組相對策略最佳化,有效緩解中文語法糾錯中的過度糾正問題。在NACGEC基準上取得SOTA效能,F0.5達50.99,精確率57.17;在CSCD拼寫糾正任務中F1達59.61,超過GPT-4 5.20個百分點。

arXiv Computational Linguistics模型 / 政策 / 研究站內正文
AEyeDE:一種基於注意力的AI生成文本檢測歸因框架

隨著語言模型生成文本的流暢度接近人類水平,傳統的基於表面統計或似然訊號的檢測方法已難以應對。AEyeDE提出了一種基於注意力歸因的新方法,透過代理Transformer模型提取人類和AI生成文本的注意力矩陣,並使用輕量級卷積神經網路進行區分。實驗表明,該方法在多種設定下均表現出色,並具有可解釋性和魯棒性。

arXiv Computational Linguistics模型 / 研究站內正文