ShadowProtect 是一款專為 AI 代理設計的網絡分析工具,類似於 Wireshark 對傳統網絡的作用,幫助開發者監控、調試和優化代理行為。
AI 新聞即時情報
即時監測
即時更新
即時追蹤可信來源,保留出處、權限和站內閱讀模式,把噪音壓成可讀情報。
即時更新
JetBrains 開源了 Mellum2,一個 12B 參數的 MoE 模型,專為快速、高效的 AI 工作流設計,用於路由、問答、子代理等。由於採用 MoE 架構,每 token 僅激活 2.5B 參數,降低了推理成本和延遲。
西蒙·威利森開發了一款原型工具,可將大量文本粘貼自動轉換為文件附件,支持直接打開文件、拖拽上傳,靈感來自Claude的粘貼檢測功能。
一種名為RocketSmith的新型代理系統能夠自動化高功率火箭的設計、製造與優化流程,通過子代理和技能實現飛行參數的迭代優化。四枚火箭採用FDM打印機制造並進行了飛行測試,全部穩定發射,兩枚成功回收。飛行仿真與實際數據對比顯示遠地點預測準確率達84%。
本文綜述了物理AI系統中新興的安全問題——'靜默故障',即黑盒模型看似自信且語義對齊,但產生物理上無效的動作。文章提出了有界問題形式化,定義了靜默物理動作失敗,並給出了運行時護欄功能的分類法。
本文提出物理可接受性作為預測控制接口,通過在執行前評估預測動力學是否滿足運動學、動力學和直接到組合水平條件,來驗證物理可執行性。實驗表明,完整門控在Hugging Face LeRobot PushT數據集上達到0.957的AUC,並有效阻止87-89%的無效提議。
GraphDiff-IK提出了一種結構感知的圖擴散逆運動學框架,能夠在多種機器人形態下準確、穩定地生成關節配置,並支持多解輸出。
提出自適應動力學編排(ADO)框架,用於自動駕駛導航中的模型預測控制。ADO動態選擇最適合當前導航上下文的動力學模型,通過在線反事實推演優化模型選擇,從而在保持低延遲的同時接近高保真模型的精度。野外實驗驗證了其在複雜地形中的有效性。
本文提出Invascal,一種架構無關的不確定性感知適配器頭,通過偏好頭和強度頭分解預測,並利用逆空窗自校準目標實現可靠的不確定性估計,在保持分割精度的同時顯著改善校準效果,計算開銷極低。
研究表明,在低雷諾數流體中,線性運動映射擴展到任何冪律粘度流體,而卡拉-安田流體的非線性特性允許通過往復運動實現淨位移,甚至可通過改變速度切換運動方向。
該論文提出一種強化學習代理,用於為機電系統的系統辨識生成最優激勵信號,並在Quanser Aero 2測試平台上驗證,實現了高估計精度且僅0.75%的安全違規。
本綜述系統梳理了利用人類視頻數據訓練視覺-語言-動作(VLA)模型的方法,將其分為潛在動作表示、預測世界模型、顯式2D監督和顯式3D重建四類,並指出視頻結構化、跨實體動作接地和評估協議設計三大挑戰,旨在降低對昂貴機器人演示數據的依賴。
VLAMotor是一種新型框架,用於增強視覺-語言-動作(VLA)模型。它通過距離感知測試暴露失敗模式,並利用智能體合成數據微調模型。在模擬和真實機器人操作任務中,VLAMotor顯著提高了失敗檢測率和任務成功率。
提出一種分割引導的空間索引方法,通過語義選擇面部區域補丁(而非整體特徵)進行深度偽造檢測,在Celeb-DF v2上達到0.905 AUC,優於現有方法,且無需微調或目標域數據。
本文研究了視覺代理在複雜推理任務中工具使用的現象,發現“工具使用崩塌”——模型隨着訓練逐漸停止使用工具但準確性卻提高。作者提出通過熵正則化鼓勵多樣化探索,獲得最佳性能,表明工具應作為訓練時的支架而非最終依賴。
一種名為HSGM的新型零樣本框架通過將3D信息轉換為與VLM兼容的分層地圖,彌合了視覺語言導航中的語義幾何鴻溝,在R2R-CE和RxR-CE基準測試上取得了最先進的性能。
研究人員提出了MIND(數據流形感知圖像擴散模型),通過將離散補丁標記化集成到連續擴散模型的得分函數中,顯式建模流形幾何。該方法在ImageNet 256×256上實現了FID 2.06(MIND-B,1.3億參數),優於LlamaGen-3B(31億參數)的FID。
研究人員提出將細胞層(cellular sheaves)應用於弱監督全切片圖像分類,通過注意力條件一致性對齊細胞層不一致場與臨牀診斷區域,大幅提升定位精度並增強模型可解釋性。
研究提出EviOSAHS框架,通過將面部圖像分解為7個解剖學查詢,結合臨牀數據,實現阻塞性睡眠呼吸暫停低通氣綜合徵的高靈敏度篩查。在642名受試者中,準確率88.47%,敏感性94.86%,F1分數93.74%,假陰性率5.14%。
研究人員發佈了Planktonzilla-17M,這是迄今最大最全面的浮游生物圖像數據集,包含1740萬張圖像,涵蓋13種成像系統、602個分類類別。他們發現,使用分類學譜系作為文本的監督分類器在性能上匹配或超越CLIP式訓練,而現有生物基礎模型(如BioCLIP)在浮游生物識別上表現不佳。
該研究提出了一種任務感知的流式生成框架,通過重新定義流匹配訓練範式,學習最優的子採樣掩碼,從而在圖像分類、重建和MRI加速等壓縮感知應用中顯著提升性能。在CelebA數據集上以5%採樣率達到25.17 dB的PSNR,在fastMRI上實現8倍加速重建的29.24 dB,計算開銷極小。
本文在Belief-Attention基礎上提出Belief2-Attention,利用正交投影中的垂直分量和投影分量,並引入額外內積矩陣增強token相關性,在圖像分類和分割任務上驗證了有效性。
DefocusTrackerAI是一個基於深度學習的通用框架,可自動檢測和定位不同光學配置下的離焦粒子圖像。研究比較了Faster R-CNN和YOLOv9,發現YOLOv9在召回率和不確定性方面更優,尤其在高粒子密度下表現突出。該框架適用於散光和非散光圖像,並在多種光照條件下有效。已在真實DPT實驗(包括熒光和陰影圖數據)中驗證,可應用於噴霧和液滴追蹤等傳統DPT之外的任務。預訓練模型已公開,結合深度校準可用於三維離焦粒子追蹤。
本研究提出了一個多領域紅隊框架,用於評估醫療領域大語言模型在對抗性和倫理複雜場景下的表現。通過對11個當代模型在690個臨牀場景的測試,發現平均得分範圍0.791-0.984,但高性能模型在安全關鍵場景中會出現完全失敗,且公平性任務中人口統計修改導致10-20%的誤差放大。研究強調,性能方差和極端失敗比平均準確率更能反映臨牀可靠性,混合評估方法結合自動化與臨牀醫生監督對安全評估至關重要。
一項新研究結合認知語言特徵和DistilBERT嵌入,使用全息約簡表示(HRR)檢測在線文本中的抑鬱症,在Reddit帖子數據集上實現了0.94的宏F1分數,顯著優於傳統TF-IDF基線的0.80。
大語言模型在長上下文解碼時面臨內存帶寬瓶頸,因為需要頻繁訪問龐大的鍵值(KV)緩存。現有方法多在解碼前進行基於鍵的剪枝,但忽視了注意力輸出同時依賴鍵和值。本文提出注意力運行時終止(ART),一種輕量級機制,在內核執行過程中動態跟蹤累積的注意力輸出,當後續貢獻可忽略時提前終止KV塊訪問。ART與現有基於鍵的方法正交,可無縫集成。在LongBench基準測試中,大批量下生成吞吐量提升20%,且精度相當。
一項名為TrustLDM的新基準測試,全面評估語言擴散模型在安全性、隱私和公平性方面的可信度。研究發現,雖然模型在僅用户提示下表現良好,但附加上下文中的惡意內容會顯著降低其對齊行為。此外,較長的上下文不一定產生更強的影響,解碼順序和生成長度也會影響評估結果。研究還提出了自動評估框架TrustLDM-Auto,系統性地識別脆弱配置。
該系統採用“先生成再擇優”策略,通過偏好模型(從人工對比中學習)來篩選幽默候選,在SemEval-2026幽默生成任務中取得英語和中文第一名、西班牙語第二名的成績。
提出SENSE方法,通過基於目標模型隱藏狀態的語義檢索和軟門控評估,提升檢索式推測解碼的魯棒性和效率,在LLaMA和Qwen上實現高達4.09的平均接受長度和3.26倍加速。
提出CSRP三階段框架,通過持續預訓練、鏈式推理監督微調和基於效率感知獎勵的組相對策略優化,有效緩解中文語法糾錯中的過度糾正問題。在NACGEC基準上取得SOTA性能,F0.5達50.99,精確率57.17;在CSCD拼寫糾正任務中F1達59.61,超過GPT-4 5.20個百分點。