JetBrains 開源了 Mellum2,一個 12B 引數的 MoE 模型,專為快速、高效的 AI 工作流設計,用於路由、問答、子代理等。由於採用 MoE 架構,每 token 僅啟用 2.5B 引數,降低了推理成本和延遲。
AI 新聞即時情報
即時監測
即時更新
即時追蹤可信來源,保留出處、權限和站內閱讀模式,把噪音壓成可讀情報。
即時更新
西蒙·威利森開發了一款原型工具,可將大量文本貼上自動轉換為檔案附件,支援直接開啟檔案、拖拽上傳,靈感來自Claude的貼上檢測功能。
一種名為RocketSmith的新型代理系統能夠自動化高功率火箭的設計、製造與最佳化流程,透過子代理和技能實現飛行引數的迭代最佳化。四枚火箭採用FDM印表機制造並進行了飛行測試,全部穩定發射,兩枚成功回收。飛行模擬與實際資料對比顯示遠地點預測準確率達84%。
本文綜述了物理AI系統中新興的安全問題——'靜默故障',即黑盒模型看似自信且語義對齊,但產生物理上無效的動作。文章提出了有界問題形式化,定義了靜默物理動作失敗,並給出了執行時護欄功能的分類法。
本文提出物理可接受性作為預測控制介面,透過在執行前評估預測動力學是否滿足運動學、動力學和直接到組合水平條件,來驗證物理可執行性。實驗表明,完整門控在Hugging Face LeRobot PushT資料集上達到0.957的AUC,並有效阻止87-89%的無效提議。
GraphDiff-IK提出了一種結構感知的圖擴散逆運動學框架,能夠在多種機器人形態下準確、穩定地生成關節配置,並支援多解輸出。
提出自適應動力學編排(ADO)框架,用於自動駕駛導航中的模型預測控制。ADO動態選擇最適合當前導航上下文的動力學模型,透過線上反事實推演最佳化模型選擇,從而在保持低延遲的同時接近高保真模型的精度。野外實驗驗證了其在複雜地形中的有效性。
本文提出Invascal,一種架構無關的不確定性感知介面卡頭,透過偏好頭和強度頭分解預測,並利用逆空窗自校準目標實現可靠的不確定性估計,在保持分割精度的同時顯著改善校準效果,計算開銷極低。
研究表明,在低雷諾數流體中,線性運動對映擴充套件到任何冪律粘度流體,而卡拉-安田流體的非線性特性允許透過往復運動實現淨位移,甚至可透過改變速度切換運動方向。
該論文提出一種強化學習代理,用於為機電系統的系統辨識生成最優激勵訊號,並在Quanser Aero 2測試平臺上驗證,實現了高估計精度且僅0.75%的安全違規。
本綜述系統梳理了利用人類影片資料訓練視覺-語言-動作(VLA)模型的方法,將其分為潛在動作表示、預測世界模型、顯式2D監督和顯式3D重建四類,並指出影片結構化、跨實體動作接地和評估協議設計三大挑戰,旨在降低對昂貴機器人演示資料的依賴。
VLAMotor是一種新型框架,用於增強視覺-語言-動作(VLA)模型。它透過距離感知測試暴露失敗模式,並利用智慧體合成資料微調模型。在模擬和真實機器人操作任務中,VLAMotor顯著提高了失敗檢測率和任務成功率。
提出一種分割引導的空間索引方法,透過語義選擇面部區域補丁(而非整體特徵)進行深度偽造檢測,在Celeb-DF v2上達到0.905 AUC,優於現有方法,且無需微調或目標域資料。
本文研究了視覺代理在複雜推理任務中工具使用的現象,發現“工具使用崩塌”——模型隨著訓練逐漸停止使用工具但準確性卻提高。作者提出透過熵正則化鼓勵多樣化探索,獲得最佳效能,表明工具應作為訓練時的支架而非最終依賴。
一種名為HSGM的新型零樣本框架透過將3D資訊轉換為與VLM相容的分層地圖,彌合了視覺語言導航中的語義幾何鴻溝,在R2R-CE和RxR-CE基準測試上取得了最先進的效能。
研究人員提出了MIND(資料流形感知影像擴散模型),透過將離散補丁標記化整合到連續擴散模型的得分函式中,顯式建模流形幾何。該方法在ImageNet 256×256上實現了FID 2.06(MIND-B,1.3億引數),優於LlamaGen-3B(31億引數)的FID。
研究人員提出將細胞層(cellular sheaves)應用於弱監督全切片影像分類,透過注意力條件一致性對齊細胞層不一致場與臨床診斷區域,大幅提升定位精度並增強模型可解釋性。
研究提出EviOSAHS框架,透過將面部影像分解為7個解剖學查詢,結合臨床資料,實現阻塞性睡眠呼吸暫停低通氣綜合徵的高靈敏度篩查。在642名受試者中,準確率88.47%,敏感性94.86%,F1分數93.74%,假陰性率5.14%。
研究人員釋出了Planktonzilla-17M,這是迄今最大最全面的浮游生物影像資料集,包含1740萬張影像,涵蓋13種成像系統、602個分類類別。他們發現,使用分類學譜系作為文本的監督分類器在效能上匹配或超越CLIP式訓練,而現有生物基礎模型(如BioCLIP)在浮游生物識別上表現不佳。
該研究提出了一種任務感知的流式生成框架,透過重新定義流匹配訓練正規化,學習最優的子取樣掩碼,從而在影像分類、重建和MRI加速等壓縮感知應用中顯著提升效能。在CelebA資料集上以5%取樣率達到25.17 dB的PSNR,在fastMRI上實現8倍加速重建的29.24 dB,計算開銷極小。
本文在Belief-Attention基礎上提出Belief2-Attention,利用正交投影中的垂直分量和投影分量,並引入額外內積矩陣增強token相關性,在影像分類和分割任務上驗證了有效性。
DefocusTrackerAI是一個基於深度學習的通用框架,可自動檢測和定位不同光學配置下的離焦粒子影像。研究比較了Faster R-CNN和YOLOv9,發現YOLOv9在召回率和不確定性方面更優,尤其在高粒子密度下表現突出。該框架適用於散光和非散光影像,並在多種光照條件下有效。已在真實DPT實驗(包括熒光和陰影圖資料)中驗證,可應用於噴霧和液滴追蹤等傳統DPT之外的任務。預訓練模型已公開,結合深度校準可用於三維離焦粒子追蹤。
本研究提出了一個多領域紅隊框架,用於評估醫療領域大語言模型在對抗性和倫理複雜場景下的表現。透過對11個當代模型在690個臨床場景的測試,發現平均得分範圍0.791-0.984,但高效能模型在安全關鍵場景中會出現完全失敗,且公平性任務中人口統計修改導致10-20%的誤差放大。研究強調,效能方差和極端失敗比平均準確率更能反映臨床可靠性,混合評估方法結合自動化與臨床醫生監督對安全評估至關重要。
一項新研究結合認知語言特徵和DistilBERT嵌入,使用全息約簡表示(HRR)檢測線上文本中的憂鬱症,在Reddit帖子資料集上實現了0.94的宏F1分數,顯著優於傳統TF-IDF基線的0.80。
大語言模型在長上下文解碼時面臨記憶體頻寬瓶頸,因為需要頻繁訪問龐大的鍵值(KV)快取。現有方法多在解碼前進行基於鍵的剪枝,但忽視了注意力輸出同時依賴鍵和值。本文提出注意力執行時終止(ART),一種輕量級機制,在核心執行過程中動態跟蹤累積的注意力輸出,當後續貢獻可忽略時提前終止KV塊訪問。ART與現有基於鍵的方法正交,可無縫整合。在LongBench基準測試中,大批次下生成吞吐量提升20%,且精度相當。
一項名為TrustLDM的新基準測試,全面評估語言擴散模型在安全性、隱私和公平性方面的可信度。研究發現,雖然模型在僅使用者提示下表現良好,但附加上下文中的惡意內容會顯著降低其對齊行為。此外,較長的上下文不一定產生更強的影響,解碼順序和生成長度也會影響評估結果。研究還提出了自動評估框架TrustLDM-Auto,系統性地識別脆弱配置。
該系統採用“先生成再擇優”策略,透過偏好模型(從人工對比中學習)來篩選幽默候選,在SemEval-2026幽默生成任務中取得英語和中文第一名、西班牙語第二名的成績。
提出SENSE方法,透過基於目標模型隱藏狀態的語義檢索和軟門控評估,提升檢索式推測解碼的魯棒性和效率,在LLaMA和Qwen上實現高達4.09的平均接受長度和3.26倍加速。
提出CSRP三階段框架,透過持續預訓練、鏈式推理監督微調和基於效率感知獎勵的組相對策略最佳化,有效緩解中文語法糾錯中的過度糾正問題。在NACGEC基準上取得SOTA效能,F0.5達50.99,精確率57.17;在CSCD拼寫糾正任務中F1達59.61,超過GPT-4 5.20個百分點。
隨著語言模型生成文本的流暢度接近人類水平,傳統的基於表面統計或似然訊號的檢測方法已難以應對。AEyeDE提出了一種基於注意力歸因的新方法,透過代理Transformer模型提取人類和AI生成文本的注意力矩陣,並使用輕量級卷積神經網路進行區分。實驗表明,該方法在多種設定下均表現出色,並具有可解釋性和魯棒性。