崑崙萬維釋出SkyClaw-v1.0及輕量版SkyClaw-v1.0-lite,原生Agent模型效能比肩Claude Opus 4.6等頂尖模型,價格僅為主流一半,限時免費,深度適配OpenClaw、Claude Code等主流Agent框架,相容OpenAI介面。
AI 新聞即時情報
即時監測
即時更新
即時追蹤可信來源,保留出處、權限和站內閱讀模式,把噪音壓成可讀情報。
即時更新
在長期人機協作中,機器人需要在部分觀測下輔助使用者,並利用跨天互動歷史。然而,協作初期人類特徵和慣例未知,被動推斷後行動效率低下。為此,本文提出PACT(主動詢問持續任務輔助)框架,透過當前觀測和累積互動歷史評估上下文充分性,決定是否先澄清再行動。實驗表明,PACT在輔助準確性和澄清效用上均優於被動基線。
本文介紹IsaacIPC,一個將GPU加速的增量勢接觸(IPC)與IsaacSim/Lab結合的機器人模擬框架。它透過對映模擬變形到視覺網格,實現即時逼真渲染,支援資料採集和策略評估。同時提出幾何砂漿接觸勢(GMCP),用於觸覺感測中更好地解析接觸壓力分佈。在四足機器人、靈巧手和通用操縱介面(UMI)夾爪等剛柔混合模擬中驗證了有效性。
針對行星探測車在不同地形(如斜坡、顆粒狀地面)面臨的移動挑戰,研究者提出了一種能連續調整履刺高度的多模態輪子。在四種代表性表面上的750次試驗表明,自適應部署可將滑移率降低30%-58%,在顆粒狀地形中旅行時間和能耗最多減少77.4%。結果凸顯了固定輪系統的侷限性,支援了履刺自適應形態在增強火星車機動性方面的潛力。
本文提出了一種基於強化學習的框架,透過調變恆定參考軌跡實現緊湊、位置受限的四旋翼翻轉,並與傳統軌跡生成和跟蹤相容。在模擬中,該方法相比最強最佳化基線,位置均方根誤差降低32%,穩定時間減少57%。硬體實驗在多種偏航配置下成功翻轉,位置均方根誤差低於0.35米。
一種新方法結合了機器人的進化與學習,使用基於具身條件的專家混合模型,在效率與適應性之間取得平衡,避免了單一控制器的問題。
該研究透過在黑盒執行器上加裝定製串聯彈性元件,將力控制頻寬從10.32 Hz提升至30.32 Hz(提升2.93倍),且效能優於商用感測器7.63%,成本僅25英鎊。
研究人員提出了一種新的各向異性擴散方法,用於多機器人系統的遍歷搜尋,克服了傳統各向同性擴散導致的誤差均勻傳播問題,透過Perona-Malik擴散梯度引導機器人運動,實現了更靈活的覆蓋。
一種名為MASt3R-Nav的新型視覺導航方法,利用畫素相對連通性構建幾何精確但無需全域性一致性的地圖,相比傳統拓撲圖實現更強大的導航能力。
RED是一個為資源受限機器人平臺設計的即時排程框架,透過引入截止時間感知排程器、子截止時間分配以及基於MIMONet的圖重構技術,能夠自適應環境變化(如新任務誕生、依賴關係變更),在保證端到端時序約束的同時提升吞吐量和魯棒性。實驗表明其在Jetson和MacBook平臺上優於現有方法。
冠狀動脈微血管功能障礙(CMVD)影響約40%-60%的缺血但無阻塞性冠脈患者,但診斷依賴於侵入性功能測試或主觀的TIMI血流分級。TIMI心肌灌注幀計數(TMPFC)提供客觀、基於血管造影的定量指標,但手動計算繁瑣且驗證不足。本研究開發並驗證了深度學習驅動的TMPFC計算(DL-TMPFC),在655名患者佇列中(來自三個獨立機構)顯示出與專家手動測量極好的一致性(偏差:-0.93幀;95%一致性界限:-5.33至+3.47;r=0.98)。DL-TMPFC透過完全自動化TMPFC並消除觀察者依賴性,顯著增強了臨床可行性,並能準確識別全譜冠脈病變中的CMVD,實現連續嚴重程度定量和風險分層。
ActQuant是一種針對視覺-語言-動作(VLA)模型的動作引導混合精度後訓練量化框架,透過兩階段方法實現亞4位權重量化,同時在LIBERO基準測試和真實UR3機械臂上保持高成功率,顯著減小模型記憶體佔用。
本研究比較了傳統線性插值與多種深度學習模型在填補因雲層覆蓋導致的衛星資料缺失方面的效果。實驗基於四個有藻華歷史記錄的湖泊,採用CNN、Inception Resnet、Autoencoder及其與LSTM結合的模型。結果表明,深度學習模型顯著優於線性插值,其中CNN表現最優。此外,利用填補後的資料計算的藻華指數與觀測資料吻合良好,證明該方法可提升水環境監測的可靠性。
研究人員提出了一種腦到影像系統,利用自然觀看影像時的腦電圖(EEG)訊號解碼視覺刺激。系統包括兩個任務:EEG到影像的檢索(在200個候選中識別正確影像,Top-1準確率86.30%,Top-5準確率98.55%)和EEG到影像的重建(生成與感知刺激一致的影像,CLIP評分達0.903)。該方法結合多級模糊、EVNet特徵、InfoNCE損失以及基於CLIP的多模態對齊和SDXL-Turbo生成模型,展示了從EEG訊號解碼豐富視覺表徵的可行性。
本文系統綜述了自監督學習(SSL)在醫學影像分析中的應用,分析了75項研究,將方法分為對比學習、非對比預測學習、生成式重建學習和混合學習四類。研究發現,沒有通用的最優SSL策略,效能取決於預文本任務、成像模態和目標任務的對齊。對比學習適合分類,但可能忽略病理細節;生成式方法保留區域性解剖結構,適合分割;混合方法效能最平衡。文章還提出了實踐設計指南,並指出了開放挑戰。
數字人水印面臨獨特挑戰:數字人經常需要經過背景替換、重新構圖和格式轉換等後處理才能部署。本文提出RAW基準,包含來自5家商業供應商的50個合成數字人影片和6種模擬實際工作流的攻擊。評估7種現有方法發現,背景移除等數字人特有攻擊會顯著降低水印恢復率。提出WALT方法,透過3D人臉重建在UV紋理空間嵌入水印,在縮放攻擊下魯棒性最高(92.4%),背景移除效能也強(95.6%)。該基準已開源以促進數字人水印研究。
Nano World Models 是一個極簡程式碼庫,專注於基於擴散強制(diffusion forcing)的未來影片預測。它提供統一的介面,支援生成目標、模型規模、動作條件機制、潛在觀測空間、資料集、評估協議和長期推演過程,旨在為世界模型研究提供可重複、可擴充套件的實驗平臺。
GazeWorld是一種醫學影像世界模型,將影像視為世界,放射科醫生的注視序列視為軌跡。它透過自迴歸預測注視補丁的潛在表示,並用空間補全分支覆蓋未訪問區域。在推理時,僅從影像生成補丁表示,無需真實注視資料。凍結的GazeWorld特徵在CheXpert、RSNA肺炎和SIIM-ACR氣胸資料集上取得了所有九項監督設定的最新診斷準確率,以及所有三個基準的最佳零樣本準確率。在GazeSearch基準上,基於相同凍結特徵的通用解碼器在ScanMatch和SED指標上分別比專用模型LogitGaze-Med高出16%和22%。該工作表明,建模專家如何讀片,而非僅關注其結論,為醫學影像AI提供了一種有前景的預訓練正規化。
音訊大語言模型在轉錄英中混合語音時存在系統性失敗模式,包括語言遺漏、翻譯代替轉錄和幻覺。研究者採用直接偏好最佳化(DPO)方法,構建偏好對訓練模型,使其學會保留混合語言內容而非翻譯。在三個模型上使用10萬對(570小時)資料訓練後,模型行為得到顯著改善:分佈內詞錯誤率(MER)最高降低89.6%,分佈外降低20.0%。
AERIC 是一種輕量級安全監控器,透過讀取解碼過程中的隱藏狀態來提前檢測隱式有害內容,無需額外前向傳播。它僅含 387 個可訓練引數,在多個基準測試上優於大型模型,且延遲增加僅 2.34%。
大型語言模型(LLM)常被用作自動評判者,但研究發現它們存在位置、冗長和風格偏好等偏差。本文提出因果框架,引入一套干預措施和指標,檢驗LLM評判者是否具備提示不變性,即當非證據性提示被擾動時,其排名和解釋是否穩定。實驗發現,在標籤和安慰劑擾動下,LLM存在顯著的提示錨定合理化,而PROOF-BEFORE-PREFERENCE方法能顯著改善提示不變性。
TriVAL是一個三重驗證框架,在自動最佳化建模的三個階段(語義規範、數學公式、程式碼生成)進行顯式驗證,並引入NL4COP基準測試,包含50種問題型別的150個例項,用於更具挑戰性的組合最佳化問題。
本研究開發了一個基於大型語言模型的框架,直接從10-K報表中提取分部披露資訊,並保留可報告和巢狀分部資訊。同時,設計了一個檢索增強系統,整合多個報表的資訊以支援可比性。實驗表明,該框架能準確提取資訊並有效回答跨期問題,展示了LLM在增強分部披露衡量和解釋方面的潛力。
本文提出多角色辯論系統(MPDS),結合文獻檢索、長上下文大語言模型推理、語料驅動角色歸納和結構化多智慧體辯論,自動生成科學假設。在電池材料研究中,MPDS透過構建多達500篇文獻的快照,進行三輪引文感知辯論,由主持人綜合,生成機制明確且過程感知的提議。評估表明,MPDS在鈉離子陽極和全固態電池陰極設計任務中恢復出與實驗驗證一致的設計邏輯,並在交叉視角整合方面表現優異,有望成為工作流瓶頸診斷工具。
Raon-Speech 是一個9B引數的語音語言模型,支援英語和韓語,在語音理解和生成任務上達到頂尖水平,同時保持強大的文本能力。其全雙工擴充套件 Raon-SpeechChat 透過持續訓練實現自然的即時對話。所有模型及程式碼均已開源。
本文對139項研究進行系統綜述,提出統一框架並進行元分析。結果顯示多模態融合使準確率平均提升5.28個百分點,多視角融合帶來準確率提升4.67%、F1分數提升3.08%,但僅少數研究使用了統計檢驗,存在可重複性問題。
本文研究移動眾包中用於大語言模型(LLM)微調的誠實線上偏好聚合問題。針對工人可能策略性誤報反饋的情況,提出一種動態貝葉斯博弈模型和線上加權聚合機制,該機制能根據工人反饋準確性動態調整權重,確保誠實反饋並實現次線性遺憾O(√T)。實驗證明優於基準方案。
該研究將大語言模型整合中的提案者選擇問題重新定義為組合選擇問題,強調互補性而非單純準確率或多樣性。透過探索多種貪心式選擇演算法,實驗驗證了互補性作為選擇準則的有效性,並確定了效能與成本最佳折衷的方法。
現有蛋白質-配體基準通常評估蛋白質與配體是否相互作用及結合強度,但無法判斷模型是否能夠定位結合位點或識別分子識別中的非共價相互作用。為此,研究者引入InteractBind,一個包含約10萬對蛋白質-配體的大規模資料集及細粒度評估基準,透過六種非共價相互作用型別的殘基-原子相互作用圖來評估結合位點定位能力。評估八個現有模型發現,儘管二元結合預測表現強勁,但結合位點定位能力有限,且在不同非共價相互作用型別間差異顯著。InteractBind鼓勵開發更具可解釋性和物理基礎的蛋白質-配體模型。
本文提出LLM-AutoSciLab,一種閉環科學發現框架,將假設生成與假設條件實驗選擇及機制精煉相結合。該框架迭代提出合理假設、選擇資訊豐富的實驗以區分或精煉假設,並利用實驗結果更新狀態。引入ActiveSciBench基準,包含57項酶動力學任務和45項基因調控網路任務。在多個基準上,LLM-AutoSciLab優於先前方法,符號準確率在NewtonBench上達67.6%,在ActiveSciBench-Chem上達35.1%,在ActiveSciBench-GRN上精確圖恢復率達31.1%,且假設引導的實驗取樣效率比最強基線高2-5倍。