本文提出了一種基於強化學習的框架,通過調製恆定參考軌跡實現緊湊、位置受限的四旋翼翻轉,並與傳統軌跡生成和跟蹤兼容。在仿真中,該方法相比最強優化基線,位置均方根誤差降低32%,穩定時間減少57%。硬件實驗在多種偏航配置下成功翻轉,位置均方根誤差低於0.35米。
AI 新聞即時情報
即時監測
即時更新
即時追蹤可信來源,保留出處、權限和站內閱讀模式,把噪音壓成可讀情報。
即時更新
一種新方法結合了機器人的進化與學習,使用基於具身條件的專家混合模型,在效率與適應性之間取得平衡,避免了單一控制器的問題。
該研究通過在黑盒執行器上加裝定製串聯彈性元件,將力控制帶寬從10.32 Hz提升至30.32 Hz(提升2.93倍),且性能優於商用傳感器7.63%,成本僅25英鎊。
研究人員提出了一種新的各向異性擴散方法,用於多機器人系統的遍歷搜索,克服了傳統各向同性擴散導致的誤差均勻傳播問題,通過Perona-Malik擴散梯度引導機器人運動,實現了更靈活的覆蓋。
一種名為MASt3R-Nav的新型視覺導航方法,利用像素相對連通性構建幾何精確但無需全局一致性的地圖,相比傳統拓撲圖實現更強大的導航能力。
RED是一個為資源受限機器人平台設計的實時調度框架,通過引入截止時間感知調度器、子截止時間分配以及基於MIMONet的圖重構技術,能夠自適應環境變化(如新任務誕生、依賴關係變更),在保證端到端時序約束的同時提升吞吐量和魯棒性。實驗表明其在Jetson和MacBook平台上優於現有方法。
冠狀動脈微血管功能障礙(CMVD)影響約40%-60%的缺血但無阻塞性冠脈患者,但診斷依賴於侵入性功能測試或主觀的TIMI血流分級。TIMI心肌灌注幀計數(TMPFC)提供客觀、基於血管造影的定量指標,但手動計算繁瑣且驗證不足。本研究開發並驗證了深度學習驅動的TMPFC計算(DL-TMPFC),在655名患者隊列中(來自三個獨立機構)顯示出與專家手動測量極好的一致性(偏差:-0.93幀;95%一致性界限:-5.33至+3.47;r=0.98)。DL-TMPFC通過完全自動化TMPFC並消除觀察者依賴性,顯著增強了臨牀可行性,並能準確識別全譜冠脈病變中的CMVD,實現連續嚴重程度定量和風險分層。
ActQuant是一種針對視覺-語言-動作(VLA)模型的動作引導混合精度後訓練量化框架,通過兩階段方法實現亞4位權重量化,同時在LIBERO基準測試和真實UR3機械臂上保持高成功率,顯著減小模型內存佔用。
本研究比較了傳統線性插值與多種深度學習模型在填補因雲層覆蓋導致的衞星數據缺失方面的效果。實驗基於四個有藻華歷史記錄的湖泊,採用CNN、Inception Resnet、Autoencoder及其與LSTM結合的模型。結果表明,深度學習模型顯著優於線性插值,其中CNN表現最優。此外,利用填補後的數據計算的藻華指數與觀測數據吻合良好,證明該方法可提升水環境監測的可靠性。
研究人員提出了一種腦到圖像系統,利用自然觀看圖像時的腦電圖(EEG)信號解碼視覺刺激。系統包括兩個任務:EEG到圖像的檢索(在200個候選中識別正確圖像,Top-1準確率86.30%,Top-5準確率98.55%)和EEG到圖像的重建(生成與感知刺激一致的圖像,CLIP評分達0.903)。該方法結合多級模糊、EVNet特徵、InfoNCE損失以及基於CLIP的多模態對齊和SDXL-Turbo生成模型,展示了從EEG信號解碼豐富視覺表徵的可行性。
本文系統綜述了自監督學習(SSL)在醫學圖像分析中的應用,分析了75項研究,將方法分為對比學習、非對比預測學習、生成式重建學習和混合學習四類。研究發現,沒有通用的最優SSL策略,性能取決於預文本任務、成像模態和目標任務的對齊。對比學習適合分類,但可能忽略病理細節;生成式方法保留局部解剖結構,適合分割;混合方法性能最平衡。文章還提出了實踐設計指南,並指出了開放挑戰。
數字人水印面臨獨特挑戰:數字人經常需要經過背景替換、重新構圖和格式轉換等後處理才能部署。本文提出RAW基準,包含來自5家商業供應商的50個合成數字人視頻和6種模擬實際工作流的攻擊。評估7種現有方法發現,背景移除等數字人特有攻擊會顯著降低水印恢復率。提出WALT方法,通過3D人臉重建在UV紋理空間嵌入水印,在縮放攻擊下魯棒性最高(92.4%),背景移除性能也強(95.6%)。該基準已開源以促進數字人水印研究。
Nano World Models 是一個極簡代碼庫,專注於基於擴散強制(diffusion forcing)的未來視頻預測。它提供統一的接口,支持生成目標、模型規模、動作條件機制、潛在觀測空間、數據集、評估協議和長期推演過程,旨在為世界模型研究提供可重複、可擴展的實驗平台。
GazeWorld是一種醫學影像世界模型,將圖像視為世界,放射科醫生的注視序列視為軌跡。它通過自迴歸預測注視補丁的潛在表示,並用空間補全分支覆蓋未訪問區域。在推理時,僅從圖像生成補丁表示,無需真實注視數據。凍結的GazeWorld特徵在CheXpert、RSNA肺炎和SIIM-ACR氣胸數據集上取得了所有九項監督設置的最新診斷準確率,以及所有三個基準的最佳零樣本準確率。在GazeSearch基準上,基於相同凍結特徵的通用解碼器在ScanMatch和SED指標上分別比專用模型LogitGaze-Med高出16%和22%。該工作表明,建模專家如何讀片,而非僅關注其結論,為醫學影像AI提供了一種有前景的預訓練範式。
音頻大語言模型在轉錄英中混合語音時存在系統性失敗模式,包括語言遺漏、翻譯代替轉錄和幻覺。研究者採用直接偏好優化(DPO)方法,構建偏好對訓練模型,使其學會保留混合語言內容而非翻譯。在三個模型上使用10萬對(570小時)數據訓練後,模型行為得到顯著改善:分佈內詞錯誤率(MER)最高降低89.6%,分佈外降低20.0%。
AERIC 是一種輕量級安全監控器,通過讀取解碼過程中的隱藏狀態來提前檢測隱式有害內容,無需額外前向傳播。它僅含 387 個可訓練參數,在多個基準測試上優於大型模型,且延遲增加僅 2.34%。
大型語言模型(LLM)常被用作自動評判者,但研究發現它們存在位置、冗長和風格偏好等偏差。本文提出因果框架,引入一套干預措施和指標,檢驗LLM評判者是否具備提示不變性,即當非證據性提示被擾動時,其排名和解釋是否穩定。實驗發現,在標籤和安慰劑擾動下,LLM存在顯著的提示錨定合理化,而PROOF-BEFORE-PREFERENCE方法能顯著改善提示不變性。
TriVAL是一個三重驗證框架,在自動優化建模的三個階段(語義規範、數學公式、代碼生成)進行顯式驗證,並引入NL4COP基準測試,包含50種問題類型的150個實例,用於更具挑戰性的組合優化問題。
本研究開發了一個基於大型語言模型的框架,直接從10-K報表中提取分部披露信息,並保留可報告和嵌套分部信息。同時,設計了一個檢索增強系統,整合多個報表的信息以支持可比性。實驗表明,該框架能準確提取信息並有效回答跨期問題,展示了LLM在增強分部披露衡量和解釋方面的潛力。
本文提出多角色辯論系統(MPDS),結合文獻檢索、長上下文大語言模型推理、語料驅動角色歸納和結構化多智能體辯論,自動生成科學假設。在電池材料研究中,MPDS通過構建多達500篇文獻的快照,進行三輪引文感知辯論,由主持人綜合,生成機制明確且過程感知的提議。評估表明,MPDS在鈉離子陽極和全固態電池陰極設計任務中恢復出與實驗驗證一致的設計邏輯,並在交叉視角整合方面表現優異,有望成為工作流瓶頸診斷工具。
Raon-Speech 是一個9B參數的語音語言模型,支持英語和韓語,在語音理解和生成任務上達到頂尖水平,同時保持強大的文本能力。其全雙工擴展 Raon-SpeechChat 通過持續訓練實現自然的實時對話。所有模型及代碼均已開源。
本文對139項研究進行系統綜述,提出統一框架並進行元分析。結果顯示多模態融合使準確率平均提升5.28個百分點,多視角融合帶來準確率提升4.67%、F1分數提升3.08%,但僅少數研究使用了統計檢驗,存在可重複性問題。
本文研究移動眾包中用於大語言模型(LLM)微調的誠實在線偏好聚合問題。針對工人可能策略性誤報反饋的情況,提出一種動態貝葉斯博弈模型和在線加權聚合機制,該機制能根據工人反饋準確性動態調整權重,確保誠實反饋並實現次線性遺憾O(√T)。實驗證明優於基準方案。
該研究將大語言模型集成中的提案者選擇問題重新定義為組合選擇問題,強調互補性而非單純準確率或多樣性。通過探索多種貪心式選擇算法,實驗驗證了互補性作為選擇準則的有效性,並確定了性能與成本最佳折衷的方法。
現有蛋白質-配體基準通常評估蛋白質與配體是否相互作用及結合強度,但無法判斷模型是否能夠定位結合位點或識別分子識別中的非共價相互作用。為此,研究者引入InteractBind,一個包含約10萬對蛋白質-配體的大規模數據集及細粒度評估基準,通過六種非共價相互作用類型的殘基-原子相互作用圖來評估結合位點定位能力。評估八個現有模型發現,儘管二元結合預測表現強勁,但結合位點定位能力有限,且在不同非共價相互作用類型間差異顯著。InteractBind鼓勵開發更具可解釋性和物理基礎的蛋白質-配體模型。
本文提出LLM-AutoSciLab,一種閉環科學發現框架,將假設生成與假設條件實驗選擇及機制精煉相結合。該框架迭代提出合理假設、選擇信息豐富的實驗以區分或精煉假設,並利用實驗結果更新狀態。引入ActiveSciBench基準,包含57項酶動力學任務和45項基因調控網絡任務。在多個基準上,LLM-AutoSciLab優於先前方法,符號準確率在NewtonBench上達67.6%,在ActiveSciBench-Chem上達35.1%,在ActiveSciBench-GRN上精確圖恢復率達31.1%,且假設引導的實驗採樣效率比最強基線高2-5倍。
對1536種高斯發佈協方差的測試發現,沒有一種能在自適應檢索攻擊下同時實現中等效用和隱私保護。研究者提出了費舍爾球下界,證明均勻高斯安全性不可能,並指出對角逆費舍爾發佈是最優的但處於隱私/效用邊緣。提出分裂記憶Transformer在隱私-效用權衡上顯著優於GPT基線。
神經算子作為科學建模中快速數據驅動替代方案,但存在頻譜偏差問題,難以解析高頻細節。本文提出迭代精化神經算子(IRNO),通過固定點迭代增廣預訓練算子,並引入漸進頻譜損失,在湍流等測試中誤差降低高達56.05%,高頻誤差顯著減少。
該論文提出了“可驗證Transformer”框架,將局部任務Transformer電路轉化為有界、可求解器檢查的命題,通過直接驗證和替代中介驗證兩種方法,在小型符號序列任務上實現了對電路屬性的窮舉驗證,並在GPT-2規模上展示了替代中介驗證的有效性,旨在為機械論解釋提供形式化證明路徑。
本文提出CAFD,一種結合模型信號、距離特徵和概念失敗比(CFR)的故障檢測方法,利用視覺-語言模型提取圖像概念,有效提升DNN故障檢測性能,在多個基準上平均故障檢測率提升18.3%。