EAGLE團隊、vLLM團隊和TorchSpec團隊聯合發佈了EAGLE 3.1,旨在解決生產環境中推測解碼的不穩定性。該算法通過FC歸一化和歸一化後隱藏狀態反饋兩大架構改進,有效應對注意力漂移問題。在長上下文任務中,EAGLE 3.1的接受長度比EAGLE 3提升高達2倍;在Kimi K2.6模型上的基準測試顯示,併發數為1時每用户輸出吞吐量提升2.03倍。EAGLE 3.1完全向後兼容,已合併至vLLM主線,並將隨v0.22.0版本發佈。
AI 新聞即時情報
即時監測
即時更新
即時追蹤可信來源,保留出處、權限和站內閱讀模式,把噪音壓成可讀情報。
即時更新
儘管AI對白領工作的威脅日益引起恐慌,但數據顯示AI尚未對勞動力市場產生大規模影響。實際上,AI高暴露職業的失業率反而低於低暴露職業。然而,斯坦福大學的一項研究發現,AI可能正在悄悄削弱初級職位,年輕工作者在AI暴露職業中的就業率大幅下降。本文還涵蓋了教皇呼籲監管AI、SpaceX發射、華為芯片突破等其他技術新聞。
Mirdel是一款本地優先的桌面AI工作空間,將對話、知識庫、筆記、翻譯、圖像和視頻處理、本地模型及可擴展工作流整合到一個長期運行的環境中。它注重數據隱私和用户控制,支持多種雲模型和本地模型,並通過Applet、Skill和MCP協議實現工作流的模塊化和複用。
瞭解OpenAI、Thrive和Crete如何使用Codex構建自改進税務代理,實現申報自動化、提高準確性並加速工作流程。
本文探討了在AI寫作氾濫的時代,如何有意識地選擇使用AI,避免認知投降,並保持人類思考能力。通過教育領域的實驗對比,文章指出使用AI代替思考會損害學習,而作為輔導工具則能提升效果。作者呼籲個人和社會在默認機制形成前,主動決定哪些任務保留給人類。
OpenAI聘請了一位曾在Salesforce從事營銷工作13年的高管,負責公關事務。
本文引用了凱爾·費拉納的一條推文,用《星際迷航》的比喻説明AI系統中的“謹慎”策略。在技術領域,僅僅有防禦措施是不夠的,必須真正執行才能避免嚴重失敗。
本文探討了如何通過遊戲化機制(如打卡、徽章、排行榜)利用行為心理學來提高AI編程工具的採用率。分析了習慣循環、損失厭惡、社會比較理論、內在動機與外在動機的平衡,以及流體驗的設計原則,並警告了Goodhart定律可能導致的作弊問題。提供了實現持久參與的設計建議。
新加坡國立大學、MIT和A*STAR的研究人員提出MEMO,這是一種模塊化框架,將語料庫知識編碼到一個可單獨訓練的記憶模型中,使大型語言模型能夠無需重新訓練或微調即可吸收新知識。
只需一段提示詞,OpenAI員工Vaibhav分享的Codex自我蒸餾法引發熱議。
AI模型在原始智能方面似乎已達到平台期,下一階段的進步來自於圍繞模型構建的“代理馬具”。本文介紹了代理馬具的概念,包括工具、記憶和人類參與,並比較了Google、LangChain、OpenAI、Anthropic等公司的解決方案。
一篇新論文首次大規模評估了使用大型語言模型(LLM)生成形式化證明來解決開放數學問題的能力。最先進的智能體以每個問題幾百美元的成本,自主解決了353個開放Erdős問題中的9個,並驗證了492個OEIS猜想中的44個,目前已部署在組合學、優化、圖論、代數幾何和量子光學等多個領域。研究表明AI輔助形式化證明搜索在數學研究中具有巨大潛力。
一些股東團體越來越擔心人工智能不受約束髮展帶來的責任風險,並推動企業採取更嚴格的監管措施。Vancity投資管理公司要求Alphabet更好地防止AI聊天機器人傳播錯誤信息,而其他投資者則希望Shopify制定負責任AI使用政策。兩家公司均建議股東反對這些提案。
Mr. Guy Invests 是一款面向初學者的免費股票研究與投資組合追蹤工具,利用SEC公開數據追蹤對沖基金和內幕交易,提供AI股票導師、虛擬交易挑戰、每日市場簡報等功能。免費版有每日使用限制,Pro版每月4.99美元可解鎖無限功能。
AI芯片需求爆漲推動SK海力士和美光市值突破萬億美元,三星也躋身其中,但市場對AI泡沫的擔憂加劇。
提出隨機解耦策略梯度(SDPG)方法,一種輕量級視覺強化學習技術,可在單塊NVIDIA RTX 4080 GPU上數小時內端到端訓練多種視覺運動控制策略。SDPG通過軌跡rollout的隨機擾動估計策略梯度,大幅減少批量渲染環境的數量以及計算和內存開銷。在視覺MuJoCo基準測試中,SDPG在訓練時間、內存使用和獎勵方面一致優於基線方法。此外,引入了涵蓋靈巧操作和挑戰性運動的全新真實感視覺機器人基準測試,並在物理硬件上展示了有效的模擬到現實遷移。
針對動態城市物流中時間敏感任務隨機出現導致的異構自主空中飛行器(AAV)任務分配優化難題,本文提出一種強化學習增強的重疊聯盟形成博弈方法。該方法建立動態任務分配模型,以耦合服務質量與資源消耗的廣義物流成本量化全局最優性;並設計基於Transformer的軟演員-評論家網絡,利用多頭自注意力機制處理可變長度物流狀態、捕捉任務間時空依賴,從而自適應引導聯盟更新,取代傳統啓發式規則。理論證明聯盟形成過程構成精確勢博弈,確保有限次迭代收斂到納什穩定均衡。在32架AAV與80個任務的場景下,相比啓發式重疊聯盟形成基線,成本降低39.76%;室內飛行實驗進一步驗證了實用性。
本文提出一種魯棒Koopman-CBF SAC框架,通過數據驅動的Koopman預測器構建升維空間中的仿射CBF約束,並利用二次規劃安全層強制執行,同時考慮近似誤差的魯棒性調整。在CartPole任務中實現零違規,但在高維任務中暴露了一階速度障礙和線性EDMD模型的侷限性。
本文提出R2P2分散式方法,通過規則分配推、支撐、阻止角色,並採用比例速度控制,實現多機器人協作推動箱體在不同傾斜度和摩擦力的地表(平坦、上坡、下坡)上運輸。該方法減少了通信與同步需求,避免單點故障。在NVIDIA IsaacSim仿真中,六機器人團隊驗證了其在不同地表和箱體質量下的泛化能力,成功率優於傳統虛擬領導者-跟隨者方法。實際實驗中,四台Turtlebot成功移動了1.2千克的箱體。
遙操作在機器人數據採集中至關重要,但新手操作員常產生雖任務成功但次優的示範。本文提出數據質量評估與反饋(DQAF)框架,通過即時反饋提升示範質量。
RCSP是一種預測性規劃層,通過評估候選命令在短期障礙物未來中的風險來避免機器人的近失承諾問題。在MuJoCo、ROS2/Gazebo和DynaBARN/Jackal模擬中,RCSP提高了安全性和路徑質量,但增加了延遲,揭示了其作為現有導航堆棧補充模塊的邊界。
NightSight提出了一種輕量級感知方法,結合單目事件相機、編碼孔徑鏡頭和紅外點陣投影器,使小型飛行器能夠在完全黑暗的環境中自主導航。系統通過編碼孔徑產生深度相關的模糊特徵,並用卷積神經網絡解碼為密集深度圖,僅使用合成數據訓練即可零樣本泛化到真實場景。在NVIDIA Jetson Orin Nano上以20Hz實時運行,2.5米範圍內誤差僅7.0釐米(2.80%)。
提出了一種新框架,使異構機器人能夠在帶寬受限下協作導航,通過β-稀疏高斯過程選擇地圖點並平衡探索與任務相關性,模擬顯示路徑成本降低18%,信息傳輸減少76%。
本文提出PhyPush,一種物理引導的Transformer框架,僅通過單次推動的末端執行器速度即可估計物體的質量和摩擦係數,無需力/扭矩傳感器。實驗表明,在仿真和真實環境中,該方法相比基線具有更低的誤差和更好的泛化能力。
本文提出信念感知GSAC(BA-GSAC),通過集成不一致性動態調節蒸餾係數λ,系統研究了自適應引導在部分可觀測自動駕駛中的有效性。實驗發現,在輕度至中度部分可觀測條件下自適應引導有益,但在嚴重遮擋下自適應係數快速退化,原因是集成模型僅基於部分觀測預測,無法感知缺失信息。改進方案是使用全狀態預測訓練集成模型。研究表明,簡單的線性衰減調度在嚴重POMDP下表現最佳,穩定性收益主要來自調度策略而非自適應機制。
這項研究在視網膜眼底多病種圖像數據集(RFMiD)上對12種架構(包括卷積神經網絡、視覺Transformer、混合模型和視覺語言模型)進行了基準測試,比較它們在二元篩查和多標籤分類中的性能。結果表明,所有模型在二元篩查中表現良好(AUC>84%),但基於注意力的模型(如SwinTiny、CoAtNet0、MaxViTTiny)在二元和多標籤任務中均最優。視覺語言模型與CNN基線相當,但未超越最佳Transformer和混合模型。在Messidor-2上的外部驗證中,AUC範圍為66.8%-84.7%,混合和Transformer模型表現強勁。
VesselSim提出一個兩階段框架,通過隨機幾何驅動模擬生成16,500個解剖學合理的3D血管造影體積,並僅用合成數據訓練3D U-Net。採用測試時自適應策略彌合域差距,在真實MRI和CT數據集上達到與最先進基礎模型競爭的性能,顯著減少對專家標註的依賴。
研究人員提出一種新的情緒表徵——維度分佈情緒狀態(DDES),利用效價和喚醒度預測藝術作品引發的情感反應,輔助博物館策展人設計以情緒為基礎的展覽。
LongAV-Compass是一個系統化基準,用於評估分鐘級視聽生成任務,涵蓋文本到視聽、圖像到視聽和視頻到視聽三種模態。包含284個測試案例,集成多模態大模型輔助評估和感知指標,評估超過20個細粒度維度。對11個代表性模型的實驗揭示了當前系統在長時間生成中的侷限性。
RoMo是一個大規模、高質量的人體運動數據集,通過分類感知過濾管道去除靜態和偽影序列,採用新穎的三級語義分類體系進行標註,支持細粒度評估,訓練模型在保真度和多樣性方面達到最先進水平,併發布了Motion Toolbox以標準化指標和數據轉換。