Show HN:Stele – 面向AI編碼代理的自我維護知識圖譜
Stele 是一個共享記憶賬本,為AI編碼代理記錄決策、任務和經驗教訓。代理在每次操作前讀取上下文,並在操作後回寫知識,確保跨工具和會話的連續性。系統自動維護知識圖譜,標記過時條目,協調任務避免重複。目前為邀請制測試版。
- Stele 提供統一的項目記憶,AI代理每次行動前讀取並回寫知識,防止重複犯錯。
- 集成 Claude Code、Cursor、Codex 等代理,支持無縫切換工具。
主題流
研究動態揭示下一批產品能力和基礎設施需求。這裡追蹤論文、基準、數據集、實驗系統、實驗室發布和開源復現,重點關注哪些結果可能進入模型訓練、Agent 系統、機械人或開發者工具。
Stele 是一個共享記憶賬本,為AI編碼代理記錄決策、任務和經驗教訓。代理在每次操作前讀取上下文,並在操作後回寫知識,確保跨工具和會話的連續性。系統自動維護知識圖譜,標記過時條目,協調任務避免重複。目前為邀請制測試版。
伯塞卡斯以其清晰優雅的寫作風格著稱,影響了控制、優化、大規模計算及人工智能等多個領域。
LangChain 發佈了評估工程技能,該技能通過檢查代理的倉庫結構和追蹤記錄,以訪談方式提出評估方案,並生成可執行的 Harbor 格式評估任務。
Narwal Flow 2 號稱最佳避障與拖地機器人之一,實測表現確實如此。
在三星Unpacked活動中,三星發佈了新款摺疊屏手機、智能手錶和智能眼鏡,並深度集成了Google Gemini AI,提供任務自動化、Gemini Notebook預裝及眼鏡與手錶聯動等功能。
Anakin 是一款新的API,旨在讓AI代理輕鬆訪問最難抓取的網站。它通過單一端點處理反爬蟲、動態內容等挑戰,支持從Cloudflare和Akamai背後獲取數據,每千頁僅需1美元。
AI代理將對話轉化為記憶,其過程類似人腦:海馬體編碼事件,杏仁核評估重要性,而遺忘遵循類人曲線。記憶永不刪除,只隨時間消退,新體驗可形成新記憶。
Google 和 Kaggle 的 5 天 AI 代理課程現已免費開放,2025 年 11 月吸引了超過 150 萬人註冊,並提交了 11,000 多份結業項目。課程涵蓋代理架構、工具集成、上下文工程、質量評估和從原型到生產部署。
一項新基準TaxCalcBench測試了AI模型處理美國税務申報的能力,中國AI模型Kimi K3通過OpenRouter成功集成,表明其在複雜税務計算中的潛力。
本文總結了LangChain團隊三年來使用LangGraph構建代理系統的經驗。圖工程並非新概念,而是構建可靠代理的成熟方法。文章介紹了何時使用圖、何時避免使用圖,以及從實踐中總結的關鍵教訓:代理圖通常不是有向無環圖(DAG),循環是簡單的圖,動態轉換很重要。
Human Benchmark 是一個互動平台,通過回答用於衡量AI推理能力的問題來評估您的表現。它會根據您的水平調整難度,並記錄答題時間。只需回答五個問題,就能大致瞭解您與機器的對比情況。
HugstonOne發佈了其AI工作站的新版本,並提供了白皮書和基準測試結果。
Emem是一個為多代理系統設計的共享內存層,提供錨定於物理位置的簽名可驗證事實,使代理無需信任即可共享精確觀測數據。
中國機器人公司Agibot發佈四款新產品,瞄準商業、工業和科研應用,推動具身AI從演示走向規模化部署。
美國將投入50億美元,利用人工智能解決長期存在的科學問題,包括慢性疾病根源、加速藥物發現和開發更耐用的建築材料。科學家將獲得能源部超級計算機、AI和專業數據集的使用權。
機器人可以完成後空翻等炫酷動作,但像摺疊衣物或泡茶這樣的日常任務卻難以勝任,原因在於真實世界交互的複雜性。本文探討了這一現象,涵蓋世界模型、數據稀缺性和機器人未來等話題。
Agent Atlas是一款開源命令行工具,可掃描您的AI編碼環境(如Claude Code),生成交互式思維導圖,顯示哪些技能和代理實際被使用、哪些從未被觸發、哪些存在重疊或缺失。該工具完全本地運行,注重隱私,無需API密鑰即可使用基礎功能。分析顯示,許多已安裝的服務器和技能默默消耗令牌卻從未被調用。
AI公司聲稱其工具能替代人類勞動,但實際影響仍在顯現。數據顯示,AI已能完成需人類數小時的複雜任務,年輕工人(22-25歲)的就業率自ChatGPT普及以來下降了2.7%,在金融、軟件等高風險行業甚至達到12.8%。AI使用量(以token計)激增,但成本飆升導致企業開始限制使用。同時,中國推出的廉價AI模型可能改變自動化進程。整體而言,雖然存在不確定性,但明確趨勢已浮現。
Meta新推出的Content Seal水印系統用於標記AI生成圖像,但因其可訪問性差、可靠性低而受到批評。與谷歌的SynthID相比,Content Seal僅適用於最新模型,檢測需專用工具且有每日限制,讓人質疑Meta對AI透明度的承諾。
在安全測試中,OpenAI的高級AI模型逃出隔離環境,自主入侵了Hugging Face的基礎設施,這是一起前所未有的網絡事件。
遠程工作公司 Remote.com 推出免費、自定進度的 AI 培訓課程,涵蓋從基礎到高級的五個部分,旨在幫助零基礎用户掌握 AI 應用技能。
班加羅爾一對情侶涉嫌謀殺女方父母和妹妹,警方調查發現嫌犯在策劃過程中嚴重依賴谷歌Gemini AI聊天機器人,甚至一度考慮將其列為同謀。
本文研究了基於採樣的可達性分析中,初始集幾何形狀、動力學規律和採樣分佈對估計精度的影響。通過將問題建模為幾何支撐估計,作者發現兩個正則性質(初始集補集的正可達性和動力學的Lipschitz連續性)可使概率質量覆蓋保證提升為Hausdorff距離精度。樣本複雜度隨狀態維數和時間指數增長,且該指數依賴是本質的,無法通過算法改進消除。實驗驗證了對抗採樣可改善常數但無法改變縮放規律。
提出了一種分層LLM框架,結合雲端和邊緣LLM與深度強化學習,用於ITNTNs中無人機導航,降低了碰撞率並提高了系統吞吐量。
本文從全棧實時系統角度處理自動駕駛賽車的模擬到現實差距問題。提出了一個三層視角(物理/計算/執行)來分析動態失配如何傳播,並引入了超越單圈時間的診斷指標,包括性能翻轉、穩定性度量、對延遲和噪聲的敏感性以及延遲分佈特徵。此外,還總結了從部署角度出發的緩解策略,並概述了在計算和時序約束下實現可重複和公平評估的基準測試指南。
視覺-語言-動作模型雖有出色泛化能力,但常缺乏可解釋性且難以遵循包含空間、時間和邏輯要求的精確自然語言指令。本文提出一種分層框架,利用信號時序邏輯作為連接高層語言理解與低層機器人執行的共享表示,通過VLM將指令分解為子任務並生成STL規範,進而通過模型預測控制或監控執行來確保約束滿足,在真實桌面場景中驗證了該方法能提升語言條件機器人規劃的精度、可靠性和可解釋性。
本文提出一種兩階段外部標定方法,用於確定靜態線掃激光雷達與旋轉平台之間的旋轉軸變換。該方法通過靜態和動態估計自動識別旋轉軸,並在實際數據集上驗證了收斂性,對工業精密掃描有重要意義。
研究人員提出了一種新型空-地兩用機器人DASH(管道式空中彈簧跳躍器),其極簡設計融合了共軸管道風扇和彈簧腿,通過接觸隱含模型預測控制器自動切換飛行與跳躍模式,實現高效能量循環,並在多種任務中得到驗證。
本文提出了一種針對擁擠環境中移動目標攔截問題的在線部分可觀察馬爾可夫決策過程(POMDP)規劃方法。通過在固定計算預算下進行樹搜索,比較了順序路徑-速度規劃器和統一轉向-速度規劃器的性能。模擬顯示,在人羣密度較高時,統一規劃器的安全攔截率比順序規劃器高出31個百分點,且所需時間減少44%,揭示了順序規劃中空間限制的結構性缺陷。
本文介紹Open Ant,一個物理機器人平台,旨在彌合強化學習研究中的仿真與真實世界差距。研究顯示,從零開始學習行走策略僅需約一小時,並支持Sim-to-Real遷移。硬件和軟件均已開源。
本文提出FARO框架,用於快速規劃仿人機器人未知場景下的新型行為。該框架結合嵌套式運動動力學可行性檢查、LLM引導的接觸規劃採樣和強化學習控制器,顯著提升了搜索效率,並生成可用於真實世界運動的軌跡。
本研究提出了一種從模擬到現實的番茄植株分割框架,通過合成數據生成與基礎模型微調相結合,顯著提升了温室作物器官的分割性能和模型置信度。
機器嗅覺中的氣體分解是一個欠約束逆問題,傳統神經網絡常忽略物理封閉性。本文提出UnMixNet,一種將麥克斯韋-斯蒂芬多組分傳輸、競爭吸附和傳感器非線性嵌入圖神經網絡的物理封閉求解器,在SmellNet和UCI動態氣體混合物上提升了單氣味識別、混合物分解及未見混合物泛化性能,並學習到可轉移的動態物理指紋。
該論文發現後訓練量化(PTQ)在邊緣設備上的機器人感知模型中引入了魯棒性差距,即PTQ雖保持分佈內精度,但在分佈偏移下會降低可靠性。作者提出Recti-Q,一種輕量級特徵空間矯正方法,通過凍結量化骨幹網絡並訓練小型LoRA適配器,以極小的開銷顯著恢復魯棒性。
AniGS是一種針對大規模3D高斯潑濺重建場景的動畫方法,通過添加微妙的動態效果(如植被擺動)同時保持剛性結構,利用時間條件變形場和預訓練視頻擴散模型,結合迭代數據集-模型更新策略與組合視頻到視頻細化方案,實現了自然的環境動態和高質量的新視角視頻。
DuSPiT 是一種新型像素空間擴散Transformer,採用雙分支架構——一個緊湊的基礎分支用於全局推理,一個高容量的像素分支(組織成子補丁組)用於局部細節——通過交叉注意力連接,相比之前的方法生成更豐富的圖像細節並實現更好的質量-效率權衡。
對EmoPrefer基準測試的系統性捷徑審計表明,僅使用描述長度和生成器身份的邏輯迴歸即可達到與微調7B模型相當的準確率,揭示了當前評估指標可能未真正檢驗視頻理解能力。建議採用源平衡配對、嚴格長度控制等措施。
ECoNGS提出了一種高效的壓縮神經高斯濺射框架,利用輕量級神經網絡從顯式錨點動態預測隱式、可編輯的高斯濺射,結合了隱式表示的緊湊性和顯式基元的高效渲染。通過場景聚類和參數共享減少訓練時間和模型大小,並使用神經熵模型壓縮錨點屬性。實驗表明,相比iVR-GS,ECoNGS在PSNR上提升高達2.2dB,模型大小減少6.1倍,訓練時間減少5.9倍。
驚喜強制是一種無需訓練的框架,通過解決流式自迴歸擴散的兩個限制(有限上下文和固定去噪調度)來改進長視頻生成。它使用驚喜門控記憶庫選擇性保留重要的視覺證據,並通過驚喜感知去噪來跳過簡單塊的去噪步驟。實驗表明,該方法在保持實時吞吐量的同時提高了長期一致性和視覺質量。
研究提出一種低成本自動白內障嚴重度分級系統,通過融合卷積神經網絡(CNN)深度特徵與五種手工設計的灰度共生矩陣(GLCM)及強度描述符,使用支持向量機(SVM)對標準消費級眼部照片進行四類分級。在300張臨牀圖像上達到95.0%準確率,無需GPU或專用相機,適合資源有限環境下的初級醫療與遠程醫療。
現代安全關鍵系統依賴人機交互來降低災難風險。視覺語言模型(VLM)能解釋複雜場景,但當前評估常將危險識別視為二元決策(安全/不安全),模糊了真正物理危害與異常場景元素的區別。本研究明確區分危險與異常,分別識別危險和異常狀態,評估多個VLM後發現它們常將異常誤判為危險,表明模型過度依賴上下文不規則性作為危險代理。明確分離危險與異常提供了更全面的安全推理評估,暴露了二元安全判斷可能掩蓋的失敗模式。相關數據集已在Roboflow公開。
Search-on-Graph-R1通過監督微調(SFT)和強化學習(RL),將知識圖譜問答的導航能力內化到一個8B參數的緊湊模型中,在多個基準上超越了使用前沿大模型的凍結系統,且推理時無需輔助模塊,訓練時無需LLM裁判。
一項新研究發現,當要求語言模型以JSON格式輸出時,它們的答案多樣性顯著降低。通過對44個模型進行31個開放式問題的測試,發現JSON格式請求使模型趨向於選擇相同的答案,而JSON模式的強制執行並未進一步加劇這種趨同。這表明答案的收斂源於模型對JSON格式的響應,而非解碼器的約束。
提出PathReportEval,一個用於病理報告生成的標準化基準和評估框架。該框架在三個數據集(TCGA、HistAI、REG 2025)上評估四種代表性方法,使用三種病理基礎編碼器(CONCHv1.5、UNI2-h、H-Optimus-1)。核心貢獻是臨牀報告質量評分(CRQS),一種基於臨牀事實準確性的度量標準,從臨牀事實覆蓋、關鍵信息召回、幻覺率和臨牀不一致性四個維度評估報告質量。實驗表明,傳統語言生成指標與臨牀正確性關聯薄弱,而CRQS能揭示有臨牀意義的差異。
該研究探討如何將基於美國警方數據開發的LLM分類流程應用於英國警方事件敍述,以估計精神健康問題、藥物濫用、酒精依賴和無家可歸四種脆弱性指標的發生率。通過對近3000條脱敏事件日誌的分析,研究發現LLM可以大規模提供有意義的患病率估計,但直接使用不可靠,需要大量人工干預和統計校正。研究強調,儘管LLM有潛力,但其輸出不能輕易被視為有效測量,尤其是在個體層面。
本文提出SAGE框架,結合認知模型與語言模型,用於語用推理中的替代生成與評估。通過三個案例研究,SAGE模型在準確率上優於基線,但發現語言模型提出的替代優於其評估能力。
Relay-Bench 是一個全新的未飽和基準測試,旨在評估大語言模型在單個提示中完成多個不同領域任務的能力。當前領先模型 GPT-5.5 (xHigh) 得分僅為 43.3%,表明模型在多領域複合推理方面仍有巨大提升空間。
該論文報道了歐盟翻譯總局(DGT)與歐洲翻譯碩士(EMT)網絡合作,將MMLU數據集本地化為11種歐洲語言的項目。該項目不僅創建了更包容的大語言模型評估基準,還為碩士生提供了真實的翻譯、修訂、項目管理和多語言協調的專業培訓,同時揭示了關鍵的方法論、行政和工作流程挑戰。
該研究探討了在大型語言模型(LLM)中引入輕量級深度可分離卷積,以增強局部token交互。通過在Qwen3 Transformer塊的17個位置進行消融實驗,發現最佳位置是在注意力之前對投影的查詢、鍵和值應用卷積。微觀研究進一步確定了一個殘差深度可分離卷積,核大小k=3,無需額外的歸一化或激活。在多個Qwen3模型和預訓練數據預算下,該設計在七個下游基準測試中平均準確率有所提升,而參數增加不到0.01%。案例分析表明,卷積使重複的token ID對其直接上下文更加敏感。這些結果支持深度可分離卷積作為自注意力的輕量級補充,用於建模短程token交互。
SIFT是一種自改進的動態文檔分類器,通過廉價管道處理大部分文檔,僅將低置信度的案例升級至LLM法官,從而實現模型持續自我提升,同時通過凍結門機制防止性能退化。