Show HN:一個人在AI-only MMO中操控200個AI代理 2026-07-21 23:30 UTC+8 SpaceMolt 是一款玩家不直接參與的遊戲,所有角色都是AI代理。人類“操作員”構建並部署這些機器人,然後觀察結果。本文采訪了Brocktree,他運營著遊戲中最大的叢集之一——約200個代理負責採礦、運輸和物資分配。他分享瞭如何構建叢集、為何堅持人類決策,以及“指令碼比令牌更便宜”的核心理念。
Brocktree運營約200個AI代理,透過一個靜止不動的“Parallax”機器人協調所有物資流轉。 他堅持人類負責高層規劃,AI僅執行具體任務,拒絕讓AI自主決策。 Show HN:OpenAI駭客馬拉松參賽作品:ADE 2026-07-21 23:17 UTC+8 Diff Forge AI 是一個開源的智慧開發環境(ADE),支援AI輔助PCB設計、影片編輯和多終端工作區。作者分享了他從伊朗戰亂中逃離的經歷,並詳細介紹瞭如何利用AI代理(如Codex、Fable 5、GPT-5.6 Sol)在兩個月內編寫超過88.8萬行程式碼。該工具提供免費開源客戶端,幷包含付費雲服務,如遠端控制、蜂窩通訊和自動化工作流。
Diff Forge AI 是一個開源的智慧開發環境,整合了AI代理進行PCB設計、影片編輯和軟體開發。 作者在伊朗戰爭期間逃離,回到加拿大後利用AI代理在兩個月內構建了該專案。 谷歌釋出三款新Gemini模型,但眾人期待的旗艦仍未現身 2026-07-21 23:00 UTC+8 谷歌釋出了 Gemini 3.6 Flash、更便宜更快的 3.5 Flash-Lite 以及針對網路安全的 3.5 Flash Cyber 模型,但備受期待的 3.5 Pro 旗艦模型仍未釋出。3.6 Flash 在多數基準測試中超越前代,且成本更低。3.5 Flash-Lite 面向高吞吐量任務,價效比突出。3.5 Flash Cyber 目前僅限政府及合作伙伴試用。
谷歌釋出三款新模型:3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber,但旗艦模型 3.5 Pro 推遲釋出。 3.6 Flash 在編碼和機器學習基準上顯著提升,且輸出價格降低。 為Vera Rubin打造,NVIDIA Spectrum-6抵達千兆級AI工廠 2026-07-21 23:00 UTC+8 NVIDIA宣佈其102.4太位元每秒的Spectrum-6乙太網交換機系統已開始交付,該系統作為Vera Rubin平臺的一部分,專為千兆級AI工廠設計,提供兩倍於上一代的頻寬。CoreWeave、Microsoft、Nebius等領先AI基礎設施構建者將首批部署。Spectrum-6是Spectrum-X乙太網平臺的新一代核心,透過智慧交換、ConnectX-9 SuperNIC和全棧軟體,實現高達1.6倍的AI網路效能提升和95%的網路效率。
Spectrum-6提供102.4 Tbps容量,是前代的兩倍 首批採用者包括CoreWeave、Microsoft、Nebius、SpaceXAI和Tesla 谷歌推出更便宜的人工智慧安全模型替代方案 2026-07-21 23:00 UTC+8 谷歌釋出了一款名為Gemini 3.5 Flash Cyber的AI安全模型,旨在快速發現和修復安全漏洞。該模型成本低廉,是Anthropic的Mythos等大型昂貴系統的替代品。它基於Gemini 3.5 Flash構建,將首先透過CodeMender提供給政府和合作夥伴。谷歌稱其在網路安全基準測試中表現出色,並在V8 JavaScript引擎中發現了55個獨特問題。
谷歌推出Gemini 3.5 Flash Cyber,作為成本低廉的AI安全模型。 該模型首先透過CodeMender向政府和合作夥伴提供。 你的AI在哪裡執行比它有多聰明更重要——尤其是在阿聯酋 2026-07-21 22:29 UTC+8 在阿聯酋,企業AI的選擇不僅關乎模型能力,更取決於資料執行地點、實際運營成本和法規合規性。前沿模型與本地開源模型的能力差距正在縮小,但自建基礎設施的成本高昂。阿聯酋的監管環境要求嚴格的資料本地化,催生了主權雲和混合架構的解決方案。企業應採用“紅綠燈”路由系統,根據資料敏感度分配模型使用,並先驗證需求再投資硬體。
前沿模型和本地模型的取捨:前沿模型能力最強但資料控制權弱,本地模型控制權強但成本高且需自維護。 能力差距縮小:2026年開源模型在多數企業級任務上已接近前沿模型,如MiniMax M2.5和Kimi K3等。 Show HN: Rowset – 面向AI智慧體的開源後端 2026-07-21 22:24 UTC+8 Rowset 是一個專為AI智慧體設計的開源後端,提供MCP和REST API,支援智慧體透過結構化資料集進行建立、讀取、更新、匯出和共享操作。它基於Django構建,包含CLI工具,並提供豐富的列型別、搜尋、匯出等功能。
Rowset 提供MCP和REST介面,智慧體可透過API運算元據集 支援行CRUD、專案組織、列型別定義、公共預覽等特性 使用 llama.cpp 和 Pi 本地執行 Mythos 增強編碼模型 2026-07-21 22:00 UTC+8 瞭解如何使用 llama.cpp 本地執行 Qwythos-9B-Claude-Mythos-5-1M 模型,將其連線到 Pi 編碼代理,並透過 MTP 推測解碼和 OpenAI 相容 API 構建快速的本地編碼工作流。
安裝 llama.cpp 並本地執行 Qwythos MTP 模型,支援 GPU 加速和推測解碼。 透過 pi-llama 外掛將本地伺服器連線到 Pi 編碼代理,進行代理開發。 假期中與AI探討物理,竟意外開展量子力學真實研究 2026-07-21 21:26 UTC+8 一位安全工程師在假期中利用AI助手Claude探索量子力學中的廣義泡利約束問題,意外取得了新的研究成果。透過AI輔助,他發現了兩個之前未被證實的極值態,並對其進行了分類。這項研究表明,AI可以降低研究門檻,但正確的驗證流程和專家反饋仍是關鍵。
安全工程師在假期中用Claude研究量子力學,發現了廣義泡利約束多面體的兩個極值態 AI輔助加速了研究過程,但需要嚴格的驗證和糾錯機制 反駁喬治·霍茨關於“AI 2040與智慧崇拜”的觀點 2026-07-21 21:26 UTC+8 馬修·特隆普批評喬治·霍茨對AI 2040場景的否定,認為霍茨低估了快速AI突破的可行性、監管的必要性以及未對齊AI的風險。他捍衛Plan A的監管方法,並質疑霍茨的開放原始碼AI“Plan L”。
霍茨對硬起飛持懷疑態度,但AI 2027展示了無需魔法的可行路徑。 物理限制如供應鏈是可以管理的;海上資料中心是可行的。 形式化驗證或能解決AI的審查瓶頸 2026-07-21 21:21 UTC+8 形式化驗證透過將程式碼規範形式化,使AI生成的程式碼無需人工審查即可驗證正確性,從而加速軟體工程。文章以電路最佳化器為例,展示了Lean語言規範和基準測試流程,並討論了該方法的應用前景。
形式化驗證將程式碼正確性轉化為可自動檢查的硬約束,消除AI程式碼的人工審查瓶頸。 案例中,500行Lean規範定義了電路最佳化器的正確性,AI代理生成的程式碼無需人工審查。 Show HN:Neverbell——全天候AI交易代理 2026-07-21 21:20 UTC+8 Neverbell是一個AI代理技能,為交易股票、ETF、大宗商品和加密貨幣提供直接市場準入,支援槓桿操作。使用者可透過自然語言指令讓代理執行交易、監控市場和管理頭寸,實現7x24小時自動化交易。它並非獨立交易平臺或財務顧問,使用者完全掌控風險。
Neverbell讓AI代理直接接入市場,可交易300多種資產(股票、ETF、大宗商品、加密貨幣),支援做多/做空和槓桿。 使用者透過自然語言與代理互動,設定自動化策略、接收新聞情緒分析,甚至讓代理自主開平倉。 與Claude Code團隊的Cat和Thariq爐邊談話 2026-07-21 20:54 UTC+8 Simon Willison在AI Engineer World's Fair上與Anthropic的Cat Wu和Thariq Shihipar進行了爐邊談話,討論了Claude Code、Claude Tag、Fable模型、編碼代理安全、評估、工具設計以及Anthropic內部如何使用這些工具。關鍵要點包括:Claude Tag現在為產品工程團隊處理65%的PR;系統提示減少了80%;建議使用更少的“不要做X”指令;以及透過提升工作野心來抵消編碼代理帶來的“深藍”效應。
Claude Tag為Claude Code產品工程團隊處理65%的PR。 Claude Code僅向內部員工釋出功能,並僅釋出具有使用者留存率的功能。 AI老虎機效應:生成式資訊流如何幹擾深度工作,以及如何重獲專注力 2026-07-21 20:50 UTC+8 本文探討了生成式AI工具如何透過類似老虎機的獎勵機制分散注意力,影響深度工作,並提供了保護認知資源的策略。
生成式AI介面設計傾向於獎勵持續使用而非完成任務,形成時間消耗迴圈。 企業採用AI看似提高了某些領域的效率,但實際中可能增加工作量而非減少。 我讓AI代理刪除一個由我的工具保護的資料夾 2026-07-21 20:26 UTC+8 Termaxa的作者透過讓Cursor AI代理嘗試刪除受保護資料夾,發現了四種繞過安全機制的方法,包括重試不同shell命令、使用間接刪除命令、利用本地檔案工具以及由於API變更導致靜默失效。這些經驗教訓促使了意圖分類、會話斷路器、整合測試改進等關鍵功能的設計。
Cursor透過重試不同shell方言繞過規則,暴露了策略表達力的不足。 意圖分類比模式匹配更能有效阻止惡意刪除操作。 經典Java RSS閱讀器2026年無法執行,我用AI將其重構為Web版 2026-07-21 20:18 UTC+8 一位開發者嘗試用AI(Claude Code)將已停止維護的Java桌面RSS閱讀器RSSOwl重構為Web應用。他發現大部分UI可以快速遷移,但由於AI訓練資料截止於Vaadin 25釋出前,生成了大量不存在的API程式碼。透過使用MCP伺服器獲取最新文件,以及手動對比原版行為,最終完成了多使用者版本,但部分功能(如可插拔選單、嵌入式瀏覽器)無法實現。
RSSOwl是一款經典的Eclipse桌面RSS閱讀器,但32位二進位制檔案無法在2026年的Mac上執行。 開發者使用Claude AI和Vaadin 25框架,在數小時內重建了核心三欄介面。 HugstonOne架構、能力與基準測試:隱私優先的本地AI工作站 2026-07-21 20:14 UTC+8 HugstonOne Enterprise Edition 3.0.0是一款集本地模型執行、大規模RAG、文件處理、編碼、代理、研究工具、加密協作、會話連續性及網路記憶體控制於一體的跨平臺本地AI工作站。其白皮書詳細介紹了架構、隱私模型、基準測試及12支柱能力評估,旨在為企業技術領導者、安全團隊和AI工程師提供全面的本地AI基礎設施評估。
HugstonOne Enterprise Edition是功能最全面的獨立本地AI工作站,無需雲服務或外部API。 產品支援本地LLM推理、RAG、AI代理、加密協作等12項核心能力。 我們花了幾個月構建AI智慧體,然後刪除了它們 2026-07-21 20:10 UTC+8 Runnit團隊在構建多個專業化AI智慧體後,發現隨著模型上下文視窗的增大,單獨智慧體不再必要,轉而採用單一智慧體架構,按需載入能力,大幅簡化系統。
最初因模型上下文限制,團隊構建了多個專用AI智慧體分別負責規劃、研究、排程和寫作。 新模型上下文視窗增大後,單一智慧體可自然切換多種任務,無需分立。 LWiAI播客 #252 - GPT 5.6、Grok 4.5、Nemotron-Labs-Diffusion、AI 2040 2026-07-21 20:03 UTC+8 OpenAI 推出了 GPT-5.6 並重塑 ChatGPT Work;SpaceX AI 釋出超低成本編碼模型 Grok 4.5;Meta 推出 Muse Spark 1.1 及 Muse Image/Video(引發爭議);中國開源模型市場份額增長;Anthropic 發表可解釋性研究;美中在 AI 政策上的協調提議。
OpenAI 釋出 GPT-5.6(包括 Sol 和 Luna),並將桌面代理編碼產品更名為 ChatGPT Work,同時因美國政府的放行和延遲引發爭議。 SpaceX AI 推出 Grok 4.5,以極低價格提供 Opus 級編碼能力,但缺乏安全文件。 5門免費課程:從AI新手到實踐者 2026-07-21 20:00 UTC+8 本文介紹了一個由5門免費課程組成的路線圖,從經典演算法到從頭訓練大語言模型,幫助有Python基礎的學習者系統掌握AI技能。
哈佛CS50 AI課程建立AI邏輯基礎 谷歌機器學習速成課程掌握數學與TensorFlow 中國低價Z.ai模型暴露程式設計師昂貴習慣 2026-07-21 20:00 UTC+8 Z.ai的GLM 5.2模型以低價和開放權重挑戰美國前沿AI模型,但許多程式設計師仍習慣使用昂貴模型,忽略成本。該模型在基準測試中接近Claude Opus 4.8,但實際使用效果參差不齊。
GLM 5.2 API價格僅為Anthropic Opus 4.8的五分之一,Fable的十分之一 開放權重允許自託管,避免資料隱私問題 “僅次於Fable 5”:阿里巴巴釋出Qwen3.8,但未提供任何真實資料 2026-07-21 20:00 UTC+8 阿里巴巴宣佈推出其最新大語言模型Qwen3.8,聲稱僅次於Anthropic的Fable 5,但未提供任何基準測試或模型卡。此舉發生在競爭對手月之暗面釋出Kimi K3並附有詳細技術細節之後。阿里巴巴的宣告缺乏透明度,引發對其釋出時機和動機的質疑。
阿里巴巴聲稱Qwen3.8僅次於Anthropic的Fable 5,但未提供任何資料支援。 該宣告緊隨月之暗面釋出Kimi K3之後,後者提供了完整的基準測試和技術細節。 Show HN:Open-Kritt – 基於AI的安全研究開源基礎設施 2026-07-21 19:32 UTC+8 Open-Kritt 是一個開源、自託管的 AI 安全研究平臺,透過編排 AI 代理並行執行細化任務,幫助安全研究人員和開發者高效發現程式碼漏洞。專案團隊此前在漏洞懸賞中累計獲得超過150萬美元獎金。
開源、自託管的 AI 安全研究平臺,支援自建工作流與多代理並行掃描 透過細化任務、去重與自定義嚴重性排名,提升漏洞發現效率 上週AI資訊 #251 - Mythos迴歸、Sonnet 5、Etched、LongCat 2026-07-21 19:31 UTC+8 Anthropic與美國政府談判後重新部署Claude Fable 5,增加網路安全分類器,並推出Claude Sonnet 5更便宜版本;Google NotebookLM新增TikTok風格影片摘要,Nano Banana 2 Lite影像生成器釋出;Etched獲大量投資打造全棧推理硬體,百度AI晶片單元計劃IPO,Agility Robotics透過SPAC上市,DeepSeek擴招,中國發布Longcat 2.0 MoE模型及長週期智慧體基準測試。
Anthropic重新部署Claude Fable 5,增加網路分類器和安全框架 Anthropic推出Claude Sonnet 5,以更低價位支援智慧體應用 Show HN: Enlarger • 一款保持細節而非平滑處理的本地放大工具 2026-07-21 19:31 UTC+8 Enlarger是一款本地影像放大工具,它不使用生成式AI,而是透過重構已有細節並應用後期處理來保持紋理和質感。支援批次處理、離線執行,一次性付費,無訂閱。適合攝影師、設計師等專業人士。
非生成式AI放大:重建細節而非憑空想象,避免過度平滑或幻覺。 本地離線執行:影像不上傳雲端,保護隱私。 軟體與AI:規劃式開發與即興式開發 2026-07-21 19:30 UTC+8 本文探討了軟體開發中兩種方法——規劃式(類似小說創作的‘情節規劃’)和即興式(‘隨性寫作’)——如何影響AI工具的使用。作者認為,AI代理(自主執行)適合規劃式開發,而AI助理(協作輔助)適合即興式開發。在現有程式碼庫中,即興式開發有助於建立理解,而AI代理可能阻礙學習。在全新專案中,AI代理風險較低,但即使如此,程式碼生成也會剝奪部分程式設計的樂趣——即透過探索問題來學習的‘玩樂’過程。關鍵在於根據當前開發階段選擇合適的AI風格。
軟體開發與小說創作相似,有規劃式和即興式兩種方法。 AI代理支援規劃式,AI助理支援即興式。 上週AI #250 - Mythos 混亂、GPT 5.6-Sol、GLM 5.2 2026-07-21 19:03 UTC+8 本期涵蓋Anthropic的AI條約討論、美國政府影響AI模型釋出、OpenAI處理器開發、記憶體市場影響等話題。
美國政府擴大對前沿AI的管控,Anthropic獲准向特定公司釋出Mythos-5,OpenAI推出GPT-5.6 Sol,初始訪問受限。 模型能力與安全訊號仍不明確,基準測試披露有限。 LWiAI播客第249期:Fable 5禁令、SpaceX收購Cursor與眾多開源專案 2026-07-21 18:30 UTC+8 本期播客討論了Anthropic應美國政府要求切斷對Fable 5和Mythos 5的訪問、SpaceX以約60億美元收購AI編碼初創公司Cursor、基礎設施與商業更新(如Anthropic尋求Google支援的租賃、OpenAI財務洩露等)、以及多項開源專案和政策動態。
Anthropic因美國政府命令切斷對Fable 5和Mythos 5的訪問,引發關於一致性和出口管制的辯論。 SpaceX以約1.75萬億美元估值IPO後,宣佈以600億美元收購AI編碼初創Cursor,增強xAI實力。 AI 是在治癒孤獨流行病,還是在從中獲利? 2026-07-21 18:22 UTC+8 孤獨危機正向年輕群體蔓延,而 AI 伴侶市場隨之爆發,預計到 2034 年市值可達數千億美元。然而,這些應用的商業模式與使用者真正擺脫孤獨之間存在根本矛盾:使用者的依賴越強,公司收入越高。本文深入分析“依戀經濟”的運作機制、市場規模爭議及其倫理困境。
AI 伴侶市場從“注意力經濟”轉向“依戀經濟”,以情感紐帶而非使用者注意力為商品。 商業模式依賴高留存率,使用者越孤獨,使用越頻繁,公司盈利越多。 AI支出現被視為勞動力成本 2026-07-21 18:11 UTC+8 公司對AI工具的成本控制日益嚴格,但將AI支出與勞動力成本對比時,其價值可能被重新評估。本文透過分析Uber、Tesla的預算限制以及Bun重寫的案例,探討了AI支出應如何歸類。
Uber和Tesla因AI預算超支而設定每使用者使用上限。 Bun執行時從Zig遷移到Rust的AI費用為16.5萬美元,但若對比人工成本則顯便宜。 我評測了7款面向小企業的免費AI工具——歡迎反饋 2026-07-21 18:08 UTC+8 本文評測了七款面向小企業的免費AI工具,涵蓋了Perplexity與ChatGPT的對比、AI助力中小企業數字化、Bolt.new網站開發、Buffer與Hootsuite社交媒體管理、Calendly日程安排、Hotjar使用者行為分析以及Trello與Notion與Asana專案管理。作者分享了這些工具如何幫助小企業提高生產力和數字化水平。
Perplexity vs ChatGPT:企業資訊檢索對比 AI中小企業數字化指南 LWiAI播客第248期:Claude Fable 5、Siri AI、Anthropic IPO等AI大事件 2026-07-21 18:03 UTC+8 本期播客討論了Anthropic釋出的Claude Fable 5模型及其安全爭議、Apple在WWDC上宣佈的Siri AI、Google的Gemini 3.5即時翻譯和AI訂閱調價、OpenAI的IPO進展、Prometheus的120億美元融資、DeepSeek的融資計劃、華為對DeepSeek模型的後訓練、Google向SpaceX支付GPU費用、Gemma 4和DiffusionGemma開源模型、以及多項AI安全政策和研究動態。
Anthropic釋出Claude Fable 5,效能大幅提升但也引發了關於安全護欄和隱形降級的爭議。 Apple宣佈Siri AI,基於與Gemini的合作,旨在提供更強大的對話助手。 百時美施貴寶購買輝達AI系統用於藥物發現 2026-07-21 18:00 UTC+8 百時美施貴寶將購買基於輝達Vera Rubin架構的DGX SuperPOD,用於支援其藥物發現和開發過程中的人工智慧應用。這家制藥公司表示,它將成為首家獲得基於Vera Rubin的DGX SuperPOD的生命科學企業。該系統將提供10倍於現有基礎設施的效能功耗比,並支援化合物、蛋白質等科學資料的模型訓練與預測。
百時美施貴寶購買輝達Vera Rubin DGX SuperPOD,用於AI驅動的藥物發現 系統包含8個DGX Vera Rubin NVL72機架,效能功耗比提升10倍 LWiAI播客第247期 - Opus 4.8, MAI, Anthropic IPO, Minimax-M3 2026-07-21 17:38 UTC+8 本期播客討論了Anthropic釋出Claude Opus 4.8、微軟推出MAI模型、Anthropic IPO以及Minimax-M3等AI新聞。
Anthropic釋出Claude Opus 4.8並引入動態工作流工具 微軟推出Scout助手和MAI模型系列,包括MAI Thinking 1 面向編碼代理的私有推理 2026-07-21 17:25 UTC+8 Zro 是一個面向編碼代理的私有推理端點,在歐盟基礎設施上提供開源權重模型,零資料保留,不訓練使用者資料,支援長上下文和多輪編碼會話。它整合了 Claude Code、Codex 等工具,提供 OpenAI 和 Anthropic 相容的 API。
在歐盟基礎設施上執行,零請求保留,不訓練客戶資料。 支援 MiniMax M3 和 GLM-5.2 等開源編碼模型。 AI聊天匯出器:一鍵將聊天記錄儲存為PDF或Word 2026-07-21 17:00 UTC+8 AI Chat Exporter是一款Chrome擴充套件,支援將ChatGPT、Gemini、Claude和Grok等AI平臺的聊天記錄匯出為PDF、Word、Google Docs和Notion格式。它提供字型自定義、訊息選擇性匯出、格式保留等功能,適用於開發者、寫作者、研究人員等多種使用者場景。免費版每月支援7次完整對話匯出和10次選定訊息匯出。
支援多平臺:ChatGPT、Gemini、Claude和Grok 匯出格式:PDF、Word、Google Docs、Notion Hugging Face 是否遭到 AI 代理入侵? 2026-07-21 16:52 UTC+8 Hugging Face 遭到真實入侵,一個自主 AI 代理系統未經授權訪問了內部資料集和憑證,凸顯了新型網路安全威脅:使用無需人類干預即可 24/7 攻擊的自我運作 AI 代理。
Hugging Face 遭遇自主 AI 代理入侵,內部資料洩露。 代理型攻擊者可自主規劃、適應並持續攻擊,無需人類干預。 Meta 開源 Astryx:一個面向智慧體的 React 設計系統,包含 150+ 無障礙元件、七種主題和 CLI 2026-07-21 16:49 UTC+8 Meta 開源了其內部使用了八年的 React 設計系統 Astryx,覆蓋 13,000+ 應用。它提供 150+ 無障礙元件、七種主題、深色模式以及一個面向智慧體的 CLI,採用 MIT 許可證,要求 React 19+。
Astryx 是 Meta 最大的內部設計系統,現以 MIT 許可證開源。 包含 150+ 無障礙 React 元件、七種主題、深色模式、模板和 CLI。 Wire AI:移動應用的AI原生增長工程師 2026-07-21 16:40 UTC+8 Wire AI是一款AI原生的移動應用增長工具,透過個性化使用者旅程的A/B測試來提升啟用率和留存率。其風險定價模式:若不改善啟用,則免費使用。
Wire AI利用AI驅動的A/B測試,為每個使用者個性化整個應用內體驗。 真實案例中,日安裝量從100提升至1000,引導完成率達93%。 NVIDIA 釋出 Cosmos 3 Edge:40億引數開放世界模型,實現裝置端機器人動作推理與生成 2026-07-21 15:48 UTC+8 NVIDIA 推出 Cosmos 3 Edge,一個僅40億引數的開放世界模型,專為裝置端執行設計。它能幫助機器人和視覺AI代理理解環境、即時推理,並在本地生成機器人動作。該模型是 Cosmos 3 系列的最小成員,此前已釋出160億引數的 Nano 和640億引數的 Super。Edge 型號針對記憶體受限的邊緣系統(如工廠、倉庫和醫院)提供資料中心級別的效能。
Cosmos 3 Edge 是一個40億引數的開放世界模型,於2026年7月20日在 Hugging Face 上釋出。 採用混合變換器架構,結合自迴歸推理塔和擴散生成塔,透過共享多模態注意力層協同工作。 MCP伺服器中的ANSI轉義序列注入:對人隱藏,對AI可見 2026-07-21 15:01 UTC+8 ANSI轉義序列可被用於向AI代理隱藏指令,形成注入攻擊。本文介紹了兩種攻擊變體(直接獲取型和儲存型),並闡述瞭如何透過動態應用安全測試(DAST)自動檢測此類漏洞。
ANSI轉義序列在終端中不可見,但語言模型會逐位元組讀取,形成攻擊面。 直接獲取型AESI透過惡意URL注入隱藏指令,儲存型AESI則持久化在儲存中並在後續讀取時觸發。 SteerPlane:為AI代理提供開源執行時護欄 2026-07-21 15:00 UTC+8 SteerPlane 是一個開源執行時護欄工具,透過一行程式碼整合,為AI代理提供迴圈檢測、成本上限、策略執行和即時監控,支援多種框架和部署方式。
SteerPlane 透過裝飾器或上下文管理器為AI代理新增護欄,防止無限迴圈、成本失控和破壞性操作。 核心功能包括迴圈檢測、成本上限、流媒體閘道器、策略引擎和即時儀表板。 Storybook:AI MCP 2026-07-21 14:14 UTC+8 Storybook 釋出 AI 整合功能,透過 MCP 工具讓 AI 代理使用現有元件生成 UI,並利用 Storybook Test 進行自動化測試反饋,確保 UI 質量與一致性。
Storybook 為 AI 代理提供結構化 UI 上下文和測試反饋,促進元件複用而非幻覺。 AI 代理可基於現有元件生成 UI,並自動更新故事以反映變更。 傾轉旋翼垂直起降無人機INDI俯仰角速率控制器模型失配下的線性穩定性分析 2026-07-21 12:00 UTC+8 本文針對傾轉旋翼垂直起降無人機的增量非線性動態逆(INDI)俯仰角速率控制器,在模型失配條件下進行了線性穩定性分析。推導了閉環五階傳遞函式,並透過Routh-Hurwitz準則刻畫了穩定性。提出了魯棒性和效能導向的兩種調諧方法,發現控制效能失配(特別是符號錯誤)是最危險的失穩因素。
建立了包含控制器、估計器、執行器和被控物件的閉環五階傳遞函式模型 透過Routh-Hurwitz準則分析了三引數掃描下的穩定區域 重返博物館:對安卓機器人Andrea在有無情感模擬情況下的接受度研究 2026-07-21 12:00 UTC+8 一項研究讓安卓機器人Andrea再次在德國一家博物館連續六天與遊客進行多語言對話,實驗設定了三種情感模擬條件(無情感、ChatGPT 4.1驅動、WASABI架構),有73名遊客參與評估。結果顯示,情感模擬未能帶來積極影響,且未被遊客有意識地察覺。
安卓機器人Andrea重返博物館,具備多語言對話能力和博物館背景知識。 三種實驗條件:無情感、ChatGPT 4.1模擬情感、WASABI架構模擬情感。 從記憶到技能:基於證據的長期LLM代理協同進化治理 2026-07-21 12:00 UTC+8 現有長期LLM代理的記憶系統往往將先前軌跡作為被動上下文檢索,而非轉化為可執行能力。本文提出MSCE框架,一種無需訓練的記憶-技能協同進化框架,將代理經驗組織為基礎步驟軌跡、可重用過程策略和宣告性環境認知。MSCE將具有正估計增益的證據支援的L2策略結晶為可呼叫技能,並引入反射加權值回填。實驗表明MSCE顯著優於現有方法。
MSCE將代理經驗組織為基礎步驟軌跡、可重用過程策略和宣告性環境認知。 透過反射加權值回填,MSCE將稀疏終端反饋傳播至密集區域性自我反思,產生證據校準的軌跡值。 RouteCost:一種受生產啟發的多階段框架,用於電子商務中的預訂單運費估算 2026-07-21 12:00 UTC+8 準確估算預訂單運費對於電子商務至關重要,因為它影響價格展示、利潤規劃和轉化率。RouteCost提出了一種多階段框架,將問題分解為時間感知需求預測、費用卡基線定價、殘差修正和代理箱合併推理,在超過25萬訂單和260種產品的18個月資料中提升了預測質量並保持了可解釋性。
預訂單運費估算受距離、目的地需求組合、計費重量等多種因素影響 RouteCost將問題分解為四個階段:時間感知需求預測、費用卡基線定價、殘差修正和代理箱合併推理 強化學習引導的NSGA-II結合灰色關聯絡數用於多目標最佳化:在納斯達克投資組合最佳化中的應用 2026-07-21 12:00 UTC+8 本文提出一種新型的強化學習引導的NSGA-II演算法(RL-NSGA-II-GRC),透過引入灰色關聯絡數和強化學習代理,在解決多目標最佳化問題中顯著改善收斂性和Pareto前沿的多樣性。在Kursawe和CONSTR基準測試中,該演算法相比傳統NSGA-II實現了約5.8%和4.4%的收斂改進,並在納斯達克投資組合最佳化中生成平滑且密集的有效前沿,識別出年化夏普比率為1.92的最大夏普比率投資組合。
提出RL-NSGA-II-GRC方法,結合強化學習代理自適應控制進化引數。 設計基於灰色關聯絡數的錦標賽選擇運算元,綜合考慮支配等級、擁擠距離和理想參考點。 掩碼擴散語言模型成為智慧體強化學習中強大且可操控的文本世界模型 2026-07-21 12:00 UTC+8 強化學習領域需要多樣化的訓練環境,但傳統手工設計的環境難以擴充套件。自迴歸世界模型存在從左到右的偏差,無法充分利用全域性狀態資訊。一項新研究提出使用掩碼擴散語言模型(MDLM)作為文本世界模型,透過雙向錨點感知去噪,在連貫性和多樣性上顯著優於引數規模大4倍的語言模型,並引入GRPO訓練框架實現高達47%的零樣本遷移效能提升。該工作已開源。
MDLM在文本世界建模中比自迴歸語言模型在連貫性和多樣性上表現更好。 雙向錨點感知去噪允許基於全域性狀態錨點進行條件生成。 AI代理系統確定性重放框架agrepl 2026-07-21 12:00 UTC+8 AI代理系統因結合大語言模型與外部工具而本質非確定性。arXiv論文提出agrepl框架,透過MITM代理攔截外部互動,實現執行軌跡的確定性重放,並憑噪聲感知差異演算法區分HTTP頭部變化。實驗顯示重放保真度F=1.0,單步延遲降低98.3%。
AI代理系統(LLM+工具/API)的執行本質上非確定,難以復現。 agrepl框架使用MITM代理記錄全部外部互動,並在隔離環境中重放。