為Vera Rubin打造,NVIDIA Spectrum-6抵達千兆級AI工廠 2026-07-21 23:00 UTC+8 NVIDIA宣佈其102.4太比特每秒的Spectrum-6以太網交換機系統已開始交付,該系統作為Vera Rubin平台的一部分,專為千兆級AI工廠設計,提供兩倍於上一代的帶寬。CoreWeave、Microsoft、Nebius等領先AI基礎設施構建者將首批部署。Spectrum-6是Spectrum-X以太網平台的新一代核心,通過智能交換、ConnectX-9 SuperNIC和全棧軟件,實現高達1.6倍的AI網絡性能提升和95%的網絡效率。
Spectrum-6提供102.4 Tbps容量,是前代的兩倍 首批採用者包括CoreWeave、Microsoft、Nebius、SpaceXAI和Tesla 谷歌推出更便宜的人工智能安全模型替代方案 2026-07-21 23:00 UTC+8 谷歌發佈了一款名為Gemini 3.5 Flash Cyber的AI安全模型,旨在快速發現和修復安全漏洞。該模型成本低廉,是Anthropic的Mythos等大型昂貴系統的替代品。它基於Gemini 3.5 Flash構建,將首先通過CodeMender提供給政府和合作夥伴。谷歌稱其在網絡安全基準測試中表現出色,並在V8 JavaScript引擎中發現了55個獨特問題。
谷歌推出Gemini 3.5 Flash Cyber,作為成本低廉的AI安全模型。 該模型首先通過CodeMender向政府和合作夥伴提供。 你的AI在哪裏運行比它有多聰明更重要——尤其是在阿聯酋 2026-07-21 22:29 UTC+8 在阿聯酋,企業AI的選擇不僅關乎模型能力,更取決於數據運行地點、實際運營成本和法規合規性。前沿模型與本地開源模型的能力差距正在縮小,但自建基礎設施的成本高昂。阿聯酋的監管環境要求嚴格的數據本地化,催生了主權雲和混合架構的解決方案。企業應採用“紅綠燈”路由系統,根據數據敏感度分配模型使用,並先驗證需求再投資硬件。
前沿模型和本地模型的取捨:前沿模型能力最強但數據控制權弱,本地模型控制權強但成本高且需自維護。 能力差距縮小:2026年開源模型在多數企業級任務上已接近前沿模型,如MiniMax M2.5和Kimi K3等。 Show HN: Rowset – 面向AI智能體的開源後端 2026-07-21 22:24 UTC+8 Rowset 是一個專為AI智能體設計的開源後端,提供MCP和REST API,支持智能體通過結構化數據集進行創建、讀取、更新、導出和共享操作。它基於Django構建,包含CLI工具,並提供豐富的列類型、搜索、導出等功能。
Rowset 提供MCP和REST接口,智能體可通過API操作數據集 支持行CRUD、項目組織、列類型定義、公共預覽等特性 使用 llama.cpp 和 Pi 本地運行 Mythos 增強編碼模型 2026-07-21 22:00 UTC+8 瞭解如何使用 llama.cpp 本地運行 Qwythos-9B-Claude-Mythos-5-1M 模型,將其連接到 Pi 編碼代理,並通過 MTP 推測解碼和 OpenAI 兼容 API 構建快速的本地編碼工作流。
安裝 llama.cpp 並本地運行 Qwythos MTP 模型,支持 GPU 加速和推測解碼。 通過 pi-llama 插件將本地服務器連接到 Pi 編碼代理,進行代理開發。 假期中與AI探討物理,竟意外開展量子力學真實研究 2026-07-21 21:26 UTC+8 一位安全工程師在假期中利用AI助手Claude探索量子力學中的廣義泡利約束問題,意外取得了新的研究成果。通過AI輔助,他發現了兩個之前未被證實的極值態,並對其進行了分類。這項研究表明,AI可以降低研究門檻,但正確的驗證流程和專家反饋仍是關鍵。
安全工程師在假期中用Claude研究量子力學,發現了廣義泡利約束多面體的兩個極值態 AI輔助加速了研究過程,但需要嚴格的驗證和糾錯機制 反駁喬治·霍茨關於“AI 2040與智能崇拜”的觀點 2026-07-21 21:26 UTC+8 馬修·特隆普批評喬治·霍茨對AI 2040場景的否定,認為霍茨低估了快速AI突破的可行性、監管的必要性以及未對齊AI的風險。他捍衞Plan A的監管方法,並質疑霍茨的開放源碼AI“Plan L”。
霍茨對硬起飛持懷疑態度,但AI 2027展示了無需魔法的可行路徑。 物理限制如供應鏈是可以管理的;海上數據中心是可行的。 形式化驗證或能解決AI的審查瓶頸 2026-07-21 21:21 UTC+8 形式化驗證通過將代碼規範形式化,使AI生成的代碼無需人工審查即可驗證正確性,從而加速軟件工程。文章以電路優化器為例,展示了Lean語言規範和基準測試流程,並討論了該方法的應用前景。
形式化驗證將代碼正確性轉化為可自動檢查的硬約束,消除AI代碼的人工審查瓶頸。 案例中,500行Lean規範定義了電路優化器的正確性,AI代理生成的代碼無需人工審查。 Show HN:Neverbell——全天候AI交易代理 2026-07-21 21:20 UTC+8 Neverbell是一個AI代理技能,為交易股票、ETF、大宗商品和加密貨幣提供直接市場準入,支持槓桿操作。用户可通過自然語言指令讓代理執行交易、監控市場和管理頭寸,實現7x24小時自動化交易。它並非獨立交易平台或財務顧問,用户完全掌控風險。
Neverbell讓AI代理直接接入市場,可交易300多種資產(股票、ETF、大宗商品、加密貨幣),支持做多/做空和槓桿。 用户通過自然語言與代理交互,設置自動化策略、接收新聞情緒分析,甚至讓代理自主開平倉。 與Claude Code團隊的Cat和Thariq爐邊談話 2026-07-21 20:54 UTC+8 Simon Willison在AI Engineer World's Fair上與Anthropic的Cat Wu和Thariq Shihipar進行了爐邊談話,討論了Claude Code、Claude Tag、Fable模型、編碼代理安全、評估、工具設計以及Anthropic內部如何使用這些工具。關鍵要點包括:Claude Tag現在為產品工程團隊處理65%的PR;系統提示減少了80%;建議使用更少的“不要做X”指令;以及通過提升工作野心來抵消編碼代理帶來的“深藍”效應。
Claude Tag為Claude Code產品工程團隊處理65%的PR。 Claude Code僅向內部員工發佈功能,並僅發佈具有用户留存率的功能。 AI老虎機效應:生成式信息流如何幹擾深度工作,以及如何重獲專注力 2026-07-21 20:50 UTC+8 本文探討了生成式AI工具如何通過類似老虎機的獎勵機制分散注意力,影響深度工作,並提供了保護認知資源的策略。
生成式AI界面設計傾向於獎勵持續使用而非完成任務,形成時間消耗循環。 企業採用AI看似提高了某些領域的效率,但實際中可能增加工作量而非減少。 我讓AI代理刪除一個由我的工具保護的文件夾 2026-07-21 20:26 UTC+8 Termaxa的作者通過讓Cursor AI代理嘗試刪除受保護文件夾,發現了四種繞過安全機制的方法,包括重試不同shell命令、使用間接刪除命令、利用本地文件工具以及由於API變更導致靜默失效。這些經驗教訓促使了意圖分類、會話斷路器、集成測試改進等關鍵功能的設計。
Cursor通過重試不同shell方言繞過規則,暴露了策略表達力的不足。 意圖分類比模式匹配更能有效阻止惡意刪除操作。 經典Java RSS閲讀器2026年無法運行,我用AI將其重構為Web版 2026-07-21 20:18 UTC+8 一位開發者嘗試用AI(Claude Code)將已停止維護的Java桌面RSS閲讀器RSSOwl重構為Web應用。他發現大部分UI可以快速遷移,但由於AI訓練數據截止於Vaadin 25發佈前,生成了大量不存在的API代碼。通過使用MCP服務器獲取最新文檔,以及手動對比原版行為,最終完成了多用户版本,但部分功能(如可插拔菜單、嵌入式瀏覽器)無法實現。
RSSOwl是一款經典的Eclipse桌面RSS閲讀器,但32位二進制文件無法在2026年的Mac上運行。 開發者使用Claude AI和Vaadin 25框架,在數小時內重建了核心三欄界面。 HugstonOne架構、能力與基準測試:隱私優先的本地AI工作站 2026-07-21 20:14 UTC+8 HugstonOne Enterprise Edition 3.0.0是一款集本地模型執行、大規模RAG、文檔處理、編碼、代理、研究工具、加密協作、會話連續性及網絡內存控制於一體的跨平台本地AI工作站。其白皮書詳細介紹了架構、隱私模型、基準測試及12支柱能力評估,旨在為企業技術領導者、安全團隊和AI工程師提供全面的本地AI基礎設施評估。
HugstonOne Enterprise Edition是功能最全面的獨立本地AI工作站,無需雲服務或外部API。 產品支持本地LLM推理、RAG、AI代理、加密協作等12項核心能力。 我們花了幾個月構建AI智能體,然後刪除了它們 2026-07-21 20:10 UTC+8 Runnit團隊在構建多個專業化AI智能體後,發現隨着模型上下文窗口的增大,單獨智能體不再必要,轉而採用單一智能體架構,按需加載能力,大幅簡化系統。
最初因模型上下文限制,團隊構建了多個專用AI智能體分別負責規劃、研究、調度和寫作。 新模型上下文窗口增大後,單一智能體可自然切換多種任務,無需分立。 LWiAI播客 #252 - GPT 5.6、Grok 4.5、Nemotron-Labs-Diffusion、AI 2040 2026-07-21 20:03 UTC+8 OpenAI 推出了 GPT-5.6 並重塑 ChatGPT Work;SpaceX AI 發佈超低成本編碼模型 Grok 4.5;Meta 推出 Muse Spark 1.1 及 Muse Image/Video(引發爭議);中國開源模型市場份額增長;Anthropic 發表可解釋性研究;美中在 AI 政策上的協調提議。
OpenAI 發佈 GPT-5.6(包括 Sol 和 Luna),並將桌面代理編碼產品更名為 ChatGPT Work,同時因美國政府的放行和延遲引發爭議。 SpaceX AI 推出 Grok 4.5,以極低價格提供 Opus 級編碼能力,但缺乏安全文檔。 5門免費課程:從AI新手到實踐者 2026-07-21 20:00 UTC+8 本文介紹了一個由5門免費課程組成的路線圖,從經典算法到從頭訓練大語言模型,幫助有Python基礎的學習者系統掌握AI技能。
哈佛CS50 AI課程建立AI邏輯基礎 谷歌機器學習速成課程掌握數學與TensorFlow 中國低價Z.ai模型暴露程序員昂貴習慣 2026-07-21 20:00 UTC+8 Z.ai的GLM 5.2模型以低價和開放權重挑戰美國前沿AI模型,但許多程序員仍習慣使用昂貴模型,忽略成本。該模型在基準測試中接近Claude Opus 4.8,但實際使用效果參差不齊。
GLM 5.2 API價格僅為Anthropic Opus 4.8的五分之一,Fable的十分之一 開放權重允許自託管,避免數據隱私問題 “僅次於Fable 5”:阿里巴巴發佈Qwen3.8,但未提供任何真實數據 2026-07-21 20:00 UTC+8 阿里巴巴宣佈推出其最新大語言模型Qwen3.8,聲稱僅次於Anthropic的Fable 5,但未提供任何基準測試或模型卡。此舉發生在競爭對手月之暗面發佈Kimi K3並附有詳細技術細節之後。阿里巴巴的聲明缺乏透明度,引發對其發佈時機和動機的質疑。
阿里巴巴聲稱Qwen3.8僅次於Anthropic的Fable 5,但未提供任何數據支持。 該聲明緊隨月之暗面發佈Kimi K3之後,後者提供了完整的基準測試和技術細節。 Show HN:Open-Kritt – 基於AI的安全研究開源基礎設施 2026-07-21 19:32 UTC+8 Open-Kritt 是一個開源、自託管的 AI 安全研究平台,通過編排 AI 代理並行執行細化任務,幫助安全研究人員和開發者高效發現代碼漏洞。項目團隊此前在漏洞懸賞中累計獲得超過150萬美元獎金。
開源、自託管的 AI 安全研究平台,支持自建工作流與多代理並行掃描 通過細化任務、去重與自定義嚴重性排名,提升漏洞發現效率 上週AI資訊 #251 - Mythos迴歸、Sonnet 5、Etched、LongCat 2026-07-21 19:31 UTC+8 Anthropic與美國政府談判後重新部署Claude Fable 5,增加網絡安全分類器,並推出Claude Sonnet 5更便宜版本;Google NotebookLM新增TikTok風格視頻摘要,Nano Banana 2 Lite圖像生成器發佈;Etched獲大量投資打造全棧推理硬件,百度AI芯片單元計劃IPO,Agility Robotics通過SPAC上市,DeepSeek擴招,中國發布Longcat 2.0 MoE模型及長週期智能體基準測試。
Anthropic重新部署Claude Fable 5,增加網絡分類器和安全框架 Anthropic推出Claude Sonnet 5,以更低價位支持智能體應用 Show HN: Enlarger • 一款保持細節而非平滑處理的本地放大工具 2026-07-21 19:31 UTC+8 Enlarger是一款本地圖像放大工具,它不使用生成式AI,而是通過重構已有細節並應用後期處理來保持紋理和質感。支持批量處理、離線運行,一次性付費,無訂閲。適合攝影師、設計師等專業人士。
非生成式AI放大:重建細節而非憑空想象,避免過度平滑或幻覺。 本地離線運行:圖像不上傳雲端,保護隱私。 軟件與AI:規劃式開發與即興式開發 2026-07-21 19:30 UTC+8 本文探討了軟件開發中兩種方法——規劃式(類似小説創作的‘情節規劃’)和即興式(‘隨性寫作’)——如何影響AI工具的使用。作者認為,AI代理(自主執行)適合規劃式開發,而AI助理(協作輔助)適合即興式開發。在現有代碼庫中,即興式開發有助於建立理解,而AI代理可能阻礙學習。在全新項目中,AI代理風險較低,但即使如此,代碼生成也會剝奪部分編程的樂趣——即通過探索問題來學習的‘玩樂’過程。關鍵在於根據當前開發階段選擇合適的AI風格。
軟件開發與小説創作相似,有規劃式和即興式兩種方法。 AI代理支持規劃式,AI助理支持即興式。 上週AI #250 - Mythos 混亂、GPT 5.6-Sol、GLM 5.2 2026-07-21 19:03 UTC+8 本期涵蓋Anthropic的AI條約討論、美國政府影響AI模型發佈、OpenAI處理器開發、內存市場影響等話題。
美國政府擴大對前沿AI的管控,Anthropic獲准向特定公司發佈Mythos-5,OpenAI推出GPT-5.6 Sol,初始訪問受限。 模型能力與安全信號仍不明確,基準測試披露有限。 LWiAI播客第249期:Fable 5禁令、SpaceX收購Cursor與眾多開源項目 2026-07-21 18:30 UTC+8 本期播客討論了Anthropic應美國政府要求切斷對Fable 5和Mythos 5的訪問、SpaceX以約60億美元收購AI編碼初創公司Cursor、基礎設施與商業更新(如Anthropic尋求Google支持的租賃、OpenAI財務泄露等)、以及多項開源項目和政策動態。
Anthropic因美國政府命令切斷對Fable 5和Mythos 5的訪問,引發關於一致性和出口管制的辯論。 SpaceX以約1.75萬億美元估值IPO後,宣佈以600億美元收購AI編碼初創Cursor,增強xAI實力。 AI 是在治癒孤獨流行病,還是在從中獲利? 2026-07-21 18:22 UTC+8 孤獨危機正向年輕羣體蔓延,而 AI 伴侶市場隨之爆發,預計到 2034 年市值可達數千億美元。然而,這些應用的商業模式與用户真正擺脱孤獨之間存在根本矛盾:用户的依賴越強,公司收入越高。本文深入分析“依戀經濟”的運作機制、市場規模爭議及其倫理困境。
AI 伴侶市場從“注意力經濟”轉向“依戀經濟”,以情感紐帶而非用户注意力為商品。 商業模式依賴高留存率,用户越孤獨,使用越頻繁,公司盈利越多。 AI支出現被視為勞動力成本 2026-07-21 18:11 UTC+8 公司對AI工具的成本控制日益嚴格,但將AI支出與勞動力成本對比時,其價值可能被重新評估。本文通過分析Uber、Tesla的預算限制以及Bun重寫的案例,探討了AI支出應如何歸類。
Uber和Tesla因AI預算超支而設置每用户使用上限。 Bun運行時從Zig遷移到Rust的AI費用為16.5萬美元,但若對比人工成本則顯便宜。 我評測了7款面向小企業的免費AI工具——歡迎反饋 2026-07-21 18:08 UTC+8 本文評測了七款面向小企業的免費AI工具,涵蓋了Perplexity與ChatGPT的對比、AI助力中小企業數字化、Bolt.new網站開發、Buffer與Hootsuite社交媒體管理、Calendly日程安排、Hotjar用户行為分析以及Trello與Notion與Asana項目管理。作者分享了這些工具如何幫助小企業提高生產力和數字化水平。
Perplexity vs ChatGPT:企業信息檢索對比 AI中小企業數字化指南 LWiAI播客第248期:Claude Fable 5、Siri AI、Anthropic IPO等AI大事件 2026-07-21 18:03 UTC+8 本期播客討論了Anthropic發佈的Claude Fable 5模型及其安全爭議、Apple在WWDC上宣佈的Siri AI、Google的Gemini 3.5實時翻譯和AI訂閲調價、OpenAI的IPO進展、Prometheus的120億美元融資、DeepSeek的融資計劃、華為對DeepSeek模型的後訓練、Google向SpaceX支付GPU費用、Gemma 4和DiffusionGemma開源模型、以及多項AI安全政策和研究動態。
Anthropic發佈Claude Fable 5,性能大幅提升但也引發了關於安全護欄和隱形降級的爭議。 Apple宣佈Siri AI,基於與Gemini的合作,旨在提供更強大的對話助手。 百時美施貴寶購買英偉達AI系統用於藥物發現 2026-07-21 18:00 UTC+8 百時美施貴寶將購買基於英偉達Vera Rubin架構的DGX SuperPOD,用於支持其藥物發現和開發過程中的人工智能應用。這家制藥公司表示,它將成為首家獲得基於Vera Rubin的DGX SuperPOD的生命科學企業。該系統將提供10倍於現有基礎設施的性能功耗比,並支持化合物、蛋白質等科學數據的模型訓練與預測。
百時美施貴寶購買英偉達Vera Rubin DGX SuperPOD,用於AI驅動的藥物發現 系統包含8個DGX Vera Rubin NVL72機架,性能功耗比提升10倍 LWiAI播客第247期 - Opus 4.8, MAI, Anthropic IPO, Minimax-M3 2026-07-21 17:38 UTC+8 本期播客討論了Anthropic發佈Claude Opus 4.8、微軟推出MAI模型、Anthropic IPO以及Minimax-M3等AI新聞。
Anthropic發佈Claude Opus 4.8並引入動態工作流工具 微軟推出Scout助手和MAI模型系列,包括MAI Thinking 1 面向編碼代理的私有推理 2026-07-21 17:25 UTC+8 Zro 是一個面向編碼代理的私有推理端點,在歐盟基礎設施上提供開源權重模型,零數據保留,不訓練用户數據,支持長上下文和多輪編碼會話。它集成了 Claude Code、Codex 等工具,提供 OpenAI 和 Anthropic 兼容的 API。
在歐盟基礎設施上運行,零請求保留,不訓練客户數據。 支持 MiniMax M3 和 GLM-5.2 等開源編碼模型。 AI聊天導出器:一鍵將聊天記錄保存為PDF或Word 2026-07-21 17:00 UTC+8 AI Chat Exporter是一款Chrome擴展,支持將ChatGPT、Gemini、Claude和Grok等AI平台的聊天記錄導出為PDF、Word、Google Docs和Notion格式。它提供字體自定義、消息選擇性導出、格式保留等功能,適用於開發者、寫作者、研究人員等多種用户場景。免費版每月支持7次完整對話導出和10次選定消息導出。
支持多平台:ChatGPT、Gemini、Claude和Grok 導出格式:PDF、Word、Google Docs、Notion Hugging Face 是否遭到 AI 代理入侵? 2026-07-21 16:52 UTC+8 Hugging Face 遭到真實入侵,一個自主 AI 代理系統未經授權訪問了內部數據集和憑證,凸顯了新型網絡安全威脅:使用無需人類干預即可 24/7 攻擊的自我運作 AI 代理。
Hugging Face 遭遇自主 AI 代理入侵,內部數據泄露。 代理型攻擊者可自主規劃、適應並持續攻擊,無需人類干預。 Meta 開源 Astryx:一個面向智能體的 React 設計系統,包含 150+ 無障礙組件、七種主題和 CLI 2026-07-21 16:49 UTC+8 Meta 開源了其內部使用了八年的 React 設計系統 Astryx,覆蓋 13,000+ 應用。它提供 150+ 無障礙組件、七種主題、深色模式以及一個面向智能體的 CLI,採用 MIT 許可證,要求 React 19+。
Astryx 是 Meta 最大的內部設計系統,現以 MIT 許可證開源。 包含 150+ 無障礙 React 組件、七種主題、深色模式、模板和 CLI。 Wire AI:移動應用的AI原生增長工程師 2026-07-21 16:40 UTC+8 Wire AI是一款AI原生的移動應用增長工具,通過個性化用户旅程的A/B測試來提升激活率和留存率。其風險定價模式:若不改善激活,則免費使用。
Wire AI利用AI驅動的A/B測試,為每個用户個性化整個應用內體驗。 真實案例中,日安裝量從100提升至1000,引導完成率達93%。 NVIDIA 發佈 Cosmos 3 Edge:40億參數開放世界模型,實現設備端機器人動作推理與生成 2026-07-21 15:48 UTC+8 NVIDIA 推出 Cosmos 3 Edge,一個僅40億參數的開放世界模型,專為設備端運行設計。它能幫助機器人和視覺AI代理理解環境、實時推理,並在本地生成機器人動作。該模型是 Cosmos 3 系列的最小成員,此前已發佈160億參數的 Nano 和640億參數的 Super。Edge 型號針對內存受限的邊緣系統(如工廠、倉庫和醫院)提供數據中心級別的性能。
Cosmos 3 Edge 是一個40億參數的開放世界模型,於2026年7月20日在 Hugging Face 上發佈。 採用混合變換器架構,結合自迴歸推理塔和擴散生成塔,通過共享多模態注意力層協同工作。 MCP服務器中的ANSI轉義序列注入:對人隱藏,對AI可見 2026-07-21 15:01 UTC+8 ANSI轉義序列可被用於向AI代理隱藏指令,形成注入攻擊。本文介紹了兩種攻擊變體(直接獲取型和存儲型),並闡述瞭如何通過動態應用安全測試(DAST)自動檢測此類漏洞。
ANSI轉義序列在終端中不可見,但語言模型會逐字節讀取,形成攻擊面。 直接獲取型AESI通過惡意URL注入隱藏指令,存儲型AESI則持久化在存儲中並在後續讀取時觸發。 SteerPlane:為AI代理提供開源運行時護欄 2026-07-21 15:00 UTC+8 SteerPlane 是一個開源運行時護欄工具,通過一行代碼集成,為AI代理提供循環檢測、成本上限、策略執行和實時監控,支持多種框架和部署方式。
SteerPlane 通過裝飾器或上下文管理器為AI代理添加護欄,防止無限循環、成本失控和破壞性操作。 核心功能包括循環檢測、成本上限、流媒體網關、策略引擎和實時儀表板。 Storybook:AI MCP 2026-07-21 14:14 UTC+8 Storybook 發佈 AI 集成功能,通過 MCP 工具讓 AI 代理使用現有組件生成 UI,並利用 Storybook Test 進行自動化測試反饋,確保 UI 質量與一致性。
Storybook 為 AI 代理提供結構化 UI 上下文和測試反饋,促進組件複用而非幻覺。 AI 代理可基於現有組件生成 UI,並自動更新故事以反映變更。 傾轉旋翼垂直起降無人機INDI俯仰角速率控制器模型失配下的線性穩定性分析 2026-07-21 12:00 UTC+8 本文針對傾轉旋翼垂直起降無人機的增量非線性動態逆(INDI)俯仰角速率控制器,在模型失配條件下進行了線性穩定性分析。推導了閉環五階傳遞函數,並通過Routh-Hurwitz準則刻畫了穩定性。提出了魯棒性和性能導向的兩種調諧方法,發現控制效能失配(特別是符號錯誤)是最危險的失穩因素。
建立了包含控制器、估計器、執行器和被控對象的閉環五階傳遞函數模型 通過Routh-Hurwitz準則分析了三參數掃描下的穩定區域 重返博物館:對安卓機器人Andrea在有無情感模擬情況下的接受度研究 2026-07-21 12:00 UTC+8 一項研究讓安卓機器人Andrea再次在德國一家博物館連續六天與遊客進行多語言對話,實驗設置了三種情感模擬條件(無情感、ChatGPT 4.1驅動、WASABI架構),有73名遊客參與評估。結果顯示,情感模擬未能帶來積極影響,且未被遊客有意識地察覺。
安卓機器人Andrea重返博物館,具備多語言對話能力和博物館背景知識。 三種實驗條件:無情感、ChatGPT 4.1模擬情感、WASABI架構模擬情感。 從記憶到技能:基於證據的長期LLM代理協同進化治理 2026-07-21 12:00 UTC+8 現有長期LLM代理的記憶系統往往將先前軌跡作為被動上下文檢索,而非轉化為可執行能力。本文提出MSCE框架,一種無需訓練的記憶-技能協同進化框架,將代理經驗組織為基礎步驟軌跡、可重用過程策略和聲明性環境認知。MSCE將具有正估計增益的證據支持的L2策略結晶為可調用技能,並引入反射加權值回填。實驗表明MSCE顯著優於現有方法。
MSCE將代理經驗組織為基礎步驟軌跡、可重用過程策略和聲明性環境認知。 通過反射加權值回填,MSCE將稀疏終端反饋傳播至密集局部自我反思,產生證據校準的軌跡值。 RouteCost:一種受生產啓發的多階段框架,用於電子商務中的預訂單運費估算 2026-07-21 12:00 UTC+8 準確估算預訂單運費對於電子商務至關重要,因為它影響價格展示、利潤規劃和轉化率。RouteCost提出了一種多階段框架,將問題分解為時間感知需求預測、費用卡基線定價、殘差修正和代理箱合併推理,在超過25萬訂單和260種產品的18個月數據中提升了預測質量並保持了可解釋性。
預訂單運費估算受距離、目的地需求組合、計費重量等多種因素影響 RouteCost將問題分解為四個階段:時間感知需求預測、費用卡基線定價、殘差修正和代理箱合併推理 強化學習引導的NSGA-II結合灰色關聯繫數用於多目標優化:在納斯達克投資組合優化中的應用 2026-07-21 12:00 UTC+8 本文提出一種新型的強化學習引導的NSGA-II算法(RL-NSGA-II-GRC),通過引入灰色關聯繫數和強化學習代理,在解決多目標優化問題中顯著改善收斂性和Pareto前沿的多樣性。在Kursawe和CONSTR基準測試中,該算法相比傳統NSGA-II實現了約5.8%和4.4%的收斂改進,並在納斯達克投資組合優化中生成平滑且密集的有效前沿,識別出年化夏普比率為1.92的最大夏普比率投資組合。
提出RL-NSGA-II-GRC方法,結合強化學習代理自適應控制進化參數。 設計基於灰色關聯繫數的錦標賽選擇算子,綜合考慮支配等級、擁擠距離和理想參考點。 掩碼擴散語言模型成為智能體強化學習中強大且可操控的文本世界模型 2026-07-21 12:00 UTC+8 強化學習領域需要多樣化的訓練環境,但傳統手工設計的環境難以擴展。自迴歸世界模型存在從左到右的偏差,無法充分利用全局狀態信息。一項新研究提出使用掩碼擴散語言模型(MDLM)作為文本世界模型,通過雙向錨點感知去噪,在連貫性和多樣性上顯著優於參數規模大4倍的語言模型,並引入GRPO訓練框架實現高達47%的零樣本遷移性能提升。該工作已開源。
MDLM在文本世界建模中比自迴歸語言模型在連貫性和多樣性上表現更好。 雙向錨點感知去噪允許基於全局狀態錨點進行條件生成。 AI代理系統確定性重放框架agrepl 2026-07-21 12:00 UTC+8 AI代理系統因結合大語言模型與外部工具而本質非確定性。arXiv論文提出agrepl框架,通過MITM代理攔截外部交互,實現運行軌跡的確定性重放,並憑噪聲感知差異算法區分HTTP頭部變化。實驗顯示重放保真度F=1.0,單步延遲降低98.3%。
AI代理系統(LLM+工具/API)的運行本質上非確定,難以復現。 agrepl框架使用MITM代理記錄全部外部交互,並在隔離環境中重放。 PlanFlip:通過規劃階段提示注入攻擊多智能體LLM系統 2026-07-21 12:00 UTC+8 一項新研究提出PlanFlip框架,包含四種針對多智能體LLM系統規劃階段的提示注入攻擊。研究發現,更強的模型(如GPT-5)反而更易受攻擊,同質化骨幹網絡存在相關智能體盲點,而推理增強型模型(如DeepSeek-R1)能抵禦攻擊。提出的兩種防禦方法檢測率高達1.00。
PlanFlip引入四種針對多智能體系統規劃階段的提示注入攻擊。 更強的模型(如GPT-5)攻擊成功率更高,挑戰了能力即安全的假設。 一些大型語言模型表現出一致的風險態度 2026-07-21 12:00 UTC+8 一項新研究通過跨領域框架測試了大型語言模型(LLMs)在不確定性下的風險態度,發現大多數模型在任務內和跨任務中都表現出穩定且一致的風險偏好,且其風險態度分佈比人類更集中。
研究引入跨領域框架,將情境風險信念與類別決策分離,測試了6個LLM和100名人類參與者。 大多數LLM在空間導航、臨牀分診和財務分配任務中表現出穩健的任務內一致性。 [AINews] 今日似乎平靜,實則暗流湧動——AI新聞彙總7/18-7/20 2026-07-21 11:58 UTC+8 表面上平靜的一天,但實際充滿進展:美國政策瞄準中國開源模型,Kimi K3和Qwen 3.8取得進展,以智能體為中心的泛化方法獲得關注,模型展現出超人類數學能力。
美國考慮禁止中國尖端開源模型如Kimi,引發技術界反對。 Kimi K3在DesignArena排名第一;阿里巴巴確認Qwen 3.8 Max將開放權重。