輝達聯合清華大學等機構提出Gamma-World,透過單純形旋轉智慧體編碼、稀疏樞紐注意力和三階段蒸餾,解決了多智慧體世界建模中身份對稱性、互動效率和即時生成三大難題,實現從雙人資料訓練到四人場景的零樣本泛化。
AI 新聞即時情報
即時監測
即時更新
即時追蹤可信來源,保留出處、權限和站內閱讀模式,把噪音壓成可讀情報。
即時更新
Nous Research 的開源 Hermes Agent 新增了 Tool Search 功能,透過 BM25 漸進式模式披露,推遲載入 MCP 工具模式,減少令牌開銷並提高模型準確性。Anthropic 評估顯示,Claude Opus 4 準確率從49%提升至74%,Opus 4.5 從79.5%提升至88.1%。
mem9的故事始於一次客戶請求,從一個快速原型發展成一個完整產品。本文分享了構建智慧體記憶體的關鍵經驗:記憶體不僅僅是儲存問題,而是涉及攝取、排序、評估和產品判斷的工程挑戰。記憶體API本身不足以構成產品,使用者需要檢視、檢查、信任和糾正智慧體的記憶。此外,評估應成為記憶體產品的基礎設施,以使質量視覺化和可除錯。最後,智慧體記憶體不應侷限於文本,應向多模態發展。
Avai是一個開源的主機遙測工具,結合LLM威脅分類器,透過Docker執行,監控主機上的程序、USB、持久化、檔案完整性、瀏覽器擴充套件等26個方面,並利用17個威脅情報源和Claude類LLM給出惡意/可疑/未知/良性判定,無需代理、SIEM或雲控制平面。
在消化Anthropic重大新聞的間隙,我們重點介紹了AIE的新前向部署工程師計劃和創始人計劃,以及5月28-29日的AI新聞。主要話題包括:Claude Opus 4.8釋出及其基準測試爭議、多輪強化學習中的tokenization錯誤、開源模型與工具鏈進展、Google和OpenAI的Agent產品擴充套件,以及值得關注的研究論文。
一個研究專案展示了在2017年MacBook Air上,透過結合人類實驗者、Codex、llama.cpp、本地資料庫和IBM量子處理器取樣,將Qwen3-30B模型的推理速度從0.09 tokens/sec提升至14.03 tokens/sec,同時保持輸出連貫性。該方法並非在量子處理器上執行模型,而是用量子取樣最佳化推理配置。
AEDIS(先進經濟發展與基礎設施系統)是一個應對AI導致勞動力流失和消費需求崩潰的開源框架。它透過主權基礎設施信貸(SIC)和公共賬本實現資產支援的貨幣創造,採用模組化架構(通用核心+區域附件),幷包含防止通脹、腐敗捕獲等機制。該框架呼籲全球合作,計劃在24個月內獲得85%人口/GDP的臨界支援後同步啟動。
該專案首次實現了形式化驗證的多邊形交集演算法,利用 Lean 4 證明助手確保無限點集交集等式的正確性。開發過程藉助 AI 代理(Claude Opus 4.8)自動完成證明和實現,人類只需審查 87 行規格說明。文章介紹了演算法背景、驗證挑戰以及 AI 代理能力的演進。
透過分析1928年兒童小說《克拉科夫的號手》,本文探討了AI如何像故事中的魔法水晶一樣,只是反射使用者的偏見和錯誤,導致破壞性後果。作者認為AI削弱了人類批判性思維、創造力和同理心,並帶來環境問題。
本教程介紹AgentTrove——最大的開源代理互動軌跡集合之一,包含170萬條ShareGPT格式的軌跡。透過流式載入避免完全下載,學習標準化代理輪次、提取命令、分析軌跡,並將成功軌跡匯出為乾淨的SFT微調資料集。
Coresmith 推出 'Spec to Silicon' 服務,利用 LangGraph 將自然語言提示轉化為矽片設計規範。
本文探討了AI代幣成本與人類勞動力成本之間的權衡,以及這一新現實如何影響企業預算分配。
本文探討了AI如何大幅降低程式碼級決策的逆轉成本,從而重新定義軟體架構的邊界。作者認為,許多以往被視為架構的決策(如模組結構、框架選擇)已不再是架構問題,而資料架構、服務邊界和使用者信任等仍然難以更改。AI同時提升了可觀測性和業務戰略對齊的重要性。
本演示展示了使用Amazon Managed Grafana儀表板的全面可觀測性解決方案,為部署在Amazon SageMaker AI端點上的LLM提供質量和數量兩個維度的整體檢視。該方案涵蓋基礎設施指標(如GPU利用率、延遲、成本)和LLM質量指標(如相關性、安全性、語氣),幫助團隊檢測模型退化、最佳化資源並控制成本。
作者親身嘗試Claude Code等AI代理工具後,感到心理上的不適和依賴,如同合成阿片類藥物。他反思科技對人類的心理和生理入侵,決定減少對主流科技的依賴,並創辦印刷雜誌《Gift》以連線志同道合者。文章呼籲警惕AI代理帶來的依戀障礙,並提出了逐步迴歸模擬生活的四個層次。
Tabstack 是一個由 Mozilla 團隊開發的網路資料與自動化 API,無需維護爬蟲即可提取網頁結構資料並自動化瀏覽器。其新推出的 /research 端點允許在單一 API 呼叫中執行完整的網路研究代理,返回來自即時網路的帶引用答案。每個請求附帶可驗證的源 URL,來源選擇、資訊綜合與引用格式化均在呼叫內完成。支援 SSE 流式傳輸,即時顯示研究過程。適用於法律、金融和競爭情報等領域,首次 10,000 次呼叫免費。
輝達的X-Token解決了GOLD在跨分詞器知識蒸餾中的兩個結構性缺陷,在GSM8k等數學推理基準上取得了顯著改進。它利用投影矩陣和P-KL與H-KL損失之間的選擇機制來處理分詞器不匹配問題。
儘管企業客戶對Grok的興趣幾乎為零,AWS仍在談判將其新增到Bedrock平臺。分析認為這並非為了滿足客戶需求,而是為了推動自家Trainium晶片的部署,類似於此前與Anthropic和OpenAI的交易。
一位從未寫過程式碼的企業家,在2026年5月的21天裡,使用7個AI代理和5000美元的成本,意外構建了高管人才市場Bearhug Network。文章分享了他十年來的18次嘗試和最終的突破。
自5月28日起,ChatGPT在部分回應前新增了一條未公開的記憶檢查短語,OpenAI未作解釋。社群報告確認該行為影響多個賬戶和新對話,暗示是後端變更而非本地設定。這給企業部署帶來風險,因為輸出可預測性可能受影響。
Anthropic在Claude Code中引入了動態工作流,但作者認為更有效的架構是基於任務而非會話。本文闡述了為什麼任務樹架構更適合團隊協作,相比單一工作流模式更具優勢。
Flathub 更新了其生成式 AI 政策,明確禁止幾乎所有使用 AI 生成的應用程式和提交,僅對成熟且維護良好的專案給予例外。
答案引擎最佳化(AEO)與搜尋引擎最佳化(SEO)有本質區別:AI透過推理構建答案而非排名。本文提出機器優先架構,包括實體、答案、證據和模式四層,並強調實體圖譜對AI系統引用的關鍵作用。
Databricks Lakebase 的寫時複製資料庫分支功能,讓每個開發者都能擁有獨立的資料庫例項,從而解決了傳統共享資料庫的協作瓶頸。本文透過開發者Jen的故事,展示了從遷移指令碼編寫到測試的全新工作流,實現了更快速、更安全的資料庫變更。
施耐德電氣首席AI官Philippe Rambach分享了將AI從實驗轉化為規模化部署的關鍵:將AI視為產品開發而非創新,透過集線器-輪輻模型組建端到端團隊,圍繞業務價值對齊,並利用Databricks等平臺統一資料與AI能力。
一位開發者透過自建工具CodeBurn追蹤AI編碼API支出,發現30天內$7,890的支出中僅47.9%用於實際編碼,其餘花費在探索程式碼庫、除錯、委託子代理和對話上。文章詳細介紹了CodeBurn的功能,包括儀表盤、模型對比、浪費檢測、產出追蹤等。
最新研究表明,儘管消費者難以區分AI生成與人類創作的廣告和文章,但人類創作的內容在吸引力和效果上仍顯著優於AI內容。AI內容在搜尋排名和使用者參與度方面遠不及人類內容,尤其是在高價值渠道中。
Step 3.7 Flash 是一款 198B 稀疏 MoE 模型,擁有約 11B 活躍引數、原生視覺能力和 256K 上下文視窗。在編碼基準測試上相比前代大幅提升,支援 Advisor Mode 實現高價效比的智慧體推理,並以 Apache 2.0 許可證開源。
蘋果Mac Mini M4 Pro和Mac Studio大記憶體型號因本地AI需求激增而缺貨。本地自主AI代理(如OpenClaw)興起推動硬體搶購。但即便慷慨估算,購買128GB記憶體的本地裝置(如GMKtec EVO-X2,3299美元)執行Gemma 4模型,需2.6年才能透過節省API費用回本。
Brilliant推出全新AI導師Koji,為數學和程式設計提供個性化輔導。該導師能自適應學習水平,在螢幕上標註講解,支援語音和文本交流,由MIT、哈佛和斯坦福的學習專家打造。