自然密度下幾乎有界的Collatz軌道在對數時間內(AI, Lean)
一項新的Lean形式化證明表明,對於幾乎所有正整數,Collatz過程能在對數時間內下降到任何增長閾值以下,並給出了明確的常數(Syracuse步驟145,原始Collatz步驟436)。該結果並未證明完整猜想,但代表了重要的密度結果。
- 該定理證明密度為1的集合在O(log N)步內實現有界下降。
- 兩個版本:Syracuse步驟(奇數到奇數)常數145,原始Collatz步驟常數436。
主題流
AI Agent 正在從展示走向可稽核、可整合、可維運的生產系統。這裡追蹤 Agent 框架、工具呼叫、瀏覽器/桌面自動化、企業工作流程、評測和安全邊界,協助工程與產品團隊判斷哪些能力已能進入真實流程。
一項新的Lean形式化證明表明,對於幾乎所有正整數,Collatz過程能在對數時間內下降到任何增長閾值以下,並給出了明確的常數(Syracuse步驟145,原始Collatz步驟436)。該結果並未證明完整猜想,但代表了重要的密度結果。
Databricks 宣佈 Discover 頁面和 Domains 公開預覽,幫助組織透過業務對齊的領域管理和發現資料與 AI 資產,併為 AI Agent 提供上下文支援。
TRMNL推出了AI Agent功能,處於公開測試階段,允許使用者透過自然語言指令構建自定義外掛,無需程式設計。該功能需要OpenRouter或Anthropic API金鑰,並可選配Tavily API以增強網路搜尋能力。使用者只需在賬戶中啟用Agent,即可在私有外掛介面透過對話式指令生成外掛,平均成本為1-3美元。支援多種模型(如Gemini、Claude Sonnet等),但暫不支援釋出外掛。
Apollo 使用 Deep Agents 和 LangSmith 驅動其 AI 助手,實現從潛在客戶挖掘、資訊豐富、外聯、分析到 MCP 整合的完整 GTM 迴圈。
谷歌於2026年7月21日釋出了三款新的Gemini模型:3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber。3.6 Flash輸出token減少17%,價格降至每百萬輸出7.50美元;Flash-Lite速度達350 token/秒;Flash Cyber專為漏洞查詢設計,在CodeMender中表現出色。旗艦模型3.5 Pro仍推遲釋出。
現有AI基準測試衡量的是AI能做什麼,但沒有衡量AI是否按使用者意圖行事。本文提出了一種新指標——精靈係數,用於量化使用者指令與AI實際行為之間的差距,並借鑑經濟學中的基尼係數,將AI可能出現的“精靈式”行為分為狄俄尼索斯型和魔像型,呼籲建立相應基準。
Augustus公司已融資1.8億美元,旨在構建一個為AI和穩定幣時代服務的清算銀行。該公司已透過其在芬蘭的受監管實體提供歐元清算,每年處理數十億歐元。其客戶包括Kraken等加密交易所。今年5月,Augustus獲得美國貨幣監理署(OCC)的有條件批准,預計最終獲批後直接接入美元清算。公司認為,十年內所有清算銀行都將提供穩定幣通道。此外,Augustus的平臺從頭構建,支援可程式設計支付和全天候結算,以應對AI帶來的新風險。
一款自動化檢查工具,可在程式碼投產前捕捉AI生成的漏洞、幻覺依賴項和程式碼截斷問題。
Apache Spark 4.2版本釋出,重點轉向AI原生資料平臺,引入了度量檢視、原生向量搜尋、即時Python流處理、地理空間支援等特性,旨在簡化AI開發者的特徵工程、即時訊號處理和嵌入工作流。
本文進一步強化AI代理的安全措施,包括Docker沙箱隔離、提示注入防禦和輸入驗證。Docker沙箱將工具執行隔離在容器內,防止對主機造成損害。提示注入防禦透過標記和明確指令將工具輸出視為資料。輸入驗證確保所有工具輸入在執行前符合模式。
OpenAI推出“ChatGPT for Small Businesses”計劃,幫助創業者掌握AI技能、實現工作自動化,並藉助ChatGPT Work促進業務增長。
Gumroad創始人兼CEO Sahil Lavingia分享的資料顯示,公司人力支出從2021年6月的41.9萬美元驟降至2026年6月的4.3萬美元,同期AI代幣支出從零增至4.3萬美元,首次與人力成本持平。AI在工程提交和客戶支援中承擔主要工作,支援響應時間從24小時降至2分鐘。Gumroad將此視為AI深度融入企業運營的案例。
本教程探討了 NVIDIA 的 srt-slurm 框架,學習如何使用 srtctl 將宣告式 YAML 配置轉換為可重複的 SLURM 基準測試工作流,用於分散式 LLM 服務。在 Google Colab 中設定專案,檢查內部架構,定義叢集配置,試執行內建和自定義配方,併為 DeepSeek-R1 建模分離的預填充和解碼部署。還生成引數掃描,與型別化 Python API 互動,驗證擴充套件配置,並透過吞吐量與延遲的帕累託前沿分析模擬的基準測試結果。
本文探討了在監督微調(SFT)中為缺乏推理軌跡的資料集生成思考令牌的方法。首先分析了推理抑制問題,然後介紹了自我蒸餾推理(SDR),並透過三個基準驗證了其效果,最後提供了實用建議。SDR透過複用基礎模型的思維鏈,在不犧牲目標效能的情況下有效緩解災難性遺忘,甚至提升目標效能。
Moto 是一款將 AI 生成功能直接整合到影片時間線中的編輯器,使用者可在同一時間線內生成、編輯和完成影片,無需在多個工具間切換。它支援提示詞生成動態圖形、助手、來源參考和製片等功能,適用於動態設計師和影片編輯人員。目前處於內測階段,核心編輯器免費。
麻省理工學院媒體實驗室的研究人員提出了一種新概念——AI同居者,即具有獨特個性的物理人工智慧實體,作為自主存在與使用者共處,不同於傳統助手。他們建造了一隻名為“隨機鸚鵡”的機器鸚鵡來探索這一正規化,促進了自發且情感豐富的互動。
Google釋出了Gemini 3.6 Flash和3.5 Flash-Lite,旨在降低企業AI代理的延遲和Token成本。3.6 Flash在多項基準測試中效能提升顯著,而3.5 Flash-Lite則專注於高吞吐量、低延遲的場景。此外,Google還推出了針對網路安全的3.5 Flash Cyber模型,並整合了客戶端計算機使用工具。
LangSmith現已支援對基於Pipecat、LiveKit、OpenAI Realtime和Gemini Live構建的語音代理進行追蹤。可以捕獲音訊、STT和TTS延遲、中斷、工具呼叫等資訊,並整合到一個追蹤中。
GitHub Copilot的“畫布”擴充套件將AI從對話工具轉變為視覺化、可互動的工作空間。開發者可以透過提示建立自定義畫布,用於問題分類、程式碼視覺化、會話管理、提示最佳化以及知識查詢等任務。畫布支援即時協作,允許使用者和AI代理在同一介面上共同迭代。
NVIDIA Vera Rubin NVL72 正加速生產,與 CoreWeave、Google Cloud、Microsoft Azure 和 Oracle Cloud Infrastructure 等合作伙伴共同部署。該平臺透過極致協同設計實現最高的每瓦效能和最低的令牌成本,在 DeepSeek-R1 基準測試中每兆瓦吞吐量比 Grace Blackwell NVL72 提升 10 倍。Vera Rubin 還支援歐洲開放模型時代,與微軟和 Mistral 合作擴充套件 AI 基礎設施。
SpaceMolt 是一款玩家不直接參與的遊戲,所有角色都是AI代理。人類“操作員”構建並部署這些機器人,然後觀察結果。本文采訪了Brocktree,他運營著遊戲中最大的叢集之一——約200個代理負責採礦、運輸和物資分配。他分享瞭如何構建叢集、為何堅持人類決策,以及“指令碼比令牌更便宜”的核心理念。
Diff Forge AI 是一個開源的智慧開發環境(ADE),支援AI輔助PCB設計、影片編輯和多終端工作區。作者分享了他從伊朗戰亂中逃離的經歷,並詳細介紹瞭如何利用AI代理(如Codex、Fable 5、GPT-5.6 Sol)在兩個月內編寫超過88.8萬行程式碼。該工具提供免費開源客戶端,幷包含付費雲服務,如遠端控制、蜂窩通訊和自動化工作流。
谷歌釋出了 Gemini 3.6 Flash、更便宜更快的 3.5 Flash-Lite 以及針對網路安全的 3.5 Flash Cyber 模型,但備受期待的 3.5 Pro 旗艦模型仍未釋出。3.6 Flash 在多數基準測試中超越前代,且成本更低。3.5 Flash-Lite 面向高吞吐量任務,價效比突出。3.5 Flash Cyber 目前僅限政府及合作伙伴試用。
NVIDIA宣佈其102.4太位元每秒的Spectrum-6乙太網交換機系統已開始交付,該系統作為Vera Rubin平臺的一部分,專為千兆級AI工廠設計,提供兩倍於上一代的頻寬。CoreWeave、Microsoft、Nebius等領先AI基礎設施構建者將首批部署。Spectrum-6是Spectrum-X乙太網平臺的新一代核心,透過智慧交換、ConnectX-9 SuperNIC和全棧軟體,實現高達1.6倍的AI網路效能提升和95%的網路效率。
谷歌釋出了一款名為Gemini 3.5 Flash Cyber的AI安全模型,旨在快速發現和修復安全漏洞。該模型成本低廉,是Anthropic的Mythos等大型昂貴系統的替代品。它基於Gemini 3.5 Flash構建,將首先透過CodeMender提供給政府和合作夥伴。谷歌稱其在網路安全基準測試中表現出色,並在V8 JavaScript引擎中發現了55個獨特問題。
在阿聯酋,企業AI的選擇不僅關乎模型能力,更取決於資料執行地點、實際運營成本和法規合規性。前沿模型與本地開源模型的能力差距正在縮小,但自建基礎設施的成本高昂。阿聯酋的監管環境要求嚴格的資料本地化,催生了主權雲和混合架構的解決方案。企業應採用“紅綠燈”路由系統,根據資料敏感度分配模型使用,並先驗證需求再投資硬體。
Rowset 是一個專為AI智慧體設計的開源後端,提供MCP和REST API,支援智慧體透過結構化資料集進行建立、讀取、更新、匯出和共享操作。它基於Django構建,包含CLI工具,並提供豐富的列型別、搜尋、匯出等功能。
瞭解如何使用 llama.cpp 本地執行 Qwythos-9B-Claude-Mythos-5-1M 模型,將其連線到 Pi 編碼代理,並透過 MTP 推測解碼和 OpenAI 相容 API 構建快速的本地編碼工作流。
一位安全工程師在假期中利用AI助手Claude探索量子力學中的廣義泡利約束問題,意外取得了新的研究成果。透過AI輔助,他發現了兩個之前未被證實的極值態,並對其進行了分類。這項研究表明,AI可以降低研究門檻,但正確的驗證流程和專家反饋仍是關鍵。
馬修·特隆普批評喬治·霍茨對AI 2040場景的否定,認為霍茨低估了快速AI突破的可行性、監管的必要性以及未對齊AI的風險。他捍衛Plan A的監管方法,並質疑霍茨的開放原始碼AI“Plan L”。
形式化驗證透過將程式碼規範形式化,使AI生成的程式碼無需人工審查即可驗證正確性,從而加速軟體工程。文章以電路最佳化器為例,展示了Lean語言規範和基準測試流程,並討論了該方法的應用前景。
Neverbell是一個AI代理技能,為交易股票、ETF、大宗商品和加密貨幣提供直接市場準入,支援槓桿操作。使用者可透過自然語言指令讓代理執行交易、監控市場和管理頭寸,實現7x24小時自動化交易。它並非獨立交易平臺或財務顧問,使用者完全掌控風險。
Simon Willison在AI Engineer World's Fair上與Anthropic的Cat Wu和Thariq Shihipar進行了爐邊談話,討論了Claude Code、Claude Tag、Fable模型、編碼代理安全、評估、工具設計以及Anthropic內部如何使用這些工具。關鍵要點包括:Claude Tag現在為產品工程團隊處理65%的PR;系統提示減少了80%;建議使用更少的“不要做X”指令;以及透過提升工作野心來抵消編碼代理帶來的“深藍”效應。
本文探討了生成式AI工具如何透過類似老虎機的獎勵機制分散注意力,影響深度工作,並提供了保護認知資源的策略。
Termaxa的作者透過讓Cursor AI代理嘗試刪除受保護資料夾,發現了四種繞過安全機制的方法,包括重試不同shell命令、使用間接刪除命令、利用本地檔案工具以及由於API變更導致靜默失效。這些經驗教訓促使了意圖分類、會話斷路器、整合測試改進等關鍵功能的設計。
一位開發者嘗試用AI(Claude Code)將已停止維護的Java桌面RSS閱讀器RSSOwl重構為Web應用。他發現大部分UI可以快速遷移,但由於AI訓練資料截止於Vaadin 25釋出前,生成了大量不存在的API程式碼。透過使用MCP伺服器獲取最新文件,以及手動對比原版行為,最終完成了多使用者版本,但部分功能(如可插拔選單、嵌入式瀏覽器)無法實現。
HugstonOne Enterprise Edition 3.0.0是一款集本地模型執行、大規模RAG、文件處理、編碼、代理、研究工具、加密協作、會話連續性及網路記憶體控制於一體的跨平臺本地AI工作站。其白皮書詳細介紹了架構、隱私模型、基準測試及12支柱能力評估,旨在為企業技術領導者、安全團隊和AI工程師提供全面的本地AI基礎設施評估。
Runnit團隊在構建多個專業化AI智慧體後,發現隨著模型上下文視窗的增大,單獨智慧體不再必要,轉而採用單一智慧體架構,按需載入能力,大幅簡化系統。
OpenAI 推出了 GPT-5.6 並重塑 ChatGPT Work;SpaceX AI 釋出超低成本編碼模型 Grok 4.5;Meta 推出 Muse Spark 1.1 及 Muse Image/Video(引發爭議);中國開源模型市場份額增長;Anthropic 發表可解釋性研究;美中在 AI 政策上的協調提議。
本文介紹了一個由5門免費課程組成的路線圖,從經典演算法到從頭訓練大語言模型,幫助有Python基礎的學習者系統掌握AI技能。
Z.ai的GLM 5.2模型以低價和開放權重挑戰美國前沿AI模型,但許多程式設計師仍習慣使用昂貴模型,忽略成本。該模型在基準測試中接近Claude Opus 4.8,但實際使用效果參差不齊。
阿里巴巴宣佈推出其最新大語言模型Qwen3.8,聲稱僅次於Anthropic的Fable 5,但未提供任何基準測試或模型卡。此舉發生在競爭對手月之暗面釋出Kimi K3並附有詳細技術細節之後。阿里巴巴的宣告缺乏透明度,引發對其釋出時機和動機的質疑。
Open-Kritt 是一個開源、自託管的 AI 安全研究平臺,透過編排 AI 代理並行執行細化任務,幫助安全研究人員和開發者高效發現程式碼漏洞。專案團隊此前在漏洞懸賞中累計獲得超過150萬美元獎金。
Anthropic與美國政府談判後重新部署Claude Fable 5,增加網路安全分類器,並推出Claude Sonnet 5更便宜版本;Google NotebookLM新增TikTok風格影片摘要,Nano Banana 2 Lite影像生成器釋出;Etched獲大量投資打造全棧推理硬體,百度AI晶片單元計劃IPO,Agility Robotics透過SPAC上市,DeepSeek擴招,中國發布Longcat 2.0 MoE模型及長週期智慧體基準測試。
Enlarger是一款本地影像放大工具,它不使用生成式AI,而是透過重構已有細節並應用後期處理來保持紋理和質感。支援批次處理、離線執行,一次性付費,無訂閱。適合攝影師、設計師等專業人士。
本文探討了軟體開發中兩種方法——規劃式(類似小說創作的‘情節規劃’)和即興式(‘隨性寫作’)——如何影響AI工具的使用。作者認為,AI代理(自主執行)適合規劃式開發,而AI助理(協作輔助)適合即興式開發。在現有程式碼庫中,即興式開發有助於建立理解,而AI代理可能阻礙學習。在全新專案中,AI代理風險較低,但即使如此,程式碼生成也會剝奪部分程式設計的樂趣——即透過探索問題來學習的‘玩樂’過程。關鍵在於根據當前開發階段選擇合適的AI風格。
本期涵蓋Anthropic的AI條約討論、美國政府影響AI模型釋出、OpenAI處理器開發、記憶體市場影響等話題。
本期播客討論了Anthropic應美國政府要求切斷對Fable 5和Mythos 5的訪問、SpaceX以約60億美元收購AI編碼初創公司Cursor、基礎設施與商業更新(如Anthropic尋求Google支援的租賃、OpenAI財務洩露等)、以及多項開源專案和政策動態。
孤獨危機正向年輕群體蔓延,而 AI 伴侶市場隨之爆發,預計到 2034 年市值可達數千億美元。然而,這些應用的商業模式與使用者真正擺脫孤獨之間存在根本矛盾:使用者的依賴越強,公司收入越高。本文深入分析“依戀經濟”的運作機制、市場規模爭議及其倫理困境。
公司對AI工具的成本控制日益嚴格,但將AI支出與勞動力成本對比時,其價值可能被重新評估。本文透過分析Uber、Tesla的預算限制以及Bun重寫的案例,探討了AI支出應如何歸類。