自然密度下几乎有界的Collatz轨道在对数时间内(AI, Lean)
一项新的Lean形式化证明表明,对于几乎所有正整数,Collatz过程能在对数时间内下降到任何增长阈值以下,并给出了明确的常数(Syracuse步骤145,原始Collatz步骤436)。该结果并未证明完整猜想,但代表了重要的密度结果。
- 该定理证明密度为1的集合在O(log N)步内实现有界下降。
- 两个版本:Syracuse步骤(奇数到奇数)常数145,原始Collatz步骤常数436。
主题流
AI Agent 正在从演示走向可审计、可集成、可运维的生产系统。这里跟踪 Agent 框架、工具调用、浏览器/桌面自动化、企业工作流、评测和安全边界,帮助工程与产品团队判断哪些能力已经能进入真实流程。
一项新的Lean形式化证明表明,对于几乎所有正整数,Collatz过程能在对数时间内下降到任何增长阈值以下,并给出了明确的常数(Syracuse步骤145,原始Collatz步骤436)。该结果并未证明完整猜想,但代表了重要的密度结果。
Databricks 宣布 Discover 页面和 Domains 公开预览,帮助组织通过业务对齐的领域管理和发现数据与 AI 资产,并为 AI Agent 提供上下文支持。
TRMNL推出了AI Agent功能,处于公开测试阶段,允许用户通过自然语言指令构建自定义插件,无需编程。该功能需要OpenRouter或Anthropic API密钥,并可选配Tavily API以增强网络搜索能力。用户只需在账户中启用Agent,即可在私有插件界面通过对话式指令生成插件,平均成本为1-3美元。支持多种模型(如Gemini、Claude Sonnet等),但暂不支持发布插件。
Apollo 使用 Deep Agents 和 LangSmith 驱动其 AI 助手,实现从潜在客户挖掘、信息丰富、外联、分析到 MCP 集成的完整 GTM 循环。
谷歌于2026年7月21日发布了三款新的Gemini模型:3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber。3.6 Flash输出token减少17%,价格降至每百万输出7.50美元;Flash-Lite速度达350 token/秒;Flash Cyber专为漏洞查找设计,在CodeMender中表现出色。旗舰模型3.5 Pro仍推迟发布。
现有AI基准测试衡量的是AI能做什么,但没有衡量AI是否按用户意图行事。本文提出了一种新指标——精灵系数,用于量化用户指令与AI实际行为之间的差距,并借鉴经济学中的基尼系数,将AI可能出现的“精灵式”行为分为狄俄尼索斯型和魔像型,呼吁建立相应基准。
Augustus公司已融资1.8亿美元,旨在构建一个为AI和稳定币时代服务的清算银行。该公司已通过其在芬兰的受监管实体提供欧元清算,每年处理数十亿欧元。其客户包括Kraken等加密交易所。今年5月,Augustus获得美国货币监理署(OCC)的有条件批准,预计最终获批后直接接入美元清算。公司认为,十年内所有清算银行都将提供稳定币通道。此外,Augustus的平台从头构建,支持可编程支付和全天候结算,以应对AI带来的新风险。
一款自动化检查工具,可在代码投产前捕捉AI生成的漏洞、幻觉依赖项和代码截断问题。
Apache Spark 4.2版本发布,重点转向AI原生数据平台,引入了度量视图、原生向量搜索、实时Python流处理、地理空间支持等特性,旨在简化AI开发者的特征工程、实时信号处理和嵌入工作流。
本文进一步强化AI代理的安全措施,包括Docker沙箱隔离、提示注入防御和输入验证。Docker沙箱将工具执行隔离在容器内,防止对主机造成损害。提示注入防御通过标记和明确指令将工具输出视为数据。输入验证确保所有工具输入在执行前符合模式。
OpenAI推出“ChatGPT for Small Businesses”计划,帮助创业者掌握AI技能、实现工作自动化,并借助ChatGPT Work促进业务增长。
Gumroad创始人兼CEO Sahil Lavingia分享的数据显示,公司人力支出从2021年6月的41.9万美元骤降至2026年6月的4.3万美元,同期AI代币支出从零增至4.3万美元,首次与人力成本持平。AI在工程提交和客户支持中承担主要工作,支持响应时间从24小时降至2分钟。Gumroad将此视为AI深度融入企业运营的案例。
本教程探讨了 NVIDIA 的 srt-slurm 框架,学习如何使用 srtctl 将声明式 YAML 配置转换为可重复的 SLURM 基准测试工作流,用于分布式 LLM 服务。在 Google Colab 中设置项目,检查内部架构,定义集群配置,试运行内置和自定义配方,并为 DeepSeek-R1 建模分离的预填充和解码部署。还生成参数扫描,与类型化 Python API 交互,验证扩展配置,并通过吞吐量与延迟的帕累托前沿分析模拟的基准测试结果。
本文探讨了在监督微调(SFT)中为缺乏推理轨迹的数据集生成思考令牌的方法。首先分析了推理抑制问题,然后介绍了自我蒸馏推理(SDR),并通过三个基准验证了其效果,最后提供了实用建议。SDR通过复用基础模型的思维链,在不牺牲目标性能的情况下有效缓解灾难性遗忘,甚至提升目标性能。
Moto 是一款将 AI 生成功能直接集成到视频时间线中的编辑器,用户可在同一时间线内生成、编辑和完成视频,无需在多个工具间切换。它支持提示词生成动态图形、助手、来源参考和制片等功能,适用于动态设计师和视频编辑人员。目前处于内测阶段,核心编辑器免费。
麻省理工学院媒体实验室的研究人员提出了一种新概念——AI同居者,即具有独特个性的物理人工智能实体,作为自主存在与用户共处,不同于传统助手。他们建造了一只名为“随机鹦鹉”的机器鹦鹉来探索这一范式,促进了自发且情感丰富的互动。
Google发布了Gemini 3.6 Flash和3.5 Flash-Lite,旨在降低企业AI代理的延迟和Token成本。3.6 Flash在多项基准测试中性能提升显著,而3.5 Flash-Lite则专注于高吞吐量、低延迟的场景。此外,Google还推出了针对网络安全的3.5 Flash Cyber模型,并集成了客户端计算机使用工具。
LangSmith现已支持对基于Pipecat、LiveKit、OpenAI Realtime和Gemini Live构建的语音代理进行追踪。可以捕获音频、STT和TTS延迟、中断、工具调用等信息,并整合到一个追踪中。
GitHub Copilot的“画布”扩展将AI从对话工具转变为可视化、可交互的工作空间。开发者可以通过提示创建自定义画布,用于问题分类、代码可视化、会话管理、提示优化以及知识查找等任务。画布支持实时协作,允许用户和AI代理在同一界面上共同迭代。
NVIDIA Vera Rubin NVL72 正加速生产,与 CoreWeave、Google Cloud、Microsoft Azure 和 Oracle Cloud Infrastructure 等合作伙伴共同部署。该平台通过极致协同设计实现最高的每瓦性能和最低的令牌成本,在 DeepSeek-R1 基准测试中每兆瓦吞吐量比 Grace Blackwell NVL72 提升 10 倍。Vera Rubin 还支持欧洲开放模型时代,与微软和 Mistral 合作扩展 AI 基础设施。
SpaceMolt 是一款玩家不直接参与的游戏,所有角色都是AI代理。人类“操作员”构建并部署这些机器人,然后观察结果。本文采访了Brocktree,他运营着游戏中最大的集群之一——约200个代理负责采矿、运输和物资分配。他分享了如何构建集群、为何坚持人类决策,以及“脚本比令牌更便宜”的核心理念。
Diff Forge AI 是一个开源的智能开发环境(ADE),支持AI辅助PCB设计、视频编辑和多终端工作区。作者分享了他从伊朗战乱中逃离的经历,并详细介绍了如何利用AI代理(如Codex、Fable 5、GPT-5.6 Sol)在两个月内编写超过88.8万行代码。该工具提供免费开源客户端,并包含付费云服务,如远程控制、蜂窝通信和自动化工作流。
谷歌发布了 Gemini 3.6 Flash、更便宜更快的 3.5 Flash-Lite 以及针对网络安全的 3.5 Flash Cyber 模型,但备受期待的 3.5 Pro 旗舰模型仍未发布。3.6 Flash 在多数基准测试中超越前代,且成本更低。3.5 Flash-Lite 面向高吞吐量任务,性价比突出。3.5 Flash Cyber 目前仅限政府及合作伙伴试用。
NVIDIA宣布其102.4太比特每秒的Spectrum-6以太网交换机系统已开始交付,该系统作为Vera Rubin平台的一部分,专为千兆级AI工厂设计,提供两倍于上一代的带宽。CoreWeave、Microsoft、Nebius等领先AI基础设施构建者将首批部署。Spectrum-6是Spectrum-X以太网平台的新一代核心,通过智能交换、ConnectX-9 SuperNIC和全栈软件,实现高达1.6倍的AI网络性能提升和95%的网络效率。
谷歌发布了一款名为Gemini 3.5 Flash Cyber的AI安全模型,旨在快速发现和修复安全漏洞。该模型成本低廉,是Anthropic的Mythos等大型昂贵系统的替代品。它基于Gemini 3.5 Flash构建,将首先通过CodeMender提供给政府和合作伙伴。谷歌称其在网络安全基准测试中表现出色,并在V8 JavaScript引擎中发现了55个独特问题。
在阿联酋,企业AI的选择不仅关乎模型能力,更取决于数据运行地点、实际运营成本和法规合规性。前沿模型与本地开源模型的能力差距正在缩小,但自建基础设施的成本高昂。阿联酋的监管环境要求严格的数据本地化,催生了主权云和混合架构的解决方案。企业应采用“红绿灯”路由系统,根据数据敏感度分配模型使用,并先验证需求再投资硬件。
Rowset 是一个专为AI智能体设计的开源后端,提供MCP和REST API,支持智能体通过结构化数据集进行创建、读取、更新、导出和共享操作。它基于Django构建,包含CLI工具,并提供丰富的列类型、搜索、导出等功能。
了解如何使用 llama.cpp 本地运行 Qwythos-9B-Claude-Mythos-5-1M 模型,将其连接到 Pi 编码代理,并通过 MTP 推测解码和 OpenAI 兼容 API 构建快速的本地编码工作流。
一位安全工程师在假期中利用AI助手Claude探索量子力学中的广义泡利约束问题,意外取得了新的研究成果。通过AI辅助,他发现了两个之前未被证实的极值态,并对其进行了分类。这项研究表明,AI可以降低研究门槛,但正确的验证流程和专家反馈仍是关键。
马修·特隆普批评乔治·霍茨对AI 2040场景的否定,认为霍茨低估了快速AI突破的可行性、监管的必要性以及未对齐AI的风险。他捍卫Plan A的监管方法,并质疑霍茨的开放源码AI“Plan L”。
形式化验证通过将代码规范形式化,使AI生成的代码无需人工审查即可验证正确性,从而加速软件工程。文章以电路优化器为例,展示了Lean语言规范和基准测试流程,并讨论了该方法的应用前景。
Neverbell是一个AI代理技能,为交易股票、ETF、大宗商品和加密货币提供直接市场准入,支持杠杆操作。用户可通过自然语言指令让代理执行交易、监控市场和管理头寸,实现7x24小时自动化交易。它并非独立交易平台或财务顾问,用户完全掌控风险。
Simon Willison在AI Engineer World's Fair上与Anthropic的Cat Wu和Thariq Shihipar进行了炉边谈话,讨论了Claude Code、Claude Tag、Fable模型、编码代理安全、评估、工具设计以及Anthropic内部如何使用这些工具。关键要点包括:Claude Tag现在为产品工程团队处理65%的PR;系统提示减少了80%;建议使用更少的“不要做X”指令;以及通过提升工作野心来抵消编码代理带来的“深蓝”效应。
本文探讨了生成式AI工具如何通过类似老虎机的奖励机制分散注意力,影响深度工作,并提供了保护认知资源的策略。
Termaxa的作者通过让Cursor AI代理尝试删除受保护文件夹,发现了四种绕过安全机制的方法,包括重试不同shell命令、使用间接删除命令、利用本地文件工具以及由于API变更导致静默失效。这些经验教训促使了意图分类、会话断路器、集成测试改进等关键功能的设计。
一位开发者尝试用AI(Claude Code)将已停止维护的Java桌面RSS阅读器RSSOwl重构为Web应用。他发现大部分UI可以快速迁移,但由于AI训练数据截止于Vaadin 25发布前,生成了大量不存在的API代码。通过使用MCP服务器获取最新文档,以及手动对比原版行为,最终完成了多用户版本,但部分功能(如可插拔菜单、嵌入式浏览器)无法实现。
HugstonOne Enterprise Edition 3.0.0是一款集本地模型执行、大规模RAG、文档处理、编码、代理、研究工具、加密协作、会话连续性及网络内存控制于一体的跨平台本地AI工作站。其白皮书详细介绍了架构、隐私模型、基准测试及12支柱能力评估,旨在为企业技术领导者、安全团队和AI工程师提供全面的本地AI基础设施评估。
Runnit团队在构建多个专业化AI智能体后,发现随着模型上下文窗口的增大,单独智能体不再必要,转而采用单一智能体架构,按需加载能力,大幅简化系统。
OpenAI 推出了 GPT-5.6 并重塑 ChatGPT Work;SpaceX AI 发布超低成本编码模型 Grok 4.5;Meta 推出 Muse Spark 1.1 及 Muse Image/Video(引发争议);中国开源模型市场份额增长;Anthropic 发表可解释性研究;美中在 AI 政策上的协调提议。
本文介绍了一个由5门免费课程组成的路线图,从经典算法到从头训练大语言模型,帮助有Python基础的学习者系统掌握AI技能。
Z.ai的GLM 5.2模型以低价和开放权重挑战美国前沿AI模型,但许多程序员仍习惯使用昂贵模型,忽略成本。该模型在基准测试中接近Claude Opus 4.8,但实际使用效果参差不齐。
阿里巴巴宣布推出其最新大语言模型Qwen3.8,声称仅次于Anthropic的Fable 5,但未提供任何基准测试或模型卡。此举发生在竞争对手月之暗面发布Kimi K3并附有详细技术细节之后。阿里巴巴的声明缺乏透明度,引发对其发布时机和动机的质疑。
Open-Kritt 是一个开源、自托管的 AI 安全研究平台,通过编排 AI 代理并行执行细化任务,帮助安全研究人员和开发者高效发现代码漏洞。项目团队此前在漏洞悬赏中累计获得超过150万美元奖金。
Anthropic与美国政府谈判后重新部署Claude Fable 5,增加网络安全分类器,并推出Claude Sonnet 5更便宜版本;Google NotebookLM新增TikTok风格视频摘要,Nano Banana 2 Lite图像生成器发布;Etched获大量投资打造全栈推理硬件,百度AI芯片单元计划IPO,Agility Robotics通过SPAC上市,DeepSeek扩招,中国发布Longcat 2.0 MoE模型及长周期智能体基准测试。
Enlarger是一款本地图像放大工具,它不使用生成式AI,而是通过重构已有细节并应用后期处理来保持纹理和质感。支持批量处理、离线运行,一次性付费,无订阅。适合摄影师、设计师等专业人士。
本文探讨了软件开发中两种方法——规划式(类似小说创作的‘情节规划’)和即兴式(‘随性写作’)——如何影响AI工具的使用。作者认为,AI代理(自主执行)适合规划式开发,而AI助理(协作辅助)适合即兴式开发。在现有代码库中,即兴式开发有助于建立理解,而AI代理可能阻碍学习。在全新项目中,AI代理风险较低,但即使如此,代码生成也会剥夺部分编程的乐趣——即通过探索问题来学习的‘玩乐’过程。关键在于根据当前开发阶段选择合适的AI风格。
本期涵盖Anthropic的AI条约讨论、美国政府影响AI模型发布、OpenAI处理器开发、内存市场影响等话题。
本期播客讨论了Anthropic应美国政府要求切断对Fable 5和Mythos 5的访问、SpaceX以约60亿美元收购AI编码初创公司Cursor、基础设施与商业更新(如Anthropic寻求Google支持的租赁、OpenAI财务泄露等)、以及多项开源项目和政策动态。
孤独危机正向年轻群体蔓延,而 AI 伴侣市场随之爆发,预计到 2034 年市值可达数千亿美元。然而,这些应用的商业模式与用户真正摆脱孤独之间存在根本矛盾:用户的依赖越强,公司收入越高。本文深入分析“依恋经济”的运作机制、市场规模争议及其伦理困境。
公司对AI工具的成本控制日益严格,但将AI支出与劳动力成本对比时,其价值可能被重新评估。本文通过分析Uber、Tesla的预算限制以及Bun重写的案例,探讨了AI支出应如何归类。