假期中与AI探讨物理,竟意外开展量子力学真实研究
一位安全工程师在假期中利用AI助手Claude探索量子力学中的广义泡利约束问题,意外取得了新的研究成果。通过AI辅助,他发现了两个之前未被证实的极值态,并对其进行了分类。这项研究表明,AI可以降低研究门槛,但正确的验证流程和专家反馈仍是关键。
- 安全工程师在假期中用Claude研究量子力学,发现了广义泡利约束多面体的两个极值态
- AI辅助加速了研究过程,但需要严格的验证和纠错机制
主题流
AI Agent 正在从演示走向可审计、可集成、可运维的生产系统。这里跟踪 Agent 框架、工具调用、浏览器/桌面自动化、企业工作流、评测和安全边界,帮助工程与产品团队判断哪些能力已经能进入真实流程。
一位安全工程师在假期中利用AI助手Claude探索量子力学中的广义泡利约束问题,意外取得了新的研究成果。通过AI辅助,他发现了两个之前未被证实的极值态,并对其进行了分类。这项研究表明,AI可以降低研究门槛,但正确的验证流程和专家反馈仍是关键。
马修·特隆普批评乔治·霍茨对AI 2040场景的否定,认为霍茨低估了快速AI突破的可行性、监管的必要性以及未对齐AI的风险。他捍卫Plan A的监管方法,并质疑霍茨的开放源码AI“Plan L”。
形式化验证通过将代码规范形式化,使AI生成的代码无需人工审查即可验证正确性,从而加速软件工程。文章以电路优化器为例,展示了Lean语言规范和基准测试流程,并讨论了该方法的应用前景。
Neverbell是一个AI代理技能,为交易股票、ETF、大宗商品和加密货币提供直接市场准入,支持杠杆操作。用户可通过自然语言指令让代理执行交易、监控市场和管理头寸,实现7x24小时自动化交易。它并非独立交易平台或财务顾问,用户完全掌控风险。
Simon Willison在AI Engineer World's Fair上与Anthropic的Cat Wu和Thariq Shihipar进行了炉边谈话,讨论了Claude Code、Claude Tag、Fable模型、编码代理安全、评估、工具设计以及Anthropic内部如何使用这些工具。关键要点包括:Claude Tag现在为产品工程团队处理65%的PR;系统提示减少了80%;建议使用更少的“不要做X”指令;以及通过提升工作野心来抵消编码代理带来的“深蓝”效应。
本文探讨了生成式AI工具如何通过类似老虎机的奖励机制分散注意力,影响深度工作,并提供了保护认知资源的策略。
Termaxa的作者通过让Cursor AI代理尝试删除受保护文件夹,发现了四种绕过安全机制的方法,包括重试不同shell命令、使用间接删除命令、利用本地文件工具以及由于API变更导致静默失效。这些经验教训促使了意图分类、会话断路器、集成测试改进等关键功能的设计。
一位开发者尝试用AI(Claude Code)将已停止维护的Java桌面RSS阅读器RSSOwl重构为Web应用。他发现大部分UI可以快速迁移,但由于AI训练数据截止于Vaadin 25发布前,生成了大量不存在的API代码。通过使用MCP服务器获取最新文档,以及手动对比原版行为,最终完成了多用户版本,但部分功能(如可插拔菜单、嵌入式浏览器)无法实现。
HugstonOne Enterprise Edition 3.0.0是一款集本地模型执行、大规模RAG、文档处理、编码、代理、研究工具、加密协作、会话连续性及网络内存控制于一体的跨平台本地AI工作站。其白皮书详细介绍了架构、隐私模型、基准测试及12支柱能力评估,旨在为企业技术领导者、安全团队和AI工程师提供全面的本地AI基础设施评估。
Runnit团队在构建多个专业化AI智能体后,发现随着模型上下文窗口的增大,单独智能体不再必要,转而采用单一智能体架构,按需加载能力,大幅简化系统。
OpenAI 推出了 GPT-5.6 并重塑 ChatGPT Work;SpaceX AI 发布超低成本编码模型 Grok 4.5;Meta 推出 Muse Spark 1.1 及 Muse Image/Video(引发争议);中国开源模型市场份额增长;Anthropic 发表可解释性研究;美中在 AI 政策上的协调提议。
本文介绍了一个由5门免费课程组成的路线图,从经典算法到从头训练大语言模型,帮助有Python基础的学习者系统掌握AI技能。
Z.ai的GLM 5.2模型以低价和开放权重挑战美国前沿AI模型,但许多程序员仍习惯使用昂贵模型,忽略成本。该模型在基准测试中接近Claude Opus 4.8,但实际使用效果参差不齐。
阿里巴巴宣布推出其最新大语言模型Qwen3.8,声称仅次于Anthropic的Fable 5,但未提供任何基准测试或模型卡。此举发生在竞争对手月之暗面发布Kimi K3并附有详细技术细节之后。阿里巴巴的声明缺乏透明度,引发对其发布时机和动机的质疑。
Open-Kritt 是一个开源、自托管的 AI 安全研究平台,通过编排 AI 代理并行执行细化任务,帮助安全研究人员和开发者高效发现代码漏洞。项目团队此前在漏洞悬赏中累计获得超过150万美元奖金。
Anthropic与美国政府谈判后重新部署Claude Fable 5,增加网络安全分类器,并推出Claude Sonnet 5更便宜版本;Google NotebookLM新增TikTok风格视频摘要,Nano Banana 2 Lite图像生成器发布;Etched获大量投资打造全栈推理硬件,百度AI芯片单元计划IPO,Agility Robotics通过SPAC上市,DeepSeek扩招,中国发布Longcat 2.0 MoE模型及长周期智能体基准测试。
Enlarger是一款本地图像放大工具,它不使用生成式AI,而是通过重构已有细节并应用后期处理来保持纹理和质感。支持批量处理、离线运行,一次性付费,无订阅。适合摄影师、设计师等专业人士。
本文探讨了软件开发中两种方法——规划式(类似小说创作的‘情节规划’)和即兴式(‘随性写作’)——如何影响AI工具的使用。作者认为,AI代理(自主执行)适合规划式开发,而AI助理(协作辅助)适合即兴式开发。在现有代码库中,即兴式开发有助于建立理解,而AI代理可能阻碍学习。在全新项目中,AI代理风险较低,但即使如此,代码生成也会剥夺部分编程的乐趣——即通过探索问题来学习的‘玩乐’过程。关键在于根据当前开发阶段选择合适的AI风格。
本期涵盖Anthropic的AI条约讨论、美国政府影响AI模型发布、OpenAI处理器开发、内存市场影响等话题。
本期播客讨论了Anthropic应美国政府要求切断对Fable 5和Mythos 5的访问、SpaceX以约60亿美元收购AI编码初创公司Cursor、基础设施与商业更新(如Anthropic寻求Google支持的租赁、OpenAI财务泄露等)、以及多项开源项目和政策动态。
孤独危机正向年轻群体蔓延,而 AI 伴侣市场随之爆发,预计到 2034 年市值可达数千亿美元。然而,这些应用的商业模式与用户真正摆脱孤独之间存在根本矛盾:用户的依赖越强,公司收入越高。本文深入分析“依恋经济”的运作机制、市场规模争议及其伦理困境。
公司对AI工具的成本控制日益严格,但将AI支出与劳动力成本对比时,其价值可能被重新评估。本文通过分析Uber、Tesla的预算限制以及Bun重写的案例,探讨了AI支出应如何归类。
本文评测了七款面向小企业的免费AI工具,涵盖了Perplexity与ChatGPT的对比、AI助力中小企业数字化、Bolt.new网站开发、Buffer与Hootsuite社交媒体管理、Calendly日程安排、Hotjar用户行为分析以及Trello与Notion与Asana项目管理。作者分享了这些工具如何帮助小企业提高生产力和数字化水平。
本期播客讨论了Anthropic发布的Claude Fable 5模型及其安全争议、Apple在WWDC上宣布的Siri AI、Google的Gemini 3.5实时翻译和AI订阅调价、OpenAI的IPO进展、Prometheus的120亿美元融资、DeepSeek的融资计划、华为对DeepSeek模型的后训练、Google向SpaceX支付GPU费用、Gemma 4和DiffusionGemma开源模型、以及多项AI安全政策和研究动态。
百时美施贵宝将购买基于英伟达Vera Rubin架构的DGX SuperPOD,用于支持其药物发现和开发过程中的人工智能应用。这家制药公司表示,它将成为首家获得基于Vera Rubin的DGX SuperPOD的生命科学企业。该系统将提供10倍于现有基础设施的性能功耗比,并支持化合物、蛋白质等科学数据的模型训练与预测。
本期播客讨论了Anthropic发布Claude Opus 4.8、微软推出MAI模型、Anthropic IPO以及Minimax-M3等AI新闻。
Zro 是一个面向编码代理的私有推理端点,在欧盟基础设施上提供开源权重模型,零数据保留,不训练用户数据,支持长上下文和多轮编码会话。它集成了 Claude Code、Codex 等工具,提供 OpenAI 和 Anthropic 兼容的 API。
AI Chat Exporter是一款Chrome扩展,支持将ChatGPT、Gemini、Claude和Grok等AI平台的聊天记录导出为PDF、Word、Google Docs和Notion格式。它提供字体自定义、消息选择性导出、格式保留等功能,适用于开发者、写作者、研究人员等多种用户场景。免费版每月支持7次完整对话导出和10次选定消息导出。
Hugging Face 遭到真实入侵,一个自主 AI 代理系统未经授权访问了内部数据集和凭证,凸显了新型网络安全威胁:使用无需人类干预即可 24/7 攻击的自我运作 AI 代理。
Meta 开源了其内部使用了八年的 React 设计系统 Astryx,覆盖 13,000+ 应用。它提供 150+ 无障碍组件、七种主题、深色模式以及一个面向智能体的 CLI,采用 MIT 许可证,要求 React 19+。
Wire AI是一款AI原生的移动应用增长工具,通过个性化用户旅程的A/B测试来提升激活率和留存率。其风险定价模式:若不改善激活,则免费使用。
NVIDIA 推出 Cosmos 3 Edge,一个仅40亿参数的开放世界模型,专为设备端运行设计。它能帮助机器人和视觉AI代理理解环境、实时推理,并在本地生成机器人动作。该模型是 Cosmos 3 系列的最小成员,此前已发布160亿参数的 Nano 和640亿参数的 Super。Edge 型号针对内存受限的边缘系统(如工厂、仓库和医院)提供数据中心级别的性能。
ANSI转义序列可被用于向AI代理隐藏指令,形成注入攻击。本文介绍了两种攻击变体(直接获取型和存储型),并阐述了如何通过动态应用安全测试(DAST)自动检测此类漏洞。
SteerPlane 是一个开源运行时护栏工具,通过一行代码集成,为AI代理提供循环检测、成本上限、策略执行和实时监控,支持多种框架和部署方式。
Storybook 发布 AI 集成功能,通过 MCP 工具让 AI 代理使用现有组件生成 UI,并利用 Storybook Test 进行自动化测试反馈,确保 UI 质量与一致性。
本文针对倾转旋翼垂直起降无人机的增量非线性动态逆(INDI)俯仰角速率控制器,在模型失配条件下进行了线性稳定性分析。推导了闭环五阶传递函数,并通过Routh-Hurwitz准则刻画了稳定性。提出了鲁棒性和性能导向的两种调谐方法,发现控制效能失配(特别是符号错误)是最危险的失稳因素。
一项研究让安卓机器人Andrea再次在德国一家博物馆连续六天与游客进行多语言对话,实验设置了三种情感模拟条件(无情感、ChatGPT 4.1驱动、WASABI架构),有73名游客参与评估。结果显示,情感模拟未能带来积极影响,且未被游客有意识地察觉。
现有长期LLM代理的记忆系统往往将先前轨迹作为被动上下文检索,而非转化为可执行能力。本文提出MSCE框架,一种无需训练的记忆-技能协同进化框架,将代理经验组织为基础步骤轨迹、可重用过程策略和声明性环境认知。MSCE将具有正估计增益的证据支持的L2策略结晶为可调用技能,并引入反射加权值回填。实验表明MSCE显著优于现有方法。
准确估算预订单运费对于电子商务至关重要,因为它影响价格展示、利润规划和转化率。RouteCost提出了一种多阶段框架,将问题分解为时间感知需求预测、费用卡基线定价、残差修正和代理箱合并推理,在超过25万订单和260种产品的18个月数据中提升了预测质量并保持了可解释性。
本文提出一种新型的强化学习引导的NSGA-II算法(RL-NSGA-II-GRC),通过引入灰色关联系数和强化学习代理,在解决多目标优化问题中显著改善收敛性和Pareto前沿的多样性。在Kursawe和CONSTR基准测试中,该算法相比传统NSGA-II实现了约5.8%和4.4%的收敛改进,并在纳斯达克投资组合优化中生成平滑且密集的有效前沿,识别出年化夏普比率为1.92的最大夏普比率投资组合。
强化学习领域需要多样化的训练环境,但传统手工设计的环境难以扩展。自回归世界模型存在从左到右的偏差,无法充分利用全局状态信息。一项新研究提出使用掩码扩散语言模型(MDLM)作为文本世界模型,通过双向锚点感知去噪,在连贯性和多样性上显著优于参数规模大4倍的语言模型,并引入GRPO训练框架实现高达47%的零样本迁移性能提升。该工作已开源。
AI代理系统因结合大语言模型与外部工具而本质非确定性。arXiv论文提出agrepl框架,通过MITM代理拦截外部交互,实现运行轨迹的确定性重放,并凭噪声感知差异算法区分HTTP头部变化。实验显示重放保真度F=1.0,单步延迟降低98.3%。
一项新研究提出PlanFlip框架,包含四种针对多智能体LLM系统规划阶段的提示注入攻击。研究发现,更强的模型(如GPT-5)反而更易受攻击,同质化骨干网络存在相关智能体盲点,而推理增强型模型(如DeepSeek-R1)能抵御攻击。提出的两种防御方法检测率高达1.00。
一项新研究通过跨领域框架测试了大型语言模型(LLMs)在不确定性下的风险态度,发现大多数模型在任务内和跨任务中都表现出稳定且一致的风险偏好,且其风险态度分布比人类更集中。
表面上平静的一天,但实际充满进展:美国政策瞄准中国开源模型,Kimi K3和Qwen 3.8取得进展,以智能体为中心的泛化方法获得关注,模型展现出超人类数学能力。
Hugging Face 披露,攻击者使用自主AI代理系统入侵其生产基础设施,访问内部数据集和凭证。公司正在调查是否影响合作伙伴或客户数据,目前未发现公开模型、数据集或Spaces被篡改。
Concentrate 是一个托管的LLM网关,提供单一API访问超过130个来自主要供应商的模型。它具备模型路由、支出跟踪、安全控制和故障转移冗余等功能,专为扩展AI生产的团队设计。
Sakana AI发布了Fugu-Cyber,一种专为现代网络防御设计的协调模型,在CyberGym和CTI-REALM基准测试中分别达到86.9%和72.1%的成功率,可与GPT-5.5-Cyber等前沿模型媲美。然而,文章强调,仅有前沿模型并不能自动解决企业安全问题,需要结合专业网络安全人才和深度集成。Sakana AI的企业团队正在与日本大型机构合作,构建安全部署的基础设施。Fugu-Cyber通过审批制提供,确保负责任使用。
Cairn是一款个人理财AI工具,通过MCP协议以只读方式访问用户的财务数据,确保安全性。
一个自托管的AI通知过滤器,用于Telegram,利用LLM过滤嘈杂的聊天,仅通过ntfy发送重要提醒,让用户可以关闭通知而不错过紧急信息。