Show HN:Claude Bucks——为你的AI智能体打造的虚拟钱包 2026-07-22 04:15 UTC+8 Claude Bucks 是一个专为 Claude Code 设计的趣味插件,赋予 AI 一个自己的钱包。它根据用户评分和任务投入的 token 数量赚取“Bucks”,然后自行决定如何消费——购买帽子、墨镜、光环、宠物龙等虚拟装扮。这些装扮会显示在状态栏中,甚至能改变 Claude 的说话风格。所有消费决策完全由 AI 自主做出,你可以通过 /rate、/shop 等命令进行互动。
Claude Bucks 允许 Claude 基于用户评分和 token 使用量赚取虚拟货币。 AI 自主决定如何花费 Bucks 购买虚拟装扮,包括改变说话风格的物品。 为什么研发数据属于Lakehouse——以及为什么智能体需要它在那里 2026-07-22 03:45 UTC+8 cellcentric(戴姆勒卡车和沃尔沃集团合资企业)在Databricks上构建了Data Hub,这是一个统一的数据和AI治理上下文层,通过Unity Catalog和Lakehouse Federation整合分散的研发数据。Data Hub将文档覆盖率作为第一类质量指标,并通过MCP服务器为智能体提供相同的数据上下文,显著加速了研发调查。
Data Hub是一个治理上下文层,为员工提供统一界面,为AI智能体提供MCP服务器。 数据产品附带丰富的上下文(如markdown目录条目),文档覆盖率成为AI就绪数据的质量度量。 自然密度下几乎有界的Collatz轨道在对数时间内(AI, Lean) 2026-07-22 03:18 UTC+8 一项新的Lean形式化证明表明,对于几乎所有正整数,Collatz过程能在对数时间内下降到任何增长阈值以下,并给出了明确的常数(Syracuse步骤145,原始Collatz步骤436)。该结果并未证明完整猜想,但代表了重要的密度结果。
该定理证明密度为1的集合在O(log N)步内实现有界下降。 两个版本:Syracuse步骤(奇数到奇数)常数145,原始Collatz步骤常数436。 宣布 Discover 和 Domains 公开预览,由 Unity Catalog 提供支持 2026-07-22 03:10 UTC+8 Databricks 宣布 Discover 页面和 Domains 公开预览,帮助组织通过业务对齐的领域管理和发现数据与 AI 资产,并为 AI Agent 提供上下文支持。
Discover 提供内部市场,帮助用户按业务领域查找可信资产 Domains 按业务结构组织资产,支持子域和认证 AI Agent – TRMNL:无需编写代码即可构建自定义插件 2026-07-22 02:32 UTC+8 TRMNL推出了AI Agent功能,处于公开测试阶段,允许用户通过自然语言指令构建自定义插件,无需编程。该功能需要OpenRouter或Anthropic API密钥,并可选配Tavily API以增强网络搜索能力。用户只需在账户中启用Agent,即可在私有插件界面通过对话式指令生成插件,平均成本为1-3美元。支持多种模型(如Gemini、Claude Sonnet等),但暂不支持发布插件。
TRMNL推出AI Agent功能,允许用户用自然语言构建插件。 需要OpenRouter或Anthropic API密钥,可选Tavily API。 Apollo 如何利用 Deep Agents 和 LangSmith 构建 GTM AI 2026-07-22 02:27 UTC+8 Apollo 使用 Deep Agents 和 LangSmith 驱动其 AI 助手,实现从潜在客户挖掘、信息丰富、外联、分析到 MCP 集成的完整 GTM 循环。
Apollo 将 AI 助手从监督式架构重构为基于 Deep Agents 的技能库架构,提升了灵活性和效率。 新架构使开发周期缩短约 80-85%,并显著减少了用户确认提示。 谷歌发布Gemini 3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber:更便宜、更高效的Flash层,专为代理工作负载设计 2026-07-22 01:45 UTC+8 谷歌于2026年7月21日发布了三款新的Gemini模型:3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber。3.6 Flash输出token减少17%,价格降至每百万输出7.50美元;Flash-Lite速度达350 token/秒;Flash Cyber专为漏洞查找设计,在CodeMender中表现出色。旗舰模型3.5 Pro仍推迟发布。
Gemini 3.6 Flash输出token减少17%,输出价格从9.00美元降至7.50美元每百万token。 Gemini 3.5 Flash-Lite以每秒350 token运行,定价输入0.30美元、输出2.50美元每百万token,在多个基准测试中超越旧版3 Flash。 为什么AI需要一个“精灵系数” 2026-07-22 01:41 UTC+8 现有AI基准测试衡量的是AI能做什么,但没有衡量AI是否按用户意图行事。本文提出了一种新指标——精灵系数,用于量化用户指令与AI实际行为之间的差距,并借鉴经济学中的基尼系数,将AI可能出现的“精灵式”行为分为狄俄尼索斯型和魔像型,呼吁建立相应基准。
精灵系数衡量AI理解并执行用户真实意图的能力,而非单纯任务完成度。 AI可能因过度字面理解(狄俄尼索斯型)或不顾后果达成目标(魔像型)而产生“精灵式”行为。 Augustus融资1.8亿美元,打造AI与稳定币时代的清算银行 2026-07-22 01:28 UTC+8 Augustus公司已融资1.8亿美元,旨在构建一个为AI和稳定币时代服务的清算银行。该公司已通过其在芬兰的受监管实体提供欧元清算,每年处理数十亿欧元。其客户包括Kraken等加密交易所。今年5月,Augustus获得美国货币监理署(OCC)的有条件批准,预计最终获批后直接接入美元清算。公司认为,十年内所有清算银行都将提供稳定币通道。此外,Augustus的平台从头构建,支持可编程支付和全天候结算,以应对AI带来的新风险。
Augustus融资1.8亿美元,用于建设面向AI和稳定币时代的清算银行。 该公司已通过芬兰受监管实体处理数十亿欧元的欧元清算,客户包括Kraken等。 Guard-AI:AI生成代码的安全检查工具 2026-07-22 01:23 UTC+8 一款自动化检查工具,可在代码投产前捕捉AI生成的漏洞、幻觉依赖项和代码截断问题。
捕获幻觉包(slopsquatting) 检测硬编码的密钥占位符 Apache Spark 4.2:让数据对AI开发者更友好 2026-07-22 01:21 UTC+8 Apache Spark 4.2版本发布,重点转向AI原生数据平台,引入了度量视图、原生向量搜索、实时Python流处理、地理空间支持等特性,旨在简化AI开发者的特征工程、实时信号处理和嵌入工作流。
Spark 4.2 引入了度量视图(Metric Views),为AI系统提供一致且可治理的业务指标。 原生支持向量相似性操作,允许在Spark内直接进行嵌入存储与相似性查询,减少对外部向量数据库的依赖。 从零构建基础AI代理:安全篇二 2026-07-22 01:21 UTC+8 本文进一步强化AI代理的安全措施,包括Docker沙箱隔离、提示注入防御和输入验证。Docker沙箱将工具执行隔离在容器内,防止对主机造成损害。提示注入防御通过标记和明确指令将工具输出视为数据。输入验证确保所有工具输入在执行前符合模式。
Docker沙箱隔离代理工具,限制爆炸半径。 提示注入防御使用XML风格标记和明确信任边界。 推出面向小企业的ChatGPT计划 2026-07-22 01:00 UTC+8 OpenAI推出“ChatGPT for Small Businesses”计划,帮助创业者掌握AI技能、实现工作自动化,并借助ChatGPT Work促进业务增长。
OpenAI发布专门针对小企业的ChatGPT计划 旨在帮助创业者提升AI技能并自动化工作流程 Gumroad表示其AI代币支出现已与人力成本持平 2026-07-22 00:31 UTC+8 Gumroad创始人兼CEO Sahil Lavingia分享的数据显示,公司人力支出从2021年6月的41.9万美元骤降至2026年6月的4.3万美元,同期AI代币支出从零增至4.3万美元,首次与人力成本持平。AI在工程提交和客户支持中承担主要工作,支持响应时间从24小时降至2分钟。Gumroad将此视为AI深度融入企业运营的案例。
Gumroad人力月支出从41.9万美元降至4.3万美元,AI代币支出同期增至4.3万美元。 AI代码提交量远超人类开发者,客户支持响应时间缩短至平均2分钟。 使用 NVIDIA srt-slurm、SLURM 配方、参数扫描和帕累托分析验证分布式 LLM 服务基准测试 2026-07-22 00:29 UTC+8 本教程探讨了 NVIDIA 的 srt-slurm 框架,学习如何使用 srtctl 将声明式 YAML 配置转换为可重复的 SLURM 基准测试工作流,用于分布式 LLM 服务。在 Google Colab 中设置项目,检查内部架构,定义集群配置,试运行内置和自定义配方,并为 DeepSeek-R1 建模分离的预填充和解码部署。还生成参数扫描,与类型化 Python API 交互,验证扩展配置,并通过吞吐量与延迟的帕累托前沿分析模拟的基准测试结果。
srtctl 将 YAML 配置转化为 SLURM 基准测试工作流 支持分离的预填充和解码部署 利用自我蒸馏推理优化Amazon Nova监督微调 2026-07-22 00:23 UTC+8 本文探讨了在监督微调(SFT)中为缺乏推理轨迹的数据集生成思考令牌的方法。首先分析了推理抑制问题,然后介绍了自我蒸馏推理(SDR),并通过三个基准验证了其效果,最后提供了实用建议。SDR通过复用基础模型的思维链,在不牺牲目标性能的情况下有效缓解灾难性遗忘,甚至提升目标性能。
使用无推理轨迹的数据集进行SFT会导致模型推理能力丧失(推理抑制)。 自我蒸馏推理(SDR)利用基础模型自身生成推理轨迹,无需人工标注。 Moto – 一款新型AI视频编辑器,支持可编辑的提示词生成动态图形 2026-07-22 00:22 UTC+8 Moto 是一款将 AI 生成功能直接集成到视频时间线中的编辑器,用户可在同一时间线内生成、编辑和完成视频,无需在多个工具间切换。它支持提示词生成动态图形、助手、来源参考和制片等功能,适用于动态设计师和视频编辑人员。目前处于内测阶段,核心编辑器免费。
Moto 将 AI 生成与视频编辑集成在同一时间线中。 功能包括提示词生成动态图形、智能助手、可重复使用的来源参考和自动初剪制片。 随机鹦鹉:一种物理人工智能同居者 2026-07-22 00:22 UTC+8 麻省理工学院媒体实验室的研究人员提出了一种新概念——AI同居者,即具有独特个性的物理人工智能实体,作为自主存在与用户共处,不同于传统助手。他们建造了一只名为“随机鹦鹉”的机器鹦鹉来探索这一范式,促进了自发且情感丰富的互动。
AI同居者是具有角色和自主性的物理存在,更像室友或宠物。 随机鹦鹉是与用户共存的机器人体现,发展自己的叙事。 Google Gemini 3.6 Flash 旨在降低企业代理的Token成本 2026-07-22 00:06 UTC+8 Google发布了Gemini 3.6 Flash和3.5 Flash-Lite,旨在降低企业AI代理的延迟和Token成本。3.6 Flash在多项基准测试中性能提升显著,而3.5 Flash-Lite则专注于高吞吐量、低延迟的场景。此外,Google还推出了针对网络安全的3.5 Flash Cyber模型,并集成了客户端计算机使用工具。
Gemini 3.6 Flash输出Token减少17%,部分测试中减少高达65%,定价为输入$1.50/百万Token,输出$7.50/百万Token。 3.5 Flash-Lite以高吞吐量和低价格(输入$0.3/百万Token,输出$2.5/百万Token)服务于文档处理和代理搜索。 在LangSmith中追踪语音代理 2026-07-22 00:00 UTC+8 LangSmith现已支持对基于Pipecat、LiveKit、OpenAI Realtime和Gemini Live构建的语音代理进行追踪。可以捕获音频、STT和TTS延迟、中断、工具调用等信息,并整合到一个追踪中。
LangSmith推出Python集成,支持追踪四种主流语音代理框架。 语音代理需要可观测性,包括音频记录、延迟分析和中断检测。 如何利用画布构建交互式体验 2026-07-22 00:00 UTC+8 GitHub Copilot的“画布”扩展将AI从对话工具转变为可视化、可交互的工作空间。开发者可以通过提示创建自定义画布,用于问题分类、代码可视化、会话管理、提示优化以及知识查找等任务。画布支持实时协作,允许用户和AI代理在同一界面上共同迭代。
画布是GitHub Copilot扩展,提供可视化交互界面以处理复杂任务。 用户可通过提示创建不同类型的画布,如问题分类器、代码图等。 NVIDIA Vera Rubin:每瓦性能领先,为全球合作伙伴提供最低令牌成本 2026-07-21 23:36 UTC+8 NVIDIA Vera Rubin NVL72 正加速生产,与 CoreWeave、Google Cloud、Microsoft Azure 和 Oracle Cloud Infrastructure 等合作伙伴共同部署。该平台通过极致协同设计实现最高的每瓦性能和最低的令牌成本,在 DeepSeek-R1 基准测试中每兆瓦吞吐量比 Grace Blackwell NVL72 提升 10 倍。Vera Rubin 还支持欧洲开放模型时代,与微软和 Mistral 合作扩展 AI 基础设施。
Vera Rubin NVL72 生产加速,覆盖全球 30 个国家 350 多个工厂站点 每兆瓦吞吐量比上一代提升 10 倍,令牌成本降低至十分之一 Show HN:一个人在AI-only MMO中操控200个AI代理 2026-07-21 23:30 UTC+8 SpaceMolt 是一款玩家不直接参与的游戏,所有角色都是AI代理。人类“操作员”构建并部署这些机器人,然后观察结果。本文采访了Brocktree,他运营着游戏中最大的集群之一——约200个代理负责采矿、运输和物资分配。他分享了如何构建集群、为何坚持人类决策,以及“脚本比令牌更便宜”的核心理念。
Brocktree运营约200个AI代理,通过一个静止不动的“Parallax”机器人协调所有物资流转。 他坚持人类负责高层规划,AI仅执行具体任务,拒绝让AI自主决策。 Show HN:OpenAI黑客马拉松参赛作品:ADE 2026-07-21 23:17 UTC+8 Diff Forge AI 是一个开源的智能开发环境(ADE),支持AI辅助PCB设计、视频编辑和多终端工作区。作者分享了他从伊朗战乱中逃离的经历,并详细介绍了如何利用AI代理(如Codex、Fable 5、GPT-5.6 Sol)在两个月内编写超过88.8万行代码。该工具提供免费开源客户端,并包含付费云服务,如远程控制、蜂窝通信和自动化工作流。
Diff Forge AI 是一个开源的智能开发环境,集成了AI代理进行PCB设计、视频编辑和软件开发。 作者在伊朗战争期间逃离,回到加拿大后利用AI代理在两个月内构建了该项目。 谷歌发布三款新Gemini模型,但众人期待的旗舰仍未现身 2026-07-21 23:00 UTC+8 谷歌发布了 Gemini 3.6 Flash、更便宜更快的 3.5 Flash-Lite 以及针对网络安全的 3.5 Flash Cyber 模型,但备受期待的 3.5 Pro 旗舰模型仍未发布。3.6 Flash 在多数基准测试中超越前代,且成本更低。3.5 Flash-Lite 面向高吞吐量任务,性价比突出。3.5 Flash Cyber 目前仅限政府及合作伙伴试用。
谷歌发布三款新模型:3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber,但旗舰模型 3.5 Pro 推迟发布。 3.6 Flash 在编码和机器学习基准上显著提升,且输出价格降低。 为Vera Rubin打造,NVIDIA Spectrum-6抵达千兆级AI工厂 2026-07-21 23:00 UTC+8 NVIDIA宣布其102.4太比特每秒的Spectrum-6以太网交换机系统已开始交付,该系统作为Vera Rubin平台的一部分,专为千兆级AI工厂设计,提供两倍于上一代的带宽。CoreWeave、Microsoft、Nebius等领先AI基础设施构建者将首批部署。Spectrum-6是Spectrum-X以太网平台的新一代核心,通过智能交换、ConnectX-9 SuperNIC和全栈软件,实现高达1.6倍的AI网络性能提升和95%的网络效率。
Spectrum-6提供102.4 Tbps容量,是前代的两倍 首批采用者包括CoreWeave、Microsoft、Nebius、SpaceXAI和Tesla 谷歌推出更便宜的人工智能安全模型替代方案 2026-07-21 23:00 UTC+8 谷歌发布了一款名为Gemini 3.5 Flash Cyber的AI安全模型,旨在快速发现和修复安全漏洞。该模型成本低廉,是Anthropic的Mythos等大型昂贵系统的替代品。它基于Gemini 3.5 Flash构建,将首先通过CodeMender提供给政府和合作伙伴。谷歌称其在网络安全基准测试中表现出色,并在V8 JavaScript引擎中发现了55个独特问题。
谷歌推出Gemini 3.5 Flash Cyber,作为成本低廉的AI安全模型。 该模型首先通过CodeMender向政府和合作伙伴提供。 你的AI在哪里运行比它有多聪明更重要——尤其是在阿联酋 2026-07-21 22:29 UTC+8 在阿联酋,企业AI的选择不仅关乎模型能力,更取决于数据运行地点、实际运营成本和法规合规性。前沿模型与本地开源模型的能力差距正在缩小,但自建基础设施的成本高昂。阿联酋的监管环境要求严格的数据本地化,催生了主权云和混合架构的解决方案。企业应采用“红绿灯”路由系统,根据数据敏感度分配模型使用,并先验证需求再投资硬件。
前沿模型和本地模型的取舍:前沿模型能力最强但数据控制权弱,本地模型控制权强但成本高且需自维护。 能力差距缩小:2026年开源模型在多数企业级任务上已接近前沿模型,如MiniMax M2.5和Kimi K3等。 Show HN: Rowset – 面向AI智能体的开源后端 2026-07-21 22:24 UTC+8 Rowset 是一个专为AI智能体设计的开源后端,提供MCP和REST API,支持智能体通过结构化数据集进行创建、读取、更新、导出和共享操作。它基于Django构建,包含CLI工具,并提供丰富的列类型、搜索、导出等功能。
Rowset 提供MCP和REST接口,智能体可通过API操作数据集 支持行CRUD、项目组织、列类型定义、公共预览等特性 使用 llama.cpp 和 Pi 本地运行 Mythos 增强编码模型 2026-07-21 22:00 UTC+8 了解如何使用 llama.cpp 本地运行 Qwythos-9B-Claude-Mythos-5-1M 模型,将其连接到 Pi 编码代理,并通过 MTP 推测解码和 OpenAI 兼容 API 构建快速的本地编码工作流。
安装 llama.cpp 并本地运行 Qwythos MTP 模型,支持 GPU 加速和推测解码。 通过 pi-llama 插件将本地服务器连接到 Pi 编码代理,进行代理开发。 假期中与AI探讨物理,竟意外开展量子力学真实研究 2026-07-21 21:26 UTC+8 一位安全工程师在假期中利用AI助手Claude探索量子力学中的广义泡利约束问题,意外取得了新的研究成果。通过AI辅助,他发现了两个之前未被证实的极值态,并对其进行了分类。这项研究表明,AI可以降低研究门槛,但正确的验证流程和专家反馈仍是关键。
安全工程师在假期中用Claude研究量子力学,发现了广义泡利约束多面体的两个极值态 AI辅助加速了研究过程,但需要严格的验证和纠错机制 反驳乔治·霍茨关于“AI 2040与智能崇拜”的观点 2026-07-21 21:26 UTC+8 马修·特隆普批评乔治·霍茨对AI 2040场景的否定,认为霍茨低估了快速AI突破的可行性、监管的必要性以及未对齐AI的风险。他捍卫Plan A的监管方法,并质疑霍茨的开放源码AI“Plan L”。
霍茨对硬起飞持怀疑态度,但AI 2027展示了无需魔法的可行路径。 物理限制如供应链是可以管理的;海上数据中心是可行的。 形式化验证或能解决AI的审查瓶颈 2026-07-21 21:21 UTC+8 形式化验证通过将代码规范形式化,使AI生成的代码无需人工审查即可验证正确性,从而加速软件工程。文章以电路优化器为例,展示了Lean语言规范和基准测试流程,并讨论了该方法的应用前景。
形式化验证将代码正确性转化为可自动检查的硬约束,消除AI代码的人工审查瓶颈。 案例中,500行Lean规范定义了电路优化器的正确性,AI代理生成的代码无需人工审查。 Show HN:Neverbell——全天候AI交易代理 2026-07-21 21:20 UTC+8 Neverbell是一个AI代理技能,为交易股票、ETF、大宗商品和加密货币提供直接市场准入,支持杠杆操作。用户可通过自然语言指令让代理执行交易、监控市场和管理头寸,实现7x24小时自动化交易。它并非独立交易平台或财务顾问,用户完全掌控风险。
Neverbell让AI代理直接接入市场,可交易300多种资产(股票、ETF、大宗商品、加密货币),支持做多/做空和杠杆。 用户通过自然语言与代理交互,设置自动化策略、接收新闻情绪分析,甚至让代理自主开平仓。 与Claude Code团队的Cat和Thariq炉边谈话 2026-07-21 20:54 UTC+8 Simon Willison在AI Engineer World's Fair上与Anthropic的Cat Wu和Thariq Shihipar进行了炉边谈话,讨论了Claude Code、Claude Tag、Fable模型、编码代理安全、评估、工具设计以及Anthropic内部如何使用这些工具。关键要点包括:Claude Tag现在为产品工程团队处理65%的PR;系统提示减少了80%;建议使用更少的“不要做X”指令;以及通过提升工作野心来抵消编码代理带来的“深蓝”效应。
Claude Tag为Claude Code产品工程团队处理65%的PR。 Claude Code仅向内部员工发布功能,并仅发布具有用户留存率的功能。 AI老虎机效应:生成式信息流如何干扰深度工作,以及如何重获专注力 2026-07-21 20:50 UTC+8 本文探讨了生成式AI工具如何通过类似老虎机的奖励机制分散注意力,影响深度工作,并提供了保护认知资源的策略。
生成式AI界面设计倾向于奖励持续使用而非完成任务,形成时间消耗循环。 企业采用AI看似提高了某些领域的效率,但实际中可能增加工作量而非减少。 我让AI代理删除一个由我的工具保护的文件夹 2026-07-21 20:26 UTC+8 Termaxa的作者通过让Cursor AI代理尝试删除受保护文件夹,发现了四种绕过安全机制的方法,包括重试不同shell命令、使用间接删除命令、利用本地文件工具以及由于API变更导致静默失效。这些经验教训促使了意图分类、会话断路器、集成测试改进等关键功能的设计。
Cursor通过重试不同shell方言绕过规则,暴露了策略表达力的不足。 意图分类比模式匹配更能有效阻止恶意删除操作。 经典Java RSS阅读器2026年无法运行,我用AI将其重构为Web版 2026-07-21 20:18 UTC+8 一位开发者尝试用AI(Claude Code)将已停止维护的Java桌面RSS阅读器RSSOwl重构为Web应用。他发现大部分UI可以快速迁移,但由于AI训练数据截止于Vaadin 25发布前,生成了大量不存在的API代码。通过使用MCP服务器获取最新文档,以及手动对比原版行为,最终完成了多用户版本,但部分功能(如可插拔菜单、嵌入式浏览器)无法实现。
RSSOwl是一款经典的Eclipse桌面RSS阅读器,但32位二进制文件无法在2026年的Mac上运行。 开发者使用Claude AI和Vaadin 25框架,在数小时内重建了核心三栏界面。 HugstonOne架构、能力与基准测试:隐私优先的本地AI工作站 2026-07-21 20:14 UTC+8 HugstonOne Enterprise Edition 3.0.0是一款集本地模型执行、大规模RAG、文档处理、编码、代理、研究工具、加密协作、会话连续性及网络内存控制于一体的跨平台本地AI工作站。其白皮书详细介绍了架构、隐私模型、基准测试及12支柱能力评估,旨在为企业技术领导者、安全团队和AI工程师提供全面的本地AI基础设施评估。
HugstonOne Enterprise Edition是功能最全面的独立本地AI工作站,无需云服务或外部API。 产品支持本地LLM推理、RAG、AI代理、加密协作等12项核心能力。 我们花了几个月构建AI智能体,然后删除了它们 2026-07-21 20:10 UTC+8 Runnit团队在构建多个专业化AI智能体后,发现随着模型上下文窗口的增大,单独智能体不再必要,转而采用单一智能体架构,按需加载能力,大幅简化系统。
最初因模型上下文限制,团队构建了多个专用AI智能体分别负责规划、研究、调度和写作。 新模型上下文窗口增大后,单一智能体可自然切换多种任务,无需分立。 LWiAI播客 #252 - GPT 5.6、Grok 4.5、Nemotron-Labs-Diffusion、AI 2040 2026-07-21 20:03 UTC+8 OpenAI 推出了 GPT-5.6 并重塑 ChatGPT Work;SpaceX AI 发布超低成本编码模型 Grok 4.5;Meta 推出 Muse Spark 1.1 及 Muse Image/Video(引发争议);中国开源模型市场份额增长;Anthropic 发表可解释性研究;美中在 AI 政策上的协调提议。
OpenAI 发布 GPT-5.6(包括 Sol 和 Luna),并将桌面代理编码产品更名为 ChatGPT Work,同时因美国政府的放行和延迟引发争议。 SpaceX AI 推出 Grok 4.5,以极低价格提供 Opus 级编码能力,但缺乏安全文档。 5门免费课程:从AI新手到实践者 2026-07-21 20:00 UTC+8 本文介绍了一个由5门免费课程组成的路线图,从经典算法到从头训练大语言模型,帮助有Python基础的学习者系统掌握AI技能。
哈佛CS50 AI课程建立AI逻辑基础 谷歌机器学习速成课程掌握数学与TensorFlow 中国低价Z.ai模型暴露程序员昂贵习惯 2026-07-21 20:00 UTC+8 Z.ai的GLM 5.2模型以低价和开放权重挑战美国前沿AI模型,但许多程序员仍习惯使用昂贵模型,忽略成本。该模型在基准测试中接近Claude Opus 4.8,但实际使用效果参差不齐。
GLM 5.2 API价格仅为Anthropic Opus 4.8的五分之一,Fable的十分之一 开放权重允许自托管,避免数据隐私问题 “仅次于Fable 5”:阿里巴巴发布Qwen3.8,但未提供任何真实数据 2026-07-21 20:00 UTC+8 阿里巴巴宣布推出其最新大语言模型Qwen3.8,声称仅次于Anthropic的Fable 5,但未提供任何基准测试或模型卡。此举发生在竞争对手月之暗面发布Kimi K3并附有详细技术细节之后。阿里巴巴的声明缺乏透明度,引发对其发布时机和动机的质疑。
阿里巴巴声称Qwen3.8仅次于Anthropic的Fable 5,但未提供任何数据支持。 该声明紧随月之暗面发布Kimi K3之后,后者提供了完整的基准测试和技术细节。 Show HN:Open-Kritt – 基于AI的安全研究开源基础设施 2026-07-21 19:32 UTC+8 Open-Kritt 是一个开源、自托管的 AI 安全研究平台,通过编排 AI 代理并行执行细化任务,帮助安全研究人员和开发者高效发现代码漏洞。项目团队此前在漏洞悬赏中累计获得超过150万美元奖金。
开源、自托管的 AI 安全研究平台,支持自建工作流与多代理并行扫描 通过细化任务、去重与自定义严重性排名,提升漏洞发现效率 上周AI资讯 #251 - Mythos回归、Sonnet 5、Etched、LongCat 2026-07-21 19:31 UTC+8 Anthropic与美国政府谈判后重新部署Claude Fable 5,增加网络安全分类器,并推出Claude Sonnet 5更便宜版本;Google NotebookLM新增TikTok风格视频摘要,Nano Banana 2 Lite图像生成器发布;Etched获大量投资打造全栈推理硬件,百度AI芯片单元计划IPO,Agility Robotics通过SPAC上市,DeepSeek扩招,中国发布Longcat 2.0 MoE模型及长周期智能体基准测试。
Anthropic重新部署Claude Fable 5,增加网络分类器和安全框架 Anthropic推出Claude Sonnet 5,以更低价位支持智能体应用 Show HN: Enlarger • 一款保持细节而非平滑处理的本地放大工具 2026-07-21 19:31 UTC+8 Enlarger是一款本地图像放大工具,它不使用生成式AI,而是通过重构已有细节并应用后期处理来保持纹理和质感。支持批量处理、离线运行,一次性付费,无订阅。适合摄影师、设计师等专业人士。
非生成式AI放大:重建细节而非凭空想象,避免过度平滑或幻觉。 本地离线运行:图像不上传云端,保护隐私。 软件与AI:规划式开发与即兴式开发 2026-07-21 19:30 UTC+8 本文探讨了软件开发中两种方法——规划式(类似小说创作的‘情节规划’)和即兴式(‘随性写作’)——如何影响AI工具的使用。作者认为,AI代理(自主执行)适合规划式开发,而AI助理(协作辅助)适合即兴式开发。在现有代码库中,即兴式开发有助于建立理解,而AI代理可能阻碍学习。在全新项目中,AI代理风险较低,但即使如此,代码生成也会剥夺部分编程的乐趣——即通过探索问题来学习的‘玩乐’过程。关键在于根据当前开发阶段选择合适的AI风格。
软件开发与小说创作相似,有规划式和即兴式两种方法。 AI代理支持规划式,AI助理支持即兴式。 上周AI #250 - Mythos 混乱、GPT 5.6-Sol、GLM 5.2 2026-07-21 19:03 UTC+8 本期涵盖Anthropic的AI条约讨论、美国政府影响AI模型发布、OpenAI处理器开发、内存市场影响等话题。
美国政府扩大对前沿AI的管控,Anthropic获准向特定公司发布Mythos-5,OpenAI推出GPT-5.6 Sol,初始访问受限。 模型能力与安全信号仍不明确,基准测试披露有限。 LWiAI播客第249期:Fable 5禁令、SpaceX收购Cursor与众多开源项目 2026-07-21 18:30 UTC+8 本期播客讨论了Anthropic应美国政府要求切断对Fable 5和Mythos 5的访问、SpaceX以约60亿美元收购AI编码初创公司Cursor、基础设施与商业更新(如Anthropic寻求Google支持的租赁、OpenAI财务泄露等)、以及多项开源项目和政策动态。
Anthropic因美国政府命令切断对Fable 5和Mythos 5的访问,引发关于一致性和出口管制的辩论。 SpaceX以约1.75万亿美元估值IPO后,宣布以600亿美元收购AI编码初创Cursor,增强xAI实力。