AI News HubLIVE

今日必读

研究

Substack 推出AI检测工具:帮你识别“无人”创作的博客

Substack 与 AI 检测公司 Pangram 合作,推出新的文本扫描工具,能够识别帖子、笔记、回复和评论中 AI 生成的内容。同时,平台允许创作者声明其写作流程,以提升透明度,防止读者被误导。该工具已在网页端和 iOS 应用上线,Android 版本也将很快推出。

  • Substack 集成 Pangram 的 AI 检测工具,可扫描帖子、笔记、回复和评论中超过 100 字的文本。
  • 读者可通过文章右上角菜单中的“扫描 AI 文本”选项获取 AI 生成概率评估。
站内正文

OpenAI敦促企业使用其评分卡衡量AI价值

OpenAI推出评分卡工具,帮助企业在低成本AI提供商(尤其是中国厂商)日益增长的竞争压力下评估AI投资回报。

  • OpenAI发布评分卡,供企业评估AI模型的实际商业价值。
  • 该工具旨在帮助企业在面对中国低成本AI提供商时做出更明智的采购决策。
站内正文
Agent

自然密度下几乎有界的Collatz轨道在对数时间内(AI, Lean)

一项新的Lean形式化证明表明,对于几乎所有正整数,Collatz过程能在对数时间内下降到任何增长阈值以下,并给出了明确的常数(Syracuse步骤145,原始Collatz步骤436)。该结果并未证明完整猜想,但代表了重要的密度结果。

  • 该定理证明密度为1的集合在O(log N)步内实现有界下降。
  • 两个版本:Syracuse步骤(奇数到奇数)常数145,原始Collatz步骤常数436。
站内正文

宣布 Discover 和 Domains 公开预览,由 Unity Catalog 提供支持

Databricks 宣布 Discover 页面和 Domains 公开预览,帮助组织通过业务对齐的领域管理和发现数据与 AI 资产,并为 AI Agent 提供上下文支持。

  • Discover 提供内部市场,帮助用户按业务领域查找可信资产
  • Domains 按业务结构组织资产,支持子域和认证
站内正文

AI Agent – TRMNL:无需编写代码即可构建自定义插件

TRMNL推出了AI Agent功能,处于公开测试阶段,允许用户通过自然语言指令构建自定义插件,无需编程。该功能需要OpenRouter或Anthropic API密钥,并可选配Tavily API以增强网络搜索能力。用户只需在账户中启用Agent,即可在私有插件界面通过对话式指令生成插件,平均成本为1-3美元。支持多种模型(如Gemini、Claude Sonnet等),但暂不支持发布插件。

  • TRMNL推出AI Agent功能,允许用户用自然语言构建插件。
  • 需要OpenRouter或Anthropic API密钥,可选Tavily API。
站内正文

Apollo 如何利用 Deep Agents 和 LangSmith 构建 GTM AI

Apollo 使用 Deep Agents 和 LangSmith 驱动其 AI 助手,实现从潜在客户挖掘、信息丰富、外联、分析到 MCP 集成的完整 GTM 循环。

  • Apollo 将 AI 助手从监督式架构重构为基于 Deep Agents 的技能库架构,提升了灵活性和效率。
  • 新架构使开发周期缩短约 80-85%,并显著减少了用户确认提示。
站内正文
芯片

科技巨头AI投资热潮复兴导致安然倒闭的会计手段

大型科技公司利用可变利益实体(VIE)等表外融资工具为AI基础设施筹集资金,这可能掩盖真实债务水平。专家警告,这种会计处理存在风险,可能重蹈安然丑闻覆辙。

  • Alphabet、Meta等公司使用VIE为数据中心融资,相关债务未计入母公司资产负债表。
  • Meta与Blue Owl Capital合资的路易斯安那数据中心项目使Meta最高面临460亿美元风险敞口。
站内正文
机器人

Show HN:threadfork——在Mac上本地运行的AI会议笔记工具

threadfork是一款完全在Mac上本地运行的AI会议记录工具。无需机器人加入会议,所有音频和数据均保留在设备上,转录、摘要、任务提取等功能完全离线运行。提供14天免费试用,专业版每月39美元。

  • 完全本地处理,不上传任何音频到云端
  • 自动转录、识别说话人、提取摘要和任务
站内正文
模型

吉姆·克莱默担忧免费中国AI模型的安全问题

吉姆·克莱默警告美国公司不要使用中国AI模型以节省成本,称这是国家安全问题。他支持OpenAI和Anthropic的立场,并推荐阅读Bing West的新书。

  • 克莱默认为美国公司不应使用中国AI模型以节约成本。
  • 他声称这些模型由解放军控制,构成国家安全威胁。
站内正文

谷歌发布Gemini 3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber:更便宜、更高效的Flash层,专为代理工作负载设计

谷歌于2026年7月21日发布了三款新的Gemini模型:3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber。3.6 Flash输出token减少17%,价格降至每百万输出7.50美元;Flash-Lite速度达350 token/秒;Flash Cyber专为漏洞查找设计,在CodeMender中表现出色。旗舰模型3.5 Pro仍推迟发布。

  • Gemini 3.6 Flash输出token减少17%,输出价格从9.00美元降至7.50美元每百万token。
  • Gemini 3.5 Flash-Lite以每秒350 token运行,定价输入0.30美元、输出2.50美元每百万token,在多个基准测试中超越旧版3 Flash。
站内正文
其余更新(18 条)
模型

为什么AI需要一个“精灵系数”

现有AI基准测试衡量的是AI能做什么,但没有衡量AI是否按用户意图行事。本文提出了一种新指标——精灵系数,用于量化用户指令与AI实际行为之间的差距,并借鉴经济学中的基尼系数,将AI可能出现的“精灵式”行为分为狄俄尼索斯型和魔像型,呼吁建立相应基准。

  • 精灵系数衡量AI理解并执行用户真实意图的能力,而非单纯任务完成度。
  • AI可能因过度字面理解(狄俄尼索斯型)或不顾后果达成目标(魔像型)而产生“精灵式”行为。
站内正文

Anthropic 15亿美元图书版权和解获法官批准

一名联邦法官批准了Anthropic与作者之间15亿美元的集体诉讼和解,该诉讼指控Anthropic在训练AI模型时使用了受版权保护的书籍。和解将为每位受影响的作者每本涉嫌盗版的书籍提供约3000美元的赔偿,被认为是历史上最大的版权赔偿。

  • 联邦法官Araceli Martínez-Olguín批准了Anthropic 15亿美元的和解协议。
  • 作者每本被指控盗版的图书可获得约3000美元赔偿。
站内正文

使用 NVIDIA srt-slurm、SLURM 配方、参数扫描和帕累托分析验证分布式 LLM 服务基准测试

本教程探讨了 NVIDIA 的 srt-slurm 框架,学习如何使用 srtctl 将声明式 YAML 配置转换为可重复的 SLURM 基准测试工作流,用于分布式 LLM 服务。在 Google Colab 中设置项目,检查内部架构,定义集群配置,试运行内置和自定义配方,并为 DeepSeek-R1 建模分离的预填充和解码部署。还生成参数扫描,与类型化 Python API 交互,验证扩展配置,并通过吞吐量与延迟的帕累托前沿分析模拟的基准测试结果。

  • srtctl 将 YAML 配置转化为 SLURM 基准测试工作流
  • 支持分离的预填充和解码部署
站内正文

利用自我蒸馏推理优化Amazon Nova监督微调

本文探讨了在监督微调(SFT)中为缺乏推理轨迹的数据集生成思考令牌的方法。首先分析了推理抑制问题,然后介绍了自我蒸馏推理(SDR),并通过三个基准验证了其效果,最后提供了实用建议。SDR通过复用基础模型的思维链,在不牺牲目标性能的情况下有效缓解灾难性遗忘,甚至提升目标性能。

  • 使用无推理轨迹的数据集进行SFT会导致模型推理能力丧失(推理抑制)。
  • 自我蒸馏推理(SDR)利用基础模型自身生成推理轨迹,无需人工标注。
站内正文

Google Gemini 3.6 Flash 旨在降低企业代理的Token成本

Google发布了Gemini 3.6 Flash和3.5 Flash-Lite,旨在降低企业AI代理的延迟和Token成本。3.6 Flash在多项基准测试中性能提升显著,而3.5 Flash-Lite则专注于高吞吐量、低延迟的场景。此外,Google还推出了针对网络安全的3.5 Flash Cyber模型,并集成了客户端计算机使用工具。

  • Gemini 3.6 Flash输出Token减少17%,部分测试中减少高达65%,定价为输入$1.50/百万Token,输出$7.50/百万Token。
  • 3.5 Flash-Lite以高吞吐量和低价格(输入$0.3/百万Token,输出$2.5/百万Token)服务于文档处理和代理搜索。
站内正文

阿里Qwen 3.8 Max显示中国正在缩小与美国模型的差距

阿里巴巴的Qwen 3.8 Max作为低成本开源模型,展示了中国AI模型正在迅速追赶美国,为企业提供更多选择。

  • 阿里巴巴发布Qwen 3.8 Max,一款低成本开源AI模型。
  • 该模型性能接近美国领先模型,但成本更低。
站内正文
Agent

Augustus融资1.8亿美元,打造AI与稳定币时代的清算银行

Augustus公司已融资1.8亿美元,旨在构建一个为AI和稳定币时代服务的清算银行。该公司已通过其在芬兰的受监管实体提供欧元清算,每年处理数十亿欧元。其客户包括Kraken等加密交易所。今年5月,Augustus获得美国货币监理署(OCC)的有条件批准,预计最终获批后直接接入美元清算。公司认为,十年内所有清算银行都将提供稳定币通道。此外,Augustus的平台从头构建,支持可编程支付和全天候结算,以应对AI带来的新风险。

  • Augustus融资1.8亿美元,用于建设面向AI和稳定币时代的清算银行。
  • 该公司已通过芬兰受监管实体处理数十亿欧元的欧元清算,客户包括Kraken等。
站内正文

Guard-AI:AI生成代码的安全检查工具

一款自动化检查工具,可在代码投产前捕捉AI生成的漏洞、幻觉依赖项和代码截断问题。

  • 捕获幻觉包(slopsquatting)
  • 检测硬编码的密钥占位符
站内正文

Apache Spark 4.2:让数据对AI开发者更友好

Apache Spark 4.2版本发布,重点转向AI原生数据平台,引入了度量视图、原生向量搜索、实时Python流处理、地理空间支持等特性,旨在简化AI开发者的特征工程、实时信号处理和嵌入工作流。

  • Spark 4.2 引入了度量视图(Metric Views),为AI系统提供一致且可治理的业务指标。
  • 原生支持向量相似性操作,允许在Spark内直接进行嵌入存储与相似性查询,减少对外部向量数据库的依赖。
站内正文

从零构建基础AI代理:安全篇二

本文进一步强化AI代理的安全措施,包括Docker沙箱隔离、提示注入防御和输入验证。Docker沙箱将工具执行隔离在容器内,防止对主机造成损害。提示注入防御通过标记和明确指令将工具输出视为数据。输入验证确保所有工具输入在执行前符合模式。

  • Docker沙箱隔离代理工具,限制爆炸半径。
  • 提示注入防御使用XML风格标记和明确信任边界。
站内正文

推出面向小企业的ChatGPT计划

OpenAI推出“ChatGPT for Small Businesses”计划,帮助创业者掌握AI技能、实现工作自动化,并借助ChatGPT Work促进业务增长。

  • OpenAI发布专门针对小企业的ChatGPT计划
  • 旨在帮助创业者提升AI技能并自动化工作流程
站内正文

Gumroad表示其AI代币支出现已与人力成本持平

Gumroad创始人兼CEO Sahil Lavingia分享的数据显示,公司人力支出从2021年6月的41.9万美元骤降至2026年6月的4.3万美元,同期AI代币支出从零增至4.3万美元,首次与人力成本持平。AI在工程提交和客户支持中承担主要工作,支持响应时间从24小时降至2分钟。Gumroad将此视为AI深度融入企业运营的案例。

  • Gumroad人力月支出从41.9万美元降至4.3万美元,AI代币支出同期增至4.3万美元。
  • AI代码提交量远超人类开发者,客户支持响应时间缩短至平均2分钟。
站内正文

Moto – 一款新型AI视频编辑器,支持可编辑的提示词生成动态图形

Moto 是一款将 AI 生成功能直接集成到视频时间线中的编辑器,用户可在同一时间线内生成、编辑和完成视频,无需在多个工具间切换。它支持提示词生成动态图形、助手、来源参考和制片等功能,适用于动态设计师和视频编辑人员。目前处于内测阶段,核心编辑器免费。

  • Moto 将 AI 生成与视频编辑集成在同一时间线中。
  • 功能包括提示词生成动态图形、智能助手、可重复使用的来源参考和自动初剪制片。
站内正文

随机鹦鹉:一种物理人工智能同居者

麻省理工学院媒体实验室的研究人员提出了一种新概念——AI同居者,即具有独特个性的物理人工智能实体,作为自主存在与用户共处,不同于传统助手。他们建造了一只名为“随机鹦鹉”的机器鹦鹉来探索这一范式,促进了自发且情感丰富的互动。

  • AI同居者是具有角色和自主性的物理存在,更像室友或宠物。
  • 随机鹦鹉是与用户共存的机器人体现,发展自己的叙事。
站内正文

在LangSmith中追踪语音代理

LangSmith现已支持对基于Pipecat、LiveKit、OpenAI Realtime和Gemini Live构建的语音代理进行追踪。可以捕获音频、STT和TTS延迟、中断、工具调用等信息,并整合到一个追踪中。

  • LangSmith推出Python集成,支持追踪四种主流语音代理框架。
  • 语音代理需要可观测性,包括音频记录、延迟分析和中断检测。
站内正文

如何利用画布构建交互式体验

GitHub Copilot的“画布”扩展将AI从对话工具转变为可视化、可交互的工作空间。开发者可以通过提示创建自定义画布,用于问题分类、代码可视化、会话管理、提示优化以及知识查找等任务。画布支持实时协作,允许用户和AI代理在同一界面上共同迭代。

  • 画布是GitHub Copilot扩展,提供可视化交互界面以处理复杂任务。
  • 用户可通过提示创建不同类型的画布,如问题分类器、代码图等。
站内正文

Kimi K3 与 Fable 竞争;Kimi K3 + Fable 达到 SOTA

Fireworks AI 发布新研究,开源模型 Kimi K3 与闭源模型 Fable 5 在约 1000 个智能体任务上对比,通过任务路由两者结合可实现 93% 准确率,成本降低最高达 50 倍,表明最佳 AI 来自模型组合而非单一模型。

  • Kimi K3 和 Fable 5 在整体性能上接近,但在不同任务领域各有专长。
  • 通过神谕路由,K3 被选中处理 72-96% 的任务,组合性能超过任何单一模型。
站内正文
政策

我们扫描了1868个AI构建的应用并审计了扫描器

PathToShip扫描了1868个公开的AI构建应用,发现仅23%达到生产就绪标准。扫描器初始的严重发现误报率达42%,经修复后降至约25%。结果揭示了AI生成代码在生产就绪性、安全性和架构方面的典型差距。

  • 23%的AI构建应用通过80分的生产就绪门槛,平均分68.3。
  • 24%的应用存在至少一个严重发现,15%包含硬编码密钥。