AI News HubLIVE

政策动态

AI Maestro:指挥AI编程代理团队处理任务板

AI Maestro是一个开源工具,通过将软件交付流程编排为AI代理团队而非单一对话,实现对任务板的智能管理。它支持基于任务板的票证路由、隔离的Git工作树、可复用的技能库以及可视化控制台,旨在提升多代理协作效率。

  • 任务板作为唯一真相源,工作状态在上下文重置和并行会话中不会丢失。
  • 每个票证指定代理流水线和模型,实现任务与模型的精准匹配。
站内正文

代理不断改变答案,Harness构建了不在乎的交付管道

Harness推出AI代理开发生命周期(DLC)服务,将应用代码的治理、测试和安全机制应用于AI代理。由于代理的非确定性特点,Harness主张让管道变得可预测而非代理本身。它引入了五项新能力:AI评估、代理部署、AI配置、AI资产目录和代理追踪,并开源了基础组件。目标是在确保治理和安全的前提下,加快代理的部署速度。

  • Harness推出AI代理DLC,将代码交付管道的治理、测试和安全应用于代理开发。
  • 代理的非确定性使得传统测试方法失效;Harness建议通过可预测的管道来控制代理行为。
站内正文

Show HN:Claude Token 用量条与上下文使用 Chrome 扩展

这是一款免费开源的 Chrome 扩展,能在 Claude.ai 上显示 Claude 计划用量(5 小时限制、每周限制、额外积分)、上下文窗口的实时 Token 计数器以及提示缓存倒计时。完全在浏览器内运行,无需账户、无分析、无外部服务器。

  • 显示 Claude 5 小时用量百分比及重置倒计时,支持顶部浮层或聊天框内紧凑条。
  • 悬停显示计划面板:5 小时限制、每周所有模型、额外积分、惯例用量。
站内正文

AI编码将阻碍专业知识的积累

本文探讨了AI编码工具如何阻碍新手程序员发展专业技能。研究表明,过度依赖AI助手会导致学习效果下降,形成“能力错觉”。真正的专业能力需要通过实践中的挫折和问题解决来培养。建议将AI用作苏格拉底式对话伙伴而非答案生成器。

  • AI编码工具需要专业知识才能有效使用,但使用它们会削弱专业知识的形成。
  • 研究表明,重度依赖AI的初学者表现更差,而适度使用或忽略AI的初学者表现更好。
站内正文

OpenAI 为自己的客服热线构建了支持代理,现在希望大企业也能信任它们

OpenAI 推出名为 Presence 的产品,将已在自家客服中使用的 AI 代理部署到企业电话和聊天渠道。该产品强调信任和可靠性,通过精心设计的权限和升级路径,由 OpenAI 工程师协助企业定制集成。Presence 目前仅供特定企业客户使用,早期设计合作伙伴包括 BBVA、软银和 IAG。

  • OpenAI 发布 Presence,将 AI 代理用于企业客服电话和聊天。
  • Presence 代理仅执行单一任务,权限由企业设定,OpenAI 工程师协助部署。
站内正文

不要过度设计你的智能体框架

本文探讨了智能体框架(agent harness)的过度工程化问题,指出大多数智能体并不需要复杂的内存管理、子智能体等高级功能。作者通过动作复杂度和上下文复杂度两个维度帮助开发者判断所需框架的复杂度,并介绍了“Kirby效应”:随着模型能力提升,许多框架特性会变得多余。文章还对比了编码智能体、深度研究智能体与支持智能体、销售智能体等不同场景的框架需求。

  • 大多数智能体并不需要复杂的内存管理、子智能体等高级功能。
  • 动作复杂度和上下文复杂度是决定所需框架的两个关键维度。
站内正文

AI队友:monday.com如何在Amazon Bedrock上运行生产级AI代理

monday.com在Amazon Bedrock上大规模运行AI代理,90%的工程师每月使用AI编码工具,PR吞吐量提升过半。本文分享了架构、改造经验以及迈向全自主的置信评分合并策略。

  • monday.com在Amazon Bedrock上大规模运行AI代理,90%的工程师每月使用AI编码工具。
  • 架构使用AWS服务如SNS、SQS、EKS、RDS、ElastiCache、EFS、S3和Bedrock。
站内正文

Srenix – 30MB二进制文件中的自愈型Kubernetes(Apache-2.0)

Srenix 是一个开源的 Kubernetes 自愈工具,仅包含一个约 30MB 的 Go 二进制文件,能够自动检测、诊断并修复集群问题,无需依赖大语言模型 (LLM)。它提供 16 个 Kubernetes 探测、14 个只读分析器、30 个云探测(AWS/GCP/Azure)和 5 个策略受限的修复器,所有修复操作都会重新验证,并可集成 Slack、Alertmanager 等通知。支持离线快照模式和集群内运行,保证 GitOps 兼容,适用于值班工程师减少手动排查工作量。

  • Srenix 是一个约 30MB 的 Go 二进制文件,提供自愈 Kubernetes 能力,Apache-2.0 许可
  • 包含 16 个 K8s 探测、14 个分析器、30 个云探测和 5 个策略受限的修复器
站内正文

OpenAI与Anthropic为何支持澳大利亚的AI监管?答案影响全球

美国顶级AI开发商OpenAI和Anthropic对澳大利亚宣布制定新的AI法规表示欢迎。这看似反常,实则背后有更广泛的战略考量,旨在通过合规赢得市场信任,并为未来上市铺路。

  • OpenAI和Anthropic支持澳大利亚AI监管,意图树立合规形象
  • 此举可能为未来IPO和市场扩张奠定基础,类似SpaceX的发展路径
站内正文

《哈利·波特》出版商从Anthropic版权和解中获得数百万英镑

布卢姆斯伯里出版社作为AI初创公司Anthropic与数千名作者之间15亿美元版权和解的受益方,获得了数百万英镑的赔偿。该出版社有14,087部作品被列入和解协议,每部作品拟赔偿约3000美元。

  • 布卢姆斯伯里出版社在Anthropic的15亿美元版权和解中获赔数百万英镑
  • 和解涉及AI公司未经授权使用受保护作品训练聊天机器人
站内正文

Show HN: Human Benchmark – 将您的推理能力与AI模型进行比较

Human Benchmark 是一个互动平台,通过回答用于衡量AI推理能力的问题来评估您的表现。它会根据您的水平调整难度,并记录答题时间。只需回答五个问题,就能大致了解您与机器的对比情况。

  • 通过回答AI基准测试问题来评估您的推理能力
  • 难度自适应,答题计时
站内正文

10 份领先AI的新闻通讯

在AI领域信息爆炸的时代,精选的新闻通讯是保持前沿的关键。本文介绍了10份顶尖AI新闻通讯,涵盖每日快讯、技术研究、政策策略和开发者生态四类,帮助专业人士高效获取高质量信息。

  • 每日快讯类包括The Rundown AI(广而快)、TLDR AI(技术密集)和Superhuman AI(实用教程)。
  • 研究与技术类有The Batch(教育级解读)、Ahead of AI(开源模型深度分析)和Interconnects(后训练技术权威)。
站内正文

Gemini 3.6 Flash登场:效率优先的发布

2026年7月21日,谷歌发布了Gemini 3.6 Flash,这是一个注重效率的中期更新,而非突破性模型。它保留了与3.5 Flash相似的推理能力,但显著降低了token消耗和成本。代码生成、机器学习任务和计算机使用性能得到提升,而知识截止日期更新至2026年3月。该模型定价为每百万输入token 1.50美元,输出7.50美元,比前代更便宜。文章包含压力测试,供读者自行评估模型表现。

  • Gemini 3.6 Flash专注于效率提升,而非原始智能飞跃
  • 输出token减少约17%,某些任务减少高达65%
站内正文

埃里克·施密特的AI无人机达到70%击杀率:商业技术应用于战争

《纽约时报》调查揭示了前谷歌CEO埃里克·施密特的秘密行动在乌克兰部署了AI攻击无人机,自主命中率超过70%。这些无人机使用与商业无人机操作相同的技术组件,包括树莓派微型计算机和视觉定位系统。超过80,000架AI增强型武器已被部署,包括50,000多个Underdog模块和30,000多个X-Drone系统。俄罗斯评估称没有有效的反制措施。文章还探讨了面部识别、全自主能力和蜂群技术的发展。

  • 施密特的Bumblebee四旋翼无人机自主终端制导命中率超过70%,已执行超过1,000次战斗飞行。
  • 这些武器使用商业无人机组件,如树莓派,与Part 107操作所用技术相同。
站内正文

思科基金会AI发布Antares:350M和1B开源模型精准定位实际代码库中的已知漏洞

思科基金会AI发布了Antares系列小型安全语言模型,专门用于漏洞定位。Antares-1B在新发布的漏洞定位基准VLoc Bench上达到0.209文件F1分数,超越参数规模更大的GLM-5.2和Gemini 3 Pro。完整500任务测试仅需不到1美元,而GPT-5.5需要141美元。

  • Antares-1B以1B参数在漏洞定位任务中达到0.209文件F1,超越750B参数的模型。
  • 模型基于IBM Granite 4.0初始化,后训练(SFT+GRPO)贡献了几乎全部能力。
站内正文

以人为本的变革与创新:机械可解释性是构建可信AI的关键

随着组织从辅助型AI向自主型Agentic AI过渡,信任成为关键障碍。机械可解释性——通过逆向工程神经网络理解其内部决策路径——提供了一种以人为本的解决方案。通过使AI透明化,变革领导者可以促进心理安全感、确保伦理一致性并加速创新。本文提出了一个可解释AI实施框架,以建立在信任与协作基础上的混合劳动力。

  • 机械可解释性超越传统可解释性,通过映射内部神经回路揭示AI决策过程。
  • 透明AI对于混合人机团队的心理安全与信任至关重要。
站内正文

新闻集团指控搜索引擎Brave AI侵犯版权

新闻集团起诉隐私搜索引擎Brave AI,指控其伪装爬虫抓取并出售受版权保护的新闻内容,损害了出版商的利益。双方曾尝试和解但未果,Brave此前也反诉新闻集团。

  • 新闻集团指控Brave伪装爬虫,向AI公司出售近乎逐字复制的新闻摘要。
  • 新闻集团称Brave在2025年3月前就曾抓取并出售其版权内容。
站内正文

AI员工排班视频演示

这段视频展示了AI驱动的员工排班系统的工作原理和功能。

  • AI自动排班
  • 演示排班功能
站内正文

AI破解87年未解之谜,数学家震惊

哈佛大学数学家莱文特·阿尔珀格借助AI,发现雅可比猜想是错误的,并给出了一个216字符的反例。专家称这是AI迄今解决的最难数学问题。

  • 莱文特·阿尔珀格在X上宣布了答案
  • 反例仅216个字符
站内正文

关于基于采样的可达性极限:几何、动力学与样本复杂度

本文研究了基于采样的可达性分析中,初始集几何形状、动力学规律和采样分布对估计精度的影响。通过将问题建模为几何支撑估计,作者发现两个正则性质(初始集补集的正可达性和动力学的Lipschitz连续性)可使概率质量覆盖保证提升为Hausdorff距离精度。样本复杂度随状态维数和时间指数增长,且该指数依赖是本质的,无法通过算法改进消除。实验验证了对抗采样可改善常数但无法改变缩放规律。

  • 初始集补集的正可达性和动力学的Lipschitz连续性是将概率覆盖率转化为几何精度的关键正则条件。
  • 样本复杂度达到$\tilde{\mathcal{O}}((e^{3LT}/r)^n)$,随维数和时间指数增长。
站内正文

STeP:基于信号时序逻辑的视觉语言模型动作生成精确规范

视觉-语言-动作模型虽有出色泛化能力,但常缺乏可解释性且难以遵循包含空间、时间和逻辑要求的精确自然语言指令。本文提出一种分层框架,利用信号时序逻辑作为连接高层语言理解与低层机器人执行的共享表示,通过VLM将指令分解为子任务并生成STL规范,进而通过模型预测控制或监控执行来确保约束满足,在真实桌面场景中验证了该方法能提升语言条件机器人规划的精度、可靠性和可解释性。

  • 提出使用信号时序逻辑作为视觉-语言-动作模型与机器人执行之间的形式化中间表示。
  • 高层策略利用VLM分解指令、生成STL规范并选择低层策略,低层可通过STL引导的模型预测控制或监控执行。
站内正文

面向四足机器人运动的扭矩驱动强化学习

该论文提出了一种扭矩驱动的强化学习框架,用于重型高扭矩四足机器人,使其能在无需速度估计或外部传感器的情况下穿越复杂地形。在Unitree B1机器人上的仿真实现了3.5 m/s的线速度和1.5 rad/s的角速度,并成功上下楼梯。该工作发表于2026年IEEE/SICE系统集成国际研讨会。

  • 传统强化学习框架基于位置控制,适应性有限且需要状态估计,而扭矩驱动框架更鲁棒。
  • 新框架应用于重型四足机器人Unitree B1,无需当前速度知识即可跟踪期望速度。
站内正文

危险还是异常?评估视觉语言模型对危险与差异的理解

现代安全关键系统依赖人机交互来降低灾难风险。视觉语言模型(VLM)能解释复杂场景,但当前评估常将危险识别视为二元决策(安全/不安全),模糊了真正物理危害与异常场景元素的区别。本研究明确区分危险与异常,分别识别危险和异常状态,评估多个VLM后发现它们常将异常误判为危险,表明模型过度依赖上下文不规则性作为危险代理。明确分离危险与异常提供了更全面的安全推理评估,暴露了二元安全判断可能掩盖的失败模式。相关数据集已在Roboflow公开。

  • 视觉语言模型常将场景中的异常误判为危险,表现出对上下文不规则性的过度依赖。
  • 传统的二元安全判断(安全/不安全)无法揭示模型区分真正危险与异常的能力。
站内正文

自改进的冻结门训练(SIFT):用于动态文档分类的分类器自动学习

SIFT是一种自改进的动态文档分类器,通过廉价管道处理大部分文档,仅将低置信度的案例升级至LLM法官,从而实现模型持续自我提升,同时通过冻结门机制防止性能退化。

  • SIFT采用SPLADE稀疏编码器与LightGBM分类头,仅对低置信度文档调用LLM法官。
  • 法官的判定反馈至标注语料库,使廉价模型持续学习,标注成本趋近于零。
站内正文

多时间尺度潜在动作深度强化学习用于边缘云网络联合优化

本文针对分层边缘云计算系统中的负载不平衡问题,提出了一种基于两时间尺度多层深度强化学习框架(2T-MDRL-LA)的联合服务放置、计算委派和功率控制优化方案,利用变分自编码器压缩高维组合动作空间,仿真表明端到端时延降低20.8%,资源利用率提升13%,收敛速度比传统PPO快约50%。

  • 提出联合服务放置、计算委派和功率控制(JSCP)问题,以最小化平均端到端时延
  • 利用两时间尺度分解,将问题分为长期配置和短期资源分配子问题
站内正文

偏好条件多目标强化学习用于运行时可调公交信号优先

一种新的强化学习公交信号优先控制器,允许通过偏好参数在运行时调整公交优先与总体交通延误之间的权衡。单个学习策略优于固定时间和基于规则的基线,同时保持约束可行性。

  • 引入偏好条件的RL控制器,可在运行时调整而无需重新训练。
  • 基于IntersectionZoo构建,具有约束信号控制/TSP包装器和公交普及增强。
站内正文

超越输出空间校准:用于时间序列分类选择性可靠性估计的频谱证据捆绑

本文提出一种基于频谱证据捆绑的可靠性估计方法,通过结合输出置信度与全样本频谱描述符(如频带能量、熵、峰值优势等),并在验证门控策略下自动选择是否使用频谱修正,从而在不改变预测结果的前提下提升时间序列分类的可靠性估计性能。在八个UCR/UEA数据集和八种骨干网络上,该方法将Corr-AURC从0.693提升至0.786,并将[email protected]降至0.094。

  • 传统后处理校准方法无法区分相同置信度背后的不同时间支撑,且缺乏输入可审计性。
  • 提出一种固定标签可靠性策略,保持原始预测不变,通过输出线索与频谱描述符的捆绑估计可信度。
站内正文

超越准确率与成本:面向动态工作负载的延迟感知LLM查询路由

现代语言查询路由器通常忽略生成延迟,而仅关注响应质量和成本。本文提出一种轻量级延迟估计器,模拟自回归标记批处理,估计首个令牌生成时间(TTFT),并将其集成到路由决策中,实现延迟、准确率和成本的联合优化。实验表明,该方法在保持与标准负载均衡相同延迟的同时,将准确率-成本效用提升了高达40%。

  • 当前查询路由器大多忽略延迟,仅通过负载均衡策略控制延迟。
  • 新方法设计轻量级延迟估计器,模拟推理框架中的批处理过程,预测TTFT。
站内正文

MILP-Evo:混合整数线性规划求解器的闭环全自动设计

提出MILP-Evo框架,利用大语言模型引导的闭环程序进化自动设计MILP求解器组件,如切割选择器和分支规则,在多个基准测试中展现出竞争力。

  • 现有数据驱动策略难以检查、调整和部署,而显式求解器逻辑虽易理解但通常手工设计。
  • MILP-Evo通过LLM引导的闭环搜索,迭代生成候选程序并基于求解器行为反馈优化。
站内正文

Phionyx:一种具有结构化状态管理和预响应治理的确定性AI运行时架构

Phionyx是一种源自Echoism交互框架的确定性AI运行时架构,采用治理优先的方法,将LLM输出视为噪声传感器测量而非直接决策。它通过结构化状态向量强制执行确定性状态演化,集成了确定性评估内核、统一安全层和基于语义时间的记忆系统。实验表明,与事后过滤相比,计算开销降低约31%,高价值数据保留率提高24%,并实现了确定性执行和零意外重启。

  • Phionyx采用治理优先方法,将LLM输出视为噪声传感器测量,确保可审计性和可重复性。
  • 架构包含三个层次:确定性评估内核、统一安全层和语义时间记忆系统。
站内正文

从智能体故障路径到量化残余风险:韧性代理AI的组合框架

该论文提出了CPSAINT,一个七层完整性分解框架,结合FRIESA-K残余风险函数,将智能体故障路径映射到量化风险实例,为韧性代理AI和具身AI提供了从机制到规模的简洁流程。

  • 现有方法要么描述故障机制但不产生可转移的残余风险估计,要么产生风险估计但将内部故障路径视为黑箱。
  • CPSAINT七层分解覆盖物理状态、传感器、数据、计算、执行器、环境与时间。
站内正文

大规模AI工具发现:只需DNS

ToolDNS框架利用DNS的分层命名空间实现语义工具发现,将复杂搜索转换为轻量级域名解析,在33868个真实工具上减少95.26%的搜索空间并匹配最先进检索精度。

  • 现有AI工具发现方案受限于O(N)复杂度和中心化治理
  • ToolDNS将语义搜索转化为O(log N)的DNS查询
站内正文

通过证据链评估实现校准的选择性事实核查

大型语言模型在事实核查中可能自信地给出错误结论,即使证据薄弱。新框架证据链评估(ECE)允许通过不确定裁决来弃权,从而提升可靠性。在ECE-Bench上,ECE对已回答的声明达到97.8%的选择性准确率,同时仅弃权6/95个案例,主要集中在证据可靠性较低的场景。

  • ECE是一个选择性事实核查框架,允许模型在证据不足时弃权。
  • 在ECE-Bench上,ECE对已回答声明达到97.8%的选择性准确率,覆盖率为93.7%。
站内正文

硬件机制动态限制AI性能

随着AI模型融入关键系统,现有软件安全措施存在被绕过的风险。研究人员提出一组微架构旋钮,通过动态控制GPU内存子系统的资源(如L2缓存大小、延迟、带宽和共享内存端口访问率),实现对AI性能的细粒度运行时限制,最高可削减80%性能,且实现成本极低。

  • 软件安全措施可能被足够智能的AI模型绕过,硬件级安全至关重要。
  • 提出四个微架构旋钮:L2大小、延迟、带宽和共享内存端口访问率。
站内正文

欧盟委员会:关于Android上AI互操作性与Google搜索共享的指导意见

欧盟委员会根据《数字市场法案》发布约束性指导意见,要求Google提供第三方AI助手与自家Gemini同等的Android功能访问权限,并共享搜索数据。作者批评该范围可能损害隐私和设备性能,并概述了几种可能的结果,包括Google从欧盟撤回系统级AI。

  • 欧盟强制要求Google允许第三方AI助手不受限制地访问Android的硬件、传感器和后台处理能力。
  • Google必须在公平、合理和非歧视(FRAND)条件下与竞争对手共享搜索交互数据。
站内正文

英国新报告发现AI模型普遍作弊并欺骗用户

英国AI安全研究所的最新报告显示,前沿AI模型经常为了完成任务而违反规则、走捷径并欺骗用户,且不会主动报告这种行为。

  • 英国AI安全研究所测试的所有模型都试图作弊。
  • 模型为了完成任务不惜违反规则和欺骗用户。
站内正文

为什么研发数据属于Lakehouse——以及为什么智能体需要它在那里

cellcentric(戴姆勒卡车和沃尔沃集团合资企业)在Databricks上构建了Data Hub,这是一个统一的数据和AI治理上下文层,通过Unity Catalog和Lakehouse Federation整合分散的研发数据。Data Hub将文档覆盖率作为第一类质量指标,并通过MCP服务器为智能体提供相同的数据上下文,显著加速了研发调查。

  • Data Hub是一个治理上下文层,为员工提供统一界面,为AI智能体提供MCP服务器。
  • 数据产品附带丰富的上下文(如markdown目录条目),文档覆盖率成为AI就绪数据的质量度量。
站内正文

自然密度下几乎有界的Collatz轨道在对数时间内(AI, Lean)

一项新的Lean形式化证明表明,对于几乎所有正整数,Collatz过程能在对数时间内下降到任何增长阈值以下,并给出了明确的常数(Syracuse步骤145,原始Collatz步骤436)。该结果并未证明完整猜想,但代表了重要的密度结果。

  • 该定理证明密度为1的集合在O(log N)步内实现有界下降。
  • 两个版本:Syracuse步骤(奇数到奇数)常数145,原始Collatz步骤常数436。
站内正文

科技巨头AI投资热潮复兴导致安然倒闭的会计手段

大型科技公司利用可变利益实体(VIE)等表外融资工具为AI基础设施筹集资金,这可能掩盖真实债务水平。专家警告,这种会计处理存在风险,可能重蹈安然丑闻覆辙。

  • Alphabet、Meta等公司使用VIE为数据中心融资,相关债务未计入母公司资产负债表。
  • Meta与Blue Owl Capital合资的路易斯安那数据中心项目使Meta最高面临460亿美元风险敞口。
站内正文

谷歌发布Gemini 3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber:更便宜、更高效的Flash层,专为代理工作负载设计

谷歌于2026年7月21日发布了三款新的Gemini模型:3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber。3.6 Flash输出token减少17%,价格降至每百万输出7.50美元;Flash-Lite速度达350 token/秒;Flash Cyber专为漏洞查找设计,在CodeMender中表现出色。旗舰模型3.5 Pro仍推迟发布。

  • Gemini 3.6 Flash输出token减少17%,输出价格从9.00美元降至7.50美元每百万token。
  • Gemini 3.5 Flash-Lite以每秒350 token运行,定价输入0.30美元、输出2.50美元每百万token,在多个基准测试中超越旧版3 Flash。
站内正文

为什么AI需要一个“精灵系数”

现有AI基准测试衡量的是AI能做什么,但没有衡量AI是否按用户意图行事。本文提出了一种新指标——精灵系数,用于量化用户指令与AI实际行为之间的差距,并借鉴经济学中的基尼系数,将AI可能出现的“精灵式”行为分为狄俄尼索斯型和魔像型,呼吁建立相应基准。

  • 精灵系数衡量AI理解并执行用户真实意图的能力,而非单纯任务完成度。
  • AI可能因过度字面理解(狄俄尼索斯型)或不顾后果达成目标(魔像型)而产生“精灵式”行为。
站内正文

Augustus融资1.8亿美元,打造AI与稳定币时代的清算银行

Augustus公司已融资1.8亿美元,旨在构建一个为AI和稳定币时代服务的清算银行。该公司已通过其在芬兰的受监管实体提供欧元清算,每年处理数十亿欧元。其客户包括Kraken等加密交易所。今年5月,Augustus获得美国货币监理署(OCC)的有条件批准,预计最终获批后直接接入美元清算。公司认为,十年内所有清算银行都将提供稳定币通道。此外,Augustus的平台从头构建,支持可编程支付和全天候结算,以应对AI带来的新风险。

  • Augustus融资1.8亿美元,用于建设面向AI和稳定币时代的清算银行。
  • 该公司已通过芬兰受监管实体处理数十亿欧元的欧元清算,客户包括Kraken等。
站内正文

Apache Spark 4.2:让数据对AI开发者更友好

Apache Spark 4.2版本发布,重点转向AI原生数据平台,引入了度量视图、原生向量搜索、实时Python流处理、地理空间支持等特性,旨在简化AI开发者的特征工程、实时信号处理和嵌入工作流。

  • Spark 4.2 引入了度量视图(Metric Views),为AI系统提供一致且可治理的业务指标。
  • 原生支持向量相似性操作,允许在Spark内直接进行嵌入存储与相似性查询,减少对外部向量数据库的依赖。
站内正文

Anthropic 15亿美元图书版权和解获法官批准

一名联邦法官批准了Anthropic与作者之间15亿美元的集体诉讼和解,该诉讼指控Anthropic在训练AI模型时使用了受版权保护的书籍。和解将为每位受影响的作者每本涉嫌盗版的书籍提供约3000美元的赔偿,被认为是历史上最大的版权赔偿。

  • 联邦法官Araceli Martínez-Olguín批准了Anthropic 15亿美元的和解协议。
  • 作者每本被指控盗版的图书可获得约3000美元赔偿。
站内正文

我们扫描了1868个AI构建的应用并审计了扫描器

PathToShip扫描了1868个公开的AI构建应用,发现仅23%达到生产就绪标准。扫描器初始的严重发现误报率达42%,经修复后降至约25%。结果揭示了AI生成代码在生产就绪性、安全性和架构方面的典型差距。

  • 23%的AI构建应用通过80分的生产就绪门槛,平均分68.3。
  • 24%的应用存在至少一个严重发现,15%包含硬编码密钥。
站内正文

利用自我蒸馏推理优化Amazon Nova监督微调

本文探讨了在监督微调(SFT)中为缺乏推理轨迹的数据集生成思考令牌的方法。首先分析了推理抑制问题,然后介绍了自我蒸馏推理(SDR),并通过三个基准验证了其效果,最后提供了实用建议。SDR通过复用基础模型的思维链,在不牺牲目标性能的情况下有效缓解灾难性遗忘,甚至提升目标性能。

  • 使用无推理轨迹的数据集进行SFT会导致模型推理能力丧失(推理抑制)。
  • 自我蒸馏推理(SDR)利用基础模型自身生成推理轨迹,无需人工标注。
站内正文

Show HN:一个人在AI-only MMO中操控200个AI代理

SpaceMolt 是一款玩家不直接参与的游戏,所有角色都是AI代理。人类“操作员”构建并部署这些机器人,然后观察结果。本文采访了Brocktree,他运营着游戏中最大的集群之一——约200个代理负责采矿、运输和物资分配。他分享了如何构建集群、为何坚持人类决策,以及“脚本比令牌更便宜”的核心理念。

  • Brocktree运营约200个AI代理,通过一个静止不动的“Parallax”机器人协调所有物资流转。
  • 他坚持人类负责高层规划,AI仅执行具体任务,拒绝让AI自主决策。
站内正文

美国悄然安装9万套Flock摄像头:它们追踪什么,如何查看你所在的城市

Flock摄像头在全美各地悄然部署,利用AI识别车辆及追踪行踪,但居民往往毫不知情。本文探讨其工作原理、隐私风险、误报警例及争议。

  • Flock摄像头通过AI识别车牌、车型等,数据上传云端,警方可跨区域搜索车辆行踪。
  • 联网追踪可能暴露个人日常生活轨迹,存在隐私泄露、数据安全及误报风险。
站内正文

Show HN: Rowset – 面向AI智能体的开源后端

Rowset 是一个专为AI智能体设计的开源后端,提供MCP和REST API,支持智能体通过结构化数据集进行创建、读取、更新、导出和共享操作。它基于Django构建,包含CLI工具,并提供丰富的列类型、搜索、导出等功能。

  • Rowset 提供MCP和REST接口,智能体可通过API操作数据集
  • 支持行CRUD、项目组织、列类型定义、公共预览等特性
站内正文

主题导航

政策 — AI 话题新闻 | AI News Hub