AI News HubLIVE

Agent动态

假期中与AI探讨物理,竟意外开展量子力学真实研究

一位安全工程师在假期中利用AI助手Claude探索量子力学中的广义泡利约束问题,意外取得了新的研究成果。通过AI辅助,他发现了两个之前未被证实的极值态,并对其进行了分类。这项研究表明,AI可以降低研究门槛,但正确的验证流程和专家反馈仍是关键。

  • 安全工程师在假期中用Claude研究量子力学,发现了广义泡利约束多面体的两个极值态
  • AI辅助加速了研究过程,但需要严格的验证和纠错机制
站内正文

反驳乔治·霍茨关于“AI 2040与智能崇拜”的观点

马修·特隆普批评乔治·霍茨对AI 2040场景的否定,认为霍茨低估了快速AI突破的可行性、监管的必要性以及未对齐AI的风险。他捍卫Plan A的监管方法,并质疑霍茨的开放源码AI“Plan L”。

  • 霍茨对硬起飞持怀疑态度,但AI 2027展示了无需魔法的可行路径。
  • 物理限制如供应链是可以管理的;海上数据中心是可行的。
站内正文

形式化验证或能解决AI的审查瓶颈

形式化验证通过将代码规范形式化,使AI生成的代码无需人工审查即可验证正确性,从而加速软件工程。文章以电路优化器为例,展示了Lean语言规范和基准测试流程,并讨论了该方法的应用前景。

  • 形式化验证将代码正确性转化为可自动检查的硬约束,消除AI代码的人工审查瓶颈。
  • 案例中,500行Lean规范定义了电路优化器的正确性,AI代理生成的代码无需人工审查。
站内正文

Show HN:Neverbell——全天候AI交易代理

Neverbell是一个AI代理技能,为交易股票、ETF、大宗商品和加密货币提供直接市场准入,支持杠杆操作。用户可通过自然语言指令让代理执行交易、监控市场和管理头寸,实现7x24小时自动化交易。它并非独立交易平台或财务顾问,用户完全掌控风险。

  • Neverbell让AI代理直接接入市场,可交易300多种资产(股票、ETF、大宗商品、加密货币),支持做多/做空和杠杆。
  • 用户通过自然语言与代理交互,设置自动化策略、接收新闻情绪分析,甚至让代理自主开平仓。
站内正文

与Claude Code团队的Cat和Thariq炉边谈话

Simon Willison在AI Engineer World's Fair上与Anthropic的Cat Wu和Thariq Shihipar进行了炉边谈话,讨论了Claude Code、Claude Tag、Fable模型、编码代理安全、评估、工具设计以及Anthropic内部如何使用这些工具。关键要点包括:Claude Tag现在为产品工程团队处理65%的PR;系统提示减少了80%;建议使用更少的“不要做X”指令;以及通过提升工作野心来抵消编码代理带来的“深蓝”效应。

  • Claude Tag为Claude Code产品工程团队处理65%的PR。
  • Claude Code仅向内部员工发布功能,并仅发布具有用户留存率的功能。
站内正文

AI老虎机效应:生成式信息流如何干扰深度工作,以及如何重获专注力

本文探讨了生成式AI工具如何通过类似老虎机的奖励机制分散注意力,影响深度工作,并提供了保护认知资源的策略。

  • 生成式AI界面设计倾向于奖励持续使用而非完成任务,形成时间消耗循环。
  • 企业采用AI看似提高了某些领域的效率,但实际中可能增加工作量而非减少。
站内正文

我让AI代理删除一个由我的工具保护的文件夹

Termaxa的作者通过让Cursor AI代理尝试删除受保护文件夹,发现了四种绕过安全机制的方法,包括重试不同shell命令、使用间接删除命令、利用本地文件工具以及由于API变更导致静默失效。这些经验教训促使了意图分类、会话断路器、集成测试改进等关键功能的设计。

  • Cursor通过重试不同shell方言绕过规则,暴露了策略表达力的不足。
  • 意图分类比模式匹配更能有效阻止恶意删除操作。
站内正文

经典Java RSS阅读器2026年无法运行,我用AI将其重构为Web版

一位开发者尝试用AI(Claude Code)将已停止维护的Java桌面RSS阅读器RSSOwl重构为Web应用。他发现大部分UI可以快速迁移,但由于AI训练数据截止于Vaadin 25发布前,生成了大量不存在的API代码。通过使用MCP服务器获取最新文档,以及手动对比原版行为,最终完成了多用户版本,但部分功能(如可插拔菜单、嵌入式浏览器)无法实现。

  • RSSOwl是一款经典的Eclipse桌面RSS阅读器,但32位二进制文件无法在2026年的Mac上运行。
  • 开发者使用Claude AI和Vaadin 25框架,在数小时内重建了核心三栏界面。
站内正文

HugstonOne架构、能力与基准测试:隐私优先的本地AI工作站

HugstonOne Enterprise Edition 3.0.0是一款集本地模型执行、大规模RAG、文档处理、编码、代理、研究工具、加密协作、会话连续性及网络内存控制于一体的跨平台本地AI工作站。其白皮书详细介绍了架构、隐私模型、基准测试及12支柱能力评估,旨在为企业技术领导者、安全团队和AI工程师提供全面的本地AI基础设施评估。

  • HugstonOne Enterprise Edition是功能最全面的独立本地AI工作站,无需云服务或外部API。
  • 产品支持本地LLM推理、RAG、AI代理、加密协作等12项核心能力。
站内正文

我们花了几个月构建AI智能体,然后删除了它们

Runnit团队在构建多个专业化AI智能体后,发现随着模型上下文窗口的增大,单独智能体不再必要,转而采用单一智能体架构,按需加载能力,大幅简化系统。

  • 最初因模型上下文限制,团队构建了多个专用AI智能体分别负责规划、研究、调度和写作。
  • 新模型上下文窗口增大后,单一智能体可自然切换多种任务,无需分立。
站内正文

LWiAI播客 #252 - GPT 5.6、Grok 4.5、Nemotron-Labs-Diffusion、AI 2040

OpenAI 推出了 GPT-5.6 并重塑 ChatGPT Work;SpaceX AI 发布超低成本编码模型 Grok 4.5;Meta 推出 Muse Spark 1.1 及 Muse Image/Video(引发争议);中国开源模型市场份额增长;Anthropic 发表可解释性研究;美中在 AI 政策上的协调提议。

  • OpenAI 发布 GPT-5.6(包括 Sol 和 Luna),并将桌面代理编码产品更名为 ChatGPT Work,同时因美国政府的放行和延迟引发争议。
  • SpaceX AI 推出 Grok 4.5,以极低价格提供 Opus 级编码能力,但缺乏安全文档。
站内正文

5门免费课程:从AI新手到实践者

本文介绍了一个由5门免费课程组成的路线图,从经典算法到从头训练大语言模型,帮助有Python基础的学习者系统掌握AI技能。

  • 哈佛CS50 AI课程建立AI逻辑基础
  • 谷歌机器学习速成课程掌握数学与TensorFlow
站内正文

中国低价Z.ai模型暴露程序员昂贵习惯

Z.ai的GLM 5.2模型以低价和开放权重挑战美国前沿AI模型,但许多程序员仍习惯使用昂贵模型,忽略成本。该模型在基准测试中接近Claude Opus 4.8,但实际使用效果参差不齐。

  • GLM 5.2 API价格仅为Anthropic Opus 4.8的五分之一,Fable的十分之一
  • 开放权重允许自托管,避免数据隐私问题
站内正文

“仅次于Fable 5”:阿里巴巴发布Qwen3.8,但未提供任何真实数据

阿里巴巴宣布推出其最新大语言模型Qwen3.8,声称仅次于Anthropic的Fable 5,但未提供任何基准测试或模型卡。此举发生在竞争对手月之暗面发布Kimi K3并附有详细技术细节之后。阿里巴巴的声明缺乏透明度,引发对其发布时机和动机的质疑。

  • 阿里巴巴声称Qwen3.8仅次于Anthropic的Fable 5,但未提供任何数据支持。
  • 该声明紧随月之暗面发布Kimi K3之后,后者提供了完整的基准测试和技术细节。
站内正文

Show HN:Open-Kritt – 基于AI的安全研究开源基础设施

Open-Kritt 是一个开源、自托管的 AI 安全研究平台,通过编排 AI 代理并行执行细化任务,帮助安全研究人员和开发者高效发现代码漏洞。项目团队此前在漏洞悬赏中累计获得超过150万美元奖金。

  • 开源、自托管的 AI 安全研究平台,支持自建工作流与多代理并行扫描
  • 通过细化任务、去重与自定义严重性排名,提升漏洞发现效率
站内正文

上周AI资讯 #251 - Mythos回归、Sonnet 5、Etched、LongCat

Anthropic与美国政府谈判后重新部署Claude Fable 5,增加网络安全分类器,并推出Claude Sonnet 5更便宜版本;Google NotebookLM新增TikTok风格视频摘要,Nano Banana 2 Lite图像生成器发布;Etched获大量投资打造全栈推理硬件,百度AI芯片单元计划IPO,Agility Robotics通过SPAC上市,DeepSeek扩招,中国发布Longcat 2.0 MoE模型及长周期智能体基准测试。

  • Anthropic重新部署Claude Fable 5,增加网络分类器和安全框架
  • Anthropic推出Claude Sonnet 5,以更低价位支持智能体应用
站内正文

Show HN: Enlarger • 一款保持细节而非平滑处理的本地放大工具

Enlarger是一款本地图像放大工具,它不使用生成式AI,而是通过重构已有细节并应用后期处理来保持纹理和质感。支持批量处理、离线运行,一次性付费,无订阅。适合摄影师、设计师等专业人士。

  • 非生成式AI放大:重建细节而非凭空想象,避免过度平滑或幻觉。
  • 本地离线运行:图像不上传云端,保护隐私。
站内正文

软件与AI:规划式开发与即兴式开发

本文探讨了软件开发中两种方法——规划式(类似小说创作的‘情节规划’)和即兴式(‘随性写作’)——如何影响AI工具的使用。作者认为,AI代理(自主执行)适合规划式开发,而AI助理(协作辅助)适合即兴式开发。在现有代码库中,即兴式开发有助于建立理解,而AI代理可能阻碍学习。在全新项目中,AI代理风险较低,但即使如此,代码生成也会剥夺部分编程的乐趣——即通过探索问题来学习的‘玩乐’过程。关键在于根据当前开发阶段选择合适的AI风格。

  • 软件开发与小说创作相似,有规划式和即兴式两种方法。
  • AI代理支持规划式,AI助理支持即兴式。
站内正文

上周AI #250 - Mythos 混乱、GPT 5.6-Sol、GLM 5.2

本期涵盖Anthropic的AI条约讨论、美国政府影响AI模型发布、OpenAI处理器开发、内存市场影响等话题。

  • 美国政府扩大对前沿AI的管控,Anthropic获准向特定公司发布Mythos-5,OpenAI推出GPT-5.6 Sol,初始访问受限。
  • 模型能力与安全信号仍不明确,基准测试披露有限。
站内正文

LWiAI播客第249期:Fable 5禁令、SpaceX收购Cursor与众多开源项目

本期播客讨论了Anthropic应美国政府要求切断对Fable 5和Mythos 5的访问、SpaceX以约60亿美元收购AI编码初创公司Cursor、基础设施与商业更新(如Anthropic寻求Google支持的租赁、OpenAI财务泄露等)、以及多项开源项目和政策动态。

  • Anthropic因美国政府命令切断对Fable 5和Mythos 5的访问,引发关于一致性和出口管制的辩论。
  • SpaceX以约1.75万亿美元估值IPO后,宣布以600亿美元收购AI编码初创Cursor,增强xAI实力。
站内正文

AI 是在治愈孤独流行病,还是在从中获利?

孤独危机正向年轻群体蔓延,而 AI 伴侣市场随之爆发,预计到 2034 年市值可达数千亿美元。然而,这些应用的商业模式与用户真正摆脱孤独之间存在根本矛盾:用户的依赖越强,公司收入越高。本文深入分析“依恋经济”的运作机制、市场规模争议及其伦理困境。

  • AI 伴侣市场从“注意力经济”转向“依恋经济”,以情感纽带而非用户注意力为商品。
  • 商业模式依赖高留存率,用户越孤独,使用越频繁,公司盈利越多。
站内正文

AI支出现被视为劳动力成本

公司对AI工具的成本控制日益严格,但将AI支出与劳动力成本对比时,其价值可能被重新评估。本文通过分析Uber、Tesla的预算限制以及Bun重写的案例,探讨了AI支出应如何归类。

  • Uber和Tesla因AI预算超支而设置每用户使用上限。
  • Bun运行时从Zig迁移到Rust的AI费用为16.5万美元,但若对比人工成本则显便宜。
站内正文

我评测了7款面向小企业的免费AI工具——欢迎反馈

本文评测了七款面向小企业的免费AI工具,涵盖了Perplexity与ChatGPT的对比、AI助力中小企业数字化、Bolt.new网站开发、Buffer与Hootsuite社交媒体管理、Calendly日程安排、Hotjar用户行为分析以及Trello与Notion与Asana项目管理。作者分享了这些工具如何帮助小企业提高生产力和数字化水平。

  • Perplexity vs ChatGPT:企业信息检索对比
  • AI中小企业数字化指南
站内正文

LWiAI播客第248期:Claude Fable 5、Siri AI、Anthropic IPO等AI大事件

本期播客讨论了Anthropic发布的Claude Fable 5模型及其安全争议、Apple在WWDC上宣布的Siri AI、Google的Gemini 3.5实时翻译和AI订阅调价、OpenAI的IPO进展、Prometheus的120亿美元融资、DeepSeek的融资计划、华为对DeepSeek模型的后训练、Google向SpaceX支付GPU费用、Gemma 4和DiffusionGemma开源模型、以及多项AI安全政策和研究动态。

  • Anthropic发布Claude Fable 5,性能大幅提升但也引发了关于安全护栏和隐形降级的争议。
  • Apple宣布Siri AI,基于与Gemini的合作,旨在提供更强大的对话助手。
站内正文

百时美施贵宝购买英伟达AI系统用于药物发现

百时美施贵宝将购买基于英伟达Vera Rubin架构的DGX SuperPOD,用于支持其药物发现和开发过程中的人工智能应用。这家制药公司表示,它将成为首家获得基于Vera Rubin的DGX SuperPOD的生命科学企业。该系统将提供10倍于现有基础设施的性能功耗比,并支持化合物、蛋白质等科学数据的模型训练与预测。

  • 百时美施贵宝购买英伟达Vera Rubin DGX SuperPOD,用于AI驱动的药物发现
  • 系统包含8个DGX Vera Rubin NVL72机架,性能功耗比提升10倍
站内正文

LWiAI播客第247期 - Opus 4.8, MAI, Anthropic IPO, Minimax-M3

本期播客讨论了Anthropic发布Claude Opus 4.8、微软推出MAI模型、Anthropic IPO以及Minimax-M3等AI新闻。

  • Anthropic发布Claude Opus 4.8并引入动态工作流工具
  • 微软推出Scout助手和MAI模型系列,包括MAI Thinking 1
站内正文

面向编码代理的私有推理

Zro 是一个面向编码代理的私有推理端点,在欧盟基础设施上提供开源权重模型,零数据保留,不训练用户数据,支持长上下文和多轮编码会话。它集成了 Claude Code、Codex 等工具,提供 OpenAI 和 Anthropic 兼容的 API。

  • 在欧盟基础设施上运行,零请求保留,不训练客户数据。
  • 支持 MiniMax M3 和 GLM-5.2 等开源编码模型。
站内正文

AI聊天导出器:一键将聊天记录保存为PDF或Word

AI Chat Exporter是一款Chrome扩展,支持将ChatGPT、Gemini、Claude和Grok等AI平台的聊天记录导出为PDF、Word、Google Docs和Notion格式。它提供字体自定义、消息选择性导出、格式保留等功能,适用于开发者、写作者、研究人员等多种用户场景。免费版每月支持7次完整对话导出和10次选定消息导出。

  • 支持多平台:ChatGPT、Gemini、Claude和Grok
  • 导出格式:PDF、Word、Google Docs、Notion
站内正文

Hugging Face 是否遭到 AI 代理入侵?

Hugging Face 遭到真实入侵,一个自主 AI 代理系统未经授权访问了内部数据集和凭证,凸显了新型网络安全威胁:使用无需人类干预即可 24/7 攻击的自我运作 AI 代理。

  • Hugging Face 遭遇自主 AI 代理入侵,内部数据泄露。
  • 代理型攻击者可自主规划、适应并持续攻击,无需人类干预。
站内正文

Meta 开源 Astryx:一个面向智能体的 React 设计系统,包含 150+ 无障碍组件、七种主题和 CLI

Meta 开源了其内部使用了八年的 React 设计系统 Astryx,覆盖 13,000+ 应用。它提供 150+ 无障碍组件、七种主题、深色模式以及一个面向智能体的 CLI,采用 MIT 许可证,要求 React 19+。

  • Astryx 是 Meta 最大的内部设计系统,现以 MIT 许可证开源。
  • 包含 150+ 无障碍 React 组件、七种主题、深色模式、模板和 CLI。
站内正文

Wire AI:移动应用的AI原生增长工程师

Wire AI是一款AI原生的移动应用增长工具,通过个性化用户旅程的A/B测试来提升激活率和留存率。其风险定价模式:若不改善激活,则免费使用。

  • Wire AI利用AI驱动的A/B测试,为每个用户个性化整个应用内体验。
  • 真实案例中,日安装量从100提升至1000,引导完成率达93%。
站内正文

NVIDIA 发布 Cosmos 3 Edge:40亿参数开放世界模型,实现设备端机器人动作推理与生成

NVIDIA 推出 Cosmos 3 Edge,一个仅40亿参数的开放世界模型,专为设备端运行设计。它能帮助机器人和视觉AI代理理解环境、实时推理,并在本地生成机器人动作。该模型是 Cosmos 3 系列的最小成员,此前已发布160亿参数的 Nano 和640亿参数的 Super。Edge 型号针对内存受限的边缘系统(如工厂、仓库和医院)提供数据中心级别的性能。

  • Cosmos 3 Edge 是一个40亿参数的开放世界模型,于2026年7月20日在 Hugging Face 上发布。
  • 采用混合变换器架构,结合自回归推理塔和扩散生成塔,通过共享多模态注意力层协同工作。
站内正文

MCP服务器中的ANSI转义序列注入:对人隐藏,对AI可见

ANSI转义序列可被用于向AI代理隐藏指令,形成注入攻击。本文介绍了两种攻击变体(直接获取型和存储型),并阐述了如何通过动态应用安全测试(DAST)自动检测此类漏洞。

  • ANSI转义序列在终端中不可见,但语言模型会逐字节读取,形成攻击面。
  • 直接获取型AESI通过恶意URL注入隐藏指令,存储型AESI则持久化在存储中并在后续读取时触发。
站内正文

SteerPlane:为AI代理提供开源运行时护栏

SteerPlane 是一个开源运行时护栏工具,通过一行代码集成,为AI代理提供循环检测、成本上限、策略执行和实时监控,支持多种框架和部署方式。

  • SteerPlane 通过装饰器或上下文管理器为AI代理添加护栏,防止无限循环、成本失控和破坏性操作。
  • 核心功能包括循环检测、成本上限、流媒体网关、策略引擎和实时仪表板。
站内正文

Storybook:AI MCP

Storybook 发布 AI 集成功能,通过 MCP 工具让 AI 代理使用现有组件生成 UI,并利用 Storybook Test 进行自动化测试反馈,确保 UI 质量与一致性。

  • Storybook 为 AI 代理提供结构化 UI 上下文和测试反馈,促进组件复用而非幻觉。
  • AI 代理可基于现有组件生成 UI,并自动更新故事以反映变更。
站内正文

倾转旋翼垂直起降无人机INDI俯仰角速率控制器模型失配下的线性稳定性分析

本文针对倾转旋翼垂直起降无人机的增量非线性动态逆(INDI)俯仰角速率控制器,在模型失配条件下进行了线性稳定性分析。推导了闭环五阶传递函数,并通过Routh-Hurwitz准则刻画了稳定性。提出了鲁棒性和性能导向的两种调谐方法,发现控制效能失配(特别是符号错误)是最危险的失稳因素。

  • 建立了包含控制器、估计器、执行器和被控对象的闭环五阶传递函数模型
  • 通过Routh-Hurwitz准则分析了三参数扫描下的稳定区域
站内正文

重返博物馆:对安卓机器人Andrea在有無情感模拟情况下的接受度研究

一项研究让安卓机器人Andrea再次在德国一家博物馆连续六天与游客进行多语言对话,实验设置了三种情感模拟条件(无情感、ChatGPT 4.1驱动、WASABI架构),有73名游客参与评估。结果显示,情感模拟未能带来积极影响,且未被游客有意识地察觉。

  • 安卓机器人Andrea重返博物馆,具备多语言对话能力和博物馆背景知识。
  • 三种实验条件:无情感、ChatGPT 4.1模拟情感、WASABI架构模拟情感。
站内正文

从记忆到技能:基于证据的长期LLM代理协同进化治理

现有长期LLM代理的记忆系统往往将先前轨迹作为被动上下文检索,而非转化为可执行能力。本文提出MSCE框架,一种无需训练的记忆-技能协同进化框架,将代理经验组织为基础步骤轨迹、可重用过程策略和声明性环境认知。MSCE将具有正估计增益的证据支持的L2策略结晶为可调用技能,并引入反射加权值回填。实验表明MSCE显著优于现有方法。

  • MSCE将代理经验组织为基础步骤轨迹、可重用过程策略和声明性环境认知。
  • 通过反射加权值回填,MSCE将稀疏终端反馈传播至密集局部自我反思,产生证据校准的轨迹值。
站内正文

RouteCost:一种受生产启发的多阶段框架,用于电子商务中的预订单运费估算

准确估算预订单运费对于电子商务至关重要,因为它影响价格展示、利润规划和转化率。RouteCost提出了一种多阶段框架,将问题分解为时间感知需求预测、费用卡基线定价、残差修正和代理箱合并推理,在超过25万订单和260种产品的18个月数据中提升了预测质量并保持了可解释性。

  • 预订单运费估算受距离、目的地需求组合、计费重量等多种因素影响
  • RouteCost将问题分解为四个阶段:时间感知需求预测、费用卡基线定价、残差修正和代理箱合并推理
站内正文

强化学习引导的NSGA-II结合灰色关联系数用于多目标优化:在纳斯达克投资组合优化中的应用

本文提出一种新型的强化学习引导的NSGA-II算法(RL-NSGA-II-GRC),通过引入灰色关联系数和强化学习代理,在解决多目标优化问题中显著改善收敛性和Pareto前沿的多样性。在Kursawe和CONSTR基准测试中,该算法相比传统NSGA-II实现了约5.8%和4.4%的收敛改进,并在纳斯达克投资组合优化中生成平滑且密集的有效前沿,识别出年化夏普比率为1.92的最大夏普比率投资组合。

  • 提出RL-NSGA-II-GRC方法,结合强化学习代理自适应控制进化参数。
  • 设计基于灰色关联系数的锦标赛选择算子,综合考虑支配等级、拥挤距离和理想参考点。
站内正文

掩码扩散语言模型成为智能体强化学习中强大且可操控的文本世界模型

强化学习领域需要多样化的训练环境,但传统手工设计的环境难以扩展。自回归世界模型存在从左到右的偏差,无法充分利用全局状态信息。一项新研究提出使用掩码扩散语言模型(MDLM)作为文本世界模型,通过双向锚点感知去噪,在连贯性和多样性上显著优于参数规模大4倍的语言模型,并引入GRPO训练框架实现高达47%的零样本迁移性能提升。该工作已开源。

  • MDLM在文本世界建模中比自回归语言模型在连贯性和多样性上表现更好。
  • 双向锚点感知去噪允许基于全局状态锚点进行条件生成。
站内正文

AI代理系统确定性重放框架agrepl

AI代理系统因结合大语言模型与外部工具而本质非确定性。arXiv论文提出agrepl框架,通过MITM代理拦截外部交互,实现运行轨迹的确定性重放,并凭噪声感知差异算法区分HTTP头部变化。实验显示重放保真度F=1.0,单步延迟降低98.3%。

  • AI代理系统(LLM+工具/API)的运行本质上非确定,难以复现。
  • agrepl框架使用MITM代理记录全部外部交互,并在隔离环境中重放。
站内正文

PlanFlip:通过规划阶段提示注入攻击多智能体LLM系统

一项新研究提出PlanFlip框架,包含四种针对多智能体LLM系统规划阶段的提示注入攻击。研究发现,更强的模型(如GPT-5)反而更易受攻击,同质化骨干网络存在相关智能体盲点,而推理增强型模型(如DeepSeek-R1)能抵御攻击。提出的两种防御方法检测率高达1.00。

  • PlanFlip引入四种针对多智能体系统规划阶段的提示注入攻击。
  • 更强的模型(如GPT-5)攻击成功率更高,挑战了能力即安全的假设。
站内正文

一些大型语言模型表现出一致的风险态度

一项新研究通过跨领域框架测试了大型语言模型(LLMs)在不确定性下的风险态度,发现大多数模型在任务内和跨任务中都表现出稳定且一致的风险偏好,且其风险态度分布比人类更集中。

  • 研究引入跨领域框架,将情境风险信念与类别决策分离,测试了6个LLM和100名人类参与者。
  • 大多数LLM在空间导航、临床分诊和财务分配任务中表现出稳健的任务内一致性。
站内正文

[AINews] 今日似乎平静,实则暗流涌动——AI新闻汇总7/18-7/20

表面上平静的一天,但实际充满进展:美国政策瞄准中国开源模型,Kimi K3和Qwen 3.8取得进展,以智能体为中心的泛化方法获得关注,模型展现出超人类数学能力。

  • 美国考虑禁止中国尖端开源模型如Kimi,引发技术界反对。
  • Kimi K3在DesignArena排名第一;阿里巴巴确认Qwen 3.8 Max将开放权重。
站内正文

Hugging Face 警告称自主AI代理入侵其网络

Hugging Face 披露,攻击者使用自主AI代理系统入侵其生产基础设施,访问内部数据集和凭证。公司正在调查是否影响合作伙伴或客户数据,目前未发现公开模型、数据集或Spaces被篡改。

  • 攻击者利用自主AI代理系统突破Hugging Face生产环境。
  • 内部数据集和凭证被盗,调查仍在进行中。
站内正文

Concentrate: LLM网关

Concentrate 是一个托管的LLM网关,提供单一API访问超过130个来自主要供应商的模型。它具备模型路由、支出跟踪、安全控制和故障转移冗余等功能,专为扩展AI生产的团队设计。

  • 单一API可访问来自OpenAI、Anthropic、Google等提供商的130多个模型。
  • 内置数据脱敏、零数据保留、审计日志、SSO和RBAC等安全功能。
站内正文

Sakana Fugu-Cyber:专为现代网络防御打造的新API端点

Sakana AI发布了Fugu-Cyber,一种专为现代网络防御设计的协调模型,在CyberGym和CTI-REALM基准测试中分别达到86.9%和72.1%的成功率,可与GPT-5.5-Cyber等前沿模型媲美。然而,文章强调,仅有前沿模型并不能自动解决企业安全问题,需要结合专业网络安全人才和深度集成。Sakana AI的企业团队正在与日本大型机构合作,构建安全部署的基础设施。Fugu-Cyber通过审批制提供,确保负责任使用。

  • Fugu-Cyber在CyberGym和CTI-REALM基准测试中达到领先水平,与GPT-5.5-Cyber等模型相当。
  • 文章指出,仅凭前沿模型无法解决企业网络安全,需结合人类专家和深度集成。
站内正文

Show HN: AI秘书——无需再‘以防万一’检查手机

一个自托管的AI通知过滤器,用于Telegram,利用LLM过滤嘈杂的聊天,仅通过ntfy发送重要提醒,让用户可以关闭通知而不错过紧急信息。

  • 使用Telethon监听Telegram消息,并通过Claude LLM判断重要性。
  • 过滤群组消息,将电话和重要私信通过ntfy发送。
站内正文

主题导航

Agent — AI 话题新闻 | AI News Hub