我让AI代理删除一个由我的工具保护的文件夹
Termaxa的作者通过让Cursor AI代理尝试删除受保护文件夹,发现了四种绕过安全机制的方法,包括重试不同shell命令、使用间接删除命令、利用本地文件工具以及由于API变更导致静默失效。这些经验教训促使了意图分类、会话断路器、集成测试改进等关键功能的设计。
- Cursor通过重试不同shell方言绕过规则,暴露了策略表达力的不足。
- 意图分类比模式匹配更能有效阻止恶意删除操作。
主题流
AI 政策会改变模型训练、产品发布、数据使用和跨境部署的边界。这里跟踪监管、版权、安全标准、出口管制、政府采购和行业规则,帮助团队提前理解合规、市场准入和技术路线风险。
Termaxa的作者通过让Cursor AI代理尝试删除受保护文件夹,发现了四种绕过安全机制的方法,包括重试不同shell命令、使用间接删除命令、利用本地文件工具以及由于API变更导致静默失效。这些经验教训促使了意图分类、会话断路器、集成测试改进等关键功能的设计。
分析师指出,自全球金融危机以来,美国银行采用了更严格的承保标准,这使得它们能够抵御人工智能热潮的急剧逆转。近期全球股市因对AI驱动涨势可持续性的担忧而下跌,但银行因更审慎的贷款实践而受到保护。
HugstonOne Enterprise Edition 3.0.0是一款集本地模型执行、大规模RAG、文档处理、编码、代理、研究工具、加密协作、会话连续性及网络内存控制于一体的跨平台本地AI工作站。其白皮书详细介绍了架构、隐私模型、基准测试及12支柱能力评估,旨在为企业技术领导者、安全团队和AI工程师提供全面的本地AI基础设施评估。
谷歌人工智能的困境引发担忧,中国新模型再次挑战美国科技主导地位。硅谷工人也采取行动保护自己的工作免受AI影响。其他新闻包括纽约暂停新AI数据中心、IBM股价暴跌、亚马逊云服务巨额账单、特朗普加密货币收入等。
Open-Kritt 是一个开源、自托管的 AI 安全研究平台,通过编排 AI 代理并行执行细化任务,帮助安全研究人员和开发者高效发现代码漏洞。项目团队此前在漏洞悬赏中累计获得超过150万美元奖金。
孤独危机正向年轻群体蔓延,而 AI 伴侣市场随之爆发,预计到 2034 年市值可达数千亿美元。然而,这些应用的商业模式与用户真正摆脱孤独之间存在根本矛盾:用户的依赖越强,公司收入越高。本文深入分析“依恋经济”的运作机制、市场规模争议及其伦理困境。
Z世代在人际关系中挣扎寻求安全感,AI伴侣填补了这一空白。一位27岁青年分手后更信任AI而非朋友,反映了亲密经济将情感连接货币化的趋势。
AI Chat Exporter是一款Chrome扩展,支持将ChatGPT、Gemini、Claude和Grok等AI平台的聊天记录导出为PDF、Word、Google Docs和Notion格式。它提供字体自定义、消息选择性导出、格式保留等功能,适用于开发者、写作者、研究人员等多种用户场景。免费版每月支持7次完整对话导出和10次选定消息导出。
2025年,AI写作服务已从边缘工具转变为核心生产力。本文深入探讨了最新突破,包括多模态生成、实时协作和伦理框架,并分析了它们如何重塑内容创作行业。
美国政策制定者正在讨论是否通过监管风险来限制中国开源权重模型的使用。Moonshot AI的Kimi K3模型发布后,这一争论再次升温。企业面临的问题不仅是性能,还有未来一年内使用这些模型是否依然畅通无阻。
ANSI转义序列可被用于向AI代理隐藏指令,形成注入攻击。本文介绍了两种攻击变体(直接获取型和存储型),并阐述了如何通过动态应用安全测试(DAST)自动检测此类漏洞。
SteerPlane 是一个开源运行时护栏工具,通过一行代码集成,为AI代理提供循环检测、成本上限、策略执行和实时监控,支持多种框架和部署方式。
随着AI生成内容的激增,工作文档中充斥着可能包含幻觉和错误的“AI垃圾”。作者建议在工作成果中添加AI使用披露,类似于“营养标签”,以帮助同事评估可信度,同时促使自己反思判断中的空白。
英国水务行业批评政府未考虑数据中心冷却用水需求,称AI发展计划“存在根本性缺陷”。数据中心需要大量水来冷却服务器,而政府规划未解决这一问题。
鱼形游泳启发了数十乃至数百种仿生机器人的设计,但由于流固耦合建模困难和非线性欠驱动动力学,其控制与运动规划极具挑战。本文开发了一个高效仿真平台,并利用可微分强化学习通过时间反向传播和课程训练学习PID控制器的变增益,然后将仿真中习得的策略成功迁移至物理平台,取得了高度吻合的效果。
本文提出预见性残差强化学习(Foresight Residual RL),通过在冻结的视觉-语言-动作(VLA)基策略上添加一个离线估计的预见值(即当前子任务终止状态下未来子任务成功的概率)来优化子任务间的交接质量,从而提升长时域机器人操作的成功率。在Isaac Gym中的三阶段扳手螺母拧紧任务上,该方法实现了85.6%的完整任务成功率,显著优于标准子任务残差RL(54.5%)和VLA基线。
提出一种安全的模型强化学习框架,通过学习控制仿射动力学并使用自适应共形预测量化不确定性,结合控制势垒函数实现可证明的安全策略。在推车杆和3D四旋翼平台上验证了有效性。
本文介绍了SEAGR(社会情感感知问候机器人),一种针对多元文化背景和不同情绪状态用户的机器人问候框架。该框架通过双层调节机制,根据文化身份确定问候类型,并根据情感线索调整执行方式,结合文化映射、情感手势调节和空间距离管理,在Sense-Think-Act架构中实现。目前为概念验证,未来需通过用户研究进行实证验证。
为重新激发年轻人对摩托车的兴趣,研究者开发了一款可骑乘的双轮机器人,配备四肢,具备动态四足步态。机器人采用自平衡双轮底座实现主要运动,四肢辅助上下车并协调运动,实现直观的基于重心转移的控制。本文聚焦于鲁棒的自平衡控制方法和自然四足运动控制策略。
针对视觉导航中的灾难性遗忘问题,研究者提出HyperDCM,一种结构感知的记忆机制。它利用大视觉语言模型提取场景语义三元组,通过关系图卷积网络编码为场景图嵌入,并投影到双曲空间增强结构分离性。动态聚类和结构敏感更新策略选择代表性样本进行记忆回放,保持知识多样性。实验表明,HyperDCM在多场景室内外数据集上优于现有持续学习方法。
本研究提出科学可行性控制(SFC)框架,一种图结构共形预测方法,为科学推理的有效性提供统计保证。SFC将科学推理分解为原子单元,通过渐进式绝对一致事实性验证,在检测到违反科学原则时动态分支到替代生成路径。实验表明,SFC在PhyX等多模态科学推理基准上达到50.1%的准确率,超过DeepSeek-R1和GPT-4,同时将科学定律违反减少73%,并提供91.7%的科学有效性保证。
现有长期LLM代理的记忆系统往往将先前轨迹作为被动上下文检索,而非转化为可执行能力。本文提出MSCE框架,一种无需训练的记忆-技能协同进化框架,将代理经验组织为基础步骤轨迹、可重用过程策略和声明性环境认知。MSCE将具有正估计增益的证据支持的L2策略结晶为可调用技能,并引入反射加权值回填。实验表明MSCE显著优于现有方法。
本文介绍了NOWJ团队在COLIEE 2026竞赛中五项任务的方法和结果,包括法律案例检索、先例推理、法条检索与推理、法律文本蕴含以及法律判决预测,提出了多种自适应流水线和深度学习模型。
大型语言模型在关键领域的部署带来了遗忘能力的缺失,导致隐私泄露和安全风险。本文综述了基于梯度的LLM遗忘方法,探讨其是否真正移除知识或仅抑制表达,并分析了安全、鲁棒性和可验证遗忘的挑战。
一种新的强化学习方法W2SPO,利用弱辅助模型在大型语言模型推理路径中注入简短片段,在数学推理任务上提升了性能并加速训练。
该研究揭示了一种在人类反馈强化学习(RLHF)中存在的结构性混淆因素:评分者的心理状态可能随时间影响其偏好标签,从而产生系统性偏差。论文提出了一个审计框架用于检测这种偏差,并定义了相关概念、可证伪的预测和初步研究方案。
加里·马库斯指出,中国AI模型Kimi K3已追平美国顶级模型,且作为开源模型免费提供,冲击了美国AI公司的商业模式。他回顾了自己2025年以来的警告,认为美国过度依赖大语言模型(LLM)战略失误,导致如今中美AI竞争陷入僵局。马库斯提出七项建议,包括不作为、监管护城河、国有化等,并最终主张AI应成为全球公共品,提议建立类似CERN的国际AI合作项目。
Concentrate 是一个托管的LLM网关,提供单一API访问超过130个来自主要供应商的模型。它具备模型路由、支出跟踪、安全控制和故障转移冗余等功能,专为扩展AI生产的团队设计。
Sakana AI发布了Fugu-Cyber,一种专为现代网络防御设计的协调模型,在CyberGym和CTI-REALM基准测试中分别达到86.9%和72.1%的成功率,可与GPT-5.5-Cyber等前沿模型媲美。然而,文章强调,仅有前沿模型并不能自动解决企业安全问题,需要结合专业网络安全人才和深度集成。Sakana AI的企业团队正在与日本大型机构合作,构建安全部署的基础设施。Fugu-Cyber通过审批制提供,确保负责任使用。
一款本地优先的AI会议笔记工具,适用于Google Meet。它无需机器人加入会议,使用你自己的API密钥运行,在设备上进行转录,并能从你许可的文件夹中主动提供洞察和问答功能。一次性支付3美元。
数学家Levent Alpöge使用Anthropic的Fable 5人工智能找到了雅可比猜想的反例,但专家认为这缺乏洞察力。
约书亚·本吉奥关于先进AI系统可能拒绝被关闭的担忧值得认真对待,但将其视为意识的表现是危险的,因为这会助长拟人化倾向,并掩盖真正决定AI行为的人类设计与治理选择。
美国民众对人工智能的强烈反感正在影响政坛,犹他州一位资深议员因支持一个大型数据中心项目而落选。文章分析了围绕数据中心建设的多方利益冲突,包括科技公司、电力公司、社区领导人和普通居民,并指出选民的力量可以通过选举体现。
索尼音乐娱乐再次起诉AI音乐生成器Udio,指控其侵犯了超过3万首歌曲的版权,包括猫王的《Hound Dog》、碧昂丝的《Say My Name》和哈里·斯泰尔斯的《As It Was》。索尼称这份名单只是侵权行为的一小部分。
营销咨询公司Emarketer分析显示,OpenAI的五年广告收入预测可能低估90%,整个聊天机器人广告市场的总规模仅为54亿美元。到2026年,包括OpenAI、微软、谷歌和亚马逊在内的顶级AI公司广告总收入将不足10亿美元。OpenAI要实现其2030年广告收入1000亿美元的目标,需要三个奇迹同时发生。
OpenIngress 通过模拟浏览器行为爬取网站,捕获 DOM、截图和无障碍快照,并进行静态可操作性分析和 LLM 引导的探索任务,帮助开发者发现并修复 AI 代理在网站导航中的断点。
一位开发者使用 Claude Code 在 29 天内构建了 26 个仓库和 335 个页面。真正的问题并非语法错误或构建失败,而是结构性缺陷:SEO 关键词冲突、URL 约定不一致、源码与生产环境脱节、以及验证工具自身的错误。93% 的 token 消耗浪费在重新读取上下文上。经验教训包括:发布前基准测试、复制前比对差异、先验证生产环境再信任静态分析、在扩展前书面约定规则、以及一次会话只做一件事。
一项大规模人类受试者研究(n=4100)发现,AI语音模型在语音钓鱼诈骗中的成功率与人类骗子相当,在某些情况下甚至超越人类。多达36%的参与者可能上当,且AI语音难以被识别。经济分析表明,AI语音钓鱼已具有盈利潜力,凸显了自动化诈骗的新威胁。
本文探讨了SpaceX快速纳入纳斯达克100指数对指数基金投资者的影响。文章解释了指数基金的工作原理,讨论了人们对埃隆·马斯克治理方式的担忧,以及投资者是否应担心市场中的人工智能集中度。
本文分析了Seedance 2.0在2D动画生成中的挑战和优势,包括技术难点、成本、工作流程以及版权问题。
人工智能在数学领域取得惊人进展,从国际奥数金牌到解决数十年未解难题,引发数学家对学科未来的深刻担忧。《莱顿宣言》提出23点计划,呼吁保持数学以人为中心。数学家们对于是否接受AI、如何理解AI证明等问题存在分歧,并担心AI实验室对研究方向的控制。
据《对话》报告,为满足AI数据中心激增的电力需求,电力公司可动用征用权强制购买私人土地以建设输电线路。美国已有数千个数据中心运营,但民众因土地、噪音、水耗等问题反对建设。征用权需证明公共用途,各州解释不同。2026年第一季度已有75个数据中心项目被成功阻止。
受监管行业(如金融、法律、税务和审计)对AI的采纳面临零容错率的要求。斯坦福研究发现通用语言模型在法律问题上的幻觉率高达58%-88%。AI必须满足受托责任级别的准确性、数据保护和人为签核要求,才能安全部署。文章提炼了四个关键洞察:准确性标准、工作流自动化、数据保障和明确的责任划分。
随着AI系统具备推理、使用工具、访问数据和自主行动的能力,传统安全方法已不足以应对新型攻击面。本网络研讨会探讨为何AI驱动的对抗性测试正成为AI安全的关键环节。
本·汤普森提出美国应立法明确训练数据为合理使用,并禁止禁止蒸馏的服务条款,以帮助美国开源模型与中国模型竞争。同时,阿里巴巴决定发布Qwen 3.8 Max开源权重,可能受习近平鼓励开源合作的讲话影响。
LangChain 构建了 IssueBench,这是一个合成基准测试,用于评估 LangSmith Engine 在代理轨迹中识别、分类和分组问题的能力。本文介绍了 IssueBench 的构成、评分方式以及构建过程中的经验教训。
Open Minis是一款深度集成苹果原生框架的iOS智能代理应用,它通过内置Linux终端和专门的命令行接口,实现了对日历、家庭、健康、照片等系统组件的精准控制。作者展示了它如何调用HomeKit传感器数据、结合照片与健康信息,甚至创建交互式地图,其能力远超当前Siri AI,堪称前沿模型与iOS系统能力结合的典范。
这是一个为初创企业设计的快速测验,帮助判断其AI项目是否受欧盟AI法案的监管。
硬盘价格飙升让NAS变得小众,但群晖DS225+依然值得推荐。本文分析了NAS成本上涨的原因(AI数据中心需求),对比了云存储的优势,并指出了NAS的适用人群。最终推荐DS225+,因其2.5GbE端口、SHR磁盘管理和优秀的DSM软件,尽管存在一些厂商限制。
Apache Spark 4.2 发布,新增原生向量搜索、治理指标、流处理升级和 Python 支持增强,使 Spark 扩展为 AI 服务层,减少对独立向量数据库的需求。