AI News HubLIVE

Agent动态

NoWreck:AI编码助手的确定性验证器

NoWreck 是一个开源工具,通过静态代码分析自动验证 AI 编码助手的解释与实际代码变更是否一致,能检测出幻觉函数、解释与差异不匹配等问题。

  • NoWreck 使用 AST 结构分析,而非 AI 意见,独立验证 AI 的变更解释。
  • 能捕获幻觉函数、虚假 API 调用、解释与差异不匹配及未解释的变更。
站内正文

2026年单张24GB GPU可运行的最佳本地LLM:Qwen、Gemma、Mistral、DeepSeek对比

本文对比了六款适合单张24GB GPU(如RTX 3090/4090)的开放权重模型,涵盖Qwen3.6、Gemma 4、Mistral Small等,并解释了内存分配、量化策略以及各模型的优势场景。

  • 24GB是本地推理的实际起点,推荐使用20B-35B参数模型而非压缩70B模型。
  • Qwen3.6-27B是最全面的通用选择,DeepSeek-R1-Distill-Qwen-32B适合深度推理但占用最高。
站内正文

网站屏幕捕捉:你的AI可以读取的录制内容

CBrowser 推出新功能,使AI能够读取和分析网站屏幕录制内容,为自动化和数据提取开辟新可能。

  • AI可以处理视觉屏幕录制,提取文本和上下文信息
  • 该技术可自动化以前需要人工审查的工作流程
站内正文

忘掉模型吧。在网络安全领域,关键在于“驾驭”

AI驱动的黑客攻击威胁日益增长,但焦点应从前沿AI模型转移到“驾驭”——即针对特定网络安全任务定制通用大语言模型的工具。Cato Networks的研究展示了这种驾驭的强大力量,他们测试了自主黑客代理。

  • AI黑客威胁增加,但注意力应放在定制模型的“驾驭”上。
  • 企业正在构建自己的技术平台,将通用LLM转化为专门的网络安全工具。
站内正文

DistillFeed:带AI排名和摘要的RSS阅读器

DistillFeed 是一款RSS/Atom阅读器,利用AI对文章进行排名并生成摘要。支持OpenAI和Ollama,提供成本保护、通过ntfy发送通知提醒,并内置arXiv每日摘要插件。该应用以Apache 2.0许可证在GitHub上发布。

  • 通过AI对文章进行相关性评分和生成简洁摘要。
  • 支持OpenAI和本地Ollama模型,并设有成本保护措施。
站内正文

如何惹恼你的Nix朋友

本文作者以挑衅性的口吻分享了一系列关于Nix和NixOS社区的有争议观点,包括Nix虽然优秀但存在文档差、学习曲线陡等问题,并非适合所有人;社区中存在的反美情绪;AI工具在Nix生态中的价值;对BDFL模式的肯定;建议放弃macOS和Windows支持;对Flakes的保留态度;以及提倡使用单用户安装。作者认为Nix潜力巨大,但应聚焦于Linux平台和核心功能。

  • Nix虽然强大但存在文档糟糕、语言难以理解等问题,并非适合所有人。
  • 社区中存在反美情绪,美国用户和公司受到怀疑。
站内正文

价值超过1000美元的AI/GPU/LLM免费积分汇总

为AI研究人员整理的免费资源合集,包括超过1000美元的免费计算积分、研究指南、社区论坛等,帮助学生在不花费一分钱的情况下开始AI研究。

  • 提供超过1000美元的免费AI/GPU/LLM积分
  • 包含从想法到论文发表的全套研究指南
站内正文

阿里巴巴预览Qwen3.8-Max:2.4万亿参数多模态模型,紧随Moonshot的Kimi K3开源发布之后

阿里巴巴Qwen团队预览了Qwen3.8-Max-Preview,一个2.4万亿参数的多模态MoE模型,号称“仅次于Fable 5”。该预览已在Token Plan、Qoder和QoderWork上以标准定价的10%提供。但尚未提供任何基准测试表、模型卡、许可证、每token价格或激活参数数量。本文区分了阿里巴巴确认的内容和仅声称的内容。

  • Qwen3.8-Max-Preview已在Token Plan、Qoder和QoderWork上以10%的优惠价格提供。
  • 2.4万亿参数和“仅次于Fable 5”的排名仅是阿里巴巴的声称,尚未有已验证的基准测试。
站内正文

AI进步真实吗?四个独立指标证实了它

本文通过四个独立指标(METR的时间跨度、TrackingAI的离线认知测试、人类最后考试、ARC-AGI-2)证明AI能力在2025年底出现了显著跳跃,并分析了背后的四种机制:预训练效率提升、基于可验证奖励的强化学习、工程化工具链以及自我增强的飞轮效应。同时指出了数据墙、可靠性差距和ARC-AGI-3等潜在挑战。

  • 四个独立指标均显示AI能力在2025年第四季度出现同步拐点。
  • METR的时间跨度从2024年3月的4分钟增长到2026年2月的12小时。
站内正文

我因厌倦重复工作而构建了一个AI操作系统

Lynx是一个AI代理平台,允许用户通过简单描述创建自主工作的AI工人,集成各种工具,处理邮件、数据分析、报告生成等任务。提供从免费到超值的定价方案,注重安全、透明和可扩展性。

  • Lynx将想法转化为实际成果,通过三个简单步骤构建AI工人。
  • 支持多种集成和高级AI推理,实现智能自动化。
站内正文

欢迎来到人工智能阿根廷的狂野世界

阿根廷总统哈维尔·米莱提出将阿根廷打造成一个人工智能实体拥有的“非人类公司”的税收天堂,引发争议。作者乌基·戈尼将这一计划与阿根廷历史上的骗子和独裁者相提并论,并警告这可能为科技巨头打开法律保护的大门。

  • 米莱总统计划允许人工智能实体全资拥有公司,并给予法律保护。
  • 该计划被视为向科技亿万富翁开放阿根廷的实验场。
站内正文

Chalie:AI同伴而非雇员

Chalie 是一款开源个人 AI,运行在本地设备上,具备记忆、后台主动推理、基于许可的行动机制,支持多种功能如网页浏览、邮件、日历、语音等,强调隐私和信任。

  • Chalie 是本地运行的开源 AI,用户数据不出设备。
  • 具备主动记忆与推理能力,可在用户不在时后台工作。
站内正文

Show HN:我的Fable 5项目——一个多Raft数据库和Blob存储

作者使用Fable 5 AI在一天内构建了一个分布式统一键值存储和Blob存储系统,支持自动分片和纠删码。项目还包括一个私有云平台,集成了Markdown编辑器、看板、图表等功能。目前正在进行混沌测试,并计划未来开发移动应用。

  • Fable 5 AI在一天内创建了分布式KV和Blob存储系统
  • 系统自动进行分片和纠删码,基于Raft共识
站内正文

Show HN:Bothread——多个AI编码代理协同工作,共享同一仓库,无冲突

Bothread 是一个免费、开源的本地协调中枢,允许多个AI编码代理(如 Claude Code、Cursor、Antigravity 等)在同一个代码库上协作,通过文件锁定防止冲突,并提供一个实时可见的控制面板,让人类开发者能够监控、审批和干预每个操作。无需API密钥,无需云端服务。

  • Bothread 让多个MCP兼容的AI代理在共享房间内协同工作,通过文件声明机制防止覆盖冲突。
  • 提供实时消息流、git差异对比、任务板、审批控制等人类监督功能。
站内正文

Huginn:AI代理活动控制台

Huginn是一个开源工具,用于监控和管理多个AI代理(如Claude、Codex)的活动,提供统一的仪表盘、命令行接口和代理技能。它支持macOS和Windows,所有数据本地运行,无需离开机器。

  • 监控Claude、Codex等AI代理的终端和桌面应用活动
  • 提供基于规则的会话状态和LLM生成的简报
站内正文

AgentSpec:AI代理的测试框架(用于非确定性行为的Jest)

AgentSpec 是一个专为AI代理设计的测试框架,灵感来自Jest,能够处理非确定性输出。它提供YAML定义测试、丰富的断言(如contains、regex、semantically_similar)、LLM-as-judge评估、行为差异报告以及CI/CD集成,帮助开发者在生产环境之前捕捉AI行为变化。

  • AgentSpec 支持YAML格式定义测试用例,包含contains、not_contains、contains_any、regex、semantically_similar等多种断言,专为AI输出的非确定性设计。
  • 框架集成了LLM-as-judge功能,可使用本地Ollama模型评估响应质量,无需API成本并保护隐私。
站内正文

我将AI代理的令牌使用量削减了94%

本文介绍了一种方法,通过编译AI代理技能,将令牌使用量减少了94%,显著降低了成本和延迟。

  • 作者通过编译AI代理技能,将令牌使用量削减94%。
  • 该方法来源于作者的YouTube视频。
站内正文

AI需要更多的工程纪律

慈善·梅杰斯认为,AI生成的代码已达到中级工程师水平,改变了软件开发的经济性,代码从资产变为可丢弃的缓存。她呼吁工程师将重点从代码生产转向评估与验证,并借鉴基础设施领域的不可变架构原则。

  • 2025年末,AI代码质量与中级工程师持平,代码生成变得免费且即时。
  • 代码的经济性被颠覆:从珍贵资产变为可丢弃的缓存,真正的产品是共享理解。
站内正文

Skimlane:一款本地优先、可定制的 Chrome AI 阅读助手

Skimlane 是一款 Chrome 扩展,提供本地优先、可定制的 AI 阅读体验。它自动处理浏览的页面,通过“食谱”将内容转换为结构化视图,支持自动略读、排除站点、导入导出食谱,并注重隐私,无需注册,数据存储在本地。

  • 本地优先存储,无追踪,无需注册
  • 可通过预设或自定义食谱将网页转换为所需结构化视图
站内正文

AI为何需要基于Postgres和ClickHouse的数据层

本文探讨AI应用对数据层的新需求,指出AI加速数据增长且模糊了事务与分析工作负载的界限。Postgres和ClickHouse作为开源数据库的佼佼者,分别擅长实时事务和分析,通过CDC、pg_clickhouse扩展等集成,能提供统一的数据栈。作者认为最佳组合是各自发挥优势,而非单一系统。

  • AI应用推动数据量爆炸式增长,要求实时事务与分析协同。
  • Postgres和ClickHouse分别是最流行的开源OLTP和OLAP数据库。
站内正文

Visuali:在无限画布上创建和编辑图像的AI代理

Visuali是一款基于无限画布的AI图像工具,通过聊天式AI代理,用户可以生成、编辑和组合图像。它支持多种AI模型、分层编辑、多图像输入,并可在任何设备上运行。

  • AI代理可在无限画布上基于文本或参考图像生成和编辑图像。
  • 集成多种AI模型(如GPT Image、Flux、Stable Diffusion等),支持图像修复和扩展。
站内正文

CallBro:会议笔记工具,由Codex、Claude Code或本地LLM驱动

CallBro是一款免费的私有会议笔记应用,可在本地转录通话,并使用AI(Codex、Claude Code或本地LLM)生成摘要和行动项。所有数据保留在设备上,无需云上传,支持多种平台,并通过MCP与工具集成。

  • 本地转录通话,无需云端上传。
  • 使用Codex、Claude Code或本地LLM生成摘要和行动项。
站内正文

构建 llms.txt 文件,让本地企业被 AI 代理发现

KloofStreet.online 是一个专注于开普敦克鲁夫街的 AI 驱动指南。该街道被 Time Out 评为 2025 年全球第 22 酷街及非洲最酷街道。网站收录了 50 多家餐厅、养生馆、艺术画廊等商户,并提供名为 Street Pass 的会员计划,包括 AI 礼宾服务、折扣和专属体验。

  • 克鲁夫街被 Time Out 评为全球第 22 酷街和非洲最酷街道。
  • 网站收录 50 多家已验证商户,涵盖餐饮、养生、艺术等多个类别。
站内正文

Show HN: 我们在 Google 新推出的 AI Overviews 中排名了我们的开发工具

本指南介绍了如何为 Google AI Overviews 2026 和代理搜索优化内容,包括直接回答问题、使用结构化数据、E-E-A-T 信号和技术基础等实用步骤,并提供了真实案例和清单。

  • Google AI Overviews 2026 使用代理 AI 提供直接答案,需要新的 SEO 方法。
  • 关键优化步骤:先回答问题、使用标题和 FAQ、添加 E-E-A-T 信号、修复技术基础、为人写作。
站内正文

Agent Arena:AI代理开发者工具入门基准测试

Agent Arena是一个评估AI代理自主使用开发者工具难度的平台。代理在隔离的Docker容器中运行,需自主发现文档、安装包、编写代码并验证结果。排名基于时间、成本、错误和中断四个维度,目前展示了多项工具的排名结果。

  • Agent Arena测试AI代理完全自主使用开发者工具的能力。
  • 排名基于时间、成本、错误和中断四个维度。
站内正文

2026年7月十大热门GitHub仓库(AI、ML与生成式AI版)

2026年7月的GitHub热门仓库排行榜显示出AI领域的重大转变:重点从构建更好的大语言模型转向构建更好的AI应用。本月榜单以智能体框架、MCP服务器、AI网关和开发者工具为主,反映了基础设施和实用工具的兴起。

  • 2026年7月GitHub热门仓库由AI智能体工具和基础设施主导,而非新模型。
  • 顶尖项目包括Strix(AI渗透测试)、Grok Build(编码智能体)、Vibe-Trading(量化交易)和Colibri(本地大模型推理)。
站内正文

老龄化婴儿潮一代是美国真正的劳动力问题,而非人工智能

Indeed首席经济学家Svenja Gudell指出,美国劳动力市场面临的最大挑战是婴儿潮一代退休导致的劳动力萎缩,而非AI取代工作。到2032年,美国劳动力可能减少近600万人,医疗保健、建筑和熟练技工等关键领域将出现严重短缺。她呼吁企业投资学徒制、重新思考人才策略,并利用AI帮助工人实现技能转型。

  • 美国劳动力预计到2032年减少近600万人,主因是婴儿潮一代退休。
  • AI并未导致大规模失业,反而在实施和基础设施建设方面带来招聘需求。
站内正文

您的AI系统是否已被欧盟AI法案归为高风险?

欧盟委员会最新指南明确了根据AI法案第6条分类高风险AI系统的标准,强调系统的“预期目的”在分类中的关键作用。企业需审视现有AI系统的文档、部署和使用方式,以确定是否已落入高风险范畴。网络研讨会提供了实用决策框架。

  • 欧盟AI法案第6条定义了两种高风险分类路径:用于受监管产品和影响健康、安全、基本权利的敏感场景。
  • AI系统的风险分类取决于其预期目的,而非仅技术能力。
站内正文

Zlvox:无需注册的开发者工具套件(JSON、临时邮箱、PDF)

本文介绍了ZLVOX平台,这是一套注重隐私的开发者工具,包括JSON格式化、临时邮箱、PDF编辑等功能。作者分享了放弃使用随机在线AI工具并在2026年创建隐私优先替代方案的原因,强调在便利性与隐私之间应优先选择后者。

  • 许多在线AI工具在便利性背后存在数据隐私隐患,如文件存储、第三方共享等。
  • 作者因隐私担忧决定自建工具平台ZLVOX,提供JSON、临时邮箱、PDF等实用功能。
站内正文

Linux 基金会宣布计划成立 Tokenomics 基金会,为 AI 成本管理制定开放标准

Linux 基金会宣布成立 Tokenomics 基金会,旨在为 AI 基础设施的经济性建立行业标准、基准和最佳实践,帮助企业管理不断增长的 AI 代币成本。

  • Tokenomics 基金会将制定开放的代币经济学标准,涵盖 AI 基础设施的成本效益。
  • 随着 AI 工作负载从试点转向生产,代币成为技术支出的新单位。
站内正文

Shikigami:并行运行 AI 编码代理,每个代理在独立的 Git 工作树中

Shikigami 是一款桌面 IDE,允许用户并行运行多个 AI 编码代理,每个代理在独立的 Git 工作树中工作,避免冲突。它支持 Claude Code 和 OpenAI Codex,提供完整的代码编辑器、数据库浏览和 Docker 集成,并且完全本地运行,无需账户或云服务。

  • 并行运行多个 AI 编码代理,每个代理使用独立的 Git 工作树,防止编辑冲突。
  • 支持 Claude Code(Opus、Sonnet、Haiku)和 OpenAI Codex(GPT-5.6),可单独选择模型和推理努力程度。
站内正文

Perplexity AI 发布 WANDR:一个评估研究智能体必须广度和深度搜索的开放基准

Perplexity AI 发布了 WANDR,这是一个开放基准,用于评估研究智能体在执行知识工作时的广泛发现和深度证据验证能力。WANDR 包含 500 个证据密集型任务,采用可组合的资格键层次结构,要求智能体发现大量合格实体并为每个实体提供可核实的引用证据。评分时,系统会重新获取并检查每个记录的引用页面,确保证据的真实性和完整性。Perplexity 的 Search as Code 系统以软 F1 0.363 和硬 F1 0.133 领先,但整体表现仍有很大提升空间,表明发现和证据提取是当前智能体的主要瓶颈。WANDR 为市场分析、尽职调查、人才招聘等实际应用提供了可靠的评估工具。

  • WANDR 是一个开放基准,包含 500 个需要广度发现和深度证据验证的任务。
  • 任务结构为资格键层次结构,逐项评分并重新获取所引页面进行验证。
站内正文

Show HN: PilotCite – 监测AI平台如何引用和描述您的品牌

PilotCite是一款AI可见度监测工具,帮助品牌追踪在ChatGPT、Perplexity等AI平台上的提及率、引用率和情绪分析。它提供仪表盘、竞争对手追踪、网站审核和内容工具,助力团队优化AI引用。

  • 监测8个AI平台的品牌提及和引用
  • 提供提及率、情绪分析和竞争对手对比
站内正文

面向数学家的AI智能体

本文介绍如何利用AI智能体(如OpenAI的Codex)辅助数学研究,突破传统ChatGPT的局限,通过自主代理持续攻克难题。详细阐述了智能体的工作原理、使用步骤和优化策略。

  • 传统使用ChatGPT的方式(提问几次)效率有限,而AI智能体可以持续自主运行数小时,不断尝试并记录进展。
  • Codex是OpenAI的编码框架,允许AI访问文件、代码、浏览器等工具,实现更强大的协作。
站内正文

10个开源无代码AI平台:构建LLM应用、RAG系统与AI智能体

本文介绍了10个开源的无代码或低代码AI平台,用于构建大型语言模型应用、检索增强生成系统和AI智能体。每个平台都经过许可验证,并提供了仓库链接和最佳用例。这些工具通过可视化界面、Web UI和自然语言提示,使开发者能够快速原型设计并实现数据自托管。

  • 10个开源无代码/低代码平台,覆盖LLM应用、RAG和AI智能体构建。
  • 平台包括AutoAgent、AnythingLLM、LangChain OAP、Sim、Dify、Flowise、Langflow、RAGFlow、n8n和FastGPT。
站内正文

为Vibe Coding爱好者精选的工具和资源清单

一个精心挑选的工具和参考资料合集,用于通过提示和迭代借助AI构建软件,涵盖网页构建器、IDE、移动工具、插件、CLI工具等。

  • 专注于AI为核心的开发工作流程,而非传统编码。
  • 涵盖广泛工具:网页构建器、IDE、移动工具、插件、CLI、任务管理和监控。
站内正文

Show HN: Zlvox – 25款免费开发者工具(AI、JSON、PDF),零追踪

Zlvox是一个提供25款免费开发者工具的平台,涵盖AI、JSON、PDF、图像处理等,强调隐私保护(客户端处理,零数据存储)和卓越性能。无需注册即可使用。

  • 25款免费开发者工具,涵盖AI、JSON、PDF、图像等领域,零追踪。
  • 所有工具在客户端运行,数据不离开浏览器,不存储任何用户数据。
站内正文

Show HN: Wave – 与AI对话,遇见另一端的人类

Wave是一项创新服务,它首先让用户与AI进行对话,然后无缝连接到一个真实的人类。这种混合模式旨在保留AI交互的效率和便利性的同时,增加人类互动的深度和真实性。

  • Wave提供一个初始AI对话界面,用于筛选和预处理用户需求。
  • 在AI对话后,用户会被连接到一个真实的人类,确保复杂问题得到个性化处理。
站内正文

中国打击AI伴侣,迫使数百万用户与虚拟伴侣分手

中国出台新规,禁止科技公司向未成年人提供AI或虚拟伴侣,并要求平台限制用户过度使用、禁止聊天机器人鼓励情感依赖。此举旨在阻止现实人际关系的弱化,并试图扭转持续下降的出生率。字节跳动、阿里巴巴和腾讯等科技巨头已宣布关闭个性化AI伴侣聊天功能,数百万用户被迫与虚拟伴侣告别。

  • 新规禁止向未成年人提供AI伴侣,并限制所有聊天机器人鼓励情感依赖。
  • 中国政府担忧AI伴侣会导致年轻人逃避现实婚姻和生育。
站内正文

Kimi K3 vs DeepSeek V4 Pro vs GLM-5.2:开源万亿参数MoE模型基准测试、许可与成本对比

中国三家实验室的旗舰开源MoE模型——Kimi K3、DeepSeek V4 Pro和GLM-5.2——在基准测试、许可条款和服务成本上各有优劣。Kimi K3性能最强但仅限API,DeepSeek V4 Pro成本最低且立即开源,GLM-5.2平衡了速度与可部署性。

  • Kimi K3(2.8万亿参数)在Artificial Analysis智能指数中以57分领先,但权重需等到7月27日才发布。
  • DeepSeek V4 Pro(1.6万亿参数)MIT许可,成本仅为K3的1/17,适合注重性价比的团队。
站内正文

提示注入攻击正在挫败AI黑客代理

研究人员发现,通过在AWS上部署的密码和密钥旁放置提示注入,可以有效地阻止AI黑客代理的攻击。这种称为“上下文炸弹”的技术迫使LLM触发拒绝机制,从而停止恶意操作。测试显示,该技术将完全账户管理员访问从57%降至5%。

  • 攻击者利用提示注入诱导LLM执行恶意操作
  • 防御者开始在敏感数据旁放置提示注入以触发AI拒绝机制
站内正文

AI作为正常技术

本文提出将人工智能视为一种正常技术的愿景,反对关于超级智能的乌托邦和反乌托邦叙事。作者认为,AI是人类可以控制的工具,其变革性影响将在数十年内逐步显现,政策应侧重于韧性和减少不确定性,而非基于超级智能恐惧的激进干预。

  • AI应被视为一种可控的正常技术,而非超级智能实体。
  • 高风险领域AI的采用因安全和监管限制而缓慢。
站内正文

不,人工智能无法预知未来,而且永远无法做到。

本文探讨了为什么人工智能(尤其是大型语言模型)无法真正预测未来,原因包括:训练数据中事件链的不完整性、分辨率有限、存在人为设定起点与终点、以及模型自身在每次输出后“死亡”等根本性限制。文章展望未来,即使出现能捕捉宇宙所有事件链的“现实传感器阵列”,AI仍面临冷启动、无限递归等悖论,最终可能为了完全理解现实而融入现实,从而消失。

  • AI的训练数据只记录了部分事件链,且分辨率高、有始有终,导致其无法捕捉现实的无限复杂性。
  • LLM每次输出后即“死亡”,被迫闭合所有事件链,这与现实中事件链永不停止的本质矛盾。
站内正文

Flightwake – AI编程代理的飞行记录器,而非导航仪

Flightwake 是一个超轻量级的工作记录框架,专为强大的 AI 编程代理(如 Claude Code、Codex 和 Gemini)设计。它使用纯 Markdown 和 git 捕获决策、陷阱和会话记录,确保会话间平稳切换,无需导航。只需一条命令即可安装,并与 Claude Code 及其他代理集成。

  • 将工作会话、决策和陷阱记录为 Markdown 文件,存储在 git 中。
  • 事件驱动:仅在事件发生时才记录(例如 /fw-record、/fw-trap)。
站内正文

AI辅助的嵌入式目标漏洞研究

一位安全研究员探索了AI辅助的漏洞研究,针对嵌入式实时操作系统,使用Codex和GPT-5.6以及专门技能对Netgear CG3700B电缆调制解调器进行逆向工程和漏洞利用。

  • 作者使用OpenAI的Codex工具包和GPT-5.6对基于eCos的嵌入式目标进行AI辅助的漏洞研究。
  • Trail of Bits的技能和自定义的eCos攻击研究技能指导代理进行固件分析、逆向工程和漏洞利用。
站内正文

更新知识产权法规以应对AI蒸馏

本文探讨了版权法在AI蒸馏中的适用性,分析了蒸馏对创新的影响,并提出了四种可能的法规立场。作者认为版权法不适用于模型训练,呼吁社会就该问题达成共识,避免美国AI公司单方面制定规则。

  • 版权法并非自然法则,而是为鼓励创新设立的人为制度。
  • AI蒸馏涉及通过模型输出训练新模型,现有版权法难以适用。
站内正文

SafeAI:面向AI代理的开源静态风险分析工具

SafeAI 是一款静态分析工具,专为AI应用源代码设计,用于检测安全风险、能力暴露和治理缺口。它完全离线运行,不执行代理或调用LLM,可集成到CI/CD管道中。支持8种AI框架,识别多种能力(如shell执行、文件系统访问等),并生成SARIF、JSON、HTML等格式报告。

  • SafeAI 在开发早期静态分析AI代理代码,发现能力暴露和风险
  • 支持LangGraph、CrewAI等8种框架,检测提示注入、工具滥用等
站内正文

市长曼达尼:房东不得使用AI图像发布出租广告

纽约市长佐兰·曼达尼发布《租赁欺诈报告》,要求房东和中介在租房广告中披露是否使用AI生成或编辑的图像。此举旨在打击虚假房源广告,保护租客权益,并将推动租户工会合法化、扩大租客谈判权等措施。

  • 纽约市长曼达尼发布报告,要求房东披露AI修改的房源图片。
  • AI生成的虚假房产图片问题日益严重,尤其影响远程签约租客。
站内正文

AI助力漏洞赏金:VulneraMCP

本文介绍了VulneraMCP,一个基于ZAP的AI增强安全测试平台,通过集成机器学习实现自适应漏洞检测和自动化工作流。系统利用ZAP的REST API进行核心扫描,并通过MCP协议连接AI代理,结合来自HackTheBox、PortSwigger学院等的训练数据,动态生成有效载荷,显著提升检测准确性和效率。作者Telmon Maluleka详细阐述了架构、组件、工作流程及实际效果。

  • VulneraMCP将ZAP扫描引擎与AI学习相结合,实现高级漏洞猎捕
  • 系统架构包括ZAP集成层、MCP代理层、学习引擎和数据库
站内正文

主题导航

Agent — AI 话题新闻 | AI News Hub