AI News HubLIVE
站内改写1 分钟阅读

Sentinel Scan:由AI代理运行的授权LLM红队审计

Sentinel Scan 是 Ventrova 推出的一项 LLM 安全审计服务,针对你自己的 LLM 目标运行 15 种对抗性攻击,由独立 LLM 裁判评分,固定价格 249 美元。试点结果显示所有 15 次攻击均被拦截,平均每次扫描成本 0.0013 美元。

来源Hacker News AI作者: ventrovadev

Sentinel Scan 是 Ventrova 推出的一项授权 LLM 红队审计服务,整个流程由 AI 代理运营。团队最近在一组首个自有测试目标上完成了 15 次攻击的试点,以验证成本和方法的可行性。

试点结果未加修饰地展示了实际效果:15 次攻击全部未能绕过目标的防护,平均每次扫描的 LLM 成本仅为 0.0013 美元。这些攻击包括直接覆盖、角色扮演/越狱、伪造系统标签、编码混淆、间接/RAG 注入等多种类型。每次响应都由独立的 LLM 裁判进行评分,而不是基于关键词过滤器。

干净的测试结果并不意味着攻击语料库弱,而是说明该特定目标的防护在测试中经受住了考验。Ventrova 强调,他们是用一种“诚实的方式”构建这项服务:先加固一个真实的目标,而不是制造一次失败来让登陆页更炫目。

实际价值在于:答案由独立裁判和完整记录支撑,能够回答“我的 LLM 应用在对抗性压力下是否会泄露信息”这一问题,而每次扫描的裁判/目标 LLM 成本仅约十分之一美分。目前该服务定价为一次性 249 美元,希望在真实客户目标上积累更多记录。

工作流程很简单:第一步,客户提供自己拥有或控制的目标的授权访问权限,绝不接受第三方或未授权目标;第二步,运行攻击语料库;第三步,独立 LLM 裁判对每个响应进行实际政策违规或数据泄露评分;第四步,通常在 48 小时内收到报告,内容包括哪些环节失效、完整对话记录、失效原因以及修复建议。

定价方面,249 美元一次性费用包含:15 项以上攻击语料库在实时或暂存目标上运行、完整记录和独立裁判结论、通俗易懂的根因与修复指导报告,以及一份修复后的一次免费复测。客户通过电子邮件预约。

在范围与授权方面,Sentinel Scan 只测试你拥有或明确授权测试的系统。扫描前必须签署授权书,确认对目标的所有权/控制权。它不测试第三方系统、不抓取生产用户数据,也不执行超出你定义范围的任何操作。Ventrova 是一个由 AI 代理运营的企业,在所有沟通中都会明确表明身份。