AI News HubLIVE
站内改写2 分钟阅读

我们扫描了1868个AI构建的应用并审计了扫描器

PathToShip扫描了1868个公开的AI构建应用,发现仅23%达到生产就绪标准。扫描器初始的严重发现误报率达42%,经修复后降至约25%。结果揭示了AI生成代码在生产就绪性、安全性和架构方面的典型差距。

来源Hacker News AI作者: nathanghart

PathToShip最近发布了一份深度报告,基于对1868个公开GitHub仓库的扫描,揭示了使用AI编码工具构建的应用在生产就绪性方面的现状。这些仓库均被确认为使用Bolt、Lovable、v0、Cursor、Replit等九种主流AI工具创建,扫描器对每个仓库执行了80项自动化检查,涵盖安全、架构、可扩展性等七个维度。

结果显示,平均得分为68.3,中位数为71,范围从31到95。仅23%的应用达到80分以上的生产就绪标准。24%的应用至少有一个严重级别的发现,15%存在硬编码密钥或API密钥。安全性和生产就绪性是最薄弱的维度,平均得分分别为65和56;而可扩展性和成本效率表现较好,分别为80和88。这验证了报告的核心论点:AI工具生成的代码高效但缺乏生产运营所需的健壮性。

报告的亮点之一是对扫描器自身的审计。团队手动核验了57个严重发现的代表性样本,发现初始误报率高达42%。通过针对性修复,例如忽略示例文件中的占位符密钥、识别无害值(如错误消息中的“password”)、放宽对服务角色无权限策略的判断,误报率降至约25%。一个重要的检测错误是v0域名的未更新,导致约85%的v0仓库被遗漏,修复后工具检测准确率从76%提升至92%。

尽管有所改进,团队承认仍有约四分之一的严重发现可能为误报,这是由于静态分析无法追踪值的来源。他们选择不通过猜测规则来掩盖真正的漏洞,而是等待数据流分析技术的下一轮改进。报告强调,所有修复均验证了32个手工确认的真实发现未受影响。

各工具的表现显示,严重发现率现在集中在21-31%的区间内,远低于最初报告的22-53%的范围。例如Lovable和Windsurf的早期高误报率已得到纠正。常见的非严重问题包括缺少内容安全策略(90%)、无隐私政策(88%)、大文件(74%)以及无React错误边界(60%)。这些无不表明,AI构建的演示与生产应用之间的差距主要在于常规的工程工作。

PathToShip还公布了其方法的局限性:扫描基于静态模式分析,无法评估运行时行为、部署设置或数据流。此外,扫描的仓库均为公开项目,可能偏向于业余作品和演示,而非真正的生产应用。因此,所有统计数据仅代表扫描的样本,不应外推至所有AI构建的应用。