企业AI的数据优先安全策略
本文探讨了AI采用与数据治理之间的差距,指出88%的组织已使用AI,但仅有35%的组织能完全了解非结构化数据的存储位置。文章通过专家见解提出了四个关键洞察:实时敏感数据流映射、统一治理、开发前问责框架以及数据级安全控制。
企业AI的承诺与现实之间存在一个关键鸿沟:模型和代理访问敏感数据的速度远超组织监控、治理或解释这种访问的能力。这一差距使领导者难以证明合规性、控制风险敞口,也无法解释AI如何使用数据。斯坦福HAI报告显示,88%的组织现已在业务中使用AI,而2025年有记录的AI事件从2024年的233起激增至362起。美国政府问责局指出,金融服务中AI的应用引入了数据质量、隐私和网络安全风险,监管机构正在积极审查。
云安全联盟的报告进一步揭示了结构性问题:仅35%的组织能完全掌握非结构化数据的存储位置,只有9%具备实时扫描能力,23%完全无法扫描非结构化数据风险。这些限制约束了任何AI系统的表现。
Emerj的Yolandi de Weerdt主持了一场对话,邀请了Securiti的产品营销总监Chris Joynt、谷歌云AI专家James Dean、Securiti区域销售副总裁Mark Crean、花旗数据分析副总裁Oscar Rodriguez博士以及Veeam Securiti AI销售工程团队副总裁Todd Vancil。本文提炼出四个核心洞察,定义了金融服务中安全可扩展AI所需的数据、治理和安全要求。
实时敏感数据流映射与预摄取控制
Chris Joynt指出,许多企业的数据资产中非结构化内容已超出传统治理实践的检查范围。客户运行着超过20万个数据系统,产生数十亿文件,每天生成PB级日志。在这种规模下,即使确定文件中存在哪些敏感信息也成为结构性挑战——而这个挑战出现在任何模型构建或评估之前。
Joynt的核心观点是,一旦非结构化数据被摄取、转换或向量化,组织就会失去对其使用情况的可见性。原始形式被掩盖,衍生副本泛滥,治理团队无法可靠地追溯敏感信息进入AI系统的途径。预摄取可见性成为了唯一可以施加控制的地方。
“非结构化数据一夜间变成了黄金。机构产生大量数据,仅日志每天就可能达到PB级。你不能直接把这些数据交给AI并期望模型自己搞清楚。你需要知道文件里有什么,它们的敏感程度如何,以及它们流向何处。一旦数据进入模型,你就失去了控制。对数据流的可见性是第一道安全防线。”
——Chris Joynt,Securiti产品营销总监
他为企业高管提供了清晰的预摄取框架:映射敏感数据流、分类和标记非结构化内容、定义AI访问边界、监控转换和衍生路径、检测影子AI。
Joynt的结论是结构性的:预摄取可见性是AI治理的基础。一旦敏感数据进入模型,其转换和衍生路径变得难以追踪,控制将变得被动而非预防。在上游映射流、分类内容和定义边界,为领导者提供了安全规模化治理AI所需的事实基线。
统一治理:让AI数据就绪
Mark Crean和James Dean都指出,当安全、数据、业务团队对AI就绪数据持有不同定义时,金融服务中的AI规模化就会陷入停滞。这种碎片化导致试点项目困在创新实验室,而高价值用例难以进入生产。生产力工具和编码助手进展迅速,但企业级AI并非如此——因为治理未能统一。
James Dean强调了操作层面的差距:概念验证后部署失败,是因为机构无法保护PB级敏感数据或协调孤立的数据集。据他估计,半数银行的数据仍锁在隔离系统中,阻碍了模型和代理访问合规授权的信息。Crean补充说,即使AI在内部扩散,组织也缺乏对访问权限、上下文和回滚的共享护栏,使团队不知如何安全地采用AI。
“利益相关者对齐始终是第一步。随着模型和代理激增,你设置了哪些护栏和控制措施来确保用户能够安全使用这些工具?哪些数据安全实践能保证数据完整性值得信赖?”
——Mark Crean,Securiti区域销售副总裁
“首先要让CISO、数据科学家和业务领导者对齐AI就绪数据的定义。然后,将治理映射到每个阶段,并在训练或云迁移前自动进行数据分类。”
——James Dean,谷歌云AI专家
他们提出了统一治理机制的关键要素:跨职能定义AI就绪数据、在训练前自动化分类、将访问控制嵌入模型操作、为代理采用建立护栏、将治理与合规准备相结合。这样,模型和代理只能操作合规授权的信息,使金融机构能够超越孤立试点,进入企业级AI部署,同时不损害安全性、合规性或数据完整性。
开发前问责框架
Oscar Rodriguez博士指出,AI项目在应该规模化的时候经常崩溃。原因很简单:团队在决定谁承担结果之前就开始构建。当问责制未定义时,治理就成了混乱,而这种混乱只会在模型已经存在后才开始,此时已无法塑造其假设、数据或风险状况。
Rodriguez观察到,业务部门争先恐后地实验,数据团队使用互不关联的数据源,安全和合规团队事后才参与,领导层关注未来风险而团队关注证明价值。结果不是技术失败,而是组织错位。模型在早期测试中展现潜力,然后因无人事先同意标准、所有权或治理而停滞。
开发前问责框架可以防止这种情况。其核心是明确角色:谁定义成功、谁批准数据、谁监控风险、谁对结果负责?这些问题的答案必须在编码开始前确立。框架包括:设定AI决策的明确所有者、定义数据权和访问权限、建立风险和合规审批流程、以及创建持续监控和审计机制。当问责制先于开发,治理成为基础而非事后补救,AI项目才能可靠地规模化。
数据级安全控制
Todd Vancil强调,数据级安全控制是AI安全的基础。传统边界安全不足以应对AI系统直接访问内部数据的场景。必须在源头限制和净化敏感数据,确保AI系统只能访问授权信息,并在发生泄露时即时遏制。具体措施包括:基于属性的访问控制、对检索结果的实时过滤、以及结合加密和令牌化技术。
Vancil指出,随着AI代理自主执行任务,每个代理都必须拥有最小必要权限,且所有数据访问行为必须可审计、可撤销。数据级控制使组织能够在问题扩散前切断恶意或错误的数据流,而不是在事后清理。
总之,企业AI的安全不能依赖于单一技术或团队。它需要从预摄取可见性到统一治理,从开发前问责到数据级控制的全栈方法。只有当这些安全策略以数据为中心时,AI的承诺才能以可信、合规且可扩展的方式实现。