CPS的罗塞塔石碑:Claroty的AI驱动库
Claroty推出了基于人工智能的CPS库,利用多智能体系统和Databricks平台解决工业与医疗设备身份识别难题,显著提升漏洞归因准确率和安全建议覆盖。
长期以来,网络物理系统(CPS)——驱动工厂、医院和关键基础设施的机器——一直面临着一场无声的“身份危机”。IT管理员可以轻松识别网络上的每台笔记本电脑,而OT(运营技术)安全团队往往难以确切知道工厂车间里运行的是什么设备。Claroty的Team82研究团队最近的一份报告揭示了一个惊人的现实:88%的CPS资产不传输精确的产品代码,76%使用的产品代码与供应商的官方记录不符。这种“数字出生证明”的缺失使得漏洞管理几乎不可能,安全团队被迫手动从不一致的资源中拼凑信息。
为了解决这一问题,Claroty发布了其AI驱动的CPS库,这是首个权威的映射引擎,旨在成为工业和医疗硬件的“通用翻译器”。该系统的核心是实体解析(ER)挑战,目的是通过匹配和整合嘈杂的现实世界数据,形成单一真相来源。为了实现高保真度的确定性可追溯性,Claroty超越了标准匹配算法,设计了一种混合架构,将久经考验的经典ER方法与生成式AI的认知能力相结合。
该系统基于Databricks数据智能平台构建,采用了Lakehouse架构,消除了传统数据孤岛,能够将来自专有OT协议、API调用以及非结构化供应商PDF手册等不同数据集整合到一个可扩展的环境中。数据工程方面,采用基于Delta Lake的Medallion架构,从Bronze层原始JSON数据开始,通过推广管道动态应用映射注册表,将原始证据转换为治理后的规范模式。利用Delta Lake的模式演变和时间旅行,Claroty维护了不可篡改的监管链。
最复杂的部分是使用Databricks Custom Agents构建的编排式多智能体系统。该系统由三个核心组件构成:NLP代理(解析复杂混合格式数据)、推理代理(应用置信度评分和统计检验区分信号与噪声)以及人工参与(对低置信度映射进行专家审核并反馈训练)。这种架构使得系统能够处理超过1700万个资产及其复杂依赖关系。
在实际应用中,当Claroty的xDome检测到设备型号如1769-L36ERMS/B时,该系统会自动识别内部代码,链接到商业名称,确定具体部件和固件版本,并准确附加相关CVE。这取代了以往手动搜索目录、检查CISA警告、核实NVD条目的繁琐过程。
关键成果包括:确定性可追溯性(即使设备报告数据极少,也能通过统计推断三角定位精确身份)、漏洞归因准确性提升25%、以及56%的受分析设备获得了以前不可见的新安全建议。Claroty还利用Lakeflow Jobs编排从原始数据到结构化表的完整ETL流程,并使用LLM-as-a-Judge方法持续评估输出质量。