AI News HubLIVE
站内改写2 分钟阅读

为什么研发数据属于Lakehouse——以及为什么智能体需要它在那里

cellcentric(戴姆勒卡车和沃尔沃集团合资企业)在Databricks上构建了Data Hub,这是一个统一的数据和AI治理上下文层,通过Unity Catalog和Lakehouse Federation整合分散的研发数据。Data Hub将文档覆盖率作为第一类质量指标,并通过MCP服务器为智能体提供相同的数据上下文,显著加速了研发调查。

在cellcentric——戴姆勒卡车和沃尔沃集团的合资企业,专注于重型应用氢燃料电池系统的研发——数据整合是一个核心挑战。团队的问题很少局限于单一来源系统,而是跨越产品层次、制造历史、返工记录、实验室证据、测试遥测和领域知识。工业AI在研发中的价值取决于智能体能否像工程师一样,在受治理的上下文中推理:数据来源、含义、完整性、注意事项和权限。

为了解决这一问题,cellcentric在过去四年中基于Azure和Databricks构建了数据基础,并创建了Data Hub——一个用于数据和AI的治理上下文层。Data Hub最初是一个数据产品平台,结果证明这正是它成为优秀AI平台的原因。它通过Unity Catalog管理元数据和权限,通过Lakehouse Federation将本地SQL源整合到lakehouse模式中,并使用Delta Sharing跨边界交换数据。

一个典型的数据产品是“燃料电池护照”,它汇集了五个企业源系统:SAP S/4HANA、两个制造执行系统(MES)、一个实验室数据库和IoT遥测平台。该产品建模了从系统到原材料批次的七个层级,每日刷新,并使用时态模型支持时间点配置和完整返工历史查询。数据质量检查确保产品完整,足以支持工程、质量和制造调查。

Data Hub的关键创新是将上下文覆盖作为第一类质量指标。每个数据产品附带一个“上下文覆盖标记”,显示表描述和列级文档的覆盖率。这促使工程师在开发过程中编写丰富的markdown目录条目,记录工作流、领域决策、表关系、注意事项和预期消费方式。如今,27个已发布数据产品平均达到90%的列注释覆盖率,并且所有注释在合并前经过人工审核。

对于人类用户,Data Hub提供市场和工作台界面。员工可以发现数据产品、查看所有者、打开链接的仪表板和应用程序,并通过自然语言聊天界面查询数据。对于AI客户端,相同的上下文通过MCP(模型上下文协议)暴露。任何支持MCP的编码助手或智能体都可以访问Unified Catalog元数据和数据产品上下文。

治理模型围绕统一身份和权限构建。身份从Azure AD通过OAuth 2.0委托令牌传递到Databricks。智能体以用户身份执行操作,但无法使用共享后端凭证绕过Unity Catalog。如果用户无法访问表或列,智能体同样受限。AI Gateway和MLflow提供可观测性,包括使用跟踪、推理表和结构化轨迹。连续评估框架使用确定性评分器、缓存感知成本评分器和LLM评判者来测试智能体、工具和上下文。

这一模式也改变了内部开发流程。工程师在AI辅助开发环境中工作,智能体可以检查Unity Catalog元数据、阅读现有文档并协助搭建管道、测试和文档。文档在开发过程中编写,因此上下文丰富且准确。以前需要数周的跨系统数据集成和管道搭建,现在可以在几天内完成。