AI News HubLIVE
站內改寫2 分鐘閱讀

為什麼研發數據屬於Lakehouse——以及為什麼智能體需要它在那裏

cellcentric(戴姆勒卡車和沃爾沃集團合資企業)在Databricks上構建了Data Hub,這是一個統一的數據和AI治理上下文層,通過Unity Catalog和Lakehouse Federation整合分散的研發數據。Data Hub將文檔覆蓋率作為第一類質量指標,並通過MCP服務器為智能體提供相同的數據上下文,顯著加速了研發調查。

在cellcentric——戴姆勒卡車和沃爾沃集團的合資企業,專注於重型應用氫燃料電池系統的研發——數據整合是一個核心挑戰。團隊的問題很少侷限於單一來源系統,而是跨越產品層次、製造歷史、返工記錄、實驗室證據、測試遙測和領域知識。工業AI在研發中的價值取決於智能體能否像工程師一樣,在受治理的上下文中推理:數據來源、含義、完整性、注意事項和權限。

為了解決這一問題,cellcentric在過去四年中基於Azure和Databricks構建了數據基礎,並創建了Data Hub——一個用於數據和AI的治理上下文層。Data Hub最初是一個數據產品平台,結果證明這正是它成為優秀AI平台的原因。它通過Unity Catalog管理元數據和權限,通過Lakehouse Federation將本地SQL源整合到lakehouse模式中,並使用Delta Sharing跨邊界交換數據。

一個典型的數據產品是“燃料電池護照”,它彙集了五個企業源系統:SAP S/4HANA、兩個製造執行系統(MES)、一個實驗室數據庫和IoT遙測平台。該產品建模了從系統到原材料批次的七個層級,每日刷新,並使用時態模型支持時間點配置和完整返工歷史查詢。數據質量檢查確保產品完整,足以支持工程、質量和製造調查。

Data Hub的關鍵創新是將上下文覆蓋作為第一類質量指標。每個數據產品附帶一個“上下文覆蓋標記”,顯示錶描述和列級文檔的覆蓋率。這促使工程師在開發過程中編寫豐富的markdown目錄條目,記錄工作流、領域決策、表關係、注意事項和預期消費方式。如今,27個已發佈數據產品平均達到90%的列註釋覆蓋率,並且所有註釋在合併前經過人工審核。

對於人類用户,Data Hub提供市場和工作台界面。員工可以發現數據產品、查看所有者、打開鏈接的儀表板和應用程序,並通過自然語言聊天界面查詢數據。對於AI客户端,相同的上下文通過MCP(模型上下文協議)暴露。任何支持MCP的編碼助手或智能體都可以訪問Unified Catalog元數據和數據產品上下文。

治理模型圍繞統一身份和權限構建。身份從Azure AD通過OAuth 2.0委託令牌傳遞到Databricks。智能體以用户身份執行操作,但無法使用共享後端憑證繞過Unity Catalog。如果用户無法訪問表或列,智能體同樣受限。AI Gateway和MLflow提供可觀測性,包括使用跟蹤、推理表和結構化軌跡。連續評估框架使用確定性評分器、緩存感知成本評分器和LLM評判者來測試智能體、工具和上下文。

這一模式也改變了內部開發流程。工程師在AI輔助開發環境中工作,智能體可以檢查Unity Catalog元數據、閲讀現有文檔並協助搭建管道、測試和文檔。文檔在開發過程中編寫,因此上下文豐富且準確。以前需要數週的跨系統數據集成和管道搭建,現在可以在幾天內完成。