AI News HubLIVE
站內改寫2 分鐘閱讀

為什麼研發資料屬於Lakehouse——以及為什麼智慧體需要它在那裡

cellcentric(戴姆勒卡車和沃爾沃集團合資企業)在Databricks上構建了Data Hub,這是一個統一的資料和AI治理上下文層,透過Unity Catalog和Lakehouse Federation整合分散的研發資料。Data Hub將文件覆蓋率作為第一類質量指標,並透過MCP伺服器為智慧體提供相同的資料上下文,顯著加速了研發調查。

在cellcentric——戴姆勒卡車和沃爾沃集團的合資企業,專注於重型應用氫燃料電池系統的研發——資料整合是一個核心挑戰。團隊的問題很少侷限於單一來源系統,而是跨越產品層次、製造歷史、返工記錄、實驗室證據、測試遙測和領域知識。工業AI在研發中的價值取決於智慧體能否像工程師一樣,在受治理的上下文中推理:資料來源、含義、完整性、注意事項和許可權。

為了解決這一問題,cellcentric在過去四年中基於Azure和Databricks構建了資料基礎,並建立了Data Hub——一個用於資料和AI的治理上下文層。Data Hub最初是一個資料產品平臺,結果證明這正是它成為優秀AI平臺的原因。它透過Unity Catalog管理後設資料和許可權,透過Lakehouse Federation將本地SQL源整合到lakehouse模式中,並使用Delta Sharing跨邊界交換資料。

一個典型的資料產品是“燃料電池護照”,它彙集了五個企業源系統:SAP S/4HANA、兩個製造執行系統(MES)、一個實驗室資料庫和IoT遙測平臺。該產品建模了從系統到原材料批次的七個層級,每日重新整理,並使用時態模型支援時間點配置和完整返工歷史查詢。資料質量檢查確保產品完整,足以支援工程、質量和製造調查。

Data Hub的關鍵創新是將上下文覆蓋作為第一類質量指標。每個資料產品附帶一個“上下文覆蓋標記”,顯示錶描述和列級文件的覆蓋率。這促使工程師在開發過程中編寫豐富的markdown目錄條目,記錄工作流、領域決策、表關係、注意事項和預期消費方式。如今,27個已釋出資料產品平均達到90%的列註釋覆蓋率,並且所有註釋在合併前經過人工稽核。

對於人類使用者,Data Hub提供市場和工作臺介面。員工可以發現資料產品、檢視所有者、開啟連結的儀表板和應用程式,並透過自然語言聊天介面查詢資料。對於AI客戶端,相同的上下文透過MCP(模型上下文協議)暴露。任何支援MCP的編碼助手或智慧體都可以訪問Unified Catalog後設資料和資料產品上下文。

治理模型圍繞統一身份和許可權構建。身份從Azure AD透過OAuth 2.0委託令牌傳遞到Databricks。智慧體以使用者身份執行操作,但無法使用共享後端憑證繞過Unity Catalog。如果使用者無法訪問表或列,智慧體同樣受限。AI Gateway和MLflow提供可觀測性,包括使用跟蹤、推理表和結構化軌跡。連續評估框架使用確定性評分器、快取感知成本評分器和LLM評判者來測試智慧體、工具和上下文。

這一模式也改變了內部開發流程。工程師在AI輔助開發環境中工作,智慧體可以檢查Unity Catalog後設資料、閱讀現有文件並協助搭建管道、測試和文件。文件在開發過程中編寫,因此上下文豐富且準確。以前需要數週的跨系統資料整合和管道搭建,現在可以在幾天內完成。