AI News HubLIVE
サイト内リライト3 分で読了

研究開発データはレイクハウスに属する理由と、エージェントがそれを必要とする理由

cellcentric(ダイムラートラックとボルボグループの合弁会社)は、Databricks上にData Hubを構築し、Unity CatalogとLakehouse Federationを活用して散在する研究開発データを統合しました。Data Hubは、ドキュメントのカバレッジを第一級の品質指標とし、MCPサーバーを介してエージェントに同じコンテキストを提供することで、調査を数週間から数日に短縮します。

cellcentric——ダイムラートラックとボルボグループの合弁企業で、大型車両向け水素燃料電池システムの研究開発を行っている——では、データ統合が中心的な課題です。チームの質問は単一のソースシステムに収まらず、製品階層、製造履歴、リワーク、ラボの証拠、テストテレメトリ、ドメイン知識にまたがります。研究開発における産業用AIの価値は、エージェントがエンジニアと同様に、データの出所、意味、完全性、注意事項、権限をガバナンスされたコンテキスト内で推論できるかどうかにかかっています。

この問題を解決するため、cellcentricは過去4年間、AzureとDatabricks上にデータ基盤を構築し、Data Hub——データとAIのためのガバナンスコンテキスト層——を作成しました。Data Hubは当初データプロダクトプラットフォームとして始まりましたが、結果的にそれが優れたAIプラットフォームとなる理由になりました。Unity Catalogでメタデータと権限を管理し、Lakehouse FederationでオンプレミスのSQLソースをレイクハウスパターンに統合し、Delta Sharingで境界を越えたデータ交換を実現しています。

代表的なデータプロダクトは「燃料電池パスポート」で、5つのエンタープライズソースシステム(SAP S/4HANA、2つのMESシステム、ラボデータベース、IoTテレメトリプラットフォーム)を統合しています。このプロダクトはシステムから原材料バッチまでの7階層をモデル化し、毎日リフレッシュされ、状態ベースのテンポラルモデルを使用して時点構成と完全なリワーク履歴の質問に対応します。データ品質チェックにより、プロダクトがエンジニアリング、品質、製造の調査をサポートするのに十分完全であることを確認します。

Data Hubの重要な革新は、ドキュメントカバレッジを第一級の品質指標としたことです。各データプロダクトには「コンテキストカバレッジバッジ」が付与され、テーブル記述や列レベルのドキュメント有無が表示されます。これにより、エンジニアは開発プロセス中にリッチなマークダウンカタログエントリを作成し、ワークフロー、ドメイン上の決定、テーブル関係、注意事項、意図された消費方法を記録するようになりました。現在、27の公開データプロダクトがあり、平均列コメントカバレッジは90%に達し、すべてのコメントはマージ前にエンジニアによるレビューを受けています。

人間のユーザー向けには、Data Hubはマーケットプレイスとワークベンチのインターフェースを提供します。従業員はデータプロダクトを発見し、所有者やライフサイクルステータスを確認し、リンクされたダッシュボードやアプリを開き、自然言語チャットインターフェースでデータを照会できます。AIクライアント向けには、同じコンテキストがMCP(モデルコンテキストプロトコル)を通じて公開されます。MCPに対応したコーディングアシスタントやエージェントは、Unity Catalogメタデータとデータプロダクトコンテキストにアクセスできます。

ガバナンスモデルは統一されたアイデンティティと権限に基づいています。アイデンティティはAzure ADからOAuth 2.0オンビハーフトークンパターン(Databricksがエージェントガバナンスアーキテクチャで説明するもの)を介してDatabricksに伝播します。エージェントはユーザーに代わってツールを呼び出せますが、共有バックエンド認証情報でUnity Catalogをバイパスすることはできません。ユーザーがテーブルや列にアクセスできない場合、エージェントも同じ制約を受けます。AI GatewayとMLflowが可観測性を提供し、使用状況追跡、推論テーブル、構造化トレースが可能です。継続的評価フレームワークは、決定論的正解率、SQL接地評価、コスト評価、LLM審査員を使用して、エージェント、ツール、およびそのコンテキストをテストします。

このパターンは内部開発プロセスも変革しました。エンジニアはAI支援開発環境で作業し、エージェントがUnity Catalogメタデータを検査し、既存のプロダクトドキュメントを読み、パイプライン、テスト、テーブル記述、マークダウンカタログエントリの作成を支援します。ドキュメントは開発中に作成されるため、コンテキストが豊富で正確です。以前は数週間かかっていたクロスシステムデータ統合とパイプライン構築が、現在は数日で完了します。