AIにPostgresとClickHouseベースのデータ層が必要な理由
本記事では、AIアプリケーションがデータ層に求める新たな要件を探り、リアルタイムのOLTPとOLAPの統合の必要性を強調する。PostgresとClickHouseがトランザクションと分析でそれぞれ最高のオープンソースデータベースであり、CDCやpg_clickhouseなどの統合ツールと組み合わせることで理想的なデータスタックを提供すると論じる。著者は単一エンジンやデータレイクではなく、ベストオブブリードのアプローチを支持する。
過去数年、PostgresとClickHouseを使う数千の企業と協力してきた中で、AIがアプリケーションに求めるデータベースの要件を変えてきたのを目の当たりにしてきました。あらゆるAIアプリケーションはデータアプリケーションです。エージェントは大量の運用データを生成し、ユーザーはそのデータに基づくリアルタイムの応答を期待します。これにより、アプリケーションがデータベースに求めるものが変わります。
この記事では、AIアプリケーションがデータ層に実際に必要とするもの、PostgresとClickHouseがこれらのワークロードの自然な組み合わせになりつつある理由、そしてこの組み合わせを開発者にとって非常にアクセスしやすいものにするための投資について掘り下げます。
要約:AIは前例のない規模でデータ成長を加速し、トランザクション(OLTP)と分析(OLAP)の従来の境界を崩しつつあります。これらの要求を満たすには、それぞれの設計に優れたデータベース(PostgresとClickHouse)を、シームレスに連携させながら使うことが必要です。
AIのニーズとデータ環境の変化
AIネイティブアプリケーションは従来のソフトウェアよりもはるかに多くのデータを生成します。プロンプト、応答、ツール呼び出し、評価、ユーザーインタラクションのすべてがデータとなり、データ量とクエリ同時実行数の爆発的増加を引き起こします。
PostgresとClickHouseを使用するAIネイティブ企業のサンプルでは、6か月間で平均データ増加率が1000%を超え、85TB以上のデータが追加されたことが観察されています。
また、AIが「バイブコード」アプリから本番システムへ移行するにつれ、トレードオフも変化しています。アプリケーションはミッションクリティカルな決定を行い、より広い範囲と規模で動作するため、データ層の信頼性とセキュリティの基準が高まっています。
これらの要求に応えるために、AIは大量のデータをリアルタイムで取り込み、処理し、クエリできるデータ層を必要とします。高速なプロビジョニングやインスタントブランチは便利ですが、基盤となるデータスタックが高速、信頼性、セキュリティを備えていなければ意味がありません。
AIはOLTPとOLAPのリアルタイム連携を必要とする
LLM搭載アプリケーション、AI生成インサイト、異常検知、レコメンデーションエンジン、自然言語インターフェースはすべて、トランザクションデータベースと分析データベースの間のより緊密なフィードバックループを要求します。トランザクションデータベースに書き込まれたデータは、ほぼ即座に分析クエリに利用可能になる必要があります。
このようなシナリオでは、従来の時間単位や分単位のETLでデータをウェアハウスに移動するパターンでは不十分です。トランザクションデータベースと分析データベースは、データが書き込まれてから分析に利用可能になるまでの時間がわずか数秒のリアルタイムで動作しなければなりません。
オープンソースの基盤とコストの重要性
AIインフラストラクチャでも同様のシフトが進行中です。チームがプロプライエタリなLLMのロックインと増大するトークンコストに警戒するようになるにつれ、データスタックの柔軟性と経済性も見直されています。オープンソースデータベースは両方を解決します。セルフホストまたはマネージドデプロイ、ニーズに応じたベンダー変更の自由、そして多くの場合大幅に低いコストを提供します。
Postgres + ClickHouse が勝つ理由
上記の要件は、AIネイティブ企業が選択するデータスタックを再形成しています。PostgresとClickHouseは、強力なオープンソース基盤の上に、ベストインクラスのリアルタイムトランザクションと分析を組み合わせたデフォルトの選択肢になりつつあります。
Postgresは世界で最も人気のあるオープンソースのトランザクションデータベースであり、低レイテンシのCRUD操作、ACID準拠、豊富なインデックス、ほぼすべてのクエリをサポートする完全なSQLインターフェース、堅牢な拡張フレームワーク、そして広大なORMおよびアプリケーションエコシステムを提供します。ClickHouseは地球上で最速の分析データベースであり、カラムナストレージ、スキップインデックス、インクリメンタルマテリアライズドビュー、分散キャッシュ、ネイティブJSONと全文検索、最近導入されたレイジーマテリアライゼーションなど、超高速リアルタイム分析に特化した機能を備えています。両方ともエンタープライズ対応です。
さらに、両者は同じオープンソースの哲学を共有し、大規模で活発なコミュニティに支えられています。ちなみに、Postgresは最近オープンソースデータベースとして30周年を祝い、ClickHouseは10周年を迎えました。
開発者はPostgresとClickHouseを愛用しています。Postgresは業界で最も豊かなツールと統合のエコシステムを提供し、ClickHouseは使い慣れたSQL、単一バイナリでの簡単なローカル開発、そしてほとんどの場合に大規模なチューニングを必要としない分析パフォーマンスを兼ね備えています。この組み合わせは、「ただ動く」というさわやかな開発体験を提供します。これは、数千のスタートアップやAIネイティブ企業からGitLab、Instacart、Cloudflareなどのエンタープライズに至るまで、広範な採用に反映されています。
PostgresとClickHouseによるOLTPとOLAPの統合
私たちのアプローチはシンプルです。PostgresとClickHouseをOLTPとOLAPのリーディングオープンソースデータベースとして受け入れ、それらの間の統合を可能な限りシームレスかつネイティブにすることです。
これを実現するために、スタック全体に投資してきました。データ移動にはPeerDB(ClickPipes for Postgresを駆動)があり、秒単位のレプリケーションを備えた変更データキャプチャ(CDC)を提供します。クエリにはpg_clickhouse拡張機能があり、PostgresからClickHouseを直接クエリできます。可観測性にはpg_stat_chがあり、PostgresクエリテレメトリをClickHouseにストリーミングします。また、ClickHouseが管理するPostgresサービスも開始しました。
ベストオブブリードと統一ストレージアーキテクチャの比較
データベース業界では過去10年間、OLTPとOLAPを単一のデータベースエンジンに統合する試みが何度も行われてきました。また、統一ストレージやデータレイクを中心としたアーキテクチャも登場しています。これらのアプローチは技術的に興味深いですが、開発者をプロプライエタリなプラットフォームに縛り付け、根本的に異なる要件を持つワークロードを単一のシステムで最適化しようとします。
同様に、データレイクはデータウェアハウジングのユースケースには優れていますが、リアルタイムで高同時実行性の顧客向けおよびエージェント向けアプリケーション向けには設計されていません。これらのアーキテクチャの上に運用機能を重ねることはできますが、オープンテーブルフォーマットと汎用ストレージ層をサポートする必要があるため制約を受けます。その結果、MergeTreeのようなリアルタイム分析専用のストレージエンジンのパフォーマンスに匹敵することが難しくなります。
この違いは、ClickHouseの戦略であるベストオブブリードアプローチにも反映されています。私たちはMergeTreeをリアルタイム分析の最適なエンジンにすることに集中しつつ、データウェアハウジングのユースケース向けにオープンテーブルフォーマットを中心に継続的に革新しています。
AIの未来はベストオブブリードデータスタック
AIはOLTPとOLAPの区別を消し去るのではなく、それをこれまで以上に重要にしています。この時代を定義するアプリケーションは、あらゆるインタラクションを確実に捕捉できるトランザクションデータベース、そのデータをリアルタイムで処理できる分析データベース、そして両者のシームレスな統合を必要とします。
未来は、根本的に異なるワークロードを最適化しようとする単一のプロプライエタリプラットフォームではなく、PostgresとClickHouse上に構築されたオープンなベストオブブリードデータスタックであり、各データベースが最善を尽くしつつ一体となって機能することだと私たちは信じています。
それが私たちが目指しているビジョンです。エンタープライズグレードのCDCからpg_clickhouseまで、あらゆる投資は、PostgresとClickHouseを開発者にとって単一の統合スタックのように感じさせることを目的としています。