Apache Spark 4.2:データをAI開発者にとって使いやすく
Apache Spark 4.2 はAIネイティブデータプラットフォームへのシフトを明確にし、Metric Views、ネイティブベクトル検索、リアルタイムPythonストリーミング、地理空間サポートなどを導入。AI開発者のフィーチャーエンジニアリング、リアルタイムシグナル、埋め込みワークフローを簡素化する。
Apache Spark 4.2 がリリースされました。これは単なる定期アップデートではありません。このプロジェクトの商業スポンサーが、Spark を汎用ビッグデータツールではなく、AIネイティブデータプラットフォームの中核と見なすようになったことを明確に示しています。フィーチャーパイプライン、埋め込み、リアルタイムシグナル、ガバナンスに取り組むAI開発者にとって、このリリースはまさに痛点を突いています。
Spark は元々2009年にHadoop MapReduceを改善するために設計されました。しかし、機械学習やインタラクティブクエリの需要が高まるにつれ、Spark のResilient Distributed Datasets(RDD)とインメモリ処理が際立ちました。長年にわたり、Spark はバッチ分析とストリーミングパイプラインの基盤でしたが、AI機能はほとんどが後付けでした。
今、4.2 でSparkはAIを完全に取り入れました。新しいMetric Views、ネイティブベクトル検索、リアルタイムPythonストリーミングにより、従来のタスクと現代のAIアプリケーションの両方を統合するエンジンとなりました。Metric Views はSpark SQLに組み込まれた第一級のセマンティックレイヤーで、エンジニアがメトリクスを一度カタログオブジェクトとして定義し、どこでも再利用できるようにします。AI開発者にとっては、特徴量とメトリクスを計算する際の微妙なバグを減らし、LLMを活用したシステムに一貫性のあるガバナンスされた数値セットを提供します。
多くのAI開発者にとって最も注目すべき変更点は、ベクトル類似性ワークロードのネイティブサポートです。Spark 4.2 にはベクトル距離・類似性関数と、top-K類似性結合のための NEAREST BY 演算子が組み込まれています。開発者はSpark内で埋め込みを計算し、他の構造化データと一緒に保存し、類似性クエリを実行できます。専用のベクトルデータベースにデータを移動する必要はありません。専門のベクトルデータベースを完全に置き換えるわけではありませんが、レイクハウスを中心とする多くのワークロードでは、既存のインフラを活用した検索ベースのAIシステム構築の障壁を大幅に下げます。
もう一つの重要な強化は地理空間サポートです。Spark 4.2 はネイティブの GEOMETRY および GEOGRAPHY タイプと、距離、包含、空間結合のための ST_* 関数群を導入します。位置情報インテリジェンスは、巡回セールスマン問題から位置情報に基づくレコメンデーションや不正検出まで、AIユースケースでますます重要になっています。地理空間を第一級のカラムタイプとして扱うことで、AI開発者は既存のSparkベースのワークフローを使用して、空間特徴量を他のデータと同様に結合、集約、モデル入力できるようになります。
開発者体験の面では、Spark 4.2 はAI Pythonプログラマーに大きな向上をもたらします。Arrow最適化実行がPySparkユーザー定義関数のデフォルトパスとなり、既存コードの変更なしで高速な列指向処理を実現します。最新のpandasをサポートし、Arrow C Data Interfaceを介してPolarsやDuckDBとのゼロコピーデータ交換を可能にします。ノートブック駆動のワークフローやハイブリッドスタックにおいて特に魅力的です。
Spark 4.2 はPySparkにリアルタイムモードも導入し、Python開発者がミリ秒単位のステートレスストリーミングを構築できるようにします。これにより、モデル開発や実験と同じ言語で高スループット・低レイテンシのフィーチャーパイプラインを構築する道が開かれます。
舞台裏では、Spark 4.2 はAIワークロードが依存するデータエンジニアリング基盤も強化しています。自動Change Data Capture(Auto CDC)と強化されたCHANGES句により、クリーンでインクリメンタルなデータビューの維持が容易になり、手作業のMERGEロジックやアドホックなETLが削減されます。AI開発者にとって、これらの作業は地味ですが不可欠です。モデルは基礎となるデータパイプラインが脆弱だと劣化するからです。
総じて、Apache Spark 4.2 はAIプログラマーにとってこれまで以上に有用です。埋め込み、地理空間データ、リアルタイムシグナル、セマンティックメトリクス、Python中心のワークフローは、もはや二級市民ではなく、第一級の設計要素です。