AI News HubLIVE
サイト内リライト3 分で読了

Spark 4.2の新機能:ベクトルデータベースを不要にする可能性

Apache Spark 4.2 がリリースされ、ネイティブベクトル検索、ガバンドメトリクス、ストリーミングのアップグレード、Pythonサポートの強化を追加。SparkをAIサービングレイヤーとして位置づけ、独立したベクトルデータベースの必要性を低減する。

ソースHacker News AI著者: Brajeshwar

Apache Spark 4.2 が先週リリースされ、エンタープライズデータ処理の中核としてのSparkの役割をさらに拡大しました。新バージョンはAIワークロード向けに、ガバンドメトリクス、ベクトル検索プリミティブ、リアルタイム処理、Pythonサポートの改善、ネイティブ地理空間分析など、多くの新機能を追加しています。これらの機能は、Sparkの最近のAIおよびストリーミング機能の強化に基づいており、現在多くのエンジニアリングチームがプラットフォームをどのように使用しているかを反映しています。今回のリリースは、Sparkの従来のデータ処理エンジンとしての役割を基盤に、本番AIアプリケーションをサポートするために必要な機能をさらに追加しています。

すでにSparkを使用しているチームにとって、新機能はプラットフォームから離れることなくより多くの作業を完了できることを意味し、管理するシステムの数を減らすことができます。

ガバンドメトリクスが競合を防止:チームごとにビジネス指標の定義が異なることがあり、時間の経過とともにレポートの競合や信頼性の問題が生じます。AIアプリケーションがアナリストやBIツールと同じエンタープライズデータを消費し始めると、問題はさらに顕著になります。Spark 4.2はガバンドメトリクスビューを導入してこの課題を解決します。組織はビジネス指標を一度定義し、その定義をアプリケーション間で再利用できます。メトリクスビューはディメンションとメジャーをSparkが理解するファーストクラスオブジェクトとして扱い、誰が何をクエリしても集計セマンティクスが一貫するようにします。

ベクトル検索のネイティブ化:最も重要な追加機能の1つはネイティブベクトル検索であり、Sparkと独立したベクトルデータベース間でのデータ移動を削減します。Spark 4.2はベクトル距離関数、類似度関数、ベクトル正規化、ベクトル集約、およびtop-K類似度検索のための新しいSQL演算子NEAREST BYを導入します。ベクトル検索をSparkに取り込むことで、開発者は検索パイプラインのより多くの部分を同じプラットフォーム上に保持できます。

Python相互運用性の向上:Spark 4.2はSparkとArrowネイティブツール間のデータ移動を容易にします。Arrow C Data InterfaceとPyCapsuleプロトコルをサポートすることで、Spark DataFrameをPolarsやDuckDBなどのツールに直接渡すことができ、基礎データのコピーやシリアライズが不要になります(双方が標準をサポートしている場合)。さらに、PySparkが拡張され、Arrow最適化UDF実行がデフォルトになり、Pythonデータソースにはビルトインの時間およびメモリプロファイリングが含まれ、カスタムコネクタのトラブルシューティングに役立ちます。

Spark Connectがエージェントによるエンジン呼び出しを可能に:Spark ConnectはgRPCおよびArrowベースのプロトコルを介してクライアントをSparkサーバーから分離します。4.2では複数の更新が行われています。クライアントは論理プランを構築し、サーバーが分析、最適化、実行を処理し、結果はArrowバッチとして返されます。クライアントは完全なSparkランタイムや同じJVMを必要としません。このアップデートでは、RDD APIの互換性、エラーハンドリング、ステータスレポートが改善されています。AIアプリケーションはリモートのSparkクラスターに処理リクエストを送信でき、処理はSpark内部で実行され続けます。

ストリーミングがリアルタイムAIを強化:Spark 4.2のストリーミングは、Auto CDCとリアルタイムモードなどの更新を受けています。多くのAIアプリケーションは定期的なバッチジョブではなく、継続的に更新されるデータに依存しています。Auto CDCはSpark宣言型パイプラインにファーストクラスの変更データキャプチャを導入し、ソースデータの変更に応じてターゲットテーブルを最新に保つためのマージロジックを処理します。これは以前は手書きのエラーが発生しやすいコードを必要としていました。新しいCHANGES SQL句により、チームは単一のSQLインターフェースを通じてデータ変更を取得できます。さらに、Spark 4.2はGEOMETRYおよびGEOGRAPHY型とST_*関数をビルトインで追加し、外部空間拡張を必要とせずに位置情報分析を可能にします。位置情報データを扱うチーム(物流、不動産、IoT)にとって、これはデータをSparkから移動する別の理由を取り除きます。

全体像:Spark 4.2はAIおよびデータスタックのより多くの部分をプラットフォーム自体に取り込みます。かつては独立したツールに依存していた機能が、Spark内で直接処理できるようになりました。現在SparkをETLに使用し、その後データを検索、ガバナンス、リアルタイム処理のために他のシステムに引き渡しているチームにとって、今回のリリースはその境界線を曖昧にし始めます。より多くのAIアプリケーションが運用データ上で直接実行されるにつれて、Sparkはデータを準備するだけでなく、サービングレイヤーの一部になりつつあります。