AI News HubLIVE
サイト内リライト3 分で読了

LangSmithで音声エージェントをトレース

LangSmithは、Pipecat、LiveKit、OpenAI Realtime、Gemini Liveで構築された音声エージェントのトレースをサポートします。音声、STTおよびTTSのレイテンシ、割り込み、ツール呼び出しなどを1つのトレースにキャプチャします。

本日、LangSmithで4つの人気のある音声エージェントフレームワーク(Pipecat、LiveKit、OpenAI Realtime、Google ADKのGemini Live)をトレースするためのPython統合を発表します。

音声エージェントはますます実用的になり、市場は急速に成長しています。この成長は、スタック全体の進歩によって推進されています。音声アクティビティ検出モデルはより正確になり、割り込みやぎこちないやり取りを減らし、音声モデルはより感情豊かで自然に聞こえるようになり、LLMはリアルタイムの会話を行うのに十分な速さと賢さを備えています。

音声エージェントにも可観測性が必要です。音声エージェントの構築は、チャットベースのエージェントの構築と多くの点で似ています。音声エージェントはモデルを呼び出し、ツールを使用し、状態を維持し、コンテキストを取得し、意思決定を行います。本番環境で音声エージェントをスケーリングするには、音声パイプラインの任意の時点で何が起こったかを可視化し、チームメイトとトレースを共有し、エージェントの動作を評価し、エラーをデバッグし、時間をかけてエージェントを改善する機能が必要です。これはテキストベースのエージェントの場合と同じです。

ただし、音声のトレースと観察には固有の要件がいくつかあります。今回のリリースでは、音声対話のキャプチャとトレースをネイティブでサポートし、会話音声の録音、音声からテキストおよびテキストから音声への推論のトレース、割り込みの強調表示などを行います。

これにより、テキストエージェントと音声エージェントを1つの場所に統合し、既に設定済みの同じレビューおよびコラボレーションワークフローで管理できます。

音声エージェントのアーキテクチャは主に2つあります。「サンドイッチ」アーキテクチャと音声間アーキテクチャです。サンドイッチアーキテクチャでは、エージェントは3つの異なる推論コンポーネント(音声からテキスト(STT)、テキストベースのエージェント、テキストから音声(TTS))が連鎖して構成されます。各ターンはこれら3つのコンポーネントを流れます。ユーザーの音声が書き起こされ、書き起こしが従来のテキストベースのエージェントへの入力として使用され、エージェントの出力が音声に合成されてユーザーが聞くことができます。優れたサンドイッチ音声エージェントの可観測性には、パイプラインの各ステップに関する洞察(各推論リクエストのメタデータ、入力、出力、STT、LLM、TTS全体のレイテンシの内訳によるターン遅延の特定、音声アクティビティ検出イベントなど)をキャプチャできることが含まれます。

対照的に、音声間アーキテクチャでは、エージェントはマルチモーダルモデルを使用して構築され、音声入力をネイティブに処理し音声出力を生成します。このアーキテクチャでは、アプリケーションは双方向WebSocketを介してストリーミングされるイベントで構成されます。ユーザーの音声を表す音声イベントをモデルに送信し、モデルはツール呼び出し、割り込み検出イベント、書き起こし、音声出力などを返します。音声間の場合、ワイヤ上で送受信されるイベントをキャプチャして検査する必要があります。これらは音声エージェントの対話の真実を再構築し、アプリケーションをデバッグするために重要です。

LangSmithを使用すると、両方のアーキテクチャをトレースし、本番会話の完全な可観測性を得ることができます。

新しいトレース統合により、LangSmithは各本番トレースから主要な実行をキャプチャします。各トレース統合は数行のコードでセットアップでき、音声対話中に何が起こったかを完全に可視化します。これには、トレースに重ねられた完全な会話音声、音声間モデルイベント(入力、出力、その他のメタデータを含む)、音声からテキスト推論トレース(レイテンシとその他のメタデータを含む)、テキストから音声推論トレース(レイテンシとその他のメタデータを含む)、ユーザーとエージェントの高レベルターン、音声アクティビティ検出イベント、割り込みとオーバーラップ音声、モデル入力と出力、ツール呼び出し、引数、結果、エラー、音声パイプラインの各段階のタイミングが含まれます。

キャプチャされた各イベントと作業単位は単一のトレースツリーに表示され、対話が音声からエージェントアクション、そして音声応答へとどのように移行したかを追跡できます。

今すぐ始めましょう。フレームワークのトレースを設定してください:Pipecat統合ドキュメント、LiveKit統合ドキュメント、OpenAI Realtime統合ドキュメント、Gemini LiveとGoogle ADK統合ドキュメント。または、動作する例を探索してください:https://github.com/langchain-ai/voice-demo