AI News HubLIVE
サイト内リライト2 分で読了

Show HN:ナレーション付き画面録画をAIエージェント用データに変換(ローカル動作、MITライセンス)

talkthrough-mcpは、ナレーション付き画面録画をAIエージェント用の構造化データに変換するローカルファーストのMCPサーバーです。タイムスタンプ付きの文字起こし、シーン切り替えのキーフレーム、OCR、話者識別、実時間アンカーを提供し、すべてローカルで動作しクラウドに依存しません。このサーバーは様々なMCPクライアントと統合でき、録画のトリアージ、仕様抽出、バックログ生成のためのワークフローが組み込まれています。

ソースHacker News AI著者: korovin-aa

talkthrough-mcpは、ナレーション付き画面録画をAIエージェント用の構造化データに変換するローカルファーストのMCPサーバーです。ビデオやオーディオファイルから、タイムスタンプ付きの文字起こし、シーン変化のキーフレーム、画面上のテキスト認識(OCR)、オプションの話者識別、そして各タイムポイントを実世界の時計にマッピングするアンカー機能を提供します。すべての処理はローカルで実行され、クラウドに依存せず、内部に大規模言語モデルは含まれていません。

他の画面録画SaaSやビデオ分析MCPとは異なり、talkthrough-mcpは任意のローカルファイルを処理でき、エージェントワークフロー(サーバープロンプトとサンプルエージェント)が付属しており、バグトリアージ、仕様抽出、バックログ生成などの一般的なタスクを簡単に実行できます。タイムスタンプアンカー機能は特に有用で、「チェックアウトが固まったと言った瞬間」をサーバーログの該当時間帯に直接マッピングできます。

クイックスタートは1つのコマンドで完了します:uvがインストールされていることを確認し(brew install uv または公式スクリプト)、uvx talkthrough-mcp[diarization] を実行します。これにより、ffmpeg、Whisperモデル、OCRエンジンが自動的にダウンロードされます。対応するMCPクライアントは、Claude Code、Cursor、OpenAI Codex CLI、Gemini CLI、GitHub Copilotなど多岐にわたります。Claude Code用には、ネイティブのスラッシュコマンドと事前構築されたトリアージサブエージェントを含むフルプラグインも用意されています。

話者識別(ダイアリゼーション)はオプションの拡張機能で、[diarization] エクストラをインストールすることで有効になります。pyannoteとNeMoモデルを使用し、GPU不要でローカル実行されます。26分の会議のダイアリゼーションは約2分で完了します。識別されたラベルはS1、S2などの匿名形式で提供され、エージェントがコンテキストに基づいて実際の名前にマッピングします。

サーバーは7つのツールを提供します:process_media(メディアファイルの処理)、get_transcript(文字起こしの取得)、get_frames(キーフレームの取得)、get_moment(指定時間範囲の要約)、search(文字起こしとOCRテキストの検索)、extract_frame(正確なフレームの抽出)、list_jobs(処理済みジョブの一覧表示)。各ツールの説明には10以上の使用例が含まれており、エージェントが適切なツールを選択しやすくなっています。

さらに、5つのサーバープロンプト(MCPクライアントでのスラッシュコマンド)があります:triage-recording(録画のトリアージ)、spec-from-workshop(ワークショップからの仕様抽出)、backlog-from-demo(デモからのバックログ生成)、meeting-actions(会議のアクションアイテム抽出)、correlate-with-logs(録画とシステムログの関連付け)。これらのプロンプトは、MCPプロンプトをサポートしないクライアント向けにプレーンファイルとしても提供されています。

talkthrough-mcpはMITライセンスで公開されており、GitHub上で入手できます。ローカルファースト、依存関係の最小化、拡張性を重視した設計で、AIエージェントがビデオコンテンツから効率的に情報を抽出できるようにします。