AI News HubLIVE
站內改寫2 分鐘閱讀

Show HN:將帶解說的螢幕錄製轉化為AI智慧體可用的資料(本地執行,MIT許可)

talkthrough-mcp 是一個本地優先的 MCP 伺服器,能夠將帶解說的螢幕錄製轉化為 AI 智慧體可使用的結構化資料。它提供帶時間戳的轉錄、場景關鍵幀、OCR、說話人標註和真即時鍾錨定功能,全部在本地執行,無需依賴雲端。該伺服器可整合多種 MCP 客戶端,並內建了用於錄製分類、需求提取和待辦事項生成的工作流程。

來源Hacker News AI作者: korovin-aa

talkthrough-mcp 是一個本地優先的 MCP 伺服器,專為處理帶解說的螢幕錄製而設計。它能夠將影片或音訊檔案轉化為 AI 智慧體可直接使用的結構化資料,包括帶時間戳的轉錄文本、場景變化的關鍵幀、螢幕上的文字識別(OCR)、可選的說話人標註,以及將每個時間點對映到真實世界時鐘的錨定功能。所有處理都在本地完成,無需連線雲端,也不包含任何大語言模型——智慧體本身負責理解和決策。

與其他螢幕錄製 SaaS 或影片分析 MCP 不同,talkthrough-mcp 可以處理任意本地檔案,並附帶了智慧體工作流程(伺服器提示和示例智慧體),使常見任務如錯誤分類、需求提取和待辦事項生成變得簡單。其時間戳錨定功能特別有用:當開發人員說“就在我說支付介面卡住的時候”,系統能直接對應到伺服器日誌中的正確時間段。

快速上手只需一條命令:確保已安裝 uv(可透過 brew 或官方指令碼安裝),然後執行 uvx talkthrough-mcp[diarization]。該命令會自動下載所需的 ffmpeg、Whisper 模型和 OCR 引擎。支援多種 MCP 客戶端,包括 Claude Code、Cursor、OpenAI Codex CLI、Gemini CLI、GitHub Copilot 等。對於 Claude Code,還提供了完整的外掛版本,包含原生斜槓命令和預設的分類智慧體。

說話人區分(Diarization)是可選的擴充套件功能,透過安裝 [diarization] 額外包啟用。它使用 pyannote 和 NeMo 模型在本地執行,無需 GPU,對一段 26 分鐘的會議進行區分大約只需 2 分鐘。區分後的標籤以 S1、S2 等匿名形式出現,智慧體可根據上下文將其對映為實際姓名。

該伺服器提供了七個工具:process_media(處理媒體檔案)、get_transcript(獲取轉錄)、get_frames(獲取關鍵幀)、get_moment(獲取指定時間段的摘要)、search(搜尋轉錄和 OCR 文本)、extract_frame(提取精確幀)和 list_jobs(列出已處理的任務)。每個工具的描述中都包含超過 10 個使用示例,幫助智慧體正確選用工具。

此外,還有五個伺服器提示(可視為 MCP 客戶端中的斜槓命令):triage-recording(分類錄製內容)、spec-from-workshop(從研討會中提取規範)、backlog-from-demo(從演示中生成待辦事項)、meeting-actions(提取會議行動項)和 correlate-with-logs(將錄製內容與系統日誌關聯)。這些提示也以普通檔案形式提供,供不支援 MCP 提示的客戶端使用。

talkthrough-mcp 採用 MIT 許可,程式碼託管在 GitHub 上。它的設計理念是保持本地優先、無依賴、可擴充套件,讓 AI 智慧體能夠更高效地從影片內容中提取有用資訊。