AI News HubLIVE
站內改寫2 分鐘閱讀

Show HN:將帶解説的屏幕錄製轉化為AI智能體可用的數據(本地運行,MIT許可)

talkthrough-mcp 是一個本地優先的 MCP 服務器,能夠將帶解説的屏幕錄製轉化為 AI 智能體可使用的結構化數據。它提供帶時間戳的轉錄、場景關鍵幀、OCR、説話人標註和真實時鍾錨定功能,全部在本地運行,無需依賴雲端。該服務器可集成多種 MCP 客户端,並內置了用於錄製分類、需求提取和待辦事項生成的工作流程。

來源Hacker News AI作者: korovin-aa

talkthrough-mcp 是一個本地優先的 MCP 服務器,專為處理帶解説的屏幕錄製而設計。它能夠將視頻或音頻文件轉化為 AI 智能體可直接使用的結構化數據,包括帶時間戳的轉錄文本、場景變化的關鍵幀、屏幕上的文字識別(OCR)、可選的説話人標註,以及將每個時間點映射到真實世界時鐘的錨定功能。所有處理都在本地完成,無需連接雲端,也不包含任何大語言模型——智能體本身負責理解和決策。

與其他屏幕錄製 SaaS 或視頻分析 MCP 不同,talkthrough-mcp 可以處理任意本地文件,並附帶了智能體工作流程(服務器提示和示例智能體),使常見任務如錯誤分類、需求提取和待辦事項生成變得簡單。其時間戳錨定功能特別有用:當開發人員説“就在我説支付界面卡住的時候”,系統能直接對應到服務器日誌中的正確時間段。

快速上手只需一條命令:確保已安裝 uv(可通過 brew 或官方腳本安裝),然後運行 uvx talkthrough-mcp[diarization]。該命令會自動下載所需的 ffmpeg、Whisper 模型和 OCR 引擎。支持多種 MCP 客户端,包括 Claude Code、Cursor、OpenAI Codex CLI、Gemini CLI、GitHub Copilot 等。對於 Claude Code,還提供了完整的插件版本,包含原生斜槓命令和預設的分類智能體。

説話人區分(Diarization)是可選的擴展功能,通過安裝 [diarization] 額外包啓用。它使用 pyannote 和 NeMo 模型在本地運行,無需 GPU,對一段 26 分鐘的會議進行區分大約只需 2 分鐘。區分後的標籤以 S1、S2 等匿名形式出現,智能體可根據上下文將其映射為實際姓名。

該服務器提供了七個工具:process_media(處理媒體文件)、get_transcript(獲取轉錄)、get_frames(獲取關鍵幀)、get_moment(獲取指定時間段的摘要)、search(搜索轉錄和 OCR 文本)、extract_frame(提取精確幀)和 list_jobs(列出已處理的任務)。每個工具的描述中都包含超過 10 個使用示例,幫助智能體正確選用工具。

此外,還有五個服務器提示(可視為 MCP 客户端中的斜槓命令):triage-recording(分類錄製內容)、spec-from-workshop(從研討會中提取規範)、backlog-from-demo(從演示中生成待辦事項)、meeting-actions(提取會議行動項)和 correlate-with-logs(將錄製內容與系統日誌關聯)。這些提示也以普通文件形式提供,供不支持 MCP 提示的客户端使用。

talkthrough-mcp 採用 MIT 許可,代碼託管在 GitHub 上。它的設計理念是保持本地優先、無依賴、可擴展,讓 AI 智能體能夠更高效地從視頻內容中提取有用信息。