Show HN:将带解说的屏幕录制转化为AI智能体可用的数据(本地运行,MIT许可)
talkthrough-mcp 是一个本地优先的 MCP 服务器,能够将带解说的屏幕录制转化为 AI 智能体可使用的结构化数据。它提供带时间戳的转录、场景关键帧、OCR、说话人标注和真实时钟锚定功能,全部在本地运行,无需依赖云端。该服务器可集成多种 MCP 客户端,并内置了用于录制分类、需求提取和待办事项生成的工作流程。
talkthrough-mcp 是一个本地优先的 MCP 服务器,专为处理带解说的屏幕录制而设计。它能够将视频或音频文件转化为 AI 智能体可直接使用的结构化数据,包括带时间戳的转录文本、场景变化的关键帧、屏幕上的文字识别(OCR)、可选的说话人标注,以及将每个时间点映射到真实世界时钟的锚定功能。所有处理都在本地完成,无需连接云端,也不包含任何大语言模型——智能体本身负责理解和决策。
与其他屏幕录制 SaaS 或视频分析 MCP 不同,talkthrough-mcp 可以处理任意本地文件,并附带了智能体工作流程(服务器提示和示例智能体),使常见任务如错误分类、需求提取和待办事项生成变得简单。其时间戳锚定功能特别有用:当开发人员说“就在我说支付界面卡住的时候”,系统能直接对应到服务器日志中的正确时间段。
快速上手只需一条命令:确保已安装 uv(可通过 brew 或官方脚本安装),然后运行 uvx talkthrough-mcp[diarization]。该命令会自动下载所需的 ffmpeg、Whisper 模型和 OCR 引擎。支持多种 MCP 客户端,包括 Claude Code、Cursor、OpenAI Codex CLI、Gemini CLI、GitHub Copilot 等。对于 Claude Code,还提供了完整的插件版本,包含原生斜杠命令和预设的分类智能体。
说话人区分(Diarization)是可选的扩展功能,通过安装 [diarization] 额外包启用。它使用 pyannote 和 NeMo 模型在本地运行,无需 GPU,对一段 26 分钟的会议进行区分大约只需 2 分钟。区分后的标签以 S1、S2 等匿名形式出现,智能体可根据上下文将其映射为实际姓名。
该服务器提供了七个工具:process_media(处理媒体文件)、get_transcript(获取转录)、get_frames(获取关键帧)、get_moment(获取指定时间段的摘要)、search(搜索转录和 OCR 文本)、extract_frame(提取精确帧)和 list_jobs(列出已处理的任务)。每个工具的描述中都包含超过 10 个使用示例,帮助智能体正确选用工具。
此外,还有五个服务器提示(可视为 MCP 客户端中的斜杠命令):triage-recording(分类录制内容)、spec-from-workshop(从研讨会中提取规范)、backlog-from-demo(从演示中生成待办事项)、meeting-actions(提取会议行动项)和 correlate-with-logs(将录制内容与系统日志关联)。这些提示也以普通文件形式提供,供不支持 MCP 提示的客户端使用。
talkthrough-mcp 采用 MIT 许可,代码托管在 GitHub 上。它的设计理念是保持本地优先、无依赖、可扩展,让 AI 智能体能够更高效地从视频内容中提取有用信息。