Answerwatch – 追踪AI模型推荐的变化
Answerwatch是一个开源工具,可以在本地追踪不同AI模型对同一提示的推荐结果变化,通过SQLite存储数据,并生成静态HTML报告,帮助用户了解模型间的差异和推荐漂移。
Answerwatch 是一款开源的命令行工具,旨在让 AI 模型推荐的变化变得可见。它允许用户将相同的提示发送给多个模型——例如 OpenAI 的 GPT 系列、Anthropic 的 Claude 以及 Google 的 Gemini——然后比较这些模型的推荐结果,并在本地维护一份审计追踪记录。所有数据都存储在本地 SQLite 数据库中,唯一的对外调用是用户主动发起的模型请求。
该工具的核心功能是帮助回答几个关键问题:不同模型是否达成共识?哪些推荐是某个模型独有的?实体排名是否存在显著差异?推荐结果随时间如何漂移?Answerwatch 通过一个静态 HTML 报告来直观地展示这些信息,包括模型间的成对推荐一致性矩阵、共识实体、最大排名差距以及新增或移除的推荐。
使用 Answerwatch 十分简便。它要求 Python 3.10 或更高版本,可以通过 pip 安装。首次使用时,运行 answerwatch init 会生成配置文件和示例提示。工具内置了一个演示模式:执行 answerwatch run --demo 可以在不进行任何网络请求的情况下快速生成一份精美的仪表板,显示一致性、排名差距、引用域和原始答案。演示模式不会消耗任何 API 额度。
对于实际运行,Answerwatch 利用 OpenRouter 作为统一网关,只需一个 API 密钥即可查询来自不同提供商的模型。配置文件中可以指定要使用的模型标识符(例如 openai/gpt-5.2、anthropic/claude-sonnet-4.5、google/gemini-3-flash-preview)。运行 answerwatch run 执行查询,answerwatch compare 比较运行结果,answerwatch report 生成报告。要观察推荐漂移,可以隔一段时间重新运行,并使用 --baseline previous 参数进行对比。
关于提取机制,0.1 版本要求模型将推荐放在编号列表的开头,然后由本地的确定性解析器提取这些列表项。原始回答和提取的证据都保留在 SQLite 数据库中,确保了审计的可追溯性。需要注意的是,该工具并不验证生成的 URL 是否为可靠的引用。
本地数据默认存储在 .answerwatch/ 目录下,包括数据库和报告。删除该目录即可清除所有运行历史。开发方面,可以通过 PYTHONPATH=src python -m unittest discover -s tests -v 运行测试。项目采用 Conventional Commit 风格的提交信息。
Answerwatch 的发展路线图包括:当前阶段支持本地运行、推荐比较、静态报告和 OpenRouter;下一阶段将加强实体规范化、结构化提供商引用和定时本地运行;未来可能会增加可选的托管历史、告警、团队和品牌报告功能。该项目采用 MIT 许可证,并欢迎社区贡献,详细内容可参阅 CONTRIBUTING.md、CODE_OF_CONDUCT.md 等文档。