AI News HubLIVE
站內改寫2 分鐘閱讀

Answerwatch – 追蹤AI模型推薦的變化

Answerwatch是一個開源工具,可以在本地追蹤不同AI模型對同一提示的推薦結果變化,通過SQLite存儲數據,並生成靜態HTML報告,幫助用户瞭解模型間的差異和推薦漂移。

來源Hacker News AI作者: arorah

Answerwatch 是一款開源的命令行工具,旨在讓 AI 模型推薦的變化變得可見。它允許用户將相同的提示發送給多個模型——例如 OpenAI 的 GPT 系列、Anthropic 的 Claude 以及 Google 的 Gemini——然後比較這些模型的推薦結果,並在本地維護一份審計追蹤記錄。所有數據都存儲在本地 SQLite 數據庫中,唯一的對外調用是用户主動發起的模型請求。

該工具的核心功能是幫助回答幾個關鍵問題:不同模型是否達成共識?哪些推薦是某個模型獨有的?實體排名是否存在顯著差異?推薦結果隨時間如何漂移?Answerwatch 通過一個靜態 HTML 報告來直觀地展示這些信息,包括模型間的成對推薦一致性矩陣、共識實體、最大排名差距以及新增或移除的推薦。

使用 Answerwatch 十分簡便。它要求 Python 3.10 或更高版本,可以通過 pip 安裝。首次使用時,運行 answerwatch init 會生成配置文件和示例提示。工具內置了一個演示模式:執行 answerwatch run --demo 可以在不進行任何網絡請求的情況下快速生成一份精美的儀表板,顯示一致性、排名差距、引用域和原始答案。演示模式不會消耗任何 API 額度。

對於實際運行,Answerwatch 利用 OpenRouter 作為統一網關,只需一個 API 密鑰即可查詢來自不同提供商的模型。配置文件中可以指定要使用的模型標識符(例如 openai/gpt-5.2anthropic/claude-sonnet-4.5google/gemini-3-flash-preview)。運行 answerwatch run 執行查詢,answerwatch compare 比較運行結果,answerwatch report 生成報告。要觀察推薦漂移,可以隔一段時間重新運行,並使用 --baseline previous 參數進行對比。

關於提取機制,0.1 版本要求模型將推薦放在編號列表的開頭,然後由本地的確定性解析器提取這些列表項。原始回答和提取的證據都保留在 SQLite 數據庫中,確保了審計的可追溯性。需要注意的是,該工具並不驗證生成的 URL 是否為可靠的引用。

本地數據默認存儲在 .answerwatch/ 目錄下,包括數據庫和報告。刪除該目錄即可清除所有運行歷史。開發方面,可以通過 PYTHONPATH=src python -m unittest discover -s tests -v 運行測試。項目採用 Conventional Commit 風格的提交信息。

Answerwatch 的發展路線圖包括:當前階段支持本地運行、推薦比較、靜態報告和 OpenRouter;下一階段將加強實體規範化、結構化提供商引用和定時本地運行;未來可能會增加可選的託管歷史、告警、團隊和品牌報告功能。該項目採用 MIT 許可證,並歡迎社區貢獻,詳細內容可參閲 CONTRIBUTING.md、CODE_OF_CONDUCT.md 等文檔。