AI News HubLIVE
站內改寫2 分鐘閱讀

Answerwatch – 追蹤AI模型推薦的變化

Answerwatch是一個開源工具,可以在本地追蹤不同AI模型對同一提示的推薦結果變化,透過SQLite儲存資料,並生成靜態HTML報告,幫助使用者瞭解模型間的差異和推薦漂移。

來源Hacker News AI作者: arorah

Answerwatch 是一款開源的命令列工具,旨在讓 AI 模型推薦的變化變得可見。它允許使用者將相同的提示傳送給多個模型——例如 OpenAI 的 GPT 系列、Anthropic 的 Claude 以及 Google 的 Gemini——然後比較這些模型的推薦結果,並在本地維護一份審計追蹤記錄。所有資料都儲存在本地 SQLite 資料庫中,唯一的對外呼叫是使用者主動發起的模型請求。

該工具的核心功能是幫助回答幾個關鍵問題:不同模型是否達成共識?哪些推薦是某個模型獨有的?實體排名是否存在顯著差異?推薦結果隨時間如何漂移?Answerwatch 透過一個靜態 HTML 報告來直觀地展示這些資訊,包括模型間的成對推薦一致性矩陣、共識實體、最大排名差距以及新增或移除的推薦。

使用 Answerwatch 十分簡便。它要求 Python 3.10 或更高版本,可以透過 pip 安裝。首次使用時,執行 answerwatch init 會生成配置檔案和示例提示。工具內建了一個演示模式:執行 answerwatch run --demo 可以在不進行任何網路請求的情況下快速生成一份精美的儀表板,顯示一致性、排名差距、引用域和原始答案。演示模式不會消耗任何 API 額度。

對於實際執行,Answerwatch 利用 OpenRouter 作為統一閘道器,只需一個 API 金鑰即可查詢來自不同提供商的模型。配置檔案中可以指定要使用的模型識別符號(例如 openai/gpt-5.2anthropic/claude-sonnet-4.5google/gemini-3-flash-preview)。執行 answerwatch run 執行查詢,answerwatch compare 比較執行結果,answerwatch report 生成報告。要觀察推薦漂移,可以隔一段時間重新執行,並使用 --baseline previous 引數進行對比。

關於提取機制,0.1 版本要求模型將推薦放在編號列表的開頭,然後由本地的確定性解析器提取這些列表項。原始回答和提取的證據都保留在 SQLite 資料庫中,確保了審計的可追溯性。需要注意的是,該工具並不驗證生成的 URL 是否為可靠的引用。

本地資料預設儲存在 .answerwatch/ 目錄下,包括資料庫和報告。刪除該目錄即可清除所有執行歷史。開發方面,可以透過 PYTHONPATH=src python -m unittest discover -s tests -v 執行測試。專案採用 Conventional Commit 風格的提交資訊。

Answerwatch 的發展路線圖包括:當前階段支援本地執行、推薦比較、靜態報告和 OpenRouter;下一階段將加強實體規範化、結構化提供商引用和定時本地執行;未來可能會增加可選的託管歷史、告警、團隊和品牌報告功能。該專案採用 MIT 許可證,並歡迎社群貢獻,詳細內容可參閱 CONTRIBUTING.md、CODE_OF_CONDUCT.md 等文件。