Show HN:一個圍繞評估而非演示構建的AI智能體技能倉庫
該項目是一個可複用的AI智能體技能集合,每個技能都附有迴歸評估記錄。重點在於評估記錄,而非演示。提供了世界盃投注報告技能示例,並詳細説明了如何運行、比較和升級評估。
近日,開發者sourishkrout在GitHub上發佈了一個名為"Skills"的AI智能體技能倉庫。與傳統的展示型項目不同,該倉庫的核心亮點在於圍繞評估(evals)而非演示(demos)進行構建。每個技能都附帶一個完整的迴歸評估跟蹤記錄,開發者應當首先查看這些記錄,再決定是否克隆或運行代碼。
目前,倉庫中包含一個示例技能"world-cup-picks-report",用於生成2026年世界盃的預測報告。儘管賽事已經結束,但該技能的評估記錄仍然可供參考,並且持續更新。開發者可以通過兩個儀表盤來監控評估進展:Trend儀表盤展示頂級指標和迴歸趨勢,而Harbor儀表盤則保存了每一次任務和試驗的完整歷史。此外,也可以在本地克隆後通過runme eval view命令瀏覽歷史。
使用該技能非常簡單。開發者可以通過npx命令全局安裝:
npx skills add -g https://github.com/sourishkrout/skills --skill world-cup-picks-report或者通過Claude Code插件市場添加:
/plugin marketplace add sourishkrout/skills
/plugin install world-cup-picks-report@sourishkrout-skills在本地運行評估之前,需要先克隆倉庫並安裝依賴,然後導出Anthropic API密鑰(用於LLM評判)。評估流程支持多種AI代理,包括Codex、Claude Code、Cursor CLI和OpenClaw。運行完整迴歸評估的命令為:
runme eval skills/world-cup-picks-report/evals/regression \
--agent codex \
--ak reasoning_effort=xhigh如果只想運行oracle(即僅評估核心邏輯),可以使用:
runme eval skills/world-cup-picks-report/evals/regression評估完成後,開發者可以使用比較命令查看最新結果與Git基線之間的差異:
runme eval compare skills/world-cup-picks-report/evals/regression在提交證據前,還可以使用預覽命令:
runme eval promote skills/world-cup-picks-report/evals/regression --latest --dry-run如果結果令人滿意,可以將其升級為新基線。升級過程默認會壓縮評估證據,但也可以選擇保留完整日誌(使用--artifacts)。需要注意的是,Harbor展示是公開的,因此在升級前務必仔細審查證據。升級提交到主分支後,GitHub Actions會自動發佈更新結果。
該倉庫採用MIT許可證,目前仍處於早期階段,但這種以評估為中心的方法為構建可靠AI智能體提供了新的思路。開發者可以在GitHub上查看完整文檔和示例。整個工作流程強調了評估記錄作為首要產出的理念,有助於確保AI技能的質量和可重複性。