AI News HubLIVE
站内改写2 分钟阅读

Show HN:一个围绕评估而非演示构建的AI智能体技能仓库

该项目是一个可复用的AI智能体技能集合,每个技能都附有回归评估记录。重点在于评估记录,而非演示。提供了世界杯投注报告技能示例,并详细说明了如何运行、比较和升级评估。

来源Hacker News AI作者: sourishkrout

近日,开发者sourishkrout在GitHub上发布了一个名为"Skills"的AI智能体技能仓库。与传统的展示型项目不同,该仓库的核心亮点在于围绕评估(evals)而非演示(demos)进行构建。每个技能都附带一个完整的回归评估跟踪记录,开发者应当首先查看这些记录,再决定是否克隆或运行代码。

目前,仓库中包含一个示例技能"world-cup-picks-report",用于生成2026年世界杯的预测报告。尽管赛事已经结束,但该技能的评估记录仍然可供参考,并且持续更新。开发者可以通过两个仪表盘来监控评估进展:Trend仪表盘展示顶级指标和回归趋势,而Harbor仪表盘则保存了每一次任务和试验的完整历史。此外,也可以在本地克隆后通过runme eval view命令浏览历史。

使用该技能非常简单。开发者可以通过npx命令全局安装:

npx skills add -g https://github.com/sourishkrout/skills --skill world-cup-picks-report

或者通过Claude Code插件市场添加:

/plugin marketplace add sourishkrout/skills
/plugin install world-cup-picks-report@sourishkrout-skills

在本地运行评估之前,需要先克隆仓库并安装依赖,然后导出Anthropic API密钥(用于LLM评判)。评估流程支持多种AI代理,包括Codex、Claude Code、Cursor CLI和OpenClaw。运行完整回归评估的命令为:

runme eval skills/world-cup-picks-report/evals/regression \
--agent codex \
--ak reasoning_effort=xhigh

如果只想运行oracle(即仅评估核心逻辑),可以使用:

runme eval skills/world-cup-picks-report/evals/regression

评估完成后,开发者可以使用比较命令查看最新结果与Git基线之间的差异:

runme eval compare skills/world-cup-picks-report/evals/regression

在提交证据前,还可以使用预览命令:

runme eval promote skills/world-cup-picks-report/evals/regression --latest --dry-run

如果结果令人满意,可以将其升级为新基线。升级过程默认会压缩评估证据,但也可以选择保留完整日志(使用--artifacts)。需要注意的是,Harbor展示是公开的,因此在升级前务必仔细审查证据。升级提交到主分支后,GitHub Actions会自动发布更新结果。

该仓库采用MIT许可证,目前仍处于早期阶段,但这种以评估为中心的方法为构建可靠AI智能体提供了新的思路。开发者可以在GitHub上查看完整文档和示例。整个工作流程强调了评估记录作为首要产出的理念,有助于确保AI技能的质量和可重复性。