Supabase 发布 Evals:开源基准测试,用真实 Supabase 任务为 Claude Code、Codex 和 OpenCode 打分
Supabase 开源了 Apache-2.0 的基准测试框架 supabase/evals,在容器化的真实 Supabase 环境中运行 Claude Code、Codex、OpenCode 等编码代理,并用确定性检查与 LLM 裁判进行评分。该框架支持公开排行榜和每日回归测试。
Supabase 日前宣布开源 Supabase Evals,这是一个用于评估 AI 代理在 Supabase 平台上构建能力的基准测试与框架。它能够让 Claude Code、Codex、OpenCode 等编码代理执行真实任务,例如创建数据表结构、调试失败的 Edge Function、修复错误的 RLS 策略,然后对结果进行评分。该框架为 supabase.com/evals 上的公开排行榜提供支撑,也被用作每日运行的内部回归测试套件。
Evals 已可通过 pnpm 在本地运行,代码仓库 supabase/evals 采用 Apache-2.0 许可证。运行环境需要 Docker 守护进程、模型提供方的 API 密钥,并保证 54321–54329 端口未被占用。对于金融科技、医疗等受监管行业而言,如果代理生成了错误的 RLS 策略,可能直接导致安全事故,因此这类评测尤为重要。
在场景设计上,Supabase 定义了三个维度:产品(数据库、认证、存储、Edge Functions、Realtime、Cron、队列、向量、Data API)、主题(RLS、安全、迁移、SQL、SDK、可观测性、自托管、测试、声明式 Schema)和阶段(构建、部署、调查、修复)。团队从支持工单、Bug 报告和 GitHub Issue 中筛选出最小场景集,使每个维度至少被覆盖一次。场景分为公开的基准场景和每日刷新的回归场景,后者不会影响已发布的分数。
每个场景都在真实环境中执行。框架会在容器中启动接近托管的堆栈和本地 CLI 项目,代理可以直接调用真正的 MCP 服务器和 CLI。评分机制结合了确定性检查和 LLM 作为裁判,代理在评分前有一次重试机会。每个评测目录包含 PROMPT.md 描述任务与元数据、EVAL.ts 评分器,以及可选的 remote/ 和 local/ 初始状态;如果包含 local/ 工作区或声明 interface: cli,则会启动装有真实 CLI 的 Docker 沙箱。
在初步结果中,大多数场景无需加载技能即可通过。Build 阶段,Opus 5 和 Kimi K3 在无辅助的情况下均达到 100%;技能补足了其余模型的差距:Sonnet 5 从 78% 提升至 100%,GPT-5.6 Sol 从 89% 提升至 100%,GPT-5.4 mini 从 78% 提升至 89%。同时,评测也暴露了三个常见问题:代理倾向于手写迁移而非使用声明式 Schema、依赖手动验证认证而不是使用 @supabase/server、以及不同模型对文档的依赖程度差异明显(Codex / GPT-5.6 每个场景约阅读 8 页文档,Claude Code 仅约 2 页,且即使加载技能,后者在不到 40% 的场景中会查阅文档)。这些发现已促使 Supabase 更新技能指导和包选择指南。整体来看,Evals 提供了一种可复现、接近生产环境的方式,来衡量编码代理在真实 Supabase 工作流中的表现。