Supabase 發佈 Evals:開源基準測試,用真實 Supabase 任務為 Claude Code、Codex 和 OpenCode 打分
Supabase 開源了 Apache-2.0 的基準測試框架 supabase/evals,在容器化的真實 Supabase 環境中運行 Claude Code、Codex、OpenCode 等編碼代理,並用確定性檢查與 LLM 裁判進行評分。該框架支持公開排行榜和每日迴歸測試。
Supabase 日前宣佈開源 Supabase Evals,這是一個用於評估 AI 代理在 Supabase 平台上構建能力的基準測試與框架。它能夠讓 Claude Code、Codex、OpenCode 等編碼代理執行真實任務,例如創建數據表結構、調試失敗的 Edge Function、修復錯誤的 RLS 策略,然後對結果進行評分。該框架為 supabase.com/evals 上的公開排行榜提供支撐,也被用作每日運行的內部迴歸測試套件。
Evals 已可通過 pnpm 在本地運行,代碼倉庫 supabase/evals 採用 Apache-2.0 許可證。運行環境需要 Docker 守護進程、模型提供方的 API 密鑰,並保證 54321–54329 端口未被佔用。對於金融科技、醫療等受監管行業而言,如果代理生成了錯誤的 RLS 策略,可能直接導致安全事故,因此這類評測尤為重要。
在場景設計上,Supabase 定義了三個維度:產品(數據庫、認證、存儲、Edge Functions、Realtime、Cron、隊列、向量、Data API)、主題(RLS、安全、遷移、SQL、SDK、可觀測性、自託管、測試、聲明式 Schema)和階段(構建、部署、調查、修復)。團隊從支持工單、Bug 報告和 GitHub Issue 中篩選出最小場景集,使每個維度至少被覆蓋一次。場景分為公開的基準場景和每日刷新的迴歸場景,後者不會影響已發佈的分數。
每個場景都在真實環境中執行。框架會在容器中啓動接近託管的堆棧和本地 CLI 項目,代理可以直接調用真正的 MCP 服務器和 CLI。評分機制結合了確定性檢查和 LLM 作為裁判,代理在評分前有一次重試機會。每個評測目錄包含 PROMPT.md 描述任務與元數據、EVAL.ts 評分器,以及可選的 remote/ 和 local/ 初始狀態;如果包含 local/ 工作區或聲明 interface: cli,則會啓動裝有真實 CLI 的 Docker 沙箱。
在初步結果中,大多數場景無需加載技能即可通過。Build 階段,Opus 5 和 Kimi K3 在無輔助的情況下均達到 100%;技能補足了其餘模型的差距:Sonnet 5 從 78% 提升至 100%,GPT-5.6 Sol 從 89% 提升至 100%,GPT-5.4 mini 從 78% 提升至 89%。同時,評測也暴露了三個常見問題:代理傾向於手寫遷移而非使用聲明式 Schema、依賴手動驗證認證而不是使用 @supabase/server、以及不同模型對文檔的依賴程度差異明顯(Codex / GPT-5.6 每個場景約閲讀 8 頁文檔,Claude Code 僅約 2 頁,且即使加載技能,後者在不到 40% 的場景中會查閲文檔)。這些發現已促使 Supabase 更新技能指導和包選擇指南。整體來看,Evals 提供了一種可復現、接近生產環境的方式,來衡量編碼代理在真實 Supabase 工作流中的表現。