AI News HubLIVE
站內改寫2 分鐘閱讀

Supabase 釋出 Evals:開源基準測試,用真實 Supabase 任務為 Claude Code、Codex 和 OpenCode 打分

Supabase 開源了 Apache-2.0 的基準測試框架 supabase/evals,在容器化的真實 Supabase 環境中執行 Claude Code、Codex、OpenCode 等編碼代理,並用確定性檢查與 LLM 裁判進行評分。該框架支援公開排行榜和每日迴歸測試。

來源MarkTechPost作者: Michal Sutter

Supabase 日前宣佈開源 Supabase Evals,這是一個用於評估 AI 代理在 Supabase 平臺上構建能力的基準測試與框架。它能夠讓 Claude Code、Codex、OpenCode 等編碼代理執行真實任務,例如建立資料表結構、除錯失敗的 Edge Function、修復錯誤的 RLS 策略,然後對結果進行評分。該框架為 supabase.com/evals 上的公開排行榜提供支撐,也被用作每日執行的內部迴歸測試套件。

Evals 已可透過 pnpm 在本地執行,程式碼倉庫 supabase/evals 採用 Apache-2.0 許可證。執行環境需要 Docker 守護程序、模型提供方的 API 金鑰,並保證 54321–54329 埠未被佔用。對於金融科技、醫療等受監管行業而言,如果代理生成了錯誤的 RLS 策略,可能直接導致安全事故,因此這類評測尤為重要。

在場景設計上,Supabase 定義了三個維度:產品(資料庫、認證、儲存、Edge Functions、Realtime、Cron、佇列、向量、Data API)、主題(RLS、安全、遷移、SQL、SDK、可觀測性、自託管、測試、宣告式 Schema)和階段(構建、部署、調查、修復)。團隊從支援工單、Bug 報告和 GitHub Issue 中篩選出最小場景集,使每個維度至少被覆蓋一次。場景分為公開的基準場景和每日重新整理的迴歸場景,後者不會影響已釋出的分數。

每個場景都在真實環境中執行。框架會在容器中啟動接近託管的堆疊和本地 CLI 專案,代理可以直接呼叫真正的 MCP 伺服器和 CLI。評分機制結合了確定性檢查和 LLM 作為裁判,代理在評分前有一次重試機會。每個評測目錄包含 PROMPT.md 描述任務與後設資料、EVAL.ts 評分器,以及可選的 remote/ 和 local/ 初始狀態;如果包含 local/ 工作區或宣告 interface: cli,則會啟動裝有真實 CLI 的 Docker 沙箱。

在初步結果中,大多數場景無需載入技能即可透過。Build 階段,Opus 5 和 Kimi K3 在無輔助的情況下均達到 100%;技能補足了其餘模型的差距:Sonnet 5 從 78% 提升至 100%,GPT-5.6 Sol 從 89% 提升至 100%,GPT-5.4 mini 從 78% 提升至 89%。同時,評測也暴露了三個常見問題:代理傾向於手寫遷移而非使用宣告式 Schema、依賴手動驗證認證而不是使用 @supabase/server、以及不同模型對文件的依賴程度差異明顯(Codex / GPT-5.6 每個場景約閱讀 8 頁文件,Claude Code 僅約 2 頁,且即使載入技能,後者在不到 40% 的場景中會查閱文件)。這些發現已促使 Supabase 更新技能指導和包選擇指南。整體來看,Evals 提供了一種可復現、接近生產環境的方式,來衡量編碼代理在真實 Supabase 工作流中的表現。