AI 快讯 编译自 marktechpost #基准测试#开源工具#AI编程

Supabase开源Evals基准测试:评估Claude Code、Codex与OpenCode在真实任务中的表现

Supabase发布开源基准测试框架supabase/evals,用于评估Claude Code、Codex等AI编程代理在真实Supabase任务上的表现。本文解析其工作原理、评分机制及对中文开发者的实际意义,包括本地部署、国产替代对比等。

编译发布 2026/08/01 原文发布 2026/08/01

一句话看懂

Supabase开源了supabase/evals,一个Apache-2.0基准测试框架,用真实任务(如建表、修RLS策略)评估Claude Code、Codex、OpenCode等AI编程代理,并公开排行榜。

详细发生了什么

Supabase在2026年7月31日宣布开源其内部使用的AI代理评估框架supabase/evals。这个框架用来测试AI代理在真实Supabase环境中的表现,而不是用模拟数据。它支持Claude Code、Codex、OpenCode以及任何AI SDK代理,通过执行真实任务(比如构建数据库schema、调试Edge Function、修复损坏的RLS策略)来评估能力。

框架的核心设计有三个维度:产品(数据库、认证、存储、边缘函数等)、主题(RLS、安全、迁移、SQL等)和阶段(构建、部署、调查、解决)。每个评估场景都基于真实的支持工单、bug报告或GitHub issue,确保任务真实。

评估过程在容器化环境中运行,代理会调用真实的Supabase MCP服务器和CLI,而不是模拟接口。评分结合了确定性检查和LLM-as-a-judge,代理在评分前有一次重试机会。评估分为基准场景(公开,用于排行榜)和回归场景(每日刷新,跟踪已知故障模式)。

目前,supabase/evals已在GitHub上以Apache-2.0许可公开,可通过pnpm本地运行。它驱动着supabase.com/evals的公开排行榜,并作为内部回归测试套件。

中文圈视角

对中文开发者来说,这个工具的价值在于:

  1. 本地部署可行性:supabase/evals需要Docker daemon和API key,但无需特定网络环境,国内开发者可直接使用。不过,由于依赖GitHub和npm,可能需要稳定的网络连接。

  2. 国产替代对比:国内类似平台如阿里云的ModelScope或百度的千帆,但专注于AI代理评估的较少。Supabase的框架更通用,可适配任何支持MCP的代理,包括国产的如DeepSeek、Kimi等,只要它们支持MCP协议。

  3. 实际应用场景:对于使用Supabase的国内团队,这个工具能帮助评估AI编程代理在真实项目中的可靠性,尤其是在RLS策略等安全敏感场景。但若团队使用国内数据库(如阿里云RDS),则需调整场景,因为Supabase的特定功能(如RLS)在MySQL上不适用。

  4. 盲点:中文社区对AI代理的评估标准讨论较少,此工具提供了一个可量化的基准,可能推动更多中文开发者关注代理的可靠性而非仅关注功能。

几条值得记住的细节

  • 评估场景基于真实支持工单和GitHub issue,确保任务真实性。
  • 代理在评分前有一次重试机会,以减少误判。
  • 评分结合确定性检查和LLM-as-a-judge,确保客观性。
  • 基准场景公开,回归场景每日刷新,但不影响公开分数。
  • 本地运行需要Docker daemon、API key,并占用端口54321-54329。

一句话总结

Supabase Evals为AI编程代理提供了可量化的真实任务基准,中文开发者可借此评估和优化代理在安全敏感场景下的表现。