事件专题 · 单一信源

Supabase 推出 Evals 基准,实测 AI 编码代理

Supabase 发布了名为 Evals 的基准测试,用于评估 AI 编码代理在 Supabase 平台上的真实任务完成能力。该基准会运行 Claude Code、Codex 和 Open Code 等代理,并对其结果进行打分。Paul Graham 对此表示赞赏,认为未来所有面向代理的服务都应采用类似机制。

当前结论

Supabase 给 Claude Code、Codex 这些编程代理搞了个真实任务考试,谁更会建应用,看看分数就知道。

2 个信源61° AI 热度最后更新 2026/7/31 20:32:01

证据链

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情