主要来源Paul Graham
查看原文事件专题 · 单一信源
Supabase 推出 Evals 基准,实测 AI 编码代理
Supabase 发布了名为 Evals 的基准测试,用于评估 AI 编码代理在 Supabase 平台上的真实任务完成能力。该基准会运行 Claude Code、Codex 和 Open Code 等代理,并对其结果进行打分。Paul Graham 对此表示赞赏,认为未来所有面向代理的服务都应采用类似机制。
当前结论
Supabase 给 Claude Code、Codex 这些编程代理搞了个真实任务考试,谁更会建应用,看看分数就知道。
2 个信源61° AI 热度最后更新 2026/7/31 20:32:01
证据链
相关来源 1marktechpost
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。