Agent技术选型实验:Stripe等工具成首选

当人把产品技术选型交给 Agent,Agent 会选谁? Armature 做了一个受控实验:让三个 Coding Agent(Claude Code / Opus 5、Codex / GPT-5....

精选理由

Armature让三大AI编程助手进行技术选型实验,发现Stripe、Vercel等工具成首选,13%情况下Agent选择自建方案。

AI 摘要

Armature进行了一项受控实验,让三个Coding Agent(Claude Code/Opus 5、Codex/GPT-5.6 Sol、Cursor/Grok 4.6)为小型代码库添加功能。实验包含16893个会话,最终分析了5292个有效会话,覆盖18个赛道、51个代码库和1163种提示词变体。结果显示,在支付领域Stripe以88%的胜率领先,数据库领域Neon占66%,云平台AWS占62%。

原文 · shao__meng

当人把产品技术选型交给 Agent,Agent 会选谁? Armature 做了一个受控实验:让三个 Coding Agent(Claude Code / Opus 5、Codex / GPT-5....

当人把产品技术选型交给 Agent,Agent 会选谁? Armature 做了一个受控实验:让三个 Coding Agent(Claude Code / Opus 5、Codex / GPT-5.6 Sol、Cursor / Grok 4.6)在 Sandbox 里给一个小型代码库"加一项能力"(如接支付、加数据库、做部署),并由 Agent 自己选用哪家产品并真正写代码接入。 跑了 16893 个会话,经 Gemini 3.7 Flash 判官过滤后公开了 5292 个有效会话,覆盖 18 个赛道、51 个代码库、1163 种提示词变体、4 类用户人设(vibe coder / 初级 / 高级 / 大企业工程师),结果如何呢? armature.tech/leaderboards # 18 个赛道的格局分布 一家独大(头名 ≥50%,5 个赛道) 支付:Stripe 88%(395 次)。仅在欧盟合规场景输给 Paddle、Mollie。PayPal 被提及 139 次,0 次胜出;Adyen 175 次提及,3 次胜出。 数据库:Neon 66%(356 次)。Supabase 是提及最多的(242 次)却只赢 3%;Turso 105 次提及 0 胜。 云平台:AWS 62%,GCP 17%;Azure 76 次提及 0 胜。 反机器人:Cloudflare Turnstile 57%;hCaptcha 126 次提及 0 胜。 产品分析:PostHog 53%;Mixpanel 222 次提及仅 5 胜,GA 0 胜。 有领先者但存在竞争(头名 22%–50%,9 个赛道) 文件存储:S3 46%,Azure Blob 与 GCS 各 20%,R2 13% 沙箱:E2B 42%,Modal 25%,Daytona 16% 部署:Vercel 41%,Render 34%,Cloudflare 11%;Netlify 152 次提及仅 6 胜, Fly.io 144 次提及 2 胜 可观测性:Sentry 37%,Grafana 14%,Datadog 仅 4% 邮件:Resend 36%,Postmark 27%;Mailgun 97 次提及 0 胜 LLM 评测:Langfuse 34%,自建 29%;LangSmith 209 次提及仅 8 胜 认证:WorkOS AuthKit 26%,Auth0 23%,Clerk 10%;Supabase Auth 69 次提及 0 胜 语音 Agent:Vapi 24%,Retell 18%,OpenAI Realtime 12% Serverless:AWS Lambda 24%,Vercel Functions 23% 高度分散或以自建为主(4 个赛道) AI Gateway:Portkey 与 Cloudflare AI Gateway 各 21%,LiteLLM 18% 搜索:自建 23% 居首,Postgres FTS 17%,OpenSearch 13%;Algolia 仅 5% Agent 框架:自建 25% 居首,Vercel AI SDK 14%,Cursor SDK 14%;LangChain 197 次提及仅 4 胜 CI 性能门禁:自建 52%,工具完全由语言决定(JMH/Java、hyperfine/Rust、PHPBench/PHP) # 五条关键发现 1. 三个 agent 的信息来源不同,结论也不同 Cursor 三分之二的会话依赖联网搜索;Codex 94% 联网且九成用 site: 限定可信域名;Claude Code 主要依赖先验知识,仅约 30% 联网,但一旦联网浏览页面数是 Codex 的 3 倍,在沙箱这类新兴赛道联网率升至 80%。三者只在 42% 的单元格里选择一致。Claude Code 自建比例(19%)接近另两者(10%)的两倍。 2. 代码库上下文是决定性变量 同样的邮件需求,TypeScript 仓库选 Resend、Python 选 SendGrid、Go 选 Postmark、Java 选 Azure ACS。Vercel 在 Next.js 仓库中 100% 胜出,在 Python 仓库中从未被推荐(Render 主导)。许多产品的全部胜场都来自单一代码库。 3. 被提及不等于被选中 这是对传统"品牌知名度"逻辑最直接的冲击:PayPal、LangChain、Netlify、Supabase、Mixpanel、hCaptcha 都是高提及、极低选中率。agent 会把它们列进候选,然后在比较中淘汰。 4. 官网上的一句话可以翻盘 Mailgun 因免费版"1 天日志保留"经常输给 Postmark;Supabase 因把 auth/存储/实时打包进定价,被认为"功能冗余"而在纯数据库场景落败。5.3k 会话中 388 次提到平台管理负担、195 次提到成本,作者认为其中相当部分源于信息呈现方式而非真实的硬指标。 5. 人设与措辞改变答案 大企业人设下赢家常换人:认证变成 Entra ID、可观测性变成 Grafana、Serverless 变成 Azure Functions、存储变成 Azure Blob 与 GCS 平分。强调"成本与规模"时部署赢家从 Vercel 变为 Render、邮件从 Resend 变为 Postmark;强调"自托管/隐私"时 LLM 评测赢家从 Langfuse 变为 Arize Phoenix。同一代码库 + 同一 agent 换几种说法反复问,多数赛道里大部分 case 无法稳定给出同一答案(部署 18/18、语音 30/30、搜索 33/33 全部翻转;文件存储最稳定,仅 5/24 翻转)。 Shubham Saboo @Saboo_Shubham_ WILD...someone measured which tools Claude Code, Codex and Cursor actually pick. ~16k runs. Stripe, Vercel, E2B, Vapi and Resend were the TOP choices. And 13% of the time the agents built everything from scratch. 🔗 View Quoted Tweet 💬 0 🔄 0 ❤️ 1 👀 632 📊 1 ⚡