技巧多源确认精选

Grok Bot 团队 Lauren:一个月向生产环境交付 2500 个 PR

Grok Bot 团队 Lauren @poteto 怎么做到在一个月内向生产环境交付 2500 个 PR? Lauren 的经验:把工程团队的经验、约束和验证能力沉淀为运行环境,使智能体在较少人工...

精选理由

让智能体一个月提 2500 个 PR,Grok Bot 的 Lauren 把这套环境怎么搭讲透了。

Grok Bot 团队的 Lauren (@poteto) 公开了一套让智能体单月交付 2500 个 PR 到生产环境的工作方法,核心是把工程经验、约束和验证能力沉淀为可复用的运行环境。她从 Cursor 的 Agent 窗口场景切入:PR 进入速度超过人工逐条审查性能回归的能力,过去工程师用 Chrome DevTools、性能 trace 手工排查是吞吐瓶颈。方法分四层:Control Glass 通过 Chrome DevTools Protocol 采集运行时证据,Feature map 把功能交互存入代码库作任务记忆,pstack 把调试与性能经验写成 skills,Dune 用导入依赖图和线程边界约束架构。纠错按由强到弱层级沉淀:代码库与架构、静态分析、规则与 BugBot、技能、人工审查,重复出现的纠正应固化到前两层。演示链路里,外环连接 Slack、Datadog、Sentry、PlanetScale 基于事件触发任务,内环由 Cursor 自动化与 SDK 执行,缺陷报告自动复现后创建 PR。

原文 · shao__meng

Grok Bot 团队 Lauren @poteto 怎么做到在一个月内向生产环境交付 2500 个 PR? Lauren 的经验:把工程团队的经验、约束和验证能力沉淀为运行环境,使智能体在较少人工...

Grok Bot 团队 Lauren @poteto 怎么做到在一个月内向生产环境交付 2500 个 PR? Lauren 的经验:把工程团队的经验、约束和验证能力沉淀为运行环境,使智能体在较少人工盯防下持续交付。 PR 数量是这套环境长期运行后呈现出的结果,而主线始终是如何建立“信任”。Lauren 将这种环境比作“米其林厨房”:人仍对产品结果负责,智能体则在经过设计的工具、流程和约束中完成大量具体工作。 Lauren 从一个真实的性能治理场景展开。Cursor 的 Agent 窗口快速迭代,PR 的进入速度超过人工逐条审查性能回归的能力。她曾手工使用 Chrome DevTools、性能 trace 和 heap snapshot 排查问题,随后将“运行应用、采集证据、定位热点、持续改善性能”编码给智能体。她把这一变化概括为:工程师本人曾经是吞吐瓶颈,团队需要把工程判断转化为可复用的环境能力。 由此形成一条清晰的规模化路径。少量智能体可以依靠人工持续校正;更大规模的并行工作需要可靠的行为边界。环境中的验证、代码结构、静态分析、规则和技能共同降低了每次交付所需的人类确认成本。高并发本身没有产生信任,可重复的证据链和更难犯错的系统结构才产生信任。 Lauren 给出四层能力 1. 直接验证 实现:Control Glass 让智能体经由 CLI 和 Chrome DevTools Protocol 运行应用、采集 trace 与 heap snapshot。 解决:用运行时证据确认功能和性能,避免只根据“能编译”或智能体自述下结论。 2. 任务记忆 实现:Feature map 把功能入口、键盘操作、DOM 交互和功能含义保存在代码库中。 解决:让智能体可以理解模糊的缺陷截图或内部反馈,并复现具体场景。 3. 工程 skills 实现:pstack 将调试、功能开发、原型、性能等经验写成 playbook 和 skills。 解决:将资深工程师的工作方式转为团队可复用的执行步骤。 4. 架构约束 实现:Dune 用目录约定、导入依赖图和线程边界限制可选路径。 解决:让“简单路径”同时成为正确路径,并在代码层面阻断已知反模式。 这里最有价值的区分是:验证回答“功能是否真的发生”,工程质量还需要由架构、性能约束和可维护性共同保证。 pstack 当前公开文档也将此原则写为“直接检查真实产物”,并要求对功能走完整链路、对委派工作检查实际 diff 或运行行为。 对工程组织的关键启示 1. 代码库正在成为智能体的“物化记忆” 把代码库视为智能体最强的上下文来源。智能体会延续已经读到的模式,因此良好结构会被持续复制,临时 workaround 也会被持续复制。Lauren 用“花园”描述这件事:团队需要及时清除会扩散的坏模式,并维护一条清晰的“paved path”。这是一种面向智能体时代的代码健康观,重点从“写下更多规范”转向“让规范体现为可执行结构”。 2. 纠错应优先沉淀到约束系统 Lauren 给出了一条由强到弱的纠错层级:代码库与架构、静态分析、规则与 BugBot、技能、人工风格审查。前两层具有更强的一致性和可执行性。每当人需要重复纠正某类行为,团队可以把经验固化为数据结构、依赖边界、lint 规则、测试或自动化检查。这样,下一次 Agent 执行任务时就能直接继承改进后的环境。 3. 自动化的价值在于形成闭环 末尾展示了“外环”和“内环”的组合。外环由 Grok Bot 连接 Slack、Datadog、Sentry、PlanetScale 等信息源,并基于事件触发任务;内环由 Cursor 自动化和 SDK 承担具体工程工作。演示中的目标链路是:缺陷报告进入系统,智能体自动复现,随后创建 PR。这个设计把反馈、诊断、修复和验证连接成闭环。 lauren @poteto here's how i shipped 2,500 PRs last month to production this was originally supposed to be for Cursor Compile in London. i couldn't make it since i was livestreaming for Grok @Bot Galaxy so i'm making it available for free here on X! watch it on 2x speed, i talk slowly Your browser does not support the video tag. 🔗 View on Twitter 🔗 View Quoted Tweet 💬 0 🔄 0 ❤️ 0 👀 256 📊 1 ⚡