逆向工程 GPT-6 Astra「Computer Use」并将其提速 2 倍
逆向工程 GPT-6 Astra「Computer Use」并将其提速 2 倍 ?! @browserbase 团队 @kylejeong 发现 Astra 的 “Computer Use” 能力的...
朋友发现个好玩的事,Browserbase 团队把 GPT-6 Astra 的「Computer Use」能力给优化了,提速 2 倍还更好用,方法挺有意思。
Browserbase 团队发现 Astra 的「Computer Use」能力依赖「代码模式 + 无障碍树(a11y tree)」,通过把 Playwright 替换成 Stagehand 框架并引入「批处理式动作预测」,在仍使用 Astra 模型本身的前提下,将浏览器操作速度提升了约 2 倍,且行为质量常常更好。
逆向工程 GPT-6 Astra「Computer Use」并将其提速 2 倍 ?! @browserbase 团队 @kylejeong 发现 Astra 的 “Computer Use” 能力的...
逆向工程 GPT-6 Astra「Computer Use」并将其提速 2 倍 ?! @browserbase 团队 @kylejeong 发现 Astra 的 “Computer Use” 能力的秘密在于 “代码模式 + 无障碍树(a11y tree)”,团队通过把 Playwright 替换成自家 @Stagehanddev 框架并引入 “批处理式动作预测”,在仍使用 Astra 模型本身的前提下,将浏览器操作速度提升了约 2 倍,且行为质量常常更好。 # 技术解读:Astra Computer Use 究竟怎么工作? 1. 代码模式,非坐标点击。 传统 computer use(如早期的 Claude Computer Use)依赖视觉坐标:模型“看”截图,输出 (x, y) 坐标去点击。这种方式慢(每步都要截图-推理-点击)且脆弱(分辨率、缩放、遮挡都会导致点错)。Astra 改为让模型编写并执行代码来控制浏览器——这与作者早前与 LangChain 合作的深度研究结论一致:“让 agent 写代码来操作浏览器,各领域表现全面优于坐标点击”。写代码恰恰是 LLM 后训练中被强化最多的能力,等于让模型用它最擅长的方式控制环境。 2. 无障碍树(a11y tree)作为观察界面,非纯截图。 浏览器 DOM 天然带有 accessibility tree(屏幕阅读器使用的结构化元素树,包含角色、名称、可操作性等语义信息)。用它作为模型的输入,比像素截图信息密度更高、更结构化,模型定位元素时不必做视觉推理,因此更准、也更快。 3. 默认走 Playwright,且这是后训练偏好的框架。 Thread 指出 Astra 默认使用 Playwright 控制浏览器,而模型是针对 Playwright 做过后训练的——也就是说,它在“生成 Playwright 代码”这个任务上被专门优化过,这是它准确度的一个来源。 # 他们做了什么改动,为什么能快 2 倍? 改造思路是“模型不动,换执行框架”: · 把 Astra 生成的 Playwright 调用转换为 Stagehand 代码; · Stagehand 支持批处理:传统 agent 循环是“每轮只预测下一步动作 → 执行 → 观察结果 → 再预测”,而 Stagehand 让模型一次预测接下来的 5 步、10 步甚至 20 步动作。 提速的机制并不神秘:agent 循环中最大的开销往往是每步之间的往返(观察、推理、序列化上下文)。把动作打包成批,等于把 N 次往返压缩为 1 次,延迟自然大幅下降。这本质上和“让模型一次写完一段脚本而非逐行确认”是同一个逻辑。 一个值得注意的定性观察 Kyle 提到结果“往往在质上更好”,并举了一个例子:在演示中,Astra 选择用“画”的方式绘制《Starry Night》。他的解释是:换了框架后模型的“思考模式”不同了,当动作可以批量规划时,模型倾向于先把整体方案想清楚再执行,而不是走一步看一步的短视反应式循环。这个论断带有一定主观色彩,但方向上说得通:批处理改变了推理的“粒度”,宏观规划自然取代了微观逐步决策。 Kyle Jeong @kylejeong we reverse engineered astra's computer use and made it 2x faster. Your browser does not support the video tag. 🔗 View on Twitter 🔗 View Quoted Tweet 💬 1 🔄 1 ❤️ 2 👀 974 📊 4 ⚡