#自动化测试
Tw93 让 AI 用 computer use 装卸了 549 款 Mac 软件,把 Mole 的卸载残留规则补了一遍,过程挺开眼。
dotey分享了GUI自动化测试两种思路,传统Playwright和Agent Computer Use。后者成本高但能替代人工,适合复杂场景。
桌面版 Codex/Claude Code 的 Computer Use 能自动测试、自动修 bug,比人工快多了。
知名开发者Simon Willison在推特上公开喊话Anthropic,让Claude Code网页版不再拦着用户克隆其他公开仓库,实用建议,开发者该看看。
这篇论文用10个真实bug和5个流行LLM测试了它们能否直接从业务需求写测试断言,发现效果还行但差异大。如果你想了解LLM在自动化测试中的实际能力,这篇值得看看。
Google 给 Gemini 3.5 Flash 加了 Computer Use 工具,能让智能体跨浏览器、手机和桌面干活,还能自定义安全策略,实用!
宝玉分享的实操经验:把传统软件工程的代码审查、测试覆盖、灰度发布等方法用到 AI Agent 上,能少写 bug、少修 bug,适合正在用 Agent 写代码的团队。
做 LLM 智能体安全评估的团队终于有了自动化工具——VESTA 能生成上千个真实任务场景,直接测出模型执行中的安全漏洞。建议关注智能体安全的开发者点开看看,结果可能会让你重新审视现有模型的风险。
想低成本体验微软 Fara 浏览器智能体的开发者,这篇 Colab 教程让你不用 API 密钥就能跑通完整流程,值得直接跟着试。
Codex 从代码生成进化到能直接操作 Windows 桌面,做软件测试和调试的开发者可以省下大量手动操作时间,值得一试。
Replit 用户终于有了自动化的测试闭环——Squidler 模拟真实用户操作,Agent 自动修复,省去手写测试的麻烦。做快速原型或 MVP 的开发者可以直接用,减少发布前的焦虑。
做自动化测试和智能体开发的团队终于有了又快又便宜的选择——Gemini 3.5 Flash 在多个硬核基准上超越旗舰 Pro,输出速度还快 4 倍,建议直接上手试。