23:43宝玉@doteyGUI自动化测试主要依赖传统E2E测试,Web端可用Playwright等框架。Agent的Computer Use也能做自动化测试,但成本更高、稳定性更差。不过Computer Use能完成传统E2E做不到的任务,替代大量人工操作。技巧PlaywrightAgentComputer Use推荐理由:dotey分享了GUI自动化测试两种思路,传统Playwright和Agent Computer Use。后者成本高但能替代人工,适合复杂场景。原文稍后读已读值得跟进有用关注 Playwright
22:43宝玉@dotey推荐使用桌面版 Codex 或 Claude Code,借助 Computer Use 功能进行自动化测试。交付前系统会主动调用 Computer Use 执行测试并自动修复发现的问题。相比人工黑盒测试,这种方式能显著提高效率并减少漏测。技巧CodexClaude CodeComputer Use推荐理由:桌面版 Codex/Claude Code 的 Computer Use 能自动测试、自动修 bug,比人工快多了。原文稍后读已读值得跟进有用关注 Codex
17:12宝玉@dotey分享一种QA分工方案:大部分测试交给自动化测试,实现功能时同步写自动化代码,当前Agent(如AI编程助手)在此方面能力很强,稍加引导即可。人类QA则专注于黑盒测试,不查看代码实现,验证功能完整性、边界条件、极端数据量测试和安全性等。该方法可显著缩短QA耗时。技巧Agent自动化测试黑盒测试推荐理由:这个思路很实用:让Agent帮你搞定自动化测试,人只做黑盒和边界测试,能省下不少QA时间。原文稍后读已读值得跟进有用关注 Agent
13:32官方账号Simon Willison@simonw开发者Simon Willison在推特上恳请Anthropic为Claude Code网页版添加自动化测试套件,确保用户在现有会话中克隆或交互其他公共仓库时不会被阻止。该推文获得19次点赞和2130次查看,反映了社区对此问题的关注。Claude Code是Anthropic推出的AI编程助手,目前网页版存在限制用户访问外部仓库的问题。AI产品Claude CodeAnthropic编程助手10 个信源在谈事件专题推荐理由:知名开发者Simon Willison在推特上公开喊话Anthropic,让Claude Code网页版不再拦着用户克隆其他公开仓库,实用建议,开发者该看看。原文稍后读已读值得跟进有用关注 Claude Code
00:48官方一手AWS Machine Learning Blog@Reilly Manton精选Amazon Nova Act的智能导航能力支持并行执行用户流程测试。该方案从文档自动生成测试场景,使用Nova Act在云端大规模运行UX测试。通过自动化分析提供可操作洞察,提升测试效率。技巧Amazon Nova ActAWSUX测试推荐理由:AWS用Nova Act把UX测试自动化了,能自动生成用例并并行跑,省人工省时间。原文稍后读已读值得跟进有用关注 Amazon Nova Act
11:03官方一手arXiv: DeepSeek@Tiancheng Ma, Nasir U. Eisty该研究基于Defects4J中10个真实bug(Lang 1、3-11),提出需求驱动流水线,比较5个LLM(DeepSeek-V3、Gemma-3n、Llama-3、Mistral-7B、Qwen-3)生成Java测试预言的正确性与泛化能力。实验表明LLM生成的预言与需求预言(REQ)的一致性高于与系统(SUT)的一致性,宏平均准确率、精确率、召回率和F1均报告,但不同bug和模型间方差显著。需求技术性/模糊性评分与预言准确率之间的相关性弱且置信区间宽,未发现可检测的线性关系。研究结论为初步可行性证明,旨在推动更大规模实证。论文Defects4JLLM测试预言推荐理由:这篇论文用10个真实bug和5个流行LLM测试了它们能否直接从业务需求写测试断言,发现效果还行但差异大。如果你想了解LLM在自动化测试中的实际能力,这篇值得看看。原文稍后读已读值得跟进有用关注 Defects4J
11:36官方账号arXiv cs.AI@Jiale Amber Wang, Kaiyuan Wang, Pengyu NieTestEvo-Bench是一个基于真实Git提交历史的基准,包含测试生成(写新测试捕捉新行为)和测试更新(调整失败测试适配变化)两个任务。当前版本从152个开源Java项目中挖掘了746个测试生成和509个测试更新任务,每个任务都附带环境配置,使用通过率、覆盖率和变异分数作为执行指标。实验使用Claude Opus 4.7和Gemini 3.1 Pro驱动的四个智能体(Claude Code、Gemini CLI、SWE-Agent),在测试生成上最高达77.5%成功率,测试更新上达74.6%。然而,在面对最新任务或低成本限制时成功率显著下降。论文TestEvo-BenchClaude CodeSWE-Agent推荐理由:想看看AI能不能真的帮你改测试?这个新基准用真实Git提交来考Claude Code和SWE-Agent,比静态测试更贴近实际开发。原文稍后读已读值得跟进有用关注 TestEvo-Bench
00:30Google AI Developers@googleaidevs精选73°Google AI Devs 宣布 Gemini 3.5 Flash 的 Computer Use 工具正式可用。该工具支持在浏览器、移动和桌面环境中构建可看可操作的智能体,处理长时任务。新增特性包括:内置移动和桌面操作系统支持、所有函数调用的意图参数、可定制客户端函数支持人机交互接管、提示注入检测及可配置安全策略。可用于自动化 QA 测试和业务流程等场景。AI产品Gemini 3.5 FlashComputer Use智能体推荐理由:Google 给 Gemini 3.5 Flash 加了 Computer Use 工具,能让智能体跨浏览器、手机和桌面干活,还能自定义安全策略,实用!原文稍后读已读值得跟进有用关注 Gemini 3.5 Flash
10:40官方账号arXiv cs.LG@Yiteng Peng, Dongwei Xiao, Zhibo Liu, Zhenlan JI, Shuai WangHERTA是首个针对全同态加密(FHE)框架的自动化测试工具。它利用蜕变测试方法,设计了基于FHE语义的新型蜕变关系,以检测多层软件栈中的实现错误。在3个主流工业框架上的评估中,HERTA发现了21个先前未知的漏洞,部分已被开发者确认修复。分析表明这些漏洞对FHE服务的完整性和可用性构成严重安全威胁。论文全同态加密HERTA漏洞检测推荐理由:这个工具能自动找出FHE框架的隐藏bug,已经发现了21个,开发者都确认了。搞隐私计算的值得一看。原文稍后读已读值得跟进有用关注 全同态加密
03:48官方账号Greg Brockman@gdb用户 Tom Osman 利用 Codex 的 "/goal" 循环功能,将提示词设为“遍历应用中每个功能,根据代码创建用户故事和期望行为,维护单一电子表格追踪状态”,随后自动切换到测试每个用户故事并记录所有错误,最终修复逻辑或 UX 错误后再次测试。整个过程无需人工干预,自动处理成百上千的用户故事。该案例展示了 Codex 在自动化测试与修复工作流中的实际应用。技巧Codex编程助手自动化测试推荐理由:试试在 Codex 里贴一段类似的循环指令,它就能自动帮你测完整个 App 的每个功能,连修 bug 都包了。原文稍后读已读值得跟进有用关注 Codex
02:21官方账号Greg Brockman@gdb精选Tom Osman展示了一个在Codex中运行的自动化循环,用于遍历应用所有功能并生成用户故事与预期行为。该流程维护一个单源电子表格跟踪功能状态,然后切换到测试每个用户故事并记录所有错误。最后修复逻辑或UX错误后,再次测试所有用户行为。这个循环能处理数百个用户故事,展示了Codex的自动化测试能力。技巧CodexTom Osman自动化测试推荐理由:Tom Osman用Codex搞了个自动化循环,从生成用户故事到测试修复一条龙,省人工还管几百个功能,太实用了。原文稍后读已读值得跟进有用关注 Codex
00:56宝玉@dotey精选文章将传统软件工程实践迁移到 AI Agent 开发中,强调需求分析时需给 Agent 充足上下文并反复对齐,系统设计时用 plan 模式拆分里程碑。代码审查建议先让 Agent 审查格式和逻辑,但人需兜底业务逻辑。自动化测试包括单元测试、集成测试和端到端测试,需与 CI 集成自动运行。灰度发布和 CI/CD 机制(如 feature flag、自动回滚)可减少线上不稳定。线上修复目前更现实的是 AI 辅助定位、人确认后再提交,而非全自动闭环。技巧Agent软件工程代码审查推荐理由:宝玉分享的实操经验:把传统软件工程的代码审查、测试覆盖、灰度发布等方法用到 AI Agent 上,能少写 bug、少修 bug,适合正在用 Agent 写代码的团队。原文稍后读已读值得跟进有用关注 Agent
09:50官方账号arXiv cs.AI@Lu Jia, Haibo Tong, Feifei Zhao, Jindong Li, Dongqi Liang, Ping Wu, Qian Zhang, Yi Zeng精选VESTA 是一个全自动化的 LLM 智能体安全评估框架,能基于五个风险维度生成 1072 个可执行的评估场景。现有评估依赖人工编写场景或静态提示,难以捕捉智能体在任务执行中的多样化风险。VESTA 通过自动化流程对 12 个 LLM 智能体进行测试,发现平均安全风险率高达 47.1%,部分模型超过 70%。该框架强调了可执行、过程级评估对于理解和提升智能体安全性的重要性。论文LLM 智能体安全评估自动化测试推荐理由:做 LLM 智能体安全评估的团队终于有了自动化工具——VESTA 能生成上千个真实任务场景,直接测出模型执行中的安全漏洞。建议关注智能体安全的开发者点开看看,结果可能会让你重新审视现有模型的风险。原文稍后读已读值得跟进有用关注 LLM 智能体
19:20官方一手marktechpost@Sana Hassan本文是一篇实操指南,介绍如何在 Google Colab 中运行 Microsoft Fara 浏览器智能体,并通过模拟 OpenAI 兼容端点来测试其循环流程。Fara 是微软推出的浏览器自动化智能体,能执行网页操作任务。教程使用 mock 端点模拟 API 响应,无需真实 API 密钥即可在 Colab 中快速验证智能体行为。这对于开发者快速上手 Fara、调试浏览器自动化流程非常实用。AI产品Microsoft Fara浏览器智能体Google Colab10 个信源在谈事件专题推荐理由:想低成本体验微软 Fara 浏览器智能体的开发者,这篇 Colab 教程让你不用 API 密钥就能跑通完整流程,值得直接跟着试。原文稍后读已读值得跟进有用关注 Microsoft Fara
18:45官方账号Decoder@Matthias Bastian78°OpenAI 的 Codex 应用现已支持 Windows 11 的“计算机使用”功能,可以自主控制程序、测试应用并查找 Bug。用户可以通过 ChatGPT 手机应用远程启动和监控任务,即使电脑无人值守也能工作。这一功能将 AI 编程助手从代码生成扩展到实际环境中的自动化测试和调试,显著提升开发效率。对于需要频繁进行软件测试或 Bug 排查的开发者来说,这意味着一部分重复性工作可以交给 AI 完成。AI产品CodexWindows 11自动化测试10 个信源在谈事件专题推荐理由:Codex 从代码生成进化到能直接操作 Windows 桌面,做软件测试和调试的开发者可以省下大量手动操作时间,值得一试。原文稍后读已读值得跟进有用关注 Codex
10:29官方账号arXiv cs.AI@Tamerlan Aghayev, Maxime Elkael, Michele Polese, Minh Dat Nguyen, Gabriele Gemmi, Andrea Lacava, Ali Saeizadeh, Reshma Prasad, Paolo Testolina, Angelo Feraudo, Soumendra Nanda, Pedram Johari, Salvatore D'Oro, Tommaso Melodia精选72°GENESIS是一个AI智能体框架,旨在解决6G无线接入网(RAN)研发中六个结构性瓶颈,包括从标准合成代码、一致性测试、现场异常处理、数据驱动优化、新波形原型设计到安全加固。传统LLM在RAN场景中会幻觉API、误读规范,且依赖仿真导致硬件迁移失败。GENESIS通过三个可组合原语(智能体、技能、钩子)和持久知识层SYNAPSE,将意图(如规范条款、遥测异常)转化为经过空中实验验证的解决方案,并回馈到知识库。该框架使能力随运行次数累积,显著压缩R&D周期。论文6GRANAI智能体推荐理由:GENESIS解决了6G RAN研发中手动迭代耗时的核心痛点,做通信系统开发或6G标准研究的团队可以直接用这个框架加速从规范到验证的全流程。原文稍后读已读值得跟进有用关注 6G
10:37官方账号Replit@ReplitReplit 宣布其 Agent 与 Squidler 集成,实现了完整的 AI QA 循环:Agent 构建应用,Squidler 像真实用户一样测试,发现问题后自动反馈给 Agent 修复。用户只需用自然语言描述应用行为,无需编写测试脚本或选择器。该集成已上线 Replit 的 MCP 库,旨在让开发者无需测试技能即可自信发布。AI产品Replit AgentSquidlerAI QA推荐理由:Replit 用户终于有了自动化的测试闭环——Squidler 模拟真实用户操作,Agent 自动修复,省去手写测试的麻烦。做快速原型或 MVP 的开发者可以直接用,减少发布前的焦虑。原文稍后读已读值得跟进有用关注 Replit Agent
11:00rohanpaul_ai@rohanpaul_ai83°Google 的 Gemini 3.5 Flash 模型在多个真实工作自动化测试中超越了上一代旗舰 Gemini 3.1 Pro。其输出速度提升 4 倍,且在 Terminal-Bench 2.1、MCP Atlas 等硬核智能体和编程基准测试中表现更优。该模型已集成到 Gemini 应用、搜索 AI 模式、API、Antigravity、Android Studio 及企业智能体产品中。结合更新的 Antigravity 框架,3.5 Flash 能高效部署协作子智能体,例如一个子智能体检查文件夹、另一个重写代码、第三个测试结果、第四个总结变更。这使得它成为日常工作中既快又便宜的强大智能体模型。AI模型Gemini 3.5 Flash智能体自动化测试推荐理由:做自动化测试和智能体开发的团队终于有了又快又便宜的选择——Gemini 3.5 Flash 在多个硬核基准上超越旗舰 Pro,输出速度还快 4 倍,建议直接上手试。原文稍后读已读值得跟进有用关注 Gemini 3.5 Flash