7月18日
23:43
23:43宝玉@dotey
GUI自动化测试主要依赖传统E2E测试,Web端可用Playwright等框架。Agent的Computer Use也能做自动化测试,但成本更高、稳定性更差。不过Computer Use能完成传统E2E做不到的任务,替代大量人工操作。
推荐理由:dotey分享了GUI自动化测试两种思路,传统Playwright和Agent Computer Use。后者成本高但能替代人工,适合复杂场景。
13:32
7月15日
00:48
00:48官方一手AWS Machine Learning Blog@Reilly Manton
精选
Amazon Nova Act的智能导航能力支持并行执行用户流程测试。该方案从文档自动生成测试场景,使用Nova Act在云端大规模运行UX测试。通过自动化分析提供可操作洞察,提升测试效率。
推荐理由:AWS用Nova Act把UX测试自动化了,能自动生成用例并并行跑,省人工省时间。
6月23日
6月9日
09:50
09:50官方账号arXiv cs.AI@Lu Jia, Haibo Tong, Feifei Zhao, Jindong Li, Dongqi Liang, Ping Wu, Qian Zhang, Yi Zeng
精选
VESTA 是一个全自动化的 LLM 智能体安全评估框架,能基于五个风险维度生成 1072 个可执行的评估场景。现有评估依赖人工编写场景或静态提示,难以捕捉智能体在任务执行中的多样化风险。VESTA 通过自动化流程对 12 个 LLM 智能体进行测试,发现平均安全风险率高达 47.1%,部分模型超过 70%。该框架强调了可执行、过程级评估对于理解和提升智能体安全性的重要性。
推荐理由:做 LLM 智能体安全评估的团队终于有了自动化工具——VESTA 能生成上千个真实任务场景,直接测出模型执行中的安全漏洞。建议关注智能体安全的开发者点开看看,结果可能会让你重新审视现有模型的风险。
5月27日
10:29
10:29官方账号arXiv cs.AI@Tamerlan Aghayev, Maxime Elkael, Michele Polese, Minh Dat Nguyen, Gabriele Gemmi, Andrea Lacava, Ali Saeizadeh, Reshma Prasad, Paolo Testolina, Angelo Feraudo, Soumendra Nanda, Pedram Johari, Salvatore D'Oro, Tommaso Melodia
精选72°
GENESIS是一个AI智能体框架,旨在解决6G无线接入网(RAN)研发中六个结构性瓶颈,包括从标准合成代码、一致性测试、现场异常处理、数据驱动优化、新波形原型设计到安全加固。传统LLM在RAN场景中会幻觉API、误读规范,且依赖仿真导致硬件迁移失败。GENESIS通过三个可组合原语(智能体、技能、钩子)和持久知识层SYNAPSE,将意图(如规范条款、遥测异常)转化为经过空中实验验证的解决方案,并回馈到知识库。该框架使能力随运行次数累积,显著压缩R&D周期。
推荐理由:GENESIS解决了6G RAN研发中手动迭代耗时的核心痛点,做通信系统开发或6G标准研究的团队可以直接用这个框架加速从规范到验证的全流程。
5月24日
10:37
10:37官方账号Replit@Replit
Replit 宣布其 Agent 与 Squidler 集成,实现了完整的 AI QA 循环:Agent 构建应用,Squidler 像真实用户一样测试,发现问题后自动反馈给 Agent 修复。用户只需用自然语言描述应用行为,无需编写测试脚本或选择器。该集成已上线 Replit 的 MCP 库,旨在让开发者无需测试技能即可自信发布。
推荐理由:Replit 用户终于有了自动化的测试闭环——Squidler 模拟真实用户操作,Agent 自动修复,省去手写测试的麻烦。做快速原型或 MVP 的开发者可以直接用,减少发布前的焦虑。