11:05官方账号arXiv cs.AI@Chao Peng, Ruida Hu, Ajitha Rajan, Tegawendé F Bissyandé, Jacques Klein, Cuiyun Gao论文调研了197个真实TUI应用,发现仅12%的测试代码涉及界面,其中45%从不发送输入。作者将ratatui/Rust、bubbletea/Go、textual/Python、ink/TypeScript应用打包成无头基准,对比4个前沿LLM与随机探索。在相同时间预算下,随机探索是强基线,但每次交互LLM引导更高效,且能独特到达需要输入触发的故障。自动派生启动输入带来最大实际收益,使原本无法启动的应用得以运行。行覆盖率无法有效预测崩溃发现,说明它不宜作为测试有效性的代理指标。论文LLMTUI软件测试1 个信源在谈事件专题推荐理由:这篇论文把197个终端界面应用打包成基准,拿4个大模型和随机点击对比,发现随机探索还挺能打,但大模型单次操作效率更高。他们开源了tuicov和tuibot,想测TUI的可以试试。原文稍后读已读值得跟进有用关注 LLM
10:36官方账号arXiv cs.LG@Muhammad Bilal, Ali Hassaan Mughal该论文分析了一个生产级租赁搜索助手,其自动化测试套件在六周内增长到1,553个测试用例。尽管套件持续通过,用户可见缺陷仍不断进入生产环境。研究检查了项目中所有252个bug修复提交,发现约44%的修复属于四个无法被组件级单元测试观察的接缝:实时浏览器运行时、非默认市场、端到端流程和全系统级别。一个缺陷因缺少接缝防护而两次发布。论文提出了四接缝框架和实测缺陷分布。论文LLM多市场Web应用推荐理由:这篇论文用252个真实bug数据,告诉你怎么测试全绿依然出bug,给所有做LLM应用的人敲响警钟。原文稍后读已读值得跟进有用关注 LLM
20:24Guillermo Rauch@rauchgVercel CEO Rauchg在X上发文指出,Agent(智能体)正在激励众多健康的软件工程习惯,包括开放API、文档(技能)、测试(评估)、Unix命令行界面、支付与商业协议,甚至广泛采用Accept头(支持markdown/json/html)。他认为这是万维网原始愿景在眼前的实现。该帖获得113个点赞和3420次浏览。行业智能体开放APICLI推荐理由:Rauchg总结了Agent如何驱动开放API、文档、测试等好习惯,做软件的值得一看。原文稍后读已读值得跟进有用关注 智能体