17:49官方账号arXiv cs.LG@Yidi Kao, Shawn Burnham, Tommi Rose Fahy, Ali GhanbariADEPT 是一个集成了多种深度学习测试充分性度量的统一框架,覆盖神经元覆盖率、惊喜充分性、输入分布覆盖、边界覆盖以及源级和模型级变异分数。框架提供基于模板的度量接口和扩展点,支持 YAML 配置管理、预处理缓存复用和结构化结果报告。该框架旨在让研究者和开发者无需花费数天或数周配置分散的研究原型,即可复现和应用充分性度量。论文发表于 arXiv,编号 2608.12144v1,并附有演示视频。论文ADEPT深度学习测试测试充分性推荐理由:做深度学习测试的人可以省事了,ADEPT 把各种覆盖率度量统一成一个框架,不用再挨个配置那些难搞的原型工具,直接就能跑。原文稍后读已读值得跟进有用关注 ADEPT
10:08官方一手arXiv: OpenAI@Nafiseh Kahani, Mojtaba Bagherzadeh精选多智能体系统日益依赖显式工作流结构(如智能体、工具、访问规则和委托路径),但现有评估主要依赖端到端任务成功率或最终响应质量,难以验证这些声明结构是否真正被测试覆盖。该论文提出一种结构测试方法,将工作流表示为类型化协调图,推导覆盖义务(如可达智能体、允许/限制工具边、委托边),并利用DSPy生成可执行场景。在10个基准测试中,该方法成功覆盖了54/75的允许工具义务和36/48的委托义务,并发现了23/248的限制工具违规。结果表明,结构覆盖为多智能体工作流测试提供了有用的充分性层,能揭示声明结构是否被实际执行。论文多智能体系统结构测试工作流覆盖推荐理由:多智能体系统测试长期依赖端到端指标,这篇论文给出了可落地的结构覆盖方法,做AI工作流测试的团队可以直接参考其DSPy实现来补全测试盲区。原文稍后读已读值得跟进有用关注 多智能体系统