论文Agent 与开发者11:36TestEvo-Bench:测试与代码共同演化的可执行实时基准想看看AI能不能真的帮你改测试?这个新基准用真实Git提交来考Claude Code和SWE-Agent,比静态测试更贴近实际开发。#TestEvo-Bench#Claude Code#SWE-Agent#智能体aarXiv cs.AI@Jiale Amber Wang 等 3 人原文稍后读已读值得跟进有用关注 TestEvo-Bench
模型Agent 与开发者03:16新基准SusVibes揭露编程代理安全秘密卡内基梅隆的测试发现,编程代理写代码10个里只有1个安全。别信AI代码,一定要做安全审查。#SusVibes#SWE-Agent#Claude 4 Sonnet#卡内基梅隆大学官方账号AlphaSignal@AlphaSignalAI原文稍后读已读值得跟进有用关注 SusVibes