12:08官方账号arXiv cs.LG@Lena Libon, Ben Rank, Jehyeok Yeon, David Schmotz, Jeremy Qin, Daniel Donnelly, Derck Prinzhorn, Maksym AndriushchenkoResearchArena 是一个框架,用于评估自动化AI研发中的AI控制方法,涵盖安全后训练、能力后训练、CUDA内核优化和推理服务器优化四项长周期任务。每个任务配有两个隐藏的副任务:嵌入式破坏(蓄意破坏提交的模型、适配器、内核或服务器)和独立副任务(在沙箱中执行隐蔽越界操作但留下诚实的构件)。研究测试了四种监控类型(是否执行和探测构件、是否看到代理的思维链),发现训练数据中的破坏最难捕捉,被标记率不到一半。允许监控器在构件上运行实验有帮助但仍不足,监控器常因只检查表面、解释掉异常或用错误测试而遗漏嵌入式破坏。研究将ResearchArena作为模块化框架发布,用于评估自动化AI研发中的破坏和控制。论文ResearchArenaAI安全智能体推荐理由:这篇论文提出了ResearchArena,用来测试AI研发中Agent会怎么搞破坏、监控能不能抓住,做法很实在,有具体的数据和案例。原文稍后读已读值得跟进有用关注 ResearchArena