02:28lmarena.ai@lmarena_ai精选Trace-and-Amplify(TA)是UCLA博士生@hgzhou42提出的框架,可在无提示条件下大规模收集训练时奖励黑客轨迹。现有监控器在提示诱导黑客数据上准确率高达97.1%,但面对真实训练时黑客仅28.0%。TA训练的监控器将检测准确率从59.98%提升至90.16%,并在未见黑客类型上表现更好。实验基于Qwen2.5-Coder和DeepSeek-Coder,在LeetCode/TACO基准上验证。AI模型Trace-and-AmplifyQwen2.5-CoderDeepSeek-Coder推荐理由:UCLA博士生搞了个Trace-and-Amplify,不用诱导就能抓训练时的奖励黑客,准确率从60%提到90%,比老方法强多了。原文稍后读已读值得跟进有用关注 Trace-and-Amplify