论文Agent 与开发者多源确认10:33测量优先的智能体排行榜审计框架:污染风险与评分器验证一群研究者专门审计智能体排行榜的基准污染问题,用 GPT-4.1 和 DeepSeek-V4-Flash 在 SWE-bench 上做了对照实验,结论是很多污染指控证据不足,做评测的人值得看看这套框架。#SWE-bench Verified#HAL#GPT-4.1#DeepSeek-V4-Flash2 个信源在谈事件专题aarXiv: DeepSeek@Dishu Yang 等 4 人3 个信源在谈原文稍后读已读值得跟进有用关注 SWE-bench Verified