论文10:21LLM代码性能基准再审视:现有测试仅暴露6.11%显著差异这篇论文把EffiBench、EvalPerf等流行代码性能基准的漏洞全翻出来了——1538个任务里只有6%能真正测出差异。他们搞了个多智能体框架自动生成更刁钻的测试,效果直接翻四倍。#EffiBench#EvalPerf#DeepSeek-v3.1#GPT-4oaarXiv: DeepSeek@Nhat Minh Le 等 5 人原文稍后读已读值得跟进有用关注 EffiBench