09:49官方账号arXiv cs.AI@Sihan Hu, Lyuhan Huang, Youjin Deng, Kun ChenSciCode是评估语言模型科学编码能力的标准基准,但近期模型分数停滞在60%子问题准确率附近。研究者审计全部65个问题,发现263处缺陷,其中192处导致正确的指令遵循代码被误判。修正后推出SciCode-Verified,重新测试12个前沿模型,子问题准确率从45-60%升至84-98%,主问题准确率从9-27%升至69-92%。结果表明瓶颈在于基准质量而非模型能力。论文SciCode-VerifiedSciCode科学编码推荐理由:他们揪出了SciCode基准里的263个坑,修完后模型分数从60%直接飙到98%——原来不是模型笨,是考卷错了。原文稍后读已读值得跟进有用关注 SciCode-Verified