论文09:49SciCode-Verified:基准缺陷低估了语言模型的科学编码能力他们揪出了SciCode基准里的263个坑,修完后模型分数从60%直接飙到98%——原来不是模型笨,是考卷错了。#SciCode-Verified#SciCode#科学编码#基准测试aarXiv cs.AI@Sihan Hu 等 4 人原文稍后读已读值得跟进有用关注 SciCode-Verified