09:14官方一手arXiv: DeepSeek@Guiling Guo, Jia Yang, Jiahao Xu, Shuyuan Zheng, Zhonghai Sun, Qiyuan LiGraphRareBench是一个保留来源的基准,包含2,365个本体派生案例和18,093对目标-混淆对。在237个案例的基因组分测试集上,监督排序器MRR范围为0.640-0.740,目标-混淆准确率为0.898-0.916。基于Agents-A1和DeepSeek-V4-Flash的智能体MRR分别为0.746和0.718,但证据覆盖率差异达0.561。22.1%到43.7%的成功案例中仍存在硬混淆者排名高于目标。该基准可用于评估模型在完全集检索和硬混淆区分上的表现。论文GraphRareBenchAgents-A1DeepSeek-V4-Flash推荐理由:想测AI罕见病诊断能力?GraphRareBench用2365个案例和18093对混淆,专门检测模型能不能分清真病和假病。原文稍后读已读值得跟进有用关注 GraphRareBench