论文精选09:48SciR:可控科学推理基准,评估LLM的演绎、归纳与因果推理做LLM评估和科学推理研究的团队终于有了一个能独立控制提取与推理难度的基准,可以精准诊断模型短板。想了解自家模型在科学推理上到底弱在哪,建议直接看这篇。#科学推理#LLM评估#基准测试#演绎推理aarXiv: DeepSeek@Pierre Beckmann 等 3 人原文稍后读已读值得跟进有用关注 科学推理