论文精选72°14:54GIM 基准:通过多认知域整合任务评估 LLMGIM 用多认知域整合任务戳穿了现有基准的饱和困境,做 LLM 评估的团队可以直接用它来检测模型真实推理能力,比 GPQA 和 ARC-AGI 更贴近实际应用场景。#LLM 评估#基准测试#认知整合#IRT 模型aarXiv cs.LG@Rohit Patel 等 3 人原文稍后读已读值得跟进有用关注 LLM 评估