10:48官方一手arXiv: DeepSeek@Muhammed Saeed, Simon Razniewski精选73°LLMPEDIA 从 GPT-5-mini、DeepSeek-V3.2 和 Llama-3.3-70B 三个模型家族中提取了约 130 万篇文章。研究团队对分层抽样的事实声明进行审核,发现真实准确率为 68.4%,比 MMLU 基准低 21 个百分点。30.5% 的声明无法被维基百科或网络资源验证,属于长尾知识或合理幻觉。该平台提供五种一键视图,包括链接遍历探索、声明级事实核查、跨模型和政治立场比较等。论文LLMPEDIAGPT-5-miniDeepSeek-V3.21 个信源在谈事件专题推荐理由:LLMPEDIA 让你能直接查看和比较三大模型的知识准确性,发现它们在 MMLU 外的真实表现。原文稍后读已读值得跟进有用关注 LLMPEDIA