McNemar 是一种用于比较两个分类测试或观察结果一致性的统计方法,常用于评估分类器或预测模型的性能。 McNemar 近期进展 前沿LLM规则评估中的异常链崩溃与Aethis神经符号架构:Anthropic的研究表明,在大型语言模型(LLM)的规则评估中,异常链崩溃是一个值得关注的问题,而Aethis神经符号架构提供了一种可能的解决方案。 VirtualSet:类型化本体世界作为LLM生成目标,实现有依据查询和受保护决策:DeepSeek提出了一种新的方法,通过类型化本体世界作为LLM的生成目标,实现基于证据的查询和保护性决策。 Calibrated e-CUSUM解码用于量化推理模型:为什么Token Log-Probability是错误观测:DeepSeek的另一项研究探讨了在量化推理模型中使用Calibrated e-CUSUM解码的重要性,指出Token Log-Probability作为错误观测的局限性。 在隐藏信息社交推理游戏中审计信念条件LLM智能体:这项研究关注于在隐藏信息社交推理游戏中审计信念条件LLM智能体的行为。 MAST:机制引导的选择性遗忘方法,降低RLVR推理遗忘的附带损害:cs.AI提出了一种机制引导的选择性遗忘方法MAST,旨在降低RLVR推理中的遗忘附带损害。 当前焦点与观察点 McNemar作为一种统计方法,在LLM和推理模型的评估中逐渐受到重视。研究者们正在探索如何更有效地利用McNemar来评估模型性能,同时也在关注如何减少模型中的错误观测和附带损害。