09:07官方账号arXiv cs.LG@Smitha Muthya Sudheendra, Jaideep Srivastava精选73°研究者在五个开源transformer模型中测试逻辑验证能力,使用有效-无效前提-声明对。尽管行为表现接近随机水平,逻辑有效性仍可从隐藏状态中完美解码。在保留模板、领域和推理家族条件下,有效性仍保持强可解码性。在行为不正确但评估条件明确的例子中,有效性仍高度可解码。论文transformer逻辑推理语言模型推荐理由:这篇论文揭示了语言模型内部逻辑表示与行为表达的分离现象,对理解LLM推理机制有重要价值。原文稍后读已读值得跟进有用关注 transformer
10:46官方一手arXiv: DeepSeek@Réemi Andrieu, Damien Sileo精选研究构造了前提相同但框架或域条件不同的配对模态问题,自动推理验证了相反标签。在平衡核心测试中,直接提示下五款近期模型中有四款表现低于条件基线。启用推理模式后,DeepSeek V4 Flash在相同提示下从4.4%升至88.1%。结果表明模型遵循规定语义的能力高度依赖推理模式和模型身份。论文DeepSeekV4 Flash模态逻辑推荐理由:这篇论文测了语言模型会不会按给定的模态逻辑规则推理,DeepSeek V4 Flash开推理模式后从4.4%直接飙到88.1%,反差很大,可以看看。原文稍后读已读值得跟进有用关注 DeepSeek
12:05官方账号arXiv cs.AI@Theofanis Aravanis, Costas D. Koutras论文提出选择性可信度限制信念更新框架,将复合认知输入按源世界转换为弱代理后再执行可信度限制转移。该框架在语义和公理层面刻画了算子类,并识别出一致性保持与最大一致性保持两个子类。它统一了既有方法:当转换函数取恒等且不设可信度限制时,退化为Katsuno-Mendelzon更新;当不做选择时则恢复为标准可信度限制更新。论文信念更新可信度限制Katsuno-Mendelzon推荐理由:这篇 arXiv 论文给信念更新加了选择性机制,能处理部分输入不可信的情况,比旧方法更灵活。原文稍后读已读值得跟进有用关注 信念更新
10:12官方账号arXiv cs.LG@David Steinmann, Antonia Wüst, Kristian Kersting, Wolfgang StammerCOCOLogic-V2 是一个面向现实图像的对象中心数据集,覆盖一阶逻辑的广泛子集,用于视觉归纳推理评估。它将样本分为正变体、近边界和远边界负例三类,实现对模型可解释性的细粒度诊断。实验表明,模型能很好区分正样本和远边界负例,但在近边界负例上表现失败。此外,感知噪声和大规则搜索空间在少样本场景下构成额外挑战。该数据集为推进视觉归纳推理提供了具体基础。论文COCOLogic-V2推理模型视觉理解推荐理由:COCOLogic-V2 这个新数据集专测视觉推理,正反例分类特别细,模型在近边界上直接翻车,做可解释 AI 的可以看看。原文稍后读已读值得跟进有用关注 COCOLogic-V2