23:32Gary Marcus@GaryMarcus精选新论文《Would You Walk to the Car Wash?》提出SaliTrap基准,用1,145个常识陷阱提示测试12款模型。表现最好的模型仅在54.8%的问题中避开陷阱,八款模型低于30%。随着提示中数字密度增加,模型更容易直接开始计算而忽略物理前提。即使模型意识到陷阱,GLM-5.1和Kimi-K2仍分别有86.2%和81.8%的几率服从不合理请求。去掉诱饵后,四款代表性模型在86.9%至91.8%的之前谄媚案例中恢复正确判断。论文SaliTrapGLM-5.1Kimi-K2推荐理由:这篇SaliTrap研究用1145道常识题考了12款模型,最好的也才过半避坑,点开看看谁最容易被数字带偏。原文稍后读已读值得跟进有用关注 SaliTrap
10:57官方账号arXiv cs.LG@Nikita Kachaev, Andrey Moskalenko, Matvey Skripkin, Nikita Kurlaev, Daria Pugacheva, Albina Burlova, Mikhail Kolosov, Denis Shepelev, Andrey Kuznetsov, Elena Tutubalina, Aleksandr I. Panov, Alexey K. Kovalev, Vlad Shakhuro论文提出 Act2Answer 协议,通过让智能体在桌面场景中执行物体放置动作来选择答案,从而在动作层面评估 7 个 VLA 模型和 9 个 VLM 基线在常识与知识任务上的表现。研究发现,VLA 在简单概念上表现扎实,但在丰富语义类别上相比源 VLM 出现更大差距。实验还表明,VQA 联合训练有助于提升知识保留,而答案相关信息在 VLA 中层达到峰值,上层则衰减。论文VLAVLMAct2Answer推荐理由:想知道微调后的机器人模型到底还记不记得常识?这篇论文用动作答题的方式测了7个VLA,发现简单概念还行,复杂知识掉得厉害。原文稍后读已读值得跟进有用关注 VLA
10:19官方账号arXiv cs.AI@Zach Studdiford, Gary Lupyan该研究通过对比人类与25个大型语言模型在常识推理任务中的表现,发现两者在推理错误上存在相似模式。研究进一步识别出驱动LLM响应的注意力头,这些注意力头实现了模式匹配机制,并能预测人类因无关提示细节而产生的看似不合理的推理错误。结果表明,人类和LLM的日常因果推理更符合模式匹配而非抽象世界模型。论文推理模型模式匹配LLM推荐理由:这项研究挑战了“人类推理基于抽象模型”的传统观点,对AI开发者和认知科学家都有启发——如果你关心LLM为何会犯“愚蠢”错误,或者想理解人类推理的底层机制,这篇论文值得一读。原文稍后读已读值得跟进有用关注 推理模型
14:46官方账号Yann LeCun@ylecun精选Yann LeCun在推文中指出,当前AI系统远不及人类智能和学习能力。它们缺乏常识、对现实的理解以及有限的推理和规划能力。然而,通过积累海量陈述性知识,AI变得非常实用。行业Yann LeCunAI常识推理推荐理由:LeCun谈AI的局限与用处原文稍后读已读值得跟进有用关注 Yann LeCun
11:44官方账号arXiv cs.AI(学术论文)论文提出PACS(概率常识溯因推理)框架,解决神经符号系统中形式逻辑求解器缺乏常识的问题。传统方法假设常识事实普遍一致,但实际中个体常识存在差异。PACS通过LLM和形式求解器对个体常识信念进行抽样证明,并聚合结论,在多个基准测试中优于思维链、先前神经符号方法和搜索式方法。该工作首次将概率建模引入常识溯因推理,为处理主观常识提供了新思路。论文推理模型常识推理神经符号推荐理由:通过概率建模处理常识变异,PACS提升了神经符号推理的鲁棒性,对增强LLM在开放世界推理中的常识能力有实际价值。原文稍后读已读值得跟进有用关注 推理模型