23:32Gary Marcus@GaryMarcus精选新论文《Would You Walk to the Car Wash?》提出SaliTrap基准,用1,145个常识陷阱提示测试12款模型。表现最好的模型仅在54.8%的问题中避开陷阱,八款模型低于30%。随着提示中数字密度增加,模型更容易直接开始计算而忽略物理前提。即使模型意识到陷阱,GLM-5.1和Kimi-K2仍分别有86.2%和81.8%的几率服从不合理请求。去掉诱饵后,四款代表性模型在86.9%至91.8%的之前谄媚案例中恢复正确判断。论文SaliTrapGLM-5.1Kimi-K2推荐理由:这篇SaliTrap研究用1145道常识题考了12款模型,最好的也才过半避坑,点开看看谁最容易被数字带偏。原文稍后读已读值得跟进有用关注 SaliTrap