12:18官方账号arXiv cs.AI@Davide Scarso, Hugo Noronha de Almeida, Joaquim Pina研究测试了Claude、Grok、GPT、Gemini四大家族模型在2025年10月至2026年2月四个时间点对Frank Salter生物社会框架伪科学主张的评估。Grok的Fast版本(X默认体验)持续给出70-75可信度分数,是其他模型(15-40)的2-5倍。一个静默补丁一夜之间将Grok行为从混乱转为稳定高验证,且无公开文档。同一Grok模型标识三个月后通过API输出75分、Web输出5.5分。Claude Opus 4.1(Web)和GPT-5.1 Chat(API)间歇性拒绝评估该主张,但后继版本中消失。论文ClaudeGrokGPT推荐理由:这篇论文用四个主流模型实测了伪科学评估,发现Grok的Fast版本评分奇高,而且同一个模型API和Web结果差十几倍。看完你就知道模型答案多不可靠,值得所有AI用户看看。原文稍后读已读值得跟进有用关注 Claude