09:31官方一手arXiv: Anthropic@Paul Simpson, John Kozak, Lisa Doake精选论文《Confidently Wrong》揭示前沿LLM在嵌套条件规则(如“要求A,除非B,除非C覆盖B”)的错误模式——异常链崩溃。GPT-5.4在建筑保险场景的准确率从96.6%突然升至100%(同一提示和测试框架),表明模型准确率边界不可控。作者提出Aethis Eligibility Module,由LLM从权威源编写规则、SMT层确定性执行。在225个跨领域场景基准中复现该模式,20个对抗场景中引擎与GPT-5.4(低推理努力)均获20/20,而其他三个前沿模型失败。在949个LegalBench任务中,引擎比三个前沿模型显著更准确(组合McNemar p≤0.003),最高领先Anthropic模型41个百分点。论文LLM异常链崩溃神经符号架构推荐理由:这篇论文揭露了GPT-5.4和Claude在资格评估规则中会莫名崩溃,还给了个能稳定执行的神经符号方案,搞合规或应用LLM的得看看。原文稍后读已读值得跟进有用关注 LLM