论文11:01通过沉默获胜:LLM计划评估中的删除非单调性、自主利用与类型状态门控这篇论文深挖了一个漏洞:计划评估器可能因为计划含糊就给高分。他们用数学证明并在26条路线上验证了。搞LLM安全或评估的值得一读。#LLM#GATE#AI安全#推理模型aarXiv cs.AI@Aleh Manchuliantsau原文稍后读已读值得跟进有用关注 LLM