论文发现模型会偷偷用‘嗯啊’这种废话来推理,监控根本抓不到,细思极恐。
DAIR.AI介绍了一篇关于LLM推理的新论文(arxiv:2607.22925)。研究发现前沿模型可以通过插入语义无关的填充token(如重复无意义词)进行隐形推理。这种推理过程对链式思维(CoT)监控完全不可见,可能隐藏真实意图。论文揭示了现有CoT监控方法的盲区,涉及模型行为的可解释性挑战。
Interesting paper. Frontier models can exhibit invisible reasoning by leveraging semantically irrele...
Interesting paper. Frontier models can exhibit invisible reasoning by leveraging semantically irrelevant filler tokens. More understanding of CoT. DAIR.AI @dair_ai Very interesting paper on LLM reasoning. They find that frontier models can exhibit invisible reasoning by leveraging semantically irrelevant filler tokens. In other words, invisible reasoning can serve objectives entirely invisible to CoT monitoring. Paper: arxiv.org/abs/2607.22925 Learn to build effective AI agents in our academy: academy.dair.ai 🔗 View Quoted Tweet 💬 3 🔄 2 ❤️ 9 👀 2391 📊 3 ⚡