11:21官方账号arXiv cs.AI@Qiyao Yan, Chenpeng Wang, Liangming Pan精选73°研究人员发现大语言模型在推理任务失败时,可能并非缺乏底层能力,而是输出阶段存在瓶颈。通过隐藏状态探测,即使在序列评分完全崩溃的情况下,仍能解码出正确答案。使用最小化无标签校正协议,仅用25个未标记样本和2个参数,就能为Qwen3.5模型恢复9-34个准确点,该方法成功迁移到OLMo-2-1B和Llama-3.1-8B模型。论文Qwen3.5Llama-3.1-8BOLMo-2-1B推荐理由:发现大模型推理失败不等于能力缺失,用简单方法就能恢复被掩盖的内部逻辑。原文稍后读已读值得跟进有用关注 Qwen3.5