论文73°

LeCun 的自回归批评被"输出错误 token"训练回怼了吗?

精选理由

有人拿"模型会喊 oops 然后改错"这个训练行为,去质疑 LeCun 那套自回归不能纠错的老论点,争议点很具体。

一条推文质疑 Yann LeCun 关于自回归模型无法纠错的核心论点:现代 LLM 在训练中会学到"输出错误 token 后承认并修正"的行为。这种 oops 修正模式在 RLHF 与推理链训练中被显式强化。质疑者要求 LeCun 回应其论证是否已被此类训练数据削弱。

原文 · Teortaxes

Did Yann ever answer why his argument isn't defeated by training the "oops, that was the wrong token!" behavior? https://t.co/pCLtdLqJOc