09:51官方账号arXiv cs.AI@Eduardo Valle, Fergal Reid该研究在约100万参数的微型Transformer上测试了一种简单思维链(Chain of Thought)形式,命名为Protoreasoning。他们使用Dyck语言(正确嵌套括号的句子)定义推理友好任务,发现Protoreasoning轨迹大幅缩小了分布外泛化差距。消融实验证实,增益来自轨迹内容本身,而非额外标记数量。这为研究逐步推理提供了低成本实验平台。论文Transformer思维链小模型推荐理由:一篇用百万参数模型研究思维链的论文,提出Protoreasoning,能有效提升分布外泛化,比大模型实验更好分析。原文稍后读已读值得跟进有用关注 Transformer