17:49官方账号arXiv cs.AI@Arda Uzunoglu, Benjamin van Durme, Daniel Khashabi精选一篇arXiv论文提出信息丰裕悖论,认为训练上下文中相关信息过多会降低模型将其参数化编码的动机。预训练阶段扩大上下文窗口虽能提升语言建模、自然语言理解和closed-book MCQA,但只在中间最优值内有效,之后持续下降。监督微调时,更多任务相关上下文虽能提升带支持场景的表现,却削弱了测试时缺少或误导上下文时的鲁棒性。机制分析显示,长上下文将梯度压力从前馈网络转向注意力模块,导致推理时更依赖上下文。结论表明,追求无限上下文并非简单堆数据。论文长上下文参数化知识上下文学习推荐理由:这篇论文说长上下文训练反而会让模型记不住知识,上下文越长越依赖临时找资料。想调长上下文的人建议先看看。原文稍后读已读值得跟进有用关注 长上下文
01:30官方一手Google Research: Blog(资讯)精选Google Research提出'Thinking to Recall'假设,认为链式思维(Chain-of-Thought)推理的本质是组合LLM参数中分散存储的知识片段。基于PaLM 2模型的实验显示,在GSM8K和MATH等数学推理基准上,推理步骤让模型更有效地调用习得的知识。该工作揭示了注意力机制在定位和整合参数化知识过程中的关键作用。论文Chain-of-ThoughtPaLM 2参数化知识1 个信源在谈事件专题推荐理由:Google用PaLM 2发现,模型不靠堆算力背答案,而是靠推理串起脑袋里分散的知识点。比直接猜准多了。原文稍后读已读值得跟进有用关注 Chain-of-Thought