20:44阮一峰的网络日志(博客/媒体)精选大模型通过参数机制将人类知识压缩在无数参数中,如GLM 5.3拥有7440亿个参数。推理机制让模型根据已有知识推断新知识,而不必存储所有信息。联网机制则帮助模型获取参数和推理都无法覆盖的实时信息,如股票指数。技巧GLM 5.3参数机制推理机制推荐理由:这篇文章用通俗方式解释了AI工作的三种核心机制,让你明白大模型如何回答问题。原文稍后读已读值得跟进有用关注 GLM 5.3
10:41官方一手arXiv: DeepSeek@Bo Cheng, Qiaolin Lu, Yi Chang, Yuan Wu该研究用Top-K稀疏自编码器分析DeepSeek-R1-Distill-Qwen-7B在数学题上的中间表征,对比思维链(Thinking)与直接作答(NoThinking)两种模式。结果显示,Thinking模式依赖稀疏高强度特征驱动语言演绎,与题目难度无关;NoThinking模式则呈自适应扩散模式,侧重符号操作。通过抑制激活量最大的三个稀疏特征,发现推理与句法结构紧密耦合,干预会破坏LaTeX和框式答案格式。研究还发现,思维链的连贯性依赖特化特征间的脆弱协调,扰动后出现补偿性过度生成和低信息重复。论文DeepSeek-R1稀疏自编码器思维链推荐理由:想搞懂大模型“思考”和“直接答”到底差在哪?这篇用稀疏自编码器拆解了DeepSeek-R1的推理机制,结论挺反直觉。原文稍后读已读值得跟进有用关注 DeepSeek-R1
01:30官方一手Google Research: Blog(资讯)精选Google Research提出'Thinking to Recall'假设,认为链式思维(Chain-of-Thought)推理的本质是组合LLM参数中分散存储的知识片段。基于PaLM 2模型的实验显示,在GSM8K和MATH等数学推理基准上,推理步骤让模型更有效地调用习得的知识。该工作揭示了注意力机制在定位和整合参数化知识过程中的关键作用。论文Chain-of-ThoughtPaLM 2参数化知识1 个信源在谈事件专题推荐理由:Google用PaLM 2发现,模型不靠堆算力背答案,而是靠推理串起脑袋里分散的知识点。比直接猜准多了。原文稍后读已读值得跟进有用关注 Chain-of-Thought