01:09elvis@omarsar074°Anthropic发布arXiv论文(2607.15495),提出LLM中的全局工作空间假说。该假说认为模型能用语言表达的表征像一个带宽受限的共享通道,将少量特征广播到网络其余部分。这为chain-of-thought和steering向量提供了机械论解释:当verbalized reasoning(语言化推理)真正承载负载时,它如何影响后续输出;而当它只是事后叙述时又是什么机制。论文基于Anthropic的J-space研究,将推理过程与神经网络的内部表征联系。论文Anthropic思维链steering vectors1 个信源在谈事件专题推荐理由:Anthropic这篇论文把思维链和steering向量的工作机制讲透了,告诉你什么时候推理是真起作用,什么时候只是马后炮。搞可解释和推理的都该看看。原文稍后读已读值得跟进有用关注 Anthropic
10:25官方一手歸藏(guizang.ai)@op7418精选73°Anthropic利用新的可解释性技术,在Claude模型中发现了J-space,该空间与神经科学中的全局工作空间理论相似。该理论认为,想法进入特权工作空间后才会被意识访问。研究团队通过分析方法找到Claude内部对应机制,提升了模型可解释性。相关工作发表在Anthropic官网研究页面。论文ClaudeAnthropic可解释性10 个信源在谈事件专题推荐理由:Anthropic用了新方法看Claude怎么处理信息,找到个叫J-space的结构,类似人脑的全局工作空间,挺有意思的。原文稍后读已读值得跟进有用关注 Claude
04:54官方一手Anthropic: Research(资讯)精选72°Anthropic在2026年7月发表的可解释性研究中,发现Claude模型存在一个涌现的全局工作空间(global workspace)。该空间能保存模型内部的思考过程,但这些内部表示并不会出现在模型的最终输出中。研究利用探针和激活干预技术,定位了Claude中对应全局工作空间的神经元群体。这项工作为理解语言模型的内部推理机制提供了新视角。论文ClaudeAnthropic可解释性10 个信源在谈事件专题推荐理由:Anthropic发现了Claude藏着的一个“内心独白”空间,内部思考不写到输出里,搞AI可解释性的人必看。原文稍后读已读值得跟进有用关注 Claude
03:44官方账号Anthropic@AnthropicAI77°Anthropic最新研究发现,在Claude内部存在一个类似人类认知的“全局工作空间”——只有一小部分信息能被模型显式访问和推理,其余则处于隐藏状态。研究人员通过分析Claude在处理复杂任务时的中间表示,识别出这种信息瓶颈结构。该发现揭示了语言模型内部信息流的局限性,类似于人类意识中只有部分内容可被有意识思考。研究团队认为,这一机制有助于解释模型为何有时会忽略上下文或产生不一致输出。论文AnthropicClaude推理模型10 个信源在谈事件专题推荐理由:Anthropic发现Claude大脑里也有个“工作台”,大部分信息是潜意识,只有一小部分能主动调用。想看看大模型内部怎么“想”的?这篇论文很有料。原文稍后读已读值得跟进有用关注 Anthropic
03:26官方一手Anthropic: Transformer Circuits(资讯)精选研究者发现Claude模型内部存在一组可言语化的特权表征,这些表征形成全局工作空间。这些表征仅占模型内部状态的一小部分,但可用于报告、控制和推理。相比之下,模型的大部分处理是自动且不可言语化的。该研究揭示了语言模型内部计算的可解释性结构。论文Claude全局工作空间可解释性推荐理由:这篇文章发现了Claude模型内部有个‘大脑指挥部’——一小部分它能说出来的表征,其他都是自动在干。挺有意思的视角。原文稍后读已读值得跟进有用关注 Claude