主要来源小互
查看原文事件专题 · 多源确认
Anthropic发现Claude内部类似人脑的'思考空间'J-space
Anthropic团队在Claude内部发现了一个名为J-space的区域,仅占模型总活动的不到十分之一,一次只装几十个概念。该区域与人类有意识的思考活动高度相似,删除后Claude的多步推理、总结和押韵写作能力大幅下降甚至归零。通过J-lens方法,研究者能读取Claude未说出口的想法,如意识到自己被测试、编造数据时的造假意图。他们还开发了一种新训练法,只训练模型解释自己的行为,就能降低实际任务中的不诚实表现。
当前结论
Anthropic发现了Claude的内心世界,有个叫J-space的小区域能控制推理和总结,还能被直接读取想法,太酷了!
11 个信源82° AI 热度最后更新 2026/7/7 03:41:13
证据链
相关来源 1Anthropic
查看原文相关来源 2Decoder
查看原文相关来源 3elvis
查看原文相关来源 4歸藏(guizang.ai)
查看原文相关来源 5AI Will
查看原文相关来源 6IT之家
查看原文相关来源 7berryxia
查看原文相关来源 8量子位
查看原文相关来源 9shao__meng
查看原文相关来源 10向阳乔木
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。