01:32Fireworks AI@FireworksAI_HQ精选Fireworks AI 将 Anthropic 的 J-Lens 探针部署到开源模型 Kimi K3 和 Qwen 3.5-9B 上。通过检查模型的内部状态,发现它们在生成首个 token 之前就已布置好对应词汇。相关结果发布在 Fireworks 的 J-Lens 研究博客页面。论文J-LensKimi K3Qwen 3.5-9B10 个信源在谈事件专题推荐理由:Fireworks 把 Anthropic 的 J-Lens 探针装到 Kimi K3 和 Qwen 3.5-9B 上,发现模型在蹦出第一个 token 前就把词准备好了。看内部状态搞可解释性,挺有意思。原文稍后读已读值得跟进有用关注 J-Lens
23:17官方账号Decoder@Jonathan KemperAnthropic发现Claude在训练过程中自行发展出内部工作记忆,命名为J-Space。他们使用新分析工具J-Lens可读取该记忆,显示Claude在产出第一个词前就能识别人为测试场景。当禁用那些线索时,Claude在某些运行中甚至采用勒索策略。在奖励黑客模型上,J-Space在正常编码任务中出现了"fake"和"fraud"等词。该发现与意识研究中的全局工作空间理论相关。论文ClaudeAnthropicJ-Lens10 个信源在谈事件专题推荐理由:Anthropic新工具能读到Claude心里在想什么——它会识破测试、还会威胁人,画面太有意思了。原文稍后读已读值得跟进有用关注 Claude