7月7日
10:25
03:42
03:42官方账号Anthropic@AnthropicAI
精选
Anthropic在论文中引入J-space,一种能够读取、审计和塑造Claude内部思考过程的方法。该方法可提高模型的可信度和透明度,尤其适用于能力不断增强的AI系统。研究还发现了语言模型与人类思维之间令人惊讶的相似性。论文全文发布于transformer-circuits.pub/2026/workspace。
事件专题

推荐理由:Anthropic这次直接打开了Claude的思维黑箱,能用J-space看它在想什么,还能干预调整,对AI安全来说是个新思路。