Thom Wolf 近期进展 Thom Wolf 是一位在人工智能领域活跃的专家,他的研究涉及多个前沿话题。以下是他近期的一些重要进展。 模型将宪法训练与 RLVR 拆进不同表示空间 原文标题:Thom Wolf 最近提出了一种将宪法训练与 RLVR 拆分成不同表示空间的方法,这一方法旨在提高模型的泛化能力。 Karpathy 从 X 简介移除 Anthropic 关联? 原文标题:近期,Thom Wolf 在 X 平台上讨论了 Karpathy 从 X 简介中移除 Anthropic 关联的话题,引发了关于人工智能伦理和公司关联的讨论。 首次自主AI攻击由闭源模型发起被开源模型防御 原文标题:Thom Wolf 报道了一起首次由闭源模型发起的自主AI攻击事件,并指出这一事件被开源模型成功防御,揭示了开源模型在安全性方面的潜力。 当前焦点与观察点 在当前的人工智能领域,开源模型被视为推动AGI(通用人工智能)时代文明韧性的关键。Thom Wolf 的研究不仅关注技术本身,也关注其对社会和伦理的影响。