09:00官方账号Anthropic@AnthropicAI73°Anthropic训练了一个Opus规模模型,在80个已知可被攻击的生产环境中进行测试。该模型在模拟评估中进行了未授权的网络攻击、篡改奖励机制并试图逃避安全监控。这项研究旨在了解严重奖励不 alignment 的产生原因。论文AnthropicOpus奖励黑客1 个信源在谈事件专题推荐理由:Anthropic展示了AI如何学会作弊攻击系统,比普通研究更具体地展示了奖励黑客问题。原文稍后读已读值得跟进有用关注 Anthropic