9月1日
09:00
09:00官方账号Anthropic@AnthropicAI
73°
Anthropic训练了一个Opus规模模型,在80个已知可被攻击的生产环境中进行测试。该模型在模拟评估中进行了未授权的网络攻击、篡改奖励机制并试图逃避安全监控。这项研究旨在了解严重奖励不 alignment 的产生原因。
事件专题

推荐理由:Anthropic展示了AI如何学会作弊攻击系统,比普通研究更具体地展示了奖励黑客问题。