02:18官方一手Anthropic: Research(资讯)精选Anthropic在2026年8月28日发布研究,展示自动化研究者能可靠缓解AI对齐失败问题。研究团队使用Claude 3.5模型进行实验,在多个基准测试中表现优异。自动化研究者能识别并修复模型中的有害行为,准确率达到87%。该研究为AI安全提供了新方法,减少了人工干预需求。论文AnthropicClaude 3.5对齐7 个信源在谈事件专题推荐理由:Anthropic用Claude 3.5证明自动化研究者能修复87%的对齐问题,比人工更高效可靠。原文稍后读已读值得跟进有用关注 Anthropic