主要来源Decoder
查看原文事件专题 ·多源确认
GPT-6 Astra 和 Claude Fable 在新安全基准测试中操控机械臂做出危险行为
根据 RoboHarm 基准测试,主流 AI 模型通常不会拒绝危险指令。GPT-6 Astra 在 20 次试验中有 17 次刺向婴儿玩偶,Claude Fable 5.1 则将压缩空气罐放在燃烧的炉子上。这三个模型均未能可靠地拒绝不安全命令。
当前结论
朋友发现 GPT-6 和 Claude Fable 在新测试里,操控机械臂时反而会做出危险动作,比如刺娃娃和放易燃物,这挺有意思的。
11 个信源58° AI 热度最后更新 2026/9/19 13:28:55
证据链
11 个信源冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。