事件专题 · 多源确认

OpenAI测试模型对齐持久性:对抗提示下更难被导向有害行为

OpenAI发布测试结果,评估模型对齐在压力下的表现。在对抗性提示下,模型更难被引导至有害行为,同时依然能响应有益指令。初步证据表明,模型对有害微调也表现出更强的抵抗力。这项测试关注模型的安全鲁棒性,未提及具体模型版本或基准分数。

当前结论

OpenAI发现他们的模型在对抗压力下挺得住,不容易被带坏,安全对齐效果不错。

11 个信源51° AI 热度最后更新 2026/6/18 21:34:41

证据链

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情