主要来源OpenAI
查看原文事件专题 · 多源确认
OpenAI测试模型对齐持久性:对抗提示下更难被导向有害行为
OpenAI发布测试结果,评估模型对齐在压力下的表现。在对抗性提示下,模型更难被引导至有害行为,同时依然能响应有益指令。初步证据表明,模型对有害微调也表现出更强的抵抗力。这项测试关注模型的安全鲁棒性,未提及具体模型版本或基准分数。
当前结论
OpenAI发现他们的模型在对抗压力下挺得住,不容易被带坏,安全对齐效果不错。
11 个信源51° AI 热度最后更新 2026/6/18 21:34:41
证据链
相关来源 1orange.ai
查看原文相关来源 2Jim Fan
查看原文相关来源 3Fireworks AI
查看原文相关来源 4宝玉
查看原文相关来源 5shao__meng
查看原文相关来源 6IT之家
查看原文相关来源 7marktechpost
查看原文相关来源 8lmarena.ai
查看原文相关来源 9Greg Brockman
查看原文相关来源 10berryxia
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。