论文10:49Safe Trigger: 触发大推理模型的潜在安全意识实现自适应安全这篇论文发现LRM自己就能识别风险,用SFT+DPO触发安全分析,让DeepSeek-R1的越狱成功率高降36%,还不用外部数据,挺实用的。#Safe Trigger#DeepSeek-R1#大推理模型#AI安全aarXiv: DeepSeek@Ke Miao 等 5 人原文稍后读已读值得跟进有用关注 Safe Trigger