论文10:51
SteerCheck: Activation-Steering审计中的归因特异性和对齐泄漏SteerCheck是一个强大的审计工具,可以帮助研究人员识别和评估激活引导中的对齐泄漏问题,对于确保AI模型的可靠性和透明度非常有用。
SteerCheck是一个强大的审计工具,可以帮助研究人员识别和评估激活引导中的对齐泄漏问题,对于确保AI模型的可靠性和透明度非常有用。
SafeSteer 用极低成本(100 个样本)解决了安全对齐损害通用能力的痛点,做 LLM 安全或对齐的团队可以直接参考其局部化蒸馏方法,大幅减少数据依赖。
这项研究揭示了 CoT 在模型安全中的双重角色——既增强鲁棒性又引入新风险,做 AI 安全和对齐的团队值得关注,尤其是使用推理模型的开发者需要重新评估防御策略。