#安全对齐

共 22 条 · 7 天 0 条 · 30 天 5 条
信息流里打上「安全对齐」标签的资讯、产品与论文,按刊登时间排,新的在上。
9月30日
9月29日
9月17日
研究提出用含误导前提的数据训练大语言模型提升安全警惕性

朋友,这个研究挺有意思,作者不是直接教模型怎么拒绝有害指令,而是反过来,用一些故意有误导性的问题来训练模型,让它学会“留个心眼”,这样在遇到真正的安全威胁时可能更不容易被绕过。

arXiv cs.AI@Youjia Wang 等 6 人原文
9月12日
9月11日
9月3日
8月24日
7月29日
7月21日
7月7日
6月25日
6月19日
6月17日
6月11日
6月10日
6月9日
6月2日
5月30日
5月20日
论文精选10:38
安全对齐对自主安全智能体的影响:Gemma 4 等模型实测

安全智能体开发者需要了解:去对齐模型在漏洞分析任务上可能提升成功率,但效果因模型而异,且硬核漏洞验证任务仍未解决。建议点开查看具体轨迹数据和任务分类,避免盲目采用去对齐策略。

事件专题
arXiv cs.AI@Isaac David, Arthur Gervais2 个信源在谈原文
5月19日
5月14日
5月13日