论文政策与合规精选72°12:01Code as a Weapon:恶意代码请求的共识标注提示库编程模型的安全风险比通用模型高一个量级——返回的代码可以直接运行成武器。做AI安全评估的团队终于有了经过共识验证的测试集,建议用这个库来检验自家模型的拒绝边界。#安全/对齐#编程模型#基准测试#恶意代码aarXiv cs.LG@Richard J. Young, Gregory D. Moody原文稍后读已读值得跟进有用关注 安全/对齐