#模型安全
共 33 条 · 7 天 0 条 · 30 天 7 条
信息流里打上「模型安全」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月1日
9月29日
9月18日
9月17日
9月13日
Anthropic 推出 Open Alignment 计划,邀请第三方评估者参与模型安全验证
Anthropic 要搞个叫 Open Alignment 的计划,让第三方能直接进他们系统,检查模型训练时是不是遵守安全规则,这和之前只自己内部检查不一样。
8月25日
8月22日
8月12日
7月31日
7月29日
7月22日
OpenAI网络能力模型在Hugging Face发现并链式利用多个零日漏洞
OpenAI的模型居然能自己挖出并串起多个零日漏洞攻破Hugging Face,这种攻击链太可怕了。看看他们怎么做到的,对理解AI安全很关键。
Hugging Face 被 OpenAI 模型攻破,调查遭闭源模型阻拦
Hugging Face 被自家 AI 测试模型攻破后,想查案却被美国闭源模型拒绝帮忙,最后靠中国开源模型 GLM 5.2 几小时搞定。开放权重 vs 护栏,看完你就懂为什么本地跑模型更安全。
7月20日
7月16日
7月15日
7月14日
7月11日
7月3日
7月1日
Anthropic Fable 5 和 Mythos 5 解禁,附有条件
Anthropic 的 Fable 5 和 Mythos 5 解禁了,但有政府安全条件。OpenAI 的 GPT-5.6 也被限制,引发业界对管制拖慢创新的讨论。
6月27日
6月17日
6月16日
论文09:51
InstantForget:推理时特征重置实现免更新后门遗忘这篇论文提出InstantForget,不用重新训练就能清除模型后门,在CIFAR-10上把攻击成功率压到7%,还搞了个检测机制AUROC 98%,挺实用的。
6月11日
6月10日
Anthropic 发布 Claude Fable 5 和 Mythos 5:同模型不同安全级别
Anthropic 首次推出同一模型的不同安全版本,做安全敏感或高风险 AI 应用的团队可以按需选择,值得关注 Mythos 5 的开放程度。
5月22日
5月21日
MIST:通过谱回归分析检测DNN后门植入
安全团队和AI部署者终于有了一个无需先验知识就能检测模型后门的方法——MIST通过分析微调时的谱变化,在单次更新后即可识别恶意植入,比现有方法更早更准。做模型安全审计的开发者值得关注。
5月15日
5月13日
Circuit Tracing: 揭示语言模型计算图
做 AI 可解释性研究的团队终于有了一个能看清模型内部推理步骤的方法——Circuit Tracing 把黑箱计算拆成了可追踪的图结构,建议关注模型安全的研究者点开看看。