主要来源Anthropic: Research
查看原文事件专题 · 官方一手
Anthropic提出双用途知识的关闭开关
Anthropic在2026年7月发布了一项关于AI双用途知识对齐的研究。研究提出了一种“关闭开关”机制,允许在推理时选择性地禁用模型中的危险知识。实验在生物和化学领域的多个安全基准上进行了评估。结果证明了该方法在降低恶意利用风险方面的有效性。
当前结论
Anthropic研究了一个很实际的问题:怎么让AI知道太多危险东西时能随时关掉。不是只喊口号,有具体方法。
8 个信源47° AI 热度最后更新 2026/7/9 01:05:12
证据链
相关来源 1量子位
查看原文相关来源 2小互
查看原文相关来源 3歸藏(guizang.ai)
查看原文相关来源 4AI Will
查看原文相关来源 5IT之家
查看原文相关来源 6Decoder
查看原文相关来源 7Claude Code: GitHub Releases
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。