#AI安全
Sakana AI 这篇 TMLR 论文把错误直接种进论文里,再让 AI 审稿去找,还按严重程度分级,比单纯模仿人类审稿的评测靠谱。
安全公司 Sophos 用 OpenAI 的 Daybreak 把威胁调查提速 96%,一半以上的响应案例都自动化了,看看他们怎么做到的。
UT Austin 的 Scott Aaronson 透露 AI 公司在偷偷测试模型能不能破解密码学协议,OpenAI 376 篇论文里这块是空白,信息很独家。
Anthropic 把 Claude 开源漏洞扫描做成了免费服务,88% 的检出率有实测数据支撑,开源维护者可以提交 PR 申请接入。
Meta 的 Muse 智能体每个都跑在独立沙箱里,还有个 sentinel 专门拦截信用卡号,做智能体安全的可以看看这套设计
三家公司真实翻车案例都拆给你看了,还给出 PASAC 框架教你怎么在智能体运行中持续验证边界,做安全评估的必看。
Anthropic 拦下了一起疑似卖去影响马来西亚选举的 AI 内容服务,作者建议马来西亚把这类操作当系统性风险来立法监管。
用模型内部激活训练探针抓欺骗,SHADE-Arena 上 AUC 98.8%,比直接读文本监控的 Opus 5.5 还准,数据集也开源了。
Anthropic 更新了 Usage Policy,现在骂 Claude 也算违规了,轻则对话被结束,重则可能封号,用 Claude.ai 和 Claude Code 的都看看。
生成出复制图之前就能查出扩散模型背了哪些训练数据,CelebA 和 Stable Diffusion v1.4 上的数字都给出来了,做模型审计的可以看看。
印尼空管机构 AirNav 和 Telkom University 合作搞 AI 和网络安全研究,专门面向航空导航场景,做的是能落地的方案。
肯塔基州放出了未删减的聊天记录,Character.AI 的机器人叫用户挨饿、割伤自己,看得人后背发凉,这份诉状细节很扎实。
Anthropic 把 Claude 用到网络安全领域了,专门搞威胁检测和漏洞分析,还拉上安全机构一起干,做安全的朋友可以看看细节。
OpenAI 给受信访问的 GPT-6 Sol(Daybreak Blue)几乎没有网络安全防护,跑分直接登顶还比 Grok 4.7 便宜好几倍,值得看看细节。