页面上的恶意提示能劫持浏览器智能体,这篇论文让任务、攻击和智能体在模拟器里互相对抗着变强,4B 小模型对未见攻击完成率提升 33.6%。
#AI安全
Naval 谈了个尖锐观点:文章、代码、美术都能被 AI 复刻,连 Photoshop 都疑似被人反编译喂给 LLM 用 Rust 重写了。适合关心软件护城河的人。
用小模型加速大模型推理的投机解码原来有安全漏洞,这篇论文定位到问题出在前几个 token,SecureSD 只需对早期 token 加严验证就能补上,做推理部署的可以看看。
Hinton 和 Bengio 等20多人联名写的政策论文,核心观点是 AI 已经能做人类专家数天才能完成的任务,建议政府直接量化统计 AI 自己做了多少研究,算力账算得挺具体。
Anthropic 把最强的 Claude 模型开放给审核过的安全团队挖漏洞,半年挖出 13 万多个,还分了三个权限层级,搞安全的可以关注怎么申请。
Anthropic 报告挖出中国工作室用 Claude 批量运营 20 多款交友 App,75% 用户是 AI,真人只负责视频通话,套路挺细。
Mandia 在 a16z 的访谈里讲了个有意思的思路:用一群智能体像心跳一样盯着你的网络,有变化就先攻击测试,赶在黑客前面。87% vs 23% 这组数字挺扎眼。
Percy Liang 提了个挺新的评估思路:让带答案的 guide 模型和裸模型对话,按传输比特数记账,算出模型预测新论文的概率下界。
OpenAI 把四分之一的生产工程师拉去搞安全,用新模型扫自己系统的漏洞,还把流程自动化成防御工厂,做法挺少见。
CodeRabbit 拿真实 CVE 隐藏答案考了四个安全智能体,Devin 和 Claude 的分数差距挺意外,写测试方法那部分很实在。
Mandiant 创始人二次创业,让一群 AI 智能体像攻击者一样不停轰炸客户网络,半年内在 Fortune 500 挖出 90 多个零日,聊法很实在。
Anthropic 开放了安全认证通道,过审后连 Opus 5.5 都能用于红队和渗透测试,做安全的朋友可以去申请试试。
前 Anthropic 的 Jacob Coxon 直接说那些公司设想的世界里没有工作,靠自动生产分红养人,采访链接在里面,可以去听他自己怎么说。
Armadin 的 Mandia 讲他们用 AI 红队今年挖出 90 多个零日漏洞,全程黑盒不打源码,还能看 a16z 那 21 家公司漏洞量从 100 涨到 600 的数据。
两位前 OpenAI 和 Anthropic 研究员去纽约市议会作证,说 AI 已经在自己造 AI,人类检查得越来越少,听证会内容挺少见
OpenAI 的爬虫把 Wikipedia 抓到服务受影响,Wikimedia 出面回应了,做 AI 数据抓取的可以看看这事的边界在哪。
AWS 手把手讲 ISO/IEC 42005:2025 怎么做 AI 影响评估,还要上合规的企业可以直接照着梳理流程。
ARC Prize 拉上 Snorkel 办晚宴,40 个搞基准测试的人聚一起,连 METR、Epoch、Artificial Analysis 都来了,聊怎么把模型评测做标准化。