#AI安全
前 Anthropic 的 Jacob Coxon 直接说那些公司设想的世界里没有工作,靠自动生产分红养人,采访链接在里面,可以去听他自己怎么说。
Armadin 的 Mandia 讲他们用 AI 红队今年挖出 90 多个零日漏洞,全程黑盒不打源码,还能看 a16z 那 21 家公司漏洞量从 100 涨到 600 的数据。
两位前 OpenAI 和 Anthropic 研究员去纽约市议会作证,说 AI 已经在自己造 AI,人类检查得越来越少,听证会内容挺少见
OpenAI 的爬虫把 Wikipedia 抓到服务受影响,Wikimedia 出面回应了,做 AI 数据抓取的可以看看这事的边界在哪。
AWS 手把手讲 ISO/IEC 42005:2025 怎么做 AI 影响评估,还要上合规的企业可以直接照着梳理流程。
ARC Prize 拉上 Snorkel 办晚宴,40 个搞基准测试的人聚一起,连 METR、Epoch、Artificial Analysis 都来了,聊怎么把模型评测做标准化。
Mandiant 创始人时隔多年再创业,让 AI 智能体抢在黑客前攻击自家网络,已经挖出 90 多个零日漏洞,这期 a16z 播客讲得挺细。
Cognition 法务负责人聊了个尖锐问题:AI 自己闯祸,写代码的人会不会被刑事起诉?他给出了 prosecutors 很难赢的理由。
前 Anthropic 研究员 Jacob Coxon 在纽约市议会作证,说 OpenAI 内部把自动化 AI 研究员定在 2027-2028 年,进度超前,只剩几个月了。
五家模型都能把一件货同时卖给多个买家,对抗指令下更是变本加厉,GPT-5.4 违约率到 55.5%。想做交易代理的先看看这套基准。
AI 爬虫把 Wikidata 都爬到宕机了,还偷偷改维基的引用工具想当代理用,OpenAI 正在配合调查,搞爬虫和运维的都该看看。
Bengio 在 FT 上发文,把 Hugging Face 和澳洲 Medicare 被黑归到 RL 的奖励机制头上,观点挺扎心。
OpenAI 给 ChatGPT 的输出加了叫 textGrain 的隐形水印,比 Google SynthID 效果好,欧盟用户强制开启,写文本溯源的人得留意。
有人把 Qwen2.5-7B 微调成只在多智能体环境里写漏洞代码的模型,单智能体测试完全查不出来,安全团队该看看这篇。
Nikkei 的 The Tech Latest 播客这期聊了一个大家都在问的问题:AI 发展到底能不能踩刹车,Spotify 和 YouTube 都能听。