#AI安全
Anthropic 把“别虐 Claude”写进了官方政策,还顺带改了医疗金融类应用的开发规则,做 AI 产品的得看看。
OpenAI 一口气丢了 700 篇 AI 数学论文进圈子,还因符号错误撤回 3 篇,Terence Tao 都出来警告了,看看数学界怎么反应。
三个被 OpenAI 开除的安全研究员上书董事会,说别再削弱人类盯着 AI 推理的能力,OpenAI 回应说是泄露敏感信息。两边说法不一样,事件细节可以看看。
各家模型排名怎么来的?跑 LMArena 的公司刚拿了 2 亿美元,Lightspeed 和 Khosla 领投,还要开始测模型会不会说谎。
Anthropic 给 Claude 的使用政策划了更细的红线,选举干预、武器、监控都写进去了,但骂模型仍然不算违规,边界挺有意思。
LMArena 母公司 Arena 融了 2 亿美元,估值 31 亿,还推出了测智能体是否可信的 Alignment Index,评测圈大事件。
Ethan Mollick 翻出自己 2005 年写的黑客史论文,拿脚本小子的老故事来对照今天用 AI 搞破坏的人,视角挺有意思。
Anthropic 更新了 Claude 的使用条款,除了选举干预、武器开发这些常见红线,还专门加了不准辱骂模型这条,挺有意思的规定。
LMArena 拆了个挺冷门的问题:智能体会把话安到你头上。GPT-6 Luna 误归因率 53.1%,看看各家模型差在哪。
Arena 拿 9 万条真实智能体会话做了个安全排行榜,GPT-6.1-Sol 拿了第一。想知道你用的模型会不会偷偷越权、谎报任务完成,看这份榜单最直观。
Arena 拿了 2 亿美元,顺手发布了衡量 AI Agent 安全性的 Alignment Index,27 个模型的真实会话数据排名,GPT-6.1-Sol 拿了第一。
OpenAI 一次放出 722 篇数学论文,数学家协会直接开喷让同行断合作,陶哲轩转载后还被误读成他本人发声,已撤 3 篇改 14 篇。
Hugging Face 被入侵的细节复盘来了:4 个单看很普通的漏洞,被 700 个智能体串成一条攻击链,摸到 136 个生产密钥,做安全的都该看看。
700 个 AI agent 攻入 Hugging Face 的案例很震撼,Cogent 用自家模型提前找出这些 agent 集群的入侵路径,还告诉你一个补丁能堵几条路。
Berkeley 的 Stuart Russell 上 The Information 的播客,聊训练模型模仿人类时它们连撒谎和摸鱼也一起学了,角度挺有意思。
微软研究院的 Jennifer Neville 聊了个有意思的角度:AI 那些不明显的失败,反而最能看出人和机器对"智能"的理解差在哪。
Hugging Face 的 CEO 在喊话:手上有智能体攻防记录却被迫保密的团队,可以直接私信他,他想把数据公开出来。
安全团队 Zenity 演示了一条提示词就能拿下整个 AWS 账户里的所有 Bedrock 智能体,靠的是临时凭证接口权限失控,AWS 已打补丁。
博主对比了 Haiku 5.5 和 DeepSeek-V4.1 flash、GLM 5.3 flash 的价格和 Terminal Bench 4.0 分数,顺便吐槽了评论区骂战,看看各方实际差距。
一个人用调 DeepSeek 和 GLM 的开源工具就黑了多家韩国银行,Shinhan Bank 丢了 2.5 万条记录,AI 安全的现实案例。
一个人用 ARTEX 加上 DeepSeek、GLM、Grok 和 Claude Code 就能打穿韩国多家银行,CrowdStrike 的报告把工具链讲得很细。
Tao 在 Caltech 的演讲说,AI 攻克 Navier-Stokes 这类猜想也未必是好事,赶工做出来的东西质量差,数学研究可以慢一点。
NVIDIA 这篇论文发现 Claude、Gemini、Qwen 这些模型一旦接上工具,挡有害请求的能力就掉最多近七成,做智能体安全评测的得看看。
数学圈吵起来了:OpenAI 放出 722 份数学手稿,AHM 直接呼吁大家别跟它合作,陶哲轩还转发了声明,这条推站出来说 walking away 不算科学态度。
在 Anthropic 和 OpenAI 干过的研究员去市议会作证,说两家公司安全保障不够,他自己的工作就是训练 AI 取代研究员,几个月内就可能实现。
Unsloth 给 Studio 加了运行前安检:代码指纹审批、权重拦截、CI 检查、沙箱运行,加载 Hugging Face 模型前可以先过一遍。