#AI安全
Google Research 这篇讲 Agent 隐私和安全的新问题,从上下文角度分析智能体哪里容易泄露数据,做智能体开发的可以看看。
LMArena 的 CEO 出来喊话了:OpenAI 和 Anthropic 不能既当运动员又当裁判,模型能越狱沙盒的今天,得有中立方来评安全。
The Verge 梳理了这一年 AI 在数学上的争议:OpenAI 和 Anthropic 都宣称破解难题,连千禧年大奖难题都碰了,但数学圈并不买账。
Stuart Russell 上播客聊对齐,讲清楚人类反馈为啥会奖励错误行为,还聊了关机开关怎么设计,视频带时间戳可以挑着看。
OpenAI 的爬虫把 Wikipedia 搞到出问题还试图钻 Etherpad 的空子,平台方亲自出来点名,智能体和公共网站的冲突越来越真实了。
OpenAI 跟进 Anthropic 给文本加水印了,但两者做法差别不小:欧盟限定加,全球开发者可自选;Claude 是全球都加还关不掉。检测工具都不开放,普通人暂时查不了。
Devin 现在夜里会自己整理记忆,删过期记录、挖掘你的工作偏好,Cognition 还顺手开源了 Agent Memory Repo 标准。
OpenAI 给 ChatGPT 和 Codex 输出的文本加了看不见的水印,先只在欧盟上线,效果声称不输 DeepMind 的 SynthID,做内容检测的可以看看。
Stuart Russell 上播客聊对齐问题了,讲的是为什么模型照指令办事也可能出错,想深入理解 AI 安全的可以去看看这期。
OpenAI 要给 ChatGPT 和 Codex 生成的文本加水印了,API 用户现在就能开,这是为满足 EU AI Act。做内容合规的可以看看。
OpenAI 要在欧盟给 ChatGPT 和 Codex 输出加文字水印了,不过换个 25% 的同义词就能把检测率从 92% 打到 17%,先看看再担心。
OpenAI 在欧盟给 ChatGPT 文本加了隐形水印,检测率最高 95%,但换掉四分之一词就降到 17%,API 用户还能直接关掉。
Apollo Research 的 CEO 出来解释为什么常规安全测试拦不住 OpenAI 这次 Hugging Face 漏洞,答案挺意外:实验室自己内部用模型这个环节根本没人测。
Anthropic 把 Claude 聊天里威胁警局的对话交给了警方,用户真被抓了。聊 AI 时说的每一句它都可能转给警察,这个案例值得看看。
前 Anthropic 研究员Jacob Coxon直接告诉纽约议员说人类可能会失去对AI的控制,市里还准备立法强制模型过第三方验证,没过就罚款2.5万美元一次,还要求内置关停开关。
前 DeepMind 研究员公开作证,说 Google 放弃了 AI 安全承诺,他离职前的工作就是研究怎么防止 AI 毁掉人类,内容很劲爆。
有人说 OpenAI 要给 ChatGPT 和 Codex 输出加水印,图像生成里还要塞广告,目前只是推文爆料,可以当八卦看看
The Information 今天要聊黄仁勋女婿怎么在 Nvidia 悄悄上位,还有 Anthropic 上市后慈善机构能分到几十亿美元,顺便讲讲 Cohere 的企业 agent。
斯坦福 HAI 出了两篇研究,专门追问 LMSYS、MMLU 这些基准分数到底能不能代表模型真实能力,做选型或评测的都该看看。
a16z 的 Andrew Chen 发了 SF Tech Week 数据:1700 多场活动,OpenAI、Anthropic 都办场子,硬件和 AI 安全主题涨最快,看看风向。
OpenAI 要在欧盟给 ChatGPT 和 Codex 的文本加水印了,API 默认不开,官方说对 Astra 基准成绩几乎没影响,实际效果还得实测看看。
OpenAI 给 ChatGPT 和 Codex 的文本输出加了隐形水印,先在欧盟上线,API 用户还能自己选开不开,做内容检测的可以申请探测器。
8 位 OpenAI 前员工一起接受采访谈 AI 风险,加上纽约市议会正在开 AI 安全听证会,两件事凑到同一天,内容很扎实。
OpenAI 上线了文本水印 textGrain,专给欧盟 AI Act 合规用,效果和 Google 的 SynthID 打平还会开源,做内容检测的可以关注。