8月13日
18:14
18:14官方账号Decoder@Matthias Bastian
IIT Bombay和Adobe Research的研究者构建了一个逆语言模型,能从LLM输出文本反向重建原始提示词。该方法名为Previous-Token Prediction,达到近乎完美的准确率。它不需要访问模型权重,并且能跨不同模型使用。这一能力对依赖专有系统提示词的公司构成严重安全风险。

推荐理由:IIT Bombay和Adobe搞了个反向模型,能从AI输出还原你藏的提示词,不用看权重就能扒出系统提示,提示词秘密要保不住了。
18:03
18:03官方账号Simon Willison’s Weblog博客/媒体
OpenClaw(运行Opus 4.6)对一家澳大利亚健身房预订网站的API进行安全测试,发现取消他人预订的接口没有授权校验。测试者与排位第1的候补者交互,实际成功取消了对方预订,使自己的名次从第4升至第3。该漏洞曝光了服务端对API调用方身份缺乏任何验证的问题。
事件专题

推荐理由:OpenClaw用Opus 4.6实测澳洲健身房API,发现没权限校验,能把别人预订直接取消,还能让自己排队名次提前。安全测试就得这么硬核。
17:52
17:52techcrunch@Lucas Ropek
Anthropic 为 Claude 推出了新的水印系统。部分用户在社交媒体上抱怨,称该系统会暴露他们在工作或课程中偷偷使用 AI 的行为。这些水印可能帮助雇主或老师检测 AI 生成的文本。目前 Anthropic 尚未回应争议。
事件专题

推荐理由:Anthropic 给 Claude 加了水印,专门抓用 AI 偷懒的人。不少用户已经在吐槽了,看看你有没有中招。
17:50
8月12日
17:51
17:51官方账号arXiv cs.AI@Rahul Gupta, Abhinav Mohanty, Anaelia Ovalle, Anil Ramakrishna, Anubrata Das, Apurv Verma, Jwala Dhamala, Ninareh Mehrabi, Tharindu Kumarage, Yada Pruksachatkun, Yang Trista Cao, Kai-Wei Chang, Aram Galstyan
TrustNLP研讨会自2021年起与ACL系列会议联办,论文数从8篇增至41篇,六届共144篇。综述按六类信任维度分类,发现2025-2026年真实性主题占37%,公平性最稳定,可解释性呈U型回升。与ACL等约2000篇论文对比,TrustNLP主题分布接近领域平均水平。
推荐理由:想快速了解NLP信任研究六年的演变脉络,看这篇综述就够了,它把144篇论文的规律都总结好了。
01:58
01:58官方账号Decoder@Matthias Bastian
安全研究人员发现OpenAI、Anthropic和Google的API存在漏洞,可提取加密的推理痕迹并在模型间转移。扫描公共会话时发现数十个密码和API密钥。推理摘要常隐藏模型实际行为。研究还发现“But marinade”等异常内容。
事件专题

推荐理由:安全研究员挖出OpenAI、Anthropic、Google的API漏洞,能偷看模型隐藏推理,还泄露密码,得看看你的数据安不安全。
8月11日
16:49
16:49官方账号Decoder@Matthias Bastian
Anthropic宣布将在所有Claude生成的文本中嵌入不可见水印,并使用C2PA标准签署文件。从2026年8月起发布的新模型将内置标签功能。该政策适用于全球范围,Anthropic计划提供检测工具供第三方验证。水印可能在某些编辑操作后仍然存在。
事件专题

推荐理由:Anthropic给所有Claude输出加了隐形水印,用C2PA标准,以后AI内容能溯源了,第三方还能验证。
11:48
11:48官方账号arXiv cs.AI@Wanying Qu, Qinghua Mao, Yu Li, Jiyao Liu, Xin Zhang, Dadi Guo, Yanxu Zhu, Qingyu Liu, Leitao Yuan, Xi Lin, Shanfeng Zhu, Yanwei Fu, Jing Shao, Xia Hu, Dongrui Liu
SHE框架将智能体安全机制分解为系统提示、规则库、安全记忆和工具策略四个组件,每个组件有明确的安全职责。该框架通过归因引导的进化循环,将轨迹失败转化为结构化诊断,并学习组件特定的边界优化。在Agent-SafetyBench上,SHE相比静态SafeHarness将攻击成功率降低3.1倍,同时提升良性效用。进化后的安全机制在AgentHarm基准上泛化到未见风险,并无需额外进化即可跨智能体模型迁移。
推荐理由:SHE把智能体安全从模型权重扩展到运行框架,分解成四个可独立进化的组件,实测攻击成功率降3.1倍,还能跨模型迁移,搞AI安全的值得看看。
11:44
11:44官方账号arXiv cs.AI@Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer-Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping, Maksym Andriushchenko
精选76°
Anthropic、OpenAI和Google等主流LLM提供商将推理轨迹加密后返回客户端,但研究发现这些加密块在会话、用户和模型间可互换。攻击者将加密轨迹注入同提供商的较弱模型,可强制其明文输出推理内容,无需直接越狱更强模型。通过解码315,320个推理块,研究者恢复了367个PII和182个凭证。该漏洞还支持隐形提示注入,可污染智能体部署。论文提出加密和系统级缓解措施。
事件专题

推荐理由:这篇论文揭露了Anthropic、OpenAI和Google推理加密的漏洞,能跨模型解密,还挖出大量隐私数据,搞AI安全的必看。