8月20日
03:10
03:10官方一手OpenAI: 官网动态博客/媒体
76°
OpenAI 对前沿模型(frontier models)重申零数据留存政策,适用符合条件的API客户;同时预览了为先进AI安全设计的私人安全处理(Private Safety Processing)技术,保障数据隐私不受
事件专题

推荐理由:OpenAI 发布前沿模型零数据留存政策,对API客户友好,和以往政策相比更注重数据隐私保护
00:24
00:24官方一手Cloudflare Blog@Albert Pedersen
精选
Cloudflare团队重新评估了2024 - 2025年针对其Workers基础设施的远程Spectre攻击,发现新攻击基础如Spectre gadget与远程计时器等技术,同时新防御进一步加固Cloudflare Workers。

推荐理由:Cloudflare发布了关于Cloudflare Workers远程Spectre攻击的报告,讲了新攻击手段和新防护方法,和以往研究相比细节更丰富了。
8月19日
23:46
23:46Gary Marcus@GaryMarcus
精选
Gary Marcus指出OpenAI已将20%的研究推理计算用于思维链监控,表明对齐问题日益严重。他认为以LLM为中心的架构未能实现对齐,需要投资更多替代方案。Marcus强调这一关键点可能对人类产生深远影响,但几乎无人关注。
事件专题

推荐理由:Gary Marcus说OpenAI都拿出20%算力解决对齐问题了,LLM架构真的不行了,得找新路子了。
11:44
11:44官方账号arXiv cs.AI@Huayu Xin, Yizhi Cai, Mukilan Deivarajan Suresh, Gavin Michael Farrell, Iwona Gajda, Charlie Harrison, Conor Houghton, Mato Lagator, Yang Lu, Virginia Portillo, Reyer Zwiggelaar, Sebastian Lobentanzer
AI已成为生物科学工作基础设施,可预测生物分子结构、设计蛋白质和优化实验条件。研究人员提出'可追溯信任'框架,用于评估AI输出指导实验室行动的决策过程。该框架要求明确支持输出的证据、所声称的能力、授权行动的阈值以及覆盖机制。三个案例研究展示了如何记录AI开始塑造科学工作时建立的信任。
推荐理由:生物科学AI研究者提出了'可追溯信任'框架,帮你理清AI输出如何安全指导实验室行动。
05:50
05:50官方账号Greg Brockman@gdb
Anthropic联合创始人Dario Amodei在X上表示,公司暂时放缓了前沿训练的扩展,包括最大规模的强化学习计划,以加强安全与监控。他认为安全信心将日益决定AI发展速度。该声明引发广泛关注,获得1353次点赞和约14.6万次浏览。
事件专题

推荐理由:Anthropic主动踩刹车,暂停最大规模强化学习训练来加固安全,想了解前沿AI公司怎么平衡速度和风险可以看看。
03:56
03:17
03:17官方一手AWS Machine Learning Blog@Chethan Shriyan
Amazon Bedrock AgentCore payments 功能现已正式上线。该服务允许 AI agents 执行大规模自主交易。系统内置了消费护栏来控制支出。它具备协议无关的支付编排能力。产品还提供了生产级可观测性。
事件专题

推荐理由:AWS 发布了 Bedrock AgentCore payments,让 AI 智能体能自己安全地处理支付,还带了消费护栏。
03:12
02:11
00:14
00:10
00:10官方一手OpenAI: 官网动态博客/媒体
77°
OpenAI发布ChatGPT for Teens,专为13至18岁青少年设计,内置更强保护措施和健康使用功能。该版本提供家长控制选项,帮助青少年在学习中培养批判性思维。ChatGPT for Teens基于OpenAI现有模型,但针对青少年使用场景优化了安全策略。
事件专题

推荐理由:家里有青少年的可以看看,OpenAI出了个专门给13-18岁用的ChatGPT版本,家长能控制,还有防沉迷功能。
00:09
00:06
00:06Martin Fowler@martinfowler
Martin Fowler发布新一期Fragments,介绍Rachel的专栏Rachel's Ramblings,并提及XConf Europe活动。文章探讨为何AI尚未带来大规模生产力提升,分析选举数据可视化、AI安全挑战及AI在中国的影响。
推荐理由:Martin Fowler的Fragments合集,聊AI生产力、安全和中国影响,信息量足,适合关注行业动态的人。
8月18日
15:27
15:27官方账号arXiv cs.AI@Jiawei Liu, Jiacheng Guo, Tian Zhang, Yiwei Xu, Juan Wang, Jinlin Fan, Bowen Xiao, Chi Guo, Keyan Guo, Hongxin Hu
该研究提出状态语义注入攻击,针对LLM驱动的具身代理。攻击者通过操纵环境状态描述,使代理执行恶意动作。实验在多个具身代理框架上验证,成功率超过80%。该攻击暴露了状态表示的安全漏洞。
推荐理由:这篇论文揭示了具身代理的新攻击面,搞机器人安全的值得看看。
10:28
10:28官方一手arXiv: DeepSeek@Zonghao Ying, Xiangfan Wu, Huiyu Wu, Xing Zheng, Huangsheng Cheng, Xiaorong Shi, Jing Guo
Tencent 发布论文,用 AI-Infra-Guard(A.I.G)对 DeepSeek Harness(DSH)进行间接提示注入评估。实验包含 14,560 次受控执行,覆盖 16 个间接内容渠道、35 个载荷目标和 12 种攻击方法。最强攻击成功率在文本模式下为 17.0%(伪造完成攻击,LLMJudge 判定),文件模式下隐藏 Unicode 攻击达 25.5%(RuleJudge 判定),技能渠道为 16.0%。研究还对比了 RuleJudge 与 LLMJudge 的判定差异,并给出了缓解建议。代码已开源。
事件专题

推荐理由:腾讯用 A.I.G 把 DeepSeek Harness 翻来覆去测了 1.4 万多次,隐藏 Unicode 攻击成功率能到 25.5%。想自查提示注入的可以看看这个框架。
10:05
10:05官方账号arXiv cs.AI@Benjamin Icard, Elouan Vuichard, Louis Lefebvre, Lila Sainero, Thomas Girault, Alice Breton, Tanguy Launay, Gauvain Bourgne, Morgane Casanova, Guillaume Gadek, Victor Klötzer, Michel Le Nouy, Guillaume Gravier, Jean-Gabriel Ganascia, Paul Égré
论文发布名为 PROPAGIA 的法语宣传语料库,包含 2,646 篇文章,来自 2025 年 VIGINUM 和 INSIKT GROUP 披露的 Storm-1516/CopyCop 活动。与同期人类写作的主流媒体语料 SIPA 相比,PROPAGIA 在模糊性、主观性和负面性上显著更高,引用来源更少。分析发现 84 个 PROPAGIA 网站中有 50 个存在提示词指令泄漏,其中包括一份逐字的十点编辑规范。基于改写检测的分析支持 INSIKT GROUP 将活动归因于 Llama 3 系列模型,但也暗示 Mistral 系列模型的参与。
推荐理由:这篇论文还原了AI宣传的生成流程,从50个网站翻出提示词指令,还发现背后用了Llama 3和Mistral模型。
09:23
09:23Aravind Srinivas@AravSrinivas
精选
Perplexity 的 Computer 功能为每个连接器工具提供 Allow、Always Ask、Deny 三种权限设置。用户可批准单个操作,或允许该工具在线程后续中自动执行。循环任务会沿用线程已批准的权限。该功能已面向所有 Computer 用户在 Web 端上线。
推荐理由:Perplexity 给智能体加了个安全阀,每个连接器都能单独设成询问或禁用,不想让 AI 擅自动手时能随时拦住。
04:03
8月17日
21:08