8月17日
20:11
20:11官方账号Decoder@Maximilian Schreiner
Anthropic为Claude引入文本水印,使AI生成内容可被检测。批评者怀疑该水印会影响Claude的词汇选择。律师们因Anthropic的举措面临新的透明度问题。
事件专题

推荐理由:Anthropic给Claude输出加了水印,用来识别AI写的文字。但有人担心这会影响Claude的用词,想探究竟可以读这篇。
8月16日
15:41
15:41官方账号Decoder@Matthias Bastian
Anthropic在安全报告中披露,其生物与化学武器风险过滤系统近一年未生效。在此期间,约5万名外部反馈承包商与模型进行了约1.33亿次未过滤交互。该过滤器用于检测和阻止危险生物及化学信息相关请求。报告未说明过滤器失效的具体原因及修复时间。
事件专题

推荐理由:Anthropic自己承认,防生物武器滥用的过滤器居然趴窝了近一年,5万人跑了1.33亿次没过滤的对话,这事你不想知道吗?
03:06
8月15日
16:41
16:41官方账号Decoder@Tomislav Bezmalinović
精选
美国康涅狄格州一名原告在法庭文件中嵌入隐形提示词注入,用白色背景上的3点白色字体试图操纵潜在的AI审查系统。法官Spader将此举比作暗中干扰陪审团,并撤销了该原告的电子提交权限。法院强调康涅狄格州目前并未使用AI审查文件,但仅凭意图已足以构成制裁依据。

推荐理由:有人把提示词注入用到了法庭上,被法官当场识破还吊销了电子提交权限。这案例提醒你,AI安全不是闹着玩的。
06:15
06:15官方一手Anthropic: Newsroom资讯
Anthropic 于 8 月 14 日发布公告,讲解 Claude 文本水印的工作原理。文中解释了水印如何嵌入到 AI 生成的文本中,并介绍了相应的检测方法。该机制旨在帮助识别 AI 生成内容。
事件专题

推荐理由:Anthropic 官方亲自讲 Claude 水印怎么运作,想知道 AI 文本怎么留记号,看这篇就懂。
05:50
05:50官方账号Decoder@Matthias Bastian
71°
Anthropic即将发布水印检测API,允许第三方验证文本是否由Claude生成。该技术基于Google的SynthID方法,通过调整词选择过程中的随机性来嵌入水印,且不影响文本质量。官方指出该方法在事实密集文本、代码和重度改写场景下存在局限。
事件专题

推荐理由:Anthropic要开放水印检测接口了,以后第三方工具能直接查一段文字是不是Claude写的,用的是谷歌SynthID那套思路,但碰到改写过或代码类的文本可能就不灵。
02:56
02:56官方账号Anthropic@AnthropicAI
Anthropic 依据负责任扩展政策发布第二份风险报告,报告已上线 anthropic.com/aug-2026-risk 页面。报告详细说明其系统的风险类型以及 Anthropic 的应对准备程度。目前该推文获得 63 条评论、26 次转发和 298 个赞。
事件专题

推荐理由:Anthropic发了第二份风险报告,讲自家系统风险和应对准备。想了解前沿模型安全底细的可以点开看看,比官方新闻更技术。
01:30
01:30官方一手歸藏(guizang.ai)@op7418
75°
智谱为 GLM-5.3 开源发布撰文,主张网络防御能力不应只属于少数大型机构。文中强调开源维护者、独立开发者和小型团队也需要这些工具,GLM-5.3 则大幅强化了网络安全任务能力。该发布由 Z.ai 推进。
事件专题

推荐理由:智谱马上要开源 GLM-5.3,这次重点补强网络安全任务,还专门说防御能力不该被大机构垄断,中小团队和独立开发者也能用上。
00:19
00:19Aravind Srinivas@AravSrinivas
Z.ai正式发布GLM-5.3,基于743B参数的基座模型进行后训练。官方称其具备顶级编程与智能体能力,面向代码生成与Agent任务。同时宣布在网络安全领域实现重大提升,为开源模型设立新标准。技术细节已公布在官方博客。
事件专题

推荐理由:Z.ai拿743B大模型搞后训练,出了个GLM-5.3,能写代码还能搞网络防御,开源模型里不多见。
00:17
8月14日
18:12
17:26
17:26官方一手歸藏(guizang.ai)@op7418
72°
智谱发布GLM-5.3,基于743B基础模型仅做后训练,未重新预训练。新版本重点提升安全能力,针对模型防御场景做了优化。长程任务执行显著增强,包括终端操作、工具调用及大型代码库修复。在开源模型中,其网络安全能力达到新水平。
事件专题

推荐理由:智谱发了GLM-5.3,没重新预训练就靠后训练把安全和长程任务拔高一大截,搞智能体或代码修复的值得看看。
16:24
16:24官方一手Pandaily@contact@pandaily.com (Pandaily)
智谱AI首席科学家唐杰在X上回应‘sooooooon’数小时后,GLM-5.3正式上线。该模型专注编程与安全,将SWE-Marathon成绩翻倍至42.5,Terminal Bench 3.0提升至28.3,是原来的5倍。在CyberGym基准上,GLM-5.3以84.5分居所有模型之首。模型发布距用户调侃唐杰仅三天。
事件专题

推荐理由:想试最强编程+安全模型?GLM-5.3刚发布,SWE-Marathon和CyberGym都拿了第一,看它怎么碾压对手。
10:38
10:38官方账号arXiv cs.LG@Julian Minder, Viktor Moskvoretskii, Raghav Singhal, Difan Jiao, Andy Arditi, Shaobo Cui, Yiderigun Borjigin, Kartik Bali, Stefan Krsteski, Harsh Raj, Huu Nguyen, Jannik Brinkmann, Ashton Anderson, Roland Aydin, Robert West
论文提出合成人格预训练(SPP),在预训练阶段就从第一个 token 开始植入目标助手人格,而非等预训练后叠加价值观。方法先用价值规范给预训练文档标注第一人称反思,再在标准文档和反思上以交叉熵损失训练,最后用对话数据做人格绑定。在 3B 参数、500B token 的预训练中,SPP 提高了宪法遵循和越狱鲁棒性,降低了分布外道德困境中的错位率,同时保持能力。实验显示,仅在预训练末期引入 SPP 效果明显更弱,且优势随预训练预算增加而增大。
推荐理由:这篇把对齐提前到了预训练第一步,3B 模型跑 500B token,越狱更难破,值得搞 AI 安全的人看一眼。
8月13日
22:48
22:48小互@imxiaohu
76°
欧洲研究团队在8月10日发表论文,成功读取Anthropic、OpenAI、Google三家旗舰模型的隐藏推理链。团队从6708份公开AI会话日志中提取出62把真实API密钥。研究指出加密算法本身未被攻破,问题出在API设计上。
事件专题

推荐理由:欧洲团队破解了三大AI的加密思维链,还从公开日志里翻出62把API密钥,看完你就知道API设计有多危险。