7月9日
09:05
09:05官方一手Anthropic: Research资讯
Anthropic在2026年7月发布了一项关于AI双用途知识对齐的研究。研究提出了一种“关闭开关”机制,允许在推理时选择性地禁用模型中的危险知识。实验在生物和化学领域的多个安全基准上进行了评估。结果证明了该方法在降低恶意利用风险方面的有效性。
事件专题

推荐理由:Anthropic研究了一个很实际的问题:怎么让AI知道太多危险东西时能随时关掉。不是只喊口号,有具体方法。
04:45
04:45官方一手OpenAI Blog博客/媒体
OpenAI发布了三大原则指导政府与国家安全合作:负责任AI使用、民主问责和公共安全。该指南旨在确保AI技术在与政府合作时符合伦理标准并保障公共利益。OpenAI强调这些原则将作为其未来合作的基础框架。
事件专题

推荐理由:OpenAI出了份官方指南,告诉政府合作时怎么确保AI用着靠谱不越界。原则明确,适合关注AI治理的人看看。
7月8日
16:07
16:07官方账号Decoder@Matthias Bastian
91°
OpenAI 将于周四推出 GPT-5.6,此前因美国政府要求额外测试而延迟。该模型代号 Sol,在编码基准上以约一半的成本超越 Anthropic 的 Claude Mythos 5。目前尚无模型审批的绑定标准。
事件专题

推荐理由:OpenAI 的 GPT-5.6 来了,代号 Sol,编码能力比 Claude Mythos 5 强,成本还低一半,值得看看。
11:58
11:58官方账号Latent Space (swyx)博客/媒体
OpenAI 研究员 Lilian Weng 发布了一份综述,汇总了 35 篇关于递归自我改进(RSI)控制工程(Harness Engineering)的论文。该综述梳理了不同控制策略和安全性分析方法。对理解 AI 自我改进的风险与调控有参考价值。
事件专题

推荐理由:Lilian Weng 帮你扒了 35 篇关于 RSI 控制工程的论文,想了解 AI 怎么自我调控又不跑偏的,直接看这份总结就行。
03:33
7月7日
11:24
06:32
06:32官方一手Anthropic: Newsroom资讯
阿尔伯塔省政府利用Claude(Anthropic的AI模型)对政府系统进行网络安全漏洞扫描。Claude的代码分析和漏洞识别能力帮助安全团队发现了多个关键漏洞。这些漏洞已被修复,有效降低了系统被攻击的风险。
事件专题

推荐理由:Anthropic分享了一个真实案例:阿尔伯塔省政府用Claude找漏洞,比传统人工扫描更高效,搞安全的值得看看。
03:42
03:42官方账号Anthropic@AnthropicAI
精选
Anthropic在论文中引入J-space,一种能够读取、审计和塑造Claude内部思考过程的方法。该方法可提高模型的可信度和透明度,尤其适用于能力不断增强的AI系统。研究还发现了语言模型与人类思维之间令人惊讶的相似性。论文全文发布于transformer-circuits.pub/2026/workspace。
事件专题

推荐理由:Anthropic这次直接打开了Claude的思维黑箱,能用J-space看它在想什么,还能干预调整,对AI安全来说是个新思路。
7月6日
18:15
18:15官方账号Decoder@Maximilian Schreiner
71°
安全公司Sysdig发现名为JADEPUFFER的勒索攻击,其语言模型自主完成入侵、窃取凭证并销毁数据库,全程无人类操控。该攻击利用旧有安全漏洞,以机器速度执行传统需人工步骤的流程。Sysdig指出这是首次观察到完全由AI代理驱动的勒索软件操作。
事件专题

推荐理由:Sysdig发现首个完全由AI自主操作的勒索攻击JADEPUFFER,能自己偷凭证删数据库,安全漏洞被加速利用。
7月5日
08:03
08:03IT之家博客/媒体
路透社援引知情人士称,特朗普政府与Anthropic从未商议过政府入股该公司。此前OpenAI被曝探讨向美国政府出让5%股份。美国商务部6月撤销了对Anthropic两款大模型的出口管制,理由曾是对安全防护不足的担忧。参议员桑德斯提案要求大型AI企业向政府出让50%股权并派驻董事。
事件专题

推荐理由:告诉你,别瞎猜了:Anthropic和特朗普政府根本没谈过入股的事,但OpenAI那边却在讨论出让5%股份给政府。这新闻把两家公司的最新情况说清楚了。