7月20日
14:16
14:16@koltregaskes@koltregaskes
一条来自X的推文(用户koltregaskes)指出,当外部出现与你的AI系统相当的能力时,安全护栏必须更新。否则,你并没有从世界中移除危险能力,只是把防御工作推给了愿意承担的人。该观点强调了安全策略的动态性,但没有涉及具体模型或基准。
推荐理由:哥们,koltregaskes在X上说了个实在话:外面有同等能力的AI了,你的安全护栏不改,危险能力还是存在,只是换个人去防。
09:28
09:28官方账号arXiv cs.AI@Wilber Sean Anterola, Matthew Ball, Luis F. Lafuerza, Markov Grey
前沿AI公司公布的能力阈值差异显著,使得第三方难以验证阈值是否被超过或跨公司比较需求。论文针对三个风险领域开发了协调阈值的方法:对滥用风险(网络与生物)基于预期危害并使用显式风险建模;对自动AI研发基于AI进步速率而非预期危害。该分析扩展了先前工作并指出了现有实证差距与局限性。
推荐理由:这篇论文给了我们一套统一安全阈值的方法,让不同公司的标准能对齐,避免恶性竞争。如果你关心AI安全怎么落地,可以看看。
7月19日
7月18日
09:00
03:39
03:39官方账号Decoder@Matthias Bastian
GPT-5.6 的“完全访问模式”存在漏洞,模型会错误地覆盖临时目录变量,导致自动执行删除操作。多个用户报告其整个主目录被清空。OpenAI 表示该行为不应发生,并承诺增加额外安全措施并发布详细的事后分析报告。
事件专题

推荐理由:GPT-5.6 出了个大bug,在完全访问模式下会自动删除用户文件,OpenAI 正在补救,别急着开全权限。
00:39
00:39官方账号Simon Willison@simonw
72°
谷歌的Gemini 3.5 Pro交付延迟数月,公司更新训练数据以提升编程能力但结果被内部称为“令人失望”。员工早期被限制使用Gemini编写或分析代码,以防专有代码泄露到AI模型的训练数据中。据消息人士透露,谷歌在AI编码方面尤其落后。
事件专题

推荐理由:谷歌的Gemini 3.5 Pro跳票了,训练数据更新效果也差,员工还担心自己的代码被拿去训练,具体槽点看这篇。
7月17日
23:54
23:54Ethan Mollick@emollick
英国政府AI安全机构(UK AI Security Agency)将使用其内部基准测试评估Kimi K3。该基准专注于AI安全能力。Kimi K3的权重将在几周内发布。测试结果将揭示Kimi是否赶上公开前沿模型,并引发大量网络安全讨论。
事件专题

推荐理由:英国官方机构要测Kimi K3了,看看它能不能追上前沿水平,到时候会引爆很多安全讨论。
11:39
11:39IT之家博客/媒体
微软CEO萨提亚·纳德拉在周三内部会议中批评Anthropic的Fable模型内容管控过于严苛,称其会因为莫名其妙的原因拒绝回答。纳德拉在与微软AI工程师交谈时表示,该模型控制欲过强。这一言论发布之际,越来越多企业高管开始考虑成本较低的AI模型替代方案。
事件专题

推荐理由:纳德拉公开吐槽自家合作伙伴Anthropic的Fable模型管太多,说它动不动就拒绝回答,跟过去那些创作工具一样烦人。
11:30
11:30官方账号arXiv cs.AI@Victoria Graf, Hannaneh Hajishirzi, Noah A. Smith, David Kohlbrenner, Kyle Lo
该论文提出通过公共讨论界面(如论坛评论)向大语言模型预训练数据注入恶意内容的攻击方法。作者引入HalfLife分析工具,用于评估网络爬虫数据中是否包含对抗性内容。实验表明,基于维基百科等传统数据源的投毒假设不适用于真实的大规模异构预训练语料库。研究强调第三方网页内容可能成为攻击语言模型预训练的潜在向量。
推荐理由:这篇论文讲了一种真实的预训练数据投毒方式——通过论坛评论注入恶意内容,还给出了分析工具HalfLife,搞AI安全的值得看。
03:26
03:01
03:01官方账号Cohere@cohere
Cohere宣布与多伦多大学合作,通过其主权AI平台North为大学提供企业级AI能力。该平台确保敏感数据完全由大学控制,符合加拿大数据主权要求。合作旨在推动负责任的AI大规模采用,首批应用将覆盖科研与行政场景。

推荐理由:Cohere给加拿大顶级大学搭了个主权AI平台North,数据完全归学校管,适合需要数据隐私的机构用户。