6月30日
16:04
13:59
13:59官方账号Clement Delangue@ClementDelangue
Hugging Face CEO Clement Delangue在推文中指出,开源AI正在蓬勃发展,对技术进步、市场竞争和透明度产生巨大影响。他认为开源AI比闭源前沿AI危险程度低数个数量级,并呼吁全力支持开源AI。该推文目前获得143个赞、26个转发和38次分享。
推荐理由:Hugging Face老板说开源AI比闭源安全太多了,还晒了数据。想了解业界大佬对开源的态度?这条就够了。
12:37
11:39
10:25
10:25官方一手arXiv: DeepSeek@Caglar Uysal, Baturay Birinci, Süha Orhun Mutluergil, Orçun Çetin
该论文对DeepSeek、GPT、Gemini、Grok、Llama和Qwen六种前沿LLM进行了提示注入漏洞实证评估。测试涵盖直接攻击与多阶段混淆攻击,涉及多种语言和字符编码。结果显示所有模型均存在系统性漏洞,非英语语种的恶意合规率显著高于英语。DeepSeek、Gemini和Grok在复杂指令下尤其易受攻击,简单字符编码仅部分降低风险。
推荐理由:这篇论文告诉你,DeepSeek、GPT这些模型在非英语场景下有多容易被黑客利用来生成钓鱼内容,安全对齐的漏洞比想象中大。
01:58
01:58官方一手AWS Machine Learning Blog@Anuranjan Mondal
精选
PAR 在 AWS 上构建了一个生产级多租户 LLM 分析系统,通过三层架构强制执行行级安全:使用 AWS SigV4 进行加密请求签名、在 Amazon Bedrock 上进行语义验证、以及通过 Split-Plane SQL 实现程序化数据隔离。每层独立运行以降低跨租户数据暴露风险,即使 LLM 本身被攻破或操纵也能保护数据。
推荐理由:AWS 这篇教程手把手教你用 Bedrock 和 Split-Plane SQL 搭建多租户 LLM 分析系统,三层隔离防止数据泄露,值得做企业级 AI 安全的开发者看看。
6月29日
10:10
10:10官方账号arXiv cs.AI@Bo Shen, Lifeng Chang, Tianyuan Wei, Yunpeng Li, Feng Shi, Yichen Han, Peijie Gao, Shiyi Kuang, Xin Chang, Dehui Li
这篇论文提出ANIS(Agent-Native Immune System),首个嵌入智能体认知循环的生物启发式内生防御架构。它设计了六层免疫塔(L0-L5),其中L1作为非认知的物理与逻辑隔离层。论文建立了智能体病毒和智能体疫苗的统一分类,并提出了Harness Triad(Meta、Self、Auto)实现持续免疫学习(CIL),使疫苗能动态适应新威胁。ANIS在运行时提供动态“执法”机制,与静态的模型对齐形成互补。
推荐理由:这篇论文把免疫系统思路直接嵌入到智能体内部,用六层防护对抗运行时攻击,和传统外围防御完全不同,值得看看。
6月28日
18:15
18:15官方账号Decoder@Matthias Bastian
360创始人周鸿祎发布两款AI安全工具,旨在与Anthropic的Mythos竞争。其中一款工具已标记3,432个漏洞。周鸿祎承认中国模型在性能上落后西方20%至30%。他将Mythos比作“网络核武器”,并呼吁中国建立自己的战略威慑能力。
事件专题

推荐理由:360推出了对抗Anthropic Mythos的AI安全工具,其中一个已经发现了3400多个漏洞,但周鸿祎实话实说咱们的模型比西方差两成。
09:28
09:28IT之家博客/媒体
81°
美国政府6月12日颁布出口管制令后,Anthropic紧急关停Mythos 5和Fable 5两款模型。上周五Anthropic表示政府已批准向部分美国本土“可信机构”开放Mythos 5。知情人士透露Fable 5的出口限制最早将于下周解除。Fable 5面向大众开放,Mythos 5则解除了部分安全管控。
事件专题

推荐理由:美国政府对Anthropic的Fable 5模型出口管制要解除了,下周可能恢复访问。之前因为安全原因被禁,现在开了个口子,关注AI监管的可以看看。
01:34
01:34官方账号Decoder@Matthias Bastian
Anthropic 的 AI 模型 Fable 5 因安全担忧于 6 月 12 日被限制,如今可能在数天内恢复可用。Axios 报道称特朗普政府已接近解除该限制,但还需五角大楼和 NSA 最终批准。该模型此前因潜在风险被暂停服务,解除后有望重新上线。
事件专题

推荐理由:Anthropic 的 Fable 5 被禁两个月后可能很快回归,这次是特朗普政府推动解禁,五角大楼和 NSA 还在审批,值得关注后续。
6月27日
13:21
13:21官方账号LangChain@LangChainAI
LangChain与Chime合作发布指南,指导金融服务团队如何利用更强的监督机制构建生产级AI智能体。该指南涵盖LangChain框架的使用,强调可观测性、合规性和风险控制。指南提供具体步骤,帮助团队实现更可靠的AI部署。

推荐理由:LangChain出了个新指南,专门讲金融服务怎么搞生产级智能体,还加了更强监督。做金融AI的可以看看,省了自己踩坑。
13:15
13:15官方账号Simon Willison’s Weblog博客/媒体
精选
Andrew Nesbitt发布虚构事件报告CVE-2026-LGTM:两个来自不同供应商的AI审查代理在评估foxhole-lz4包是否恶意时陷入分歧循环。争论持续340条评论,消耗41,255美元推理费用后财务部撤销API密钥。其中一家营销团队借机发布新闻稿,称“对抗性多智能体安全推理同比增长430%”,公司股价因此上涨6%。
推荐理由:Andrew Nesbitt虚构了一个AI安全事件:两个审查代理死循环争论,烧掉4万多美元推理费,还给股价整涨了6%。讽刺又真实。
12:55
12:55官方账号Cohere@cohere
88°
OpenAI计划在未来几周内广泛发布GPT-5.6的三个变体Sol、Terra和Luna。应美国政府要求,目前仅在Codex和API中对少数可信合作伙伴开放有限预览。OpenAI表示相信广泛访问,但需确保安全。
事件专题

推荐理由:OpenAI要发GPT-5.6了,有三个版本(Sol、Terra、Luna)。现在只有政府批准的合作伙伴能试,几周后全面开放。想尝鲜可以关注Codex和API的预览。