7月30日
09:17
09:17官方账号arXiv cs.LG@Petr Simecek, Elnaz Babayeva, Jiri Balhar, Michal Bida, Michal Buran, Vaclav Cadek, Luigino Camastra, Tomas Dulka, Michal Janocko, Tomas Klohna, Pavel Kohout, Ondrej Kokes, Adam Krivka, Jakub Kubik, Patrik Mada, Igor Morgenstern, Marek Pavelka, Joshua Rogers, Petr Stastny, Jan Tattermusch, Dmitrijs Trizna, Martin Votruba, Guido Vranken, Jakub Zikl, Evelina Gabasova, Stanislav Fort
论文提出HoF-Bench基准,由AISLE发现的95个真实CVE组成,覆盖8个开源仓库。在严格协议下,一个最小化LLM分析器重新发现了65个CVE(68%)。10个检测骨干包括5个开源模型(21B-284B参数)和5个专有小模型,均无前沿模型参与。基准提供7,600条模型-CVE通过记录,用于比较漏洞扫描器的可靠性。数据集已在Hugging Face发布。
推荐理由:想看开源模型能不能真挖漏洞?这个基准用95个真实CVE测了10种模型,最弱的也能找回68%,数据很实在。
7月29日
19:59
19:59官方账号Decoder@Matthias Bastian
OpenAI 开源了 Codex Security CLI 工具,用于自动检测和修复代码仓库中的安全漏洞。该工具内部代号为 Aardvark,已帮助修复超过 3000 个关键安全漏洞。它与 Anthropic 的 Claude Security 直接竞争,双方都在用 AI 防御自动化网络攻击。
事件专题

推荐理由:OpenAI 开源了一个叫 Codex Security CLI 的命令行工具,能自动找代码漏洞并修复,已经修了 3000 多个高危漏洞,比 Claude Security 也不差。
7月28日
7月27日
10:57
10:57官方一手arXiv: DeepSeek@Deyu Yang, Rundong Wei, Xiaoqi Li
该论文提出一种结合漏洞聚焦代码切片、ERC-721 知识库和约束 DeepSeek 的 NFT 智能合约漏洞检测方法。在 450 个 NFT 合约样本上,完整配置的检测器给出了 437 个正标签,正标签率达到 97.1%。去除外部知识库后,正标签率降至 87.11%;进一步去除代码切片,正标签率降至 73.78%。结果表明,聚焦代码上下文和领域约束显著影响检测效果。
推荐理由:研究了一套专门针对 NFT 合约的漏洞检测方法,用 DeepSeek 加代码切片把准确率干到了 97.1%,比纯分析完整合约高了 23 个百分点。做合约安全的可以看看。
7月23日
6月23日
6月19日
02:52
02:52官方一手Cloudflare Blog@Grant Bourzikas
精选
Cloudflare博客详解其多阶段漏洞发现工具的技术架构,包括状态控制机制、通过对抗性审查将误报率降低90%的方法,以及如何绕过LLM上下文长度限制(如4k token限制)。该工具实现自动化分类,每日可处理超过10万条告警。文章还公开了其基于GPT-4的分阶段提示词模板和缓存策略。
推荐理由:Cloudflare公开了他们内部用的漏洞检测工具怎么做,从状态管理到对抗审查都讲了,想自己搭自动化安全工具的可以抄作业。
6月18日
09:23
09:23官方一手arXiv: DeepSeek@Zhengxiong Luo, Mehtab Zafar, Dylan Wolff, Abhik Roychoudhury
精选
Code-Augur提出安全规范优先范式,将漏洞检测智能体的隐性假设显式化为安全规范,并通过运行时反证持续细化。在真实项目上,Code-Augur比Claude Mythos等专用模型检测到更多漏洞。它基于Sonnet和DeepSeek等通用LLM构建,发现了22个关键开源项目的新漏洞。该方法通过模糊测试触发断言,揭示漏洞或修正规范,提升检测可信度。
推荐理由:这篇论文让AI漏洞检测不再黑箱——Code-Augur会生成明确的安全假设,再用模糊测试验证,已经在真实项目里挖出22个新漏洞,比专用模型还管用。
6月3日
01:29
01:29官方账号Decoder@Matthias Bastian
Anthropic 正在扩大其 Project Glasswing 项目,与超过 15 个国家的 150 个新合作伙伴合作,使用 Claude Mythos Preview 扫描关键基础设施的安全漏洞。现有合作伙伴已发现超过 10,000 个严重漏洞。同时,Anthropic 还通过 Claude Security 提供商业修复方案,从问题的两端获利。
事件专题

推荐理由:安全团队和基础设施运维者值得关注——Anthropic 用 AI 规模化扫描关键漏洞,已发现上万严重问题,同时提供修复方案,直接解决安全痛点。
6月2日
5月30日
16:48
16:48rohanpaul_ai@rohanpaul_ai
据路透社报道,日本三大银行将获得OpenAI最新模型及Anthropic Mythos的早期访问权限,用于安全测试。这些前沿AI模型在检测漏洞方面远优于前代,预计将帮助银行防御新型网络攻击。此举标志着金融行业在AI安全应用上的重要突破,也体现了日本对AI安全测试的重视。
事件专题

推荐理由:金融安全团队终于有了前沿AI武器——OpenAI和Anthropic的新模型专为漏洞检测优化,比旧模型强得多,做银行安全或金融AI应用的开发者值得关注。