17:43官方账号arXiv cs.AI@Jin Lu, Xuening Han, Yang Zhong, Lin Tan, Kevin Luo, Andrew Gacek, Neha RungtaVICBench 面向代码漏洞检测,包含 100 个经人工专家与智能体工作流双重验证的漏洞引入提交,对应 100 个 CVE,覆盖 88 个项目的 Python、Java、C++ 代码。该基准涵盖 48 种 CWE 类型,修复补丁平均 38.6 行,漏洞引入提交平均 252.5 行,复杂度高于此前数据集。评测中,现有最先进的 V-SZZ 和 LLM4SZZ 算法 F1 值仅为 33.3%-40.1%,表明自动化检测仍需大量人工介入。VICBench 能更可靠地评估漏洞检测方法的真实表现。论文VICBenchCVE漏洞检测推荐理由:VICBench 搞了个 100 个真实漏洞提交的基准,覆盖 Python/Java/C++,平均改动比旧数据集大不少,测漏洞检测用它更靠谱。原文稍后读已读值得跟进有用关注 VICBench