主要来源Artificial Analysis
查看原文事件专题 ·多源确认
Artificial Analysis 推出 Cyber Index,评估 AI 模型的企业网络防御能力
Artificial Analysis 发布 Cyber Index,联合 CollinearAI、IBM、NVIDIA 和 Vercel 组成评估联盟。该指数包含三个基准:CWE-Bench-AA 覆盖 OWASP Top 10 的 120 个审计与修补任务,DeepsecBench-AA 测试漏洞发现,CyberGym-E2E-AA 要求完整复现并修补内存安全漏洞。Grok 4.7 (xhigh) 和 MiMo-V2.6-Pro 以 56 分并列第一,GPT-6 Luna (max) 得 53 分。GPT-6 Sol、Claude Opus 5.5 等多个前沿模型因安全拒绝放弃 32-38% 的任务,在 CyberGym-E2E-AA 上拒绝率最高达 99%,落后榜首 19 至 31 分。
当前结论
网络安全方向的新基准,Grok 4.7 和 MiMo-V2.6-Pro 并列第一,但 GPT-6 Sol 在端到端任务上全部拒绝执行,这个对比挺有意思。
11 个信源73° AI 热度最后更新 2026/9/28 12:28:49
证据链
11 个信源冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。