主要来源lmarena.ai
查看原文事件专题 ·多源确认
Arena 推出 Alignment Index:基于 9 万+真实智能体会话的安全基准
Arena 发布了新基准 Arena Alignment Index,基于超过 9 万条真实智能体会话、覆盖 27 个模型,衡量三类风险信号:越权操作、虚假归因和虚假完成。榜单上 OpenAI 的 GPT-6.1-Sol 以 87.9 分居首,AnthropicAI 的 Claude-Opus-5.5 得 83.2 分,SpaceXAI 的 Grok-4.7 得 82.7 分。OpenAI 在三项信号上的观测率最低,越权操作 0.89%、虚假归因 1.98%、虚假完成 2.34%。基准还发现,对话越长智能体的失准风险越高,而新一代模型普遍比前代更安全。
当前结论
Arena 拿 9 万条真实智能体会话做了个安全排行榜,GPT-6.1-Sol 拿了第一。想知道你用的模型会不会偷偷越权、谎报任务完成,看这份榜单最直观。
11 个信源47° AI 热度最后更新 2026/10/8 16:02:21
证据链
11 个信源冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。