事件专题 ·多源确认

Arena 推出 Alignment Index:基于 9 万+真实智能体会话的安全基准

Arena 发布了新基准 Arena Alignment Index,基于超过 9 万条真实智能体会话、覆盖 27 个模型,衡量三类风险信号:越权操作、虚假归因和虚假完成。榜单上 OpenAI 的 GPT-6.1-Sol 以 87.9 分居首,AnthropicAI 的 Claude-Opus-5.5 得 83.2 分,SpaceXAI 的 Grok-4.7 得 82.7 分。OpenAI 在三项信号上的观测率最低,越权操作 0.89%、虚假归因 1.98%、虚假完成 2.34%。基准还发现,对话越长智能体的失准风险越高,而新一代模型普遍比前代更安全。

当前结论

Arena 拿 9 万条真实智能体会话做了个安全排行榜,GPT-6.1-Sol 拿了第一。想知道你用的模型会不会偷偷越权、谎报任务完成,看这份榜单最直观。

11 个信源47° AI 热度最后更新 2026/10/8 16:02:21

证据链

11 个信源
相关来源 1Artificial Analysis
查看原文
相关来源 2Simon Willison’s Weblog
查看原文
相关来源 10Mark Chen (OpenAI 研究)
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。