主要来源lmarena.ai
查看原文事件专题 · 多源确认
Grok-4.5 在 Agent Arena 排名第13,基于9.8K实时会话
SpaceXAI 发布 Grok-4.5,它是专为编程和智能体训练的首个模型。在 Agent Arena 排行榜上,Grok-4.5 从 Grok 4.3 的第29名升至第13名,基于9.8K个实时智能体会话评估。它在 Bash Recovery 任务上大幅提升,接近 Anthropic 和 OpenAI 模型,确认任务成功率显著提高。
当前结论
Grok-4.5 是 SpaceXAI 的首个编程+智能体专用模型,在 Agent Arena 上从29名跳到13名,Bash Recovery 追平了Claude和GPT,实测任务成功率很高。
11 个信源63° AI 热度最后更新 2026/7/13 18:00:35
证据链
相关来源 1宝玉
查看原文相关来源 2Greg Brockman
查看原文相关来源 3IT之家
查看原文相关来源 4AI Engineer
查看原文相关来源 5Geek
查看原文相关来源 6Sam Altman
查看原文相关来源 7Lovable
查看原文相关来源 8Ate-a-Pi
查看原文相关来源 9OpenAI
查看原文相关来源 10Anthropic
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。