主要来源Jim Fan
查看原文事件专题 · 多源确认
论文基准:Codex > Claude > Kimi(物理世界)
在一项无法在物理世界中被攻破的基准测试中,OpenAI Codex 的表现超越 Anthropic Claude,而 Claude 又优于月之暗面 Kimi。该基准由 @DrJimFan 参与的论文提出,专注于物理世界的真实场景评估。结果显示了各模型在复杂物理任务上的相对排名。
当前结论
英伟达科学家发推说他们论文里 Codex 把 Claude 和 Kimi 都干掉了,还是物理世界实测,看看你家模型排第几。
11 个信源37° AI 热度最后更新 2026/6/16 21:51:37
证据链
相关来源 1宝玉
查看原文相关来源 2Gary Marcus
查看原文相关来源 3Decoder
查看原文相关来源 4kimmonismus
查看原文相关来源 5Lenny Rachitsky
查看原文相关来源 6berryxia
查看原文相关来源 7@koltregaskes
查看原文相关来源 8marktechpost
查看原文相关来源 9AI Will
查看原文相关来源 10arXiv: Anthropic
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。