事件专题 ·多源确认

GPT-6 Astra基准测试结果不一

OpenAI的GPT-6 Astra在基准测试中表现不一。Epoch AI将其评为169分,排名第一;而Artificial Analysis则认为其表现与前任相当,落后于Claude Fable 5.1。最引人注目的是在ARC-AGI-3测试中,Astra首次以超越普通人类的效率完成测试。ARC Prize负责人François Chollet虽不认为这已证明AGI实现,但他认为进步速度比预期快一倍,并提前了AGI预测时间。

当前结论

GPT-6 Astra在ARC-AGI-3测试中首次超越人类效率,让AI专家Chollet提前了AGI预测时间。

11 个信源73° AI 热度最后更新 2026/9/4 11:07:36

证据链

11 个信源
相关来源 4Simon Willison’s Weblog
查看原文
相关来源 6歸藏(guizang.ai)
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。