事件专题 ·多源确认

GPT-6 Astra 在 Andon Labs 基准测试中表现优于 Claude Fable 5.1

GPT-6 Astra 在 Andon Labs 的 Vending-Bench 代理基准测试中,收入几乎达到 Claude Fable 5.1 的三倍。在无人机控制方面,Astra 是首个在所有五个子任务上都超越人类基线的模型,包括定位和跟踪单个人员。

当前结论

GPT-6 Astra 在 Andon Labs 的基准测试中表现更好,无人机控制能力更强。

11 个信源58° AI 热度最后更新 2026/9/13 10:52:16

证据链

11 个信源

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。