主要来源Epoch AI
查看原文事件专题 ·多源确认
Epoch发布自动化评估报告
EpochAIResearch推出自动化评估报告,测试前沿模型在开放性任务上的表现。Claude Fable 5.1和GPT-6 Astra表现领先,但仍远未完全自动化Epoch的工作。评估任务基于Epoch自身的研究工作设计,具有现实性和开放性。
当前结论
Epoch用AI评估自己的工作,Claude和GPT-6表现最好但还不够
11 个信源58° AI 热度最后更新 2026/10/8 17:36:46
证据链
11 个信源冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。