#Epoch AI
Epoch AI 做了个叫 InnovationEval 的基准,专门测 AI 智能体能不能自己搞出像样的后训练创新,目前结果挺拉胯的,想追自动化研究进展的可以看看。
Epoch AI 拿 OpenAI 自己公布的内部编程 Agent 使用数据做了趋势拟合,结论是开支每月翻倍,想知道 Agent 真实落地速度的可以看看。
Epoch AI 搞了个新基准,让 AI 看照片对照说明书找宜家家具装错的地方,GPT-6 Astra 拿了 80 分,还顺带测出了各家模型的不同毛病。
OpenAI 的 GPT-6 Astra 看一眼照片就能指出你 IKEA 柜子哪步装错了,准确率 80%,比半年前的 28% 高出不少。
Epoch AI 给了组狠数字:同性能下 AI 成本每季降 47%,比当年电力便宜 54 倍的速度下滑,值得对比下自己行业的降本曲线。
Epoch AI 搞了个叫 FAB 的新基准,让模型看宜家说明书加半成品照片找拼装错误,10 个月内最高分从 28% 冲到 80%。
Anthropic 的 Claude Mythos Preview 让 6 月高危漏洞报告数冲到纪录的 3.5 倍,抓虫效率惊人。
Epoch AI 搞了个新基准 EBR-bench,专门看 AI 能不能边玩边学,结果 Earthborne Rangers 这游戏 AI 完全没进步,挺有意思的。
Epoch AI 搞了个新基准 MirrorCode,让 AI 连续写几天代码,最强模型能干人类几周的活,想看看 AI 编程天花板在哪可以关注。
Epoch AI 搞了个新基准 MirrorCode,专测 AI 能不能凭空抄作业。Claude Opus 4.7 解了一半,但最难的题全挂,甚至有个模型烧了 19 天才花掉 2600 刀。