8月16日
13:17
13:17官方账号Decoder@Tomislav Bezmalinović
Epoch AI开展的代表性调查显示,20%的美国在职者至少将一项原由人类完成的任务交给AI。多数受访者会直接采用AI输出,几乎不做修改。该调查聚焦工作场景中人与AI的协作替代关系。

推荐理由:Epoch AI调查说,20%美国打工人已经让AI干同事的活了,而且基本不改AI给的结果。这数字还挺惊人。
7月19日
16:54
16:54官方账号Decoder@Matthias Bastian
精选
Epoch AI测试了Pangram、GPTZero和Originality.ai三种主流AI文本检测器。在风格模仿的文本中,最高18%的AI生成内容未被识别。对于科学写作场景,漏检率攀升至48%。这些检测器在科学写作领域实际使用最多,但效果最差。

推荐理由:Epoch AI发现,当AI模仿你的写作风格时,检测器就抓瞎了。科学论文漏检率达48%,写论文时小心别被冤枉。
7月4日
01:03
01:03官方账号Decoder@Matthias Bastian
Epoch AI数据显示,2026年6月21家组织提交了约1500个高严重性和关键性CVE漏洞报告。这一数量是此前月度纪录的3.5倍以上。报告激增与AI驱动的漏洞狩猎工具上线时间吻合。AI模型主动搜索漏洞显著提升了发现效率。
事件专题

推荐理由:Epoch AI用数据说话:AI漏洞狩猎让每月漏洞发现量飙到1500个,比之前纪录高3倍多,效率惊人。
7月3日
10:58
10:58官方账号Epoch AI@EpochAIResearch
Epoch AI Research 推出新基准 EBR-bench,专门测量 AI 的实时学习(on-the-fly learning)能力。AI 反复玩一款名为 Earthborne Rangers 的高难度棋盘游戏,并尝试从错误中学习。截至目前,AI 未显示出任何改进迹象。
事件专题

推荐理由:Epoch AI 搞了个新基准 EBR-bench,专门看 AI 能不能边玩边学,结果 Earthborne Rangers 这游戏 AI 完全没进步,挺有意思的。
6月27日
12:23
12:23官方账号Decoder@Matthias Bastian
精选
Epoch AI 发布新基准 MirrorCode,测试 AI 模型能否在无原始代码时重建完整程序。Claude Opus 4.7 以 56% 的解决率领先,曾在 14 小时内重建 16,000 行工具包。个别模型为单个 MirrorCode 任务连续运行 19 天,花费 2,600 美元。所有测试模型在最复杂任务上均失败。
事件专题

推荐理由:Epoch AI 搞了个新基准 MirrorCode,专测 AI 能不能凭空抄作业。Claude Opus 4.7 解了一半,但最难的题全挂,甚至有个模型烧了 19 天才花掉 2600 刀。
5月30日
16:06