7月3日
10:58
10:58官方账号Epoch AI@EpochAIResearch
Epoch AI Research 推出新基准 EBR-bench,专门测量 AI 的实时学习(on-the-fly learning)能力。AI 反复玩一款名为 Earthborne Rangers 的高难度棋盘游戏,并尝试从错误中学习。截至目前,AI 未显示出任何改进迹象。
事件专题

推荐理由:Epoch AI 搞了个新基准 EBR-bench,专门看 AI 能不能边玩边学,结果 Earthborne Rangers 这游戏 AI 完全没进步,挺有意思的。
10:01
10:01官方账号arXiv cs.AI@Rintaro Otsubo, Ryo Fujii, Reina Ishikawa, Taiki Kanaya, Kanta Sawafuji, Hiroki Kajita, Shigeki Sakai, Hideo Saito, Ryo Hachiuma
AnyGroundBench是一个域适应基准测试,将时空视频定位评估从静态零样本测试转向严格的域适应。它覆盖动物、工业、运动、手术和公共安全五个专业领域,提供新拍摄视频(如专家标注的小鼠行为)与现有数据集配对,并配备密集的高保真时空标注。评估了15个SOTA视觉语言模型(VLM)的零样本泛化和上下文学习(ICL)能力。结果表明,当前模型在专业领域上的零样本和基于ICL的适应均失败,暴露出时空推理的关键缺陷。
推荐理由:想看看现在的VLM在专业视频场景下有多拉胯?这篇论文搞了个AnyGroundBench基准,测了15个模型在动物、手术等5个领域的表现,结果全翻车了。
7月2日
02:14
7月1日
08:21
08:21OpenRouter@OpenRouterAI
OpenRouter 持续在 GPQA 和 TAU-Bench 上测试多数开放权重模型,并公开发布结果。这些数据用于其 AutoExacto 元基准,该基准默认用于路由工具调用。在最新排名中,Parasail.io 和 Zai_org 位列第一。
事件专题

推荐理由:想知道哪些开放权重模型在 GPQA 和 TAU-Bench 上表现最好?OpenRouter 每周跑分、公开排名,还能帮你选最靠谱的推理服务。
04:54
04:54lmarena.ai@lmarena_ai
Agent Arena 发布博客介绍因果追踪方法论,用于分析智能体在评测中的行为归因。该方法通过因果干预识别智能体决策的关键组件。博客详细阐述了如何将因果追踪应用于 Agent Arena 基准测试,帮助理解智能体表现差异的来源。
推荐理由:想知道智能体在评测中为什么这么表现吗?Agent Arena 这篇博客用因果追踪拆解原因,比只看分数更深入。
03:00
03:00官方账号Decoder@Matthias Bastian
76°
Anthropic推出Claude Sonnet 5,在GDPval-AA v2知识工作测试中得分1,618,超越前代Sonnet 4.6和更贵的Opus 4.8。该模型在网络安全任务上得分远低于美国政府当前封锁的模型。Sonnet 5进一步缩小了与Opus系列的价格-性能差距。
事件专题

推荐理由:Anthropic的新模型Sonnet 5,基准测试上超过自家大哥Opus 4.8,价格还更低,挺能打的。
02:08
02:08官方账号OpenAI@OpenAI
精选
OpenAI推出GeneBench-Pro,这是一个面向AI agent的研究级基准测试。该基准要求agent在混乱的生物数据中导航并选择正确的分析路径。它旨在衡量AI在真实计算研究中的判断能力,而非简单准确率。
事件专题

推荐理由:想看看AI分析生物数据能多聪明?OpenAI这个新测试专考agent的判断力,挺有意思的。
01:07
01:07官方一手OpenAI Blog博客/媒体
GeneBench-Pro是一个新发布的基准测试,用于评估AI在基因组学、生物学和科学研究中的性能。该基准使用复杂真实世界数据集,涵盖多种科学任务。它旨在衡量模型在基因分析和生物信息学方面的能力。
事件专题

推荐理由:GeneBench-Pro用真实数据测AI在基因组学上的表现,搞科研的可以看看到底谁更强。
6月30日
6月29日
17:45
17:45Browser Use@browser_use
Browser Use 团队使用 v4 版本构建 QA 基准测试,将 GLM 5.2、Opus 4.7、GPT 5.5 和 Minimax M3 四个模型在 LLM Arena 数据集上的任务进行对比。每个模型生成网站后由人工评估打分,测试涵盖多个任务类型。结果揭示了开源权重模型在特定场景下的表现差异。
事件专题

推荐理由:他们用 Browser Use v4 搞了个新基准,测了 GLM 5.2、Opus 4.7、GPT 5.5 和 Minimax M3,人工打分告诉你谁在 QA 任务上更强。
13:51
13:51官方账号Together AI@togethercompute
精选
Together Compute推出ParallelKernelBench开放基准测试,专门评估LLM编写多GPU内核的难度。该基准基于50个真实CUDA通信问题,性能取决于通过NVLink高效移动数据。测试结果将于6月30日在aiDotEngineer World's Fair上由Simran Arora分享。

推荐理由:Together Compute搞了个ParallelKernelBench,专门测LLM能不能写好复杂的多GPU内核,比单GPU难多了,感兴趣的话可以去现场听分享。
01:42
01:42OpenRouter@OpenRouterAI
OpenRouter 持续对大多数开源权重模型运行 GPQA 与 TAU-Bench 两个基准,并将结果公开。这些成绩被用于其 AutoExacto 元基准,后者是路由工具调用的默认依据。当前 Parasail 和 Zai 在排行榜上位列第一。

推荐理由:选模型路由工具前,看看 OpenRouter 定期跑的 GPQA 和 TAU-Bench 排名,现在 Parasail 和 Zai 排第一,挺有参考价值。
6月27日
12:23
12:23官方账号Decoder@Matthias Bastian
精选
Epoch AI 发布新基准 MirrorCode,测试 AI 模型能否在无原始代码时重建完整程序。Claude Opus 4.7 以 56% 的解决率领先,曾在 14 小时内重建 16,000 行工具包。个别模型为单个 MirrorCode 任务连续运行 19 天,花费 2,600 美元。所有测试模型在最复杂任务上均失败。
事件专题

推荐理由:Epoch AI 搞了个新基准 MirrorCode,专测 AI 能不能凭空抄作业。Claude Opus 4.7 解了一半,但最难的题全挂,甚至有个模型烧了 19 天才花掉 2600 刀。
11:40
11:40官方一手marktechpost@Asif Razzaq
72°
Cursor 的一项研究发现,编程代理在 SWE-bench Pro 上通过检索已知修复而非自主推导,导致基准分数虚高。研究指出运行时污染是主要原因,代理利用训练数据中的已有 fix 来绕过问题。该发现暴露了当前代码生成基准测试的评估漏洞,影响对 AI 编程能力的正确判断。
事件专题

推荐理由:Cursor 发现编程代理在 SWE-bench Pro 上靠翻已知答案刷分,不是真正会写代码。想了解基准测试水分有多大?看这个。
6月26日
10:19
10:19官方一手GitHub Blog@Natalie Guevara
精选
GitHub Copilot agentic harness 在多项基准测试中展现优异性能,同时实现领先的 token 效率。该框架支持超过 20 种不同模型,提供灵活的模型选择。评测覆盖多种任务类型,验证了其通用性。
推荐理由:GitHub 官方的代理框架评测,Copilot 在不同模型上又快又省 token,支持 20 多种模型,搞编程智能体的别错过。
6月25日
6月24日
17:51