7月15日
04:01
04:01官方账号Perplexity@perplexity_ai
精选
Perplexity AI 宣布开源其内部基准测试 WANDR,该基准用于评估计算机在深度与广度研究能力上的表现。WANDR 最初是为构建 Perplexity Computer 而开发的。开源后,开发者可利用此基准测试自己的模型或系统。目前该基准已发布在 research.perplexity.ai 上。
推荐理由:Perplexity AI 把他们自己用来测试 AI 研究深度的工具 WANDR 开源了,想测测自家模型的研究能力可以用它。
03:58
03:58官方账号Perplexity@perplexity_ai
精选
WANDR是一个评测基准,用于测试智能体发现大规模实体集并验证每个实体特定事实的能力。该基准提供密集且可解释的评估信号,能揭示智能体在哪个环节失败。其流程还可作为半自动训练数据工厂。由Perplexity AI发布。

推荐理由:Perplexity AI搞了个新评测WANDR,专门看智能体能不能找到一堆实体并核实每个的具体信息,比单一评分更清楚哪里不行。
03:55
03:55官方账号Perplexity@perplexity_ai
精选
Perplexity AI 引入了软分数(soft scores)和硬分数(hard scores)两种评估机制,软分数允许部分正确给分,硬分数要求成员完全正确。相关基准任务和评估工具已开源至 GitHub。这套方法为细粒度评估提供了新思路。
推荐理由:Perplexity AI 搞了个新评估方法,软硬分数区别很清晰,基准和工具都开源了,做评测的可以看看。
7月14日
09:31
09:31官方账号arXiv cs.AI@Siyi Chen, Jiahe Ying, Yixuan Jia, Yuxuan Gu, Enze Ye, Weimin Bai, Zhijun Zeng, Shaochi Ren, Binhong Gao, Yubing Li, Tianhan Zhang, He Sun
Imaging-101是一个包含57个专家验证的计算成像任务的基准,覆盖六个科学领域。每个任务基于同行评审论文,标准化为四个阶段(预处理、正向物理建模、逆求解、可视化)。基准设三个评估轨道(规划、函数级单元测试、端到端重建),测试了七个前沿LLM的系统性能力。结果发现LLM在算法选择、物理惯例处理和流水线集成方面存在具体短板。
推荐理由:这基准测试了LLM在科学计算成像编程上的真实水平,发现它们在算法选择和物理建模上容易出错,挺有参考价值。
03:15
02:30
02:30lmarena.ai@lmarena_ai
Grok-4.5在Agent Arena基准测试中总体排名第13,较此前提升5.0%。其幻觉指标排名第4,提升1.3%;确认任务成功排名第6,提升6.9%。Bash恢复排名第9,提升9.7%;表扬与投诉比例排名第12,提升6.1%。可操控性排名第15,提升0.9%。

推荐理由:xAI的Grok-4.5在Agent Arena进步明显,幻觉控制做到第4,任务成功提升近7%,适合关注智能体性能的朋友。
7月11日
08:32
7月10日
12:18
12:18官方账号arXiv cs.AI@Yifan Zhou, Qihao Yang, Yan Li, Donggang Li, Xiru Hu, Hokin Deng, Ziyang Gong, Xuanyi Zhou, Huacan Wang, Xiangchao Yan, Wanghan Xu, Wenlong Zhang, Shaofeng Zhang, Yue Zhou, Yifan Yang, Zhihang Zhong, Xue Yang
该论文提出IdeaGene-Bench (IG-Bench)基准,包含1,961条黄金谱系轨迹、1,085个Idea Genome对象和920个pairwise GenomeDiff记录,覆盖10个科学领域。IG-Exam含42个任务类型、1,029个实例,用于封闭式谱系推理;IG-Arena使用种群进化得分(PES)评估生成质量。在14个LLM科学家的测试中,最强系统仅达到27.3%的精确准确率,且结构化谱系上下文会打乱模型排名。该研究揭示了当前AI在科学思想继承与变异推理上的组合瓶颈。
推荐理由:这篇论文拿IdeaGene-Bench测了14个LLM,最强也只有27.3%准确率,而且加谱系信息反而搞乱排名。想看看AI离真正理解科学进化还有多远?读它。
06:49
06:49IT之家博客/媒体
91°
OpenAI 发布 GPT-5.6 系列,包含 Sol、Terra、Luna 三档模型,价格从每百万 token 输入 1 美元到 5 美元不等。旗舰版 Sol 在 Terminal-Bench 2.1 上标准模式得分 88.8%,超过 Claude Mythos 5 的 88.0%,开启 Ultra 模式后达 91.9%。微软 CEO 纳德拉宣布 Copilot Chat、Cowork、M365、GitHub 和 Foundry 同步上线该模型。
事件专题

推荐理由:OpenAI 出了 GPT-5.6 系列,分三档定价,最贵的 Sol 编程跑分超 Claude Mythos 5,微软 Copilot 也直接用上了。想试试新模型可以看看。
7月9日
21:37
21:37官方账号Decoder@Maximilian Schreiner
精选73°
OpenAI 审查了 SWE-Bench Pro 基准测试,发现约30%的任务存在缺陷。该公司已在官网上撤回对该测试的先前认可。SWE-Bench Pro 常被用于评估AI模型(如 GPT-4)的编程能力,但OpenAI指出许多任务存在数据污染或描述不清的问题。
事件专题

推荐理由:OpenAI自己查了SWE-Bench Pro,发现三成测试题有毛病,所以不认这个榜了。做AI编程的可以看看。
05:30
05:30官方账号OpenAI@OpenAI
精选78°
OpenAI对SWE-Bench Pro进行了审计,发现该基准存在约70%的噪音上限,已无法可靠衡量前沿编码能力。该基准在业界广泛使用,但目前已被认为饱和。OpenAI决定撤回之前推荐研究社区使用该基准作为主要编码评估的建议。
事件专题

推荐理由:OpenAI发现SWE-Bench Pro这个编码基准有70%噪音上限,已经饱和了,不再适合用来衡量最强AI编码能力。
05:27
05:27官方账号OpenAI@OpenAI
OpenAI 在推特上指出,随着编码模型不断进步,现有的评估基准已不足以衡量真实进展。他们强调需要设计更难的测试、更公平的对比和更可靠的结果。这条观点引发社区对当前基准如 SWE-bench 等是否仍有效的讨论。
事件专题

推荐理由:OpenAI 自己说现在的编码测试太简单了,得加点难度和公平性。搞 AI 写代码的可以看看基准怎么改。
03:12
03:12Qdrant@qdrant_engine
精选
Elastic的基准测试声称Qdrant 1.18.1在磁盘搜索上慢7倍,但Qdrant指出测试未开启其两项磁盘优化功能。开启优化后,Qdrant实现2倍吞吐量、一半延迟和1/3计算资源消耗。测试在K8s网络附加存储上进行,Elasticsearch 9.4.1使用DiskBBQ算法,Qdrant 1.18.1。Elastic延迟120-150ms,Qdrant在开启优化后延迟更低。
推荐理由:Qdrant刚发了博客回应Elastic的测试,发现对方没开它的优化功能,一开就反超了:吞吐量翻倍,延迟减半,计算资源只要三分之一。想选向量数据库的可以看看。
7月8日
22:25
22:25量子位@思邈
RoboDojo新基准测试发布,人类表现100分,最强AI模型仅获12.8分。该基准包含200个具身智能任务,覆盖抓取、导航、操作等场景。当前模型在长时序任务和细粒度控制上明显落后于人类。测试揭示了机器人在泛化能力和物理交互方面的核心瓶颈。
推荐理由:RoboDojo这个新基准把人类和模型放到同一考场,人类满分100,最强模型才12.8,差距大到离谱,值得看看模型到底在哪栽跟头。
12:15
12:15官方账号arXiv cs.AI@Chase McDonald, Nathan Tsang, Wesley N. Kerr
FootsiesGym 是基于 HiFight 的极简 2D 格斗游戏 Footsies 构建的开源环境,用于研究双人零和不完美信息游戏中的循环非传递策略互动。该环境提供向量化模拟器,可在标准硬件上实现高吞吐量训练。论文对多种强化学习算法进行了基准测试,并讨论了开放研究方向。代码已开源在 GitHub。
推荐理由:想研究格斗游戏AI?这个新基准FootsiesGym基于极简游戏Footsies,自带高效模拟器,适合强化学习训练和对比。
7月7日
11:07
11:07官方账号arXiv cs.AI@Zefeng Wang, Minxi Yan, Jinhe Bi, Sikuan Yan, Volker Tresp, Yunpu Ma
MetaSkill-Evolve提出双时间尺度框架,使智能体技能改进递归化:任务技能在快循环演化,元技能(分析、检索、分配、提议、进化五组件)在慢循环自我应用。在OfficeQA、SealQA和ALFWorld三个基准测试上,该方法相比无技能基线分别提升+23.54、+16.09和+1.92个点。所有组件共享单一冻结骨干模型,无需额外模型或目标。
推荐理由:这篇论文让AI智能体不仅能学技能,还能自动改进改进方法本身,在三个测试集上都有明显提升,挺有意思。
7月4日
01:36
01:36lmarena.ai@lmarena_ai
Anthropic重新部署的模型在Arena上通过Fable 5测试集,涉及60多项复杂3D生成、小游戏和世界构建任务。该模型由@petergostev进行评测,结果展示在YouTube视频中。测试覆盖了高难度3D场景生成和交互式世界构建。
事件专题

推荐理由:Anthropic的模型又升级了,一口气通过了60多项3D生成和世界构建测试,挺能打的。
7月3日
10:59