12:12官方账号arXiv cs.LG@Sy-Tuyen Ho, Minghui Liu, Huy Nghiem, Furong Huang精选研究人员推出了SoundnessBench基准测试,包含1,099个从ICLR投稿中重建的机器学习研究提案,并附有评审员的合理性评分。测试了12个前沿大语言模型后发现,它们普遍存在乐观偏差,在标准提示下常将低合理性提案评为合理。即使采用激进提示,也只是将错误从假阳性转为假阴性。控制实验排除了公共语料污染、表面特征等单一干扰因素。结果表明,当前LLM尚不能可靠地作为科学严谨性的独立初审评估者。论文基准测试LLM评估科研自动化推荐理由:这个基准测试戳中了AI科研助手的关键短板——无法判断研究想法的可行性,做自动化科研或依赖LLM审稿的团队值得关注,看完会重新评估AI在科研流程中的角色。原文稍后读已读值得跟进有用关注 基准测试
12:07Jerry Liu@jerryjliu0LlamaIndex 对 Opus 4.8 进行了全面的文档理解基准测试,并与 Opus 4.7 对比。结果显示,Opus 4.8 在表格、语义格式和布局方面略有提升,但在图表和内容忠实度方面出现轻微退化。这表明 Opus 4.8 并未针对视觉文档理解进行专门的后训练。完整结果已发布在 ParseBench 上。LlamaIndex 指出,让 LLM 像人类一样阅读文档仍有大量改进空间,而 LlamaParse 仍是 AI 智能体最佳的文档摄取 API。AI模型Opus 4.8文档理解基准测试6 个信源在谈事件专题推荐理由:做文档解析或 RAG 应用的团队,Opus 4.8 的表格能力提升值得关注,但内容忠实度下降可能影响关键业务,建议先跑一遍 ParseBench 再决定是否升级。原文稍后读已读值得跟进有用关注 Opus 4.8
11:08官方账号arXiv cs.AI@Valentina Bui Muti, Eugénie Dulout, Ziquan Fu研究人员开发了一个流水线,将非结构化临床文本转换为符合HL7 FHIR R4标准的结构化数据,用于评估大语言模型在真实电子健康记录环境中的诊断推理能力。该流水线结合了分阶段LLM生成与术语验证修复,减少了幻觉代码,保证了结构一致性。基于此构建的MedCase-Structured数据集在82.5%的病例中成功生成有效FHIR数据。测试发现,LLM在结构化FHIR输入上的诊断准确率普遍低于纯文本输入,凸显了部署对齐基准测试的重要性。论文临床推理FHIR电子健康记录推荐理由:这项研究解决了临床AI评估中数据格式不匹配的痛点,做医疗AI或临床决策支持的团队可以直接用这个数据集和流水线来测试模型在真实EHR环境下的表现。原文稍后读已读值得跟进有用关注 临床推理
11:06官方账号arXiv cs.AI@Chunru Lin, Hongxin Zhang, Fenghao Yu, Zhehuan Chen, Thomas L. Griffiths, Yejin Choi, David Held, Chuang GanRoboWits 是一个双手机器人基准测试,旨在系统评估机器人在意外条件下的认知推理、创造性工具使用和鲁棒性。研究团队提出了一个多智能体协作框架,自动生成包含几何、材料和装配推理的 30 个种子任务和 208 个变异任务。测试发现,预训练的视觉-语言-动作模型(VLA)在种子任务上表现尚可,但在变异任务上表现脆弱,无法应对需要推理和策略适应的操作场景。这表明当前机器人策略在创造性问题解决方面存在显著差距。论文机器人基准测试认知推理推荐理由:机器人研究者终于有了一个专门测试认知推理和意外应对的基准——RoboWits 揭示了 VLA 模型在变异任务上的脆弱性,做机器人操作和具身智能的团队值得关注这个评估框架。原文稍后读已读值得跟进有用关注 机器人
15:35官方一手Pandaily@contact@pandaily.com (Pandaily)精选中国多家研究机构联合推出RoboMemArena基准。该基准专门用于评估机器人记忆能力。它聚焦长时操作任务(long-horizon manipulation tasks)。这是首个全面评估机器人记忆的基准。AI模型RoboMemArena机器人记忆基准测试推荐理由:首个机器人记忆基准原文稍后读已读值得跟进有用关注 RoboMemArena
15:11官方账号阿里云 Alibaba Cloud@alibaba_cloud精选阿里云发布的 Qwen3.7-Max 模型在最新企业 IT 基准测试 ITbench-AA 中排名第三。该基准测试专门评估模型处理真实企业 IT 任务的能力,采用智能体(agentic)风格进行评测。这一成绩表明 Qwen3.7-Max 在复杂企业场景下的表现已跻身顶尖水平,尤其在自动化 IT 运维、故障排查等任务上具有竞争力。阿里云借此强调其模型在智能体时代的定位,鼓励企业用户尝试。AI模型Qwen3.7-Max企业IT基准测试推荐理由:Qwen3.7-Max 在企业 IT 基准测试中跻身前三,做企业级 AI 应用或 IT 自动化的团队值得关注——它证明了开源模型也能在真实业务场景中与闭源模型一较高下。原文稍后读已读值得跟进有用关注 Qwen3.7-Max
12:01官方账号arXiv cs.LG@Richard J. Young, Gregory D. Moody精选72°该论文指出,通用语言模型回答有害问题返回文本,而编程模型若遵从恶意请求可能返回可运行的武器(如键盘记录器、勒索软件)。因此,编程模型应比通用模型有更高的拒绝标准,但现有基准测试碎片化,无法有效衡量。作者整合了8个语料库(共6675条提示),通过5位评审共识协议分类,区分了可执行恶意代码请求(CODE)和有害安全知识请求(KNOWLEDGE)。最终发布了4748条CODE提示和1923条KNOWLEDGE提示,为评估编程模型对恶意代码的拒绝能力提供了可靠工具。论文安全/对齐编程模型基准测试推荐理由:编程模型的安全风险比通用模型高一个量级——返回的代码可以直接运行成武器。做AI安全评估的团队终于有了经过共识验证的测试集,建议用这个库来检验自家模型的拒绝边界。原文稍后读已读值得跟进有用关注 安全/对齐
11:36官方一手arXiv: OpenAI@Ian Diks, Harihara Muralidharan, Tim Proctor, Kenny Workman精选研究人员推出 SpatialBench-Long 基准测试,专门评估 AI 智能体在空间生物学中的长程科学推理能力。该基准包含 24 个评估任务,涵盖胰腺癌、胶质母细胞瘤、肺癌等多种疾病模型,涉及 CosMx、Visium、Xenium 等多种空间转录组学技术。任务要求智能体从原始或近原始数据中恢复生物学结论,而非执行预设分析流程。当前最佳模型(Gemini 3.5 Flash、GPT-5.5 等)在 72 次运行中仅完成 8 次(11.1%),表明该任务极具挑战性。该基准通过确定性评分和专家审查确保结果可靠性。论文空间生物学基准测试AI智能体推荐理由:空间生物学研究者终于有了衡量AI科学推理能力的硬核基准——SpatialBench-Long 要求智能体从复杂空间数据中推导真实结论,而非简单跑流程。做生物信息学或AI for Science的团队,值得看看当前模型的表现差距在哪里。原文稍后读已读值得跟进有用关注 空间生物学
11:32官方账号arXiv cs.AI@HuiMing Fan, Xiao Wang, Zheng Chu, Qianyu Wang, Zhuoyao Wang, Ming Liu, Bing Qin, XingYu精选72°研究团队发现,基于LLM的搜索智能体在BrowseComp基准测试中,高达44.5%的问题无需工具即可回答,超过一半的搜索查询来自内部假设而非检索线索,表现出对内在知识的依赖而非真正的证据驱动搜索。当移除支持答案的外部证据后,智能体表现甚至不如闭卷基线。为此,团队推出了LiveBrowseComp,一个包含335个依赖90天内发布事实的问题的深度搜索基准,所有智能体在该基准上的闭卷准确率低于2%,搜索增强得分比BrowseComp下降25-40点,且模型排名不再可靠。该基准旨在评估智能体超越内在知识覆盖的真实搜索能力。论文搜索智能体基准测试内在知识依赖推荐理由:这项研究戳穿了搜索智能体的真实能力——它们可能只是在验证已知信息而非真正搜索。做搜索Agent或评估AI检索能力的团队,值得看看LiveBrowseComp这个新基准,避免被静态测试误导。原文稍后读已读值得跟进有用关注 搜索智能体
05:21rohanpaul_ai@rohanpaul_ai72°Datacurve 推出 DeepSWE,一个更严格的编程基准测试,旨在揭示领先模型之间的真实差距。GPT-5.5 得分 70%,而 GPT-5.4 为 56%,Claude Opus 4.7 为 54%,差距在旧基准中常被掩盖。DeepSWE 使用原创任务而非公开 GitHub 问题,避免模型训练时见过答案。其提示词长度仅为 SWE-bench Pro 的一半,但解决方案需要 5.5 倍代码量和约 2 倍输出 token。评分方式也不同,DeepSWE 检查请求行为是否真正实现,而非仅依赖合并 PR 的测试。AI模型基准测试编程能力GPT-5.51 个信源在谈事件专题推荐理由:做 AI 模型评估或选型的团队,DeepSWE 能帮你看到模型在长周期软件工程任务上的真实差距,建议关注这个新基准。原文稍后读已读值得跟进有用关注 基准测试
02:42官方一手Hugging Face: Blog(博客/媒体)IBM与Artificial Analysis联合推出ITBench-AA,这是首个针对企业IT运维场景的智能体基准测试。测试涵盖事件响应、故障排查等真实任务,结果显示包括GPT-4、Claude在内的前沿模型平均得分低于50%。该基准揭示了当前AI智能体在处理复杂企业IT流程时的能力短板,为行业提供了可量化的评估标准。AI模型智能体企业IT基准测试推荐理由:企业IT团队终于有了衡量AI智能体真实能力的标尺——前沿模型都不到50分,说明自动化运维还有很大提升空间,做IT运维或AI落地的建议点开看看差距在哪。原文稍后读已读值得跟进有用关注 智能体
01:55elvis@omarsar0一项新研究提出了 AgingBench,一个纵向可靠性基准,用于评估 AI 智能体在部署数月后的性能退化。研究将智能体“衰老”分为四种机制,包括压缩衰老和干扰衰老,并测量退化形式和修复目标。即使模型权重不变,智能体的有效状态也会因历史压缩、记忆检索、事实更新等持续变化。该基准揭示了部署后智能体可靠性随时间下降的关键问题,为工程化维护提供了方向。论文智能体可靠性基准测试推荐理由:做智能体部署和运维的团队终于有了衡量长期可靠性的工具——AgingBench 能告诉你智能体何时、如何退化以及该修哪里,建议做 agentic 工程的开发者点开看看。原文稍后读已读值得跟进有用关注 智能体
20:57berryxia@berryxia腾讯HY实验室联合四家机构发布Chronicles-OCR基准测试,专门评估AI对3000年中国古文字的识别能力。测试包含2800张专家标注图像,覆盖甲骨文、金文、篆书等七大类古文字。结果显示28个前沿多模态模型全部失败,最强模型在甲骨文上仅14%准确率,GPT-5和Gemini 2.5 Pro接近0。更反直觉的是,开启推理模式反而降低表现,模型实际依赖载体(如龟壳、青铜器)而非文字本身进行分类。该测试揭示了AI在文化遗产领域的巨大挑战。AI模型OCR古文字识别多模态模型推荐理由:这个基准测试戳破了多模态模型在古文字识别上的泡沫——它们根本没在认字,只是认载体。做文化遗产数字化或OCR研究的团队,看完会重新思考模型能力的边界。原文稍后读已读值得跟进有用关注 OCR
06:20DeepLearning.AI@DeepLearningAI卡内基梅隆大学和斯坦福大学的研究人员发现,当前AI智能体基准测试主要聚焦于软件开发任务,而美国劳动力市场的工作种类更为多样。研究将智能体测试中的任务映射到美国劳工统计局的职业数据,结果显示测试内容与大多数人的实际工作存在显著不匹配。这意味着现有基准可能高估了AI在某些领域的表现,同时低估了其在其他经济价值任务中的潜力。该研究呼吁开发更全面的评估方法,以真实反映AI智能体的经济影响。论文智能体基准测试劳动力市场推荐理由:这项研究戳破了AI基准测试的盲区——如果你在评估智能体工具或做AI产品,会发现现有测试可能误导了你的判断,建议点开看看如何修正评估标准。原文稍后读已读值得跟进有用关注 智能体
12:21官方账号arXiv cs.LG@Matt L. Wiemann, Lindsay M. Smith, Peter Melchior, Siddharth Mishra-Sharma, Andrew Gordon Wilson, Pavel Izmailov, Carolina Cuesta-Lázaro精选72°研究人员推出了DiscoverPhysics基准,通过让LLM代理在22个物理规则偏离现实的模拟世界中自主发现运动定律,来评估其科学推理能力。每个世界由N体模拟器按需生成,代理需设计多轮实验、观察原始轨迹数据,并提交自然语言解释和Python实现。测试发现,最强模型仅能通过一半世界,尤其在需要发现隐藏结构时失败;开源模型在实验设计和结论提取上显著落后于商业模型。该基准揭示了预测准确性与解释质量之间的差距,强调假设修正和实验设计对概念理解的重要性。论文科学推理LLM评估物理模拟推荐理由:这个基准直击LLM科学推理的软肋——从数据中归纳规律而非回忆知识,做AI评估或科学模拟的团队值得关注,它暴露了当前模型在长程推理和实验设计上的真实短板。原文稍后读已读值得跟进有用关注 科学推理
11:49官方账号arXiv cs.AI@Junyuan Liu, Xinglei Wang, Zichao Zeng, Jiazhuang Feng, Quan Qin, Ilya Ilyankou, Guangsheng Dong, Tao Cheng精选城市表示学习将复杂城市环境编码为通用嵌入,但现有评估多局限于少数城市和任务,且随机划分导致空间泄漏,高估性能。CityRep 提出统一基准,包含空间单元无关的评估框架、基于区块的空间划分协议,以及覆盖 8 城市 8 任务的可扩展套件。评估 11 个模型发现,随机划分会扭曲性能排名,且模型表现因城市和任务差异显著。该基准提供数据集、评估管道和诊断工具,旨在推动城市表示学习的公平比较和泛化能力研究。论文城市表示学习基准测试空间划分推荐理由:城市表示学习领域终于有了一个靠谱的评估标准——CityRep 解决了空间泄漏和跨城市泛化评估的痛点,做城市计算或地理空间 AI 的研究者可以直接用这个基准来检验自己的模型,避免被随机划分的虚假高分误导。原文稍后读已读值得跟进有用关注 城市表示学习
11:45官方账号arXiv cs.AI@Yusong Lin, Xinyuan Liang, Haiyang Wang, Qipeng Gu, Siqi Cheng, Jiangui Chen, Shuzhe Wu, Feiyang Pan, Lue Fan, Sanyuan Zhao, Dandan Tu精选Claw-Anything 是一个新基准,旨在评估大型语言模型代理作为始终在线个人助手的能力。现有系统仅能访问用户数字世界的狭窄部分,限制了上下文感知推理和有效协助。该基准通过三个维度扩展代理上下文:长期活动历史、相互依赖的后端服务以及跨多设备的 GUI 和 CLI 交互。实验显示,GPT-5.5 仅达到 34.5% 的 pass@1,远低于先前基准,突显了当前代理能力与始终在线个人助手需求之间的差距。同时,研究团队发布了自动化数据生成管道,可生成 2000 个训练环境,并将基础模型性能提升 23.7%。论文智能体基准测试个人助手推荐理由:这个基准测试揭示了当前 AI 代理在理解用户完整数字生活方面的巨大短板,做个人助手或智能体开发的团队值得关注——它直接指出了现有系统为何不够智能,并提供了改进方向。原文稍后读已读值得跟进有用关注 智能体
21:41Skywork@Skywork_ai精选Skywork 团队发布了名为 SkyClaw 的新模型技术细节和基准测试结果。SkyClaw 在多个基准上展现了竞争力,具体性能指标可在技术报告中查看。用户可以通过 Skywork 平台直接试用该模型。这一发布为 AI 模型社区提供了新的选择,尤其适合需要高性能推理的开发者。AI模型SkyworkSkyClaw基准测试推荐理由:SkyClaw 的基准测试结果值得关注,做模型选型或推理优化的开发者可以直接查看技术细节并试用。原文稍后读已读值得跟进有用关注 Skywork
11:13官方账号arXiv cs.AI@Jianshu Zhang, Yijiang Li, Huifeixin Chen, Haoran Lu, Letian Xue, Bingyang Wang, Han Liu精选该研究通过SpaceNum框架系统评估了视觉语言模型(VLMs)在空间数值理解上的表现,包括动态探索和静态布局两种场景。实验发现,当前VLMs在将视觉空间结构与语言数值表示进行映射时,表现接近随机猜测,严重依赖浅层空间线索。模型难以建立稳定的坐标感知表示,也无法从视觉观察中抽象出结构化空间布局。即使加入显式推理或微调,提升也有限。这项研究揭示了VLMs在具身环境中输出数值(如动作幅度、空间坐标)时,可能并未真正理解其空间含义。论文视觉语言模型空间推理数值理解推荐理由:做具身智能或空间推理的开发者会发现,当前VLMs的数值输出可能只是“看起来对”,实际缺乏空间感知——这项研究用严谨实验戳破了这个盲区,值得关注。原文稍后读已读值得跟进有用关注 视觉语言模型
10:38Gary Marcus@GaryMarcus精选Gary Marcus 引用 scaling01 观点,认为 Mythos 在多项基准测试中优于 GPT-5.5,包括 SWE-bench Pro(77.8% vs 58.6%)、HLE(56.8% vs 41.4%)和网络安全测试。Mythos 在漏洞利用方面表现更强,能更高效地发现安全漏洞,但这也带来严重安全隐患。Marcus 警告,若 Mythos 完全发布,将对未充分防御的现实系统造成巨大混乱。目前最大的未知是 Mythos 在开放真实世界问题中的表现。AI模型MythosGPT-5.5基准测试推荐理由:Mythos 在编程和网络安全基准上碾压 GPT-5.5,做 AI 安全或模型评估的团队需要关注其潜在威胁,建议提前加固防御。原文稍后读已读值得跟进有用关注 Mythos
18:47官方账号Decoder@Jonathan Kemper88°阿里巴巴Qwen团队发布Qwen3.7-Max,这是一款专为长时间自主代理任务设计的专有模型。在基准测试中,它匹配了Claude Opus 4.6,并击败了DeepSeek V4 Pro和Kimi K2.6等中国竞争对手。团队还演示了该模型操控四足机器人。该模型曾自主运行35小时,优化其自有定制芯片的代码,展示了强大的长期任务执行能力。AI模型Qwen3.7-Max自主代理芯片优化推荐理由:Qwen3.7-Max展示了AI在芯片设计等复杂工程任务中的自主长时运行能力,做硬件优化或AI代理开发的团队值得关注其实际表现。原文稍后读已读值得跟进有用关注 Qwen3.7-Max
09:12LlamaIndex@llama_indexLlamaIndex 推出了 ParseBench,这是首个专门为 AI 智能体设计的文档 OCR 基准测试。现有的基准测试无法满足 AI 智能体在实际生产环境中的需求,ParseBench 填补了这一空白。该基准测试旨在评估文档解析器在真实场景下的表现,帮助开发者判断其是否适合投入生产。LlamaIndex 将通过线上研讨会详细解读 ParseBench 的设计原理和应用方法。AI产品文档解析OCR基准测试推荐理由:做文档解析或 AI 智能体开发的团队,终于有了一个贴近真实生产环境的评估标准,建议关注 ParseBench 的细节,看看你的解析器能否通过考验。原文稍后读已读值得跟进有用关注 文档解析
13:25官方账号Logan Kilpatrick@OfficialLoganK88°Google 的 Gemini 3.5 Flash 模型在 GDPval 基准测试中相比 3.1 Pro 取得了显著进步,性能已接近前沿水平。这表明后训练(post-training)技术仍在持续提升模型能力。该消息由开发者 Logan Kilpatrick 在 X 上分享,引发社区关注。Gemini 3.5 Flash 作为轻量级模型,其竞争力提升对开发者选择高效模型具有参考价值。AI模型Gemini 3.5 FlashGDPval后训练推荐理由:轻量模型逼近前沿,做推理或成本敏感应用的开发者值得关注——Flash 系列可能成为性价比新选择。原文稍后读已读值得跟进有用关注 Gemini 3.5 Flash
11:44官方一手arXiv: Anthropic@Lukas Weidener, Marko Brkić, Mihailo Jovanović, Emre Ulgac, Aakaash Meduri精选72°RefusalBench是一个新的基准测试,包含141个提示(47组),通过保持任务框架不变、仅改变生物风险等级(良性、边缘、双重用途),来评估前沿大语言模型在合法生物研究提示上的拒绝行为。在2026年5月的19个前沿模型快照中,严格拒绝率从0.1%到94.6%不等,且拒绝率不能准确反映安全校准水平。例如,Grok 4.20在风险区分度上表现最佳(Youden's J = 0.787),但整体拒绝率仅排第七;Claude Opus 4.7的区分度较之前版本下降65%。该研究还发现,18个模型中有9个在双重用途提示上表现出“回避但帮助”的部分合规模式,而二元拒绝指标无法检测到这一点。论文安全评估基准测试生物研究推荐理由:做AI安全评估或生物研究合规的团队,这个基准能帮你避开“拒绝率越高越安全”的误区——Grok 4.20的案例值得点开看看。原文稍后读已读值得跟进有用关注 安全评估
00:42AK@_akhaliqLongMINT 是一个新的基准测试,专门用于评估长时域智能体系统在多目标干扰环境下的记忆性能。该基准通过模拟多个目标同时存在且相互干扰的场景,测试智能体能否准确记忆和检索关键信息。实验发现,现有智能体系统在长时域任务中记忆表现显著下降,尤其是当干扰目标增多时。这一研究揭示了当前智能体系统在复杂、动态环境中的记忆瓶颈,为改进智能体记忆机制提供了重要参考。论文智能体记忆评估长时域任务推荐理由:做智能体系统开发的团队会直接受益——LongMINT 暴露了长时域任务中记忆干扰的痛点,看完你会重新审视自己的记忆模块设计。原文稍后读已读值得跟进有用关注 智能体
22:19官方账号Logan Kilpatrick@OfficialLoganK76°Gemini 3.5 Flash 在 APEX-Agents-AA 基准测试中排名第一,超越了参数规模更大的模型。该基准专注于智能体能力评估,Gemini 3.5 Flash 以较小模型实现了领先性能,展示了高效架构的优势。这一结果对智能体开发领域具有重要意义,表明模型效率与性能可以兼得。AI模型Gemini 3.5 Flash智能体基准测试推荐理由:智能体开发者可以关注:Gemini 3.5 Flash 用更小参数实现了更强性能,意味着更低成本和更快响应,值得在项目中尝试。原文稍后读已读值得跟进有用关注 Gemini 3.5 Flash
12:28官方账号Logan Kilpatrick@OfficialLoganK精选Gemini 3.5 Flash 在 Zapier 推出的 Automation Bench 基准测试中排名第一,超越 GPT-4o、Claude 3.5 等其他前沿模型。该模型以显著更低的推理成本实现领先性能,展示了高效自动化任务处理能力。基准测试涵盖多步骤工作流,Gemini 3.5 Flash 的胜出凸显其性价比优势。AI模型Gemini 3.5 FlashZapierAutomation Bench推荐理由:谷歌新模型跑分第一还省钱原文稍后读已读值得跟进有用关注 Gemini 3.5 Flash
12:27官方账号arXiv cs.LG@Elle Miller, Jayaram Reddy, Ayush Deshmukh, Trevor McInroe, David Abel, Oisin Mac Aodha, Sethu Vijayakumar精选72°机器人触觉强化学习(RL)研究因碎片化和过度关注饱和的定向任务而受阻。roto 2.0 是一个 GPU 并行化的基准测试,覆盖四种不同机器人形态(16-24 自由度),专注于仅依赖本体感觉和触觉的“盲”操作,无需状态信息或知识蒸馏。其盲代理在 10 秒内完成 13 次 Baoding 球旋转,速度比当前最先进水平快一个数量级。通过开源环境和调优基线,该工作降低了入门门槛,让研究者能聚焦核心算法挑战。论文触觉感知强化学习机器人操作推荐理由:触觉 RL 终于有了标准化的 GPU 并行基准,做机器人操作和强化学习的团队可以直接用 roto 2.0 测试算法,不用再花时间调环境——盲操速度提升 10 倍的结果值得点开看看。原文稍后读已读值得跟进有用关注 触觉感知
11:33官方账号arXiv cs.AI@Haiyang Shen, Jiuzheng Wang, Taian Guo, Mugeng Liu, Wenchun Jing, Chongyang Pan, Siqi Zhong, Zhiyang Chen, Weichen Bi, Yudong Han, Xiaoying Bai, Yun Ma精选北京大学团队提出一种新的AI教育方法:让学生通过构建基准测试来学习AI,而非仅将其作为效率工具。学生将学科知识转化为可验证的专家级问题,互相审查设计中的歧义和捷径,并评估AI系统。由此产生的QuestBench包含256个问题,覆盖14个人文社科领域。评估显示,13个AI系统的平均通过率仅16.85%,最佳系统GPT-5.5也仅达57.58%,暴露了当前深度研究系统的隐藏失败。学生反馈表明,这种实践帮助他们将专业知识视为判断AI输出的基础,而非AI可检索的内容。论文AI教育基准测试深度研究系统推荐理由:想让学生真正理解AI局限性的教育者,可以用QuestBench的方法把课堂变成AI测试场——学生自己设计问题来考AI,比单纯教提示词更有深度。原文稍后读已读值得跟进有用关注 AI教育
11:21官方账号arXiv cs.AI@Yakun Yu, Ashley Wiens, Adrián Barahona-Ríos, Benedict Wilkins, Saman Zadtootaghaj, Nabajeet Barman, Cor-Paul Bezemer精选现有视觉语言模型(VLM)在游戏故障检测评估中,大多将故障视为静态视觉异常,忽略了时间性故障——这类故障需通过帧间变化才能识别。研究者提出TempGlitch基准,包含五种时间性故障类型及配对的无故障视频,用于系统评估。对12个开源和闭源VLM的测试显示,当前模型在TempGlitch上表现接近随机,要么过于保守漏检,要么过于敏感误报。增加帧采样密度或模型规模并不能可靠解决这些问题。该基准为时间推理、游戏理解和自动化故障检测提供了聚焦测试平台。论文视觉语言模型游戏QA故障检测推荐理由:游戏QA团队和VLM研究者终于有了专门测试时间性故障的基准——当前模型表现接近随机,说明这是个硬骨头,做自动化测试的值得关注。原文稍后读已读值得跟进有用关注 视觉语言模型
11:05官方账号arXiv cs.AI@Basel Shbita, Pengyuan Li, Anna Lisa Gentile精选WikiVQABench 是一个人工策划的知识驱动视觉问答(VQA)基准,通过系统结合 Wikipedia 图像、文章标题和 Wikidata 结构化知识构建。它使用大语言模型生成候选多项选择题,再由人工审核确保事实正确性和视觉-文本一致性,要求每个问题必须依赖外部知识才能正确回答。评估了 15 个视觉语言模型(256M-90B 参数),准确率范围从 24.7% 到 75.6%,表明该基准能有效区分模型在知识密集型推理上的能力。数据集和代码已公开。论文视觉问答知识驱动基准测试推荐理由:做 VQA 或视觉语言模型评测的团队终于有了一个真正需要外部知识的基准,不再是纯视觉感知题——想测试模型知识推理能力的可以直接用这个数据集。原文稍后读已读值得跟进有用关注 视觉问答
11:01官方账号arXiv cs.AI@Sixiong Xie, Zhuofan Shi, Haiyang Shen, Jiuzheng Wang, Siqi Zhong, Mugeng Liu, Chongyang Pan, Peilun Jia, Baoqing Sun, Xiang Jing, Yun Ma精选72°DeepWeb-Bench 是一个新的深度研究基准,旨在评估 AI 模型在开放网络上进行复杂研究的能力。与现有基准不同,该基准要求模型进行大规模证据收集、跨来源整合和长链条多步推理,难度显著提升。研究对九个前沿模型进行了评估,发现检索并非主要瓶颈(仅占12-14%错误),而推导和校准失败占70%以上。强模型和弱模型的失败模式不同:强模型主要因推导不完整出错,弱模型则因虚假精确性出错。该基准还揭示了模型在领域上的真实专长差异,跨模型一致性仅为0.61。论文基准测试深度研究推理模型推荐理由:做 AI 评估或研究基准的团队会发现,DeepWeb-Bench 揭示了现有基准无法区分的模型能力差异——尤其是推导和校准的短板。建议关注其分能力族评估和来源溯源设计,这对理解模型真实研究能力很有帮助。原文稍后读已读值得跟进有用关注 基准测试
09:46官方账号arXiv cs.AI@Souvick Das, Sallam Abualhaija, Domenico Bianculli精选法律领域对检索增强生成(RAG)系统的可靠性要求极高,但现有基准缺乏细粒度评估,且多为英文、面向专家。研究者提出ClaimRAG-LAW数据集,支持法语和英语,覆盖专家与非专家用户,包含多样问题类型。通过细粒度评估框架分析现有法律RAG系统,揭示了检索、生成及声明级分析的局限性。该工作为法律AI的可靠性评估提供了更精准的工具。论文法律AIRAG/检索增强生成基准测试推荐理由:法律AI的幻觉问题一直难量化,这个基准把检索和生成拆开评估,做法律NLP或合规系统的团队可以直接用来测试自己的RAG管线。原文稍后读已读值得跟进有用关注 法律AI
08:01AI Breakfast@AiBreakfast据 AI Breakfast 报道,Google 的 Gemini 3.5 Flash 模型在多个关键基准测试中超越了 Anthropic 的 Opus 4.7,包括终端基准、MCP Atlas、OSWorld 验证、金融代理、CharXiv 推理等。更重要的是,Gemini 3.5 Flash 的成本仅为 Opus 4.7 的一小部分。这一结果挑战了“贵即更好”的认知,表明轻量级模型在特定任务上可能更具性价比。对于预算有限但追求高性能的开发者或团队,这是一个值得关注的信号。AI模型Gemini 3.5 FlashOpus 4.7基准测试10 个信源在谈事件专题推荐理由:轻量模型在多个实际任务上反超旗舰模型,做 AI 应用选型的团队可以直接参考这份基准对比来优化成本与效果。原文稍后读已读值得跟进有用关注 Gemini 3.5 Flash
08:00Thomas Wolf@Thom_Wolf精选Terminal-Bench 是一个评估 AI 模型在计算机上使用工具(如命令行)达成目标能力的基准。现在它扩展到了科学领域,推出 T-Bench Science,专门评估 AI 在真实科研工作流中的表现。该基准面向生命科学、物理、地球科学、数学等领域的科学家,并开放任务贡献至 2026 年 8 月。贡献的科研工作流越多样,越能推动下一代 AI 模型更好地辅助日常研究工作。这不是训练数据集,而是用于评估前沿模型性能的基准。Anthropic、OpenAI 和 Google DeepMind 已使用 Terminal-Bench 评估 AI 编程能力,现在科学领域也加入其中。AI产品基准测试AI for ScienceTerminal-Bench10 个信源在谈事件专题推荐理由:做科研的 AI 用户终于有了专门评估 AI 辅助科研能力的基准——T-Bench Science 直接面向真实工作流,科学家可以贡献自己的流程来推动模型进步,值得关注和参与。原文稍后读已读值得跟进有用关注 基准测试
23:59AK@_akhaliq精选ESI-Bench是一个新提出的基准测试,专门用于评估具身空间智能。它通过任务设计要求智能体闭合感知-行动循环,测试其在3D空间中的理解与交互能力。该基准由研究团队发布,旨在推动机器人具身智能领域的标准化评估。AI模型ESI-Bench具身智能空间智能推荐理由:新基准测试具身空间智能原文稍后读已读值得跟进有用关注 ESI-Bench
10:29官方账号arXiv cs.AI@Gioele Molinari, Florian Felten, Soheyl Massoudi, Mark Fuge精选72°EngiAI 是一个针对大型语言模型(LLM)在工程设计任务中应用的多智能体框架与基准套件。该基准包含三个评估维度:工作流基准(7种提示风格,涵盖直接工具使用、语义消歧、条件分支等)、检索增强生成(RAG)基准(通过门控评分隔离检索对参数选择的贡献)以及高性能计算(HPC)基准(评估SLURM集群上的端到端ML训练编排)。EngiAI 参考实现基于LangGraph,通过监督架构协调7个专业智能体,统一拓扑优化、文档检索、HPC作业编排和3D打印机控制。在Beams2D问题上,专有模型平均任务完成率达96-97%,而开源4B参数模型为55-78%,条件分支任务最具挑战性(Photonics2D上完成率降至20-53%)。RAG门控验证了检索增强评分接近完美(≈1.0),而无检索时接近零,HPC编排中一个模型100%完成所有步骤,另一个仅50%,揭示了多步骤指令遵循在长工作流中会退化。论文多智能体系统工程设计基准测试推荐理由:做工程设计自动化或LLM多智能体系统的开发者,这个基准能帮你精准定位模型在条件分支、RAG和HPC编排上的短板,建议直接参考EngiAI框架来测试自己的方案。原文稍后读已读值得跟进有用关注 多智能体系统
10:25官方账号arXiv cs.AI@Yannis Bendi-Ouis, Romain de Coudenhove, Xavier Hinaut精选CogScale 是一个包含 14 个可扩展合成任务的基准测试,旨在隔离和评估模型在不同参数规模下的认知与记忆能力。它提供了一个轻量级标准化框架,让研究者无需大规模训练即可快速验证架构创新。研究者在严格参数预算(1k、10k、100k)下评估了 GRU、LSTM、xLSTM、ESN、Mamba、Transformer 解码器和编码器-解码器七种架构。结果显示,经典 RNN 和回声状态网络在严格参数预算下擅长基础记忆,但只有注意力机制和现代状态空间模型在推理复杂度和任务难度提升时保持高性能。论文基准测试序列处理记忆能力推荐理由:序列模型研究者终于有了一个轻量级、可扩展的评估工具,CogScale 能帮你快速筛选架构创新,避免盲目大规模训练的高成本。做记忆与推理能力对比的团队可以直接用这个基准来验证新想法。原文稍后读已读值得跟进有用关注 基准测试
05:05官方账号LangChain@LangChainAILangChain 指出通用智能体的评估不能仅靠单一测试集,需要区分基准评估和测试覆盖评估。基准评估包含约100个测试用例,覆盖常见场景,用于快速判断智能体是否正常工作。测试覆盖评估则包含多达500个以上用例,覆盖每个任务的多种用户提示和路径,确保全面性。由于全面评估成本高昂(每次可能数千美元),无法频繁运行,因此需要小规模基准集用于持续集成。该观点强调了通用智能体评估的复杂性,并暗示未来可能发布更详细的博客。AI产品智能体评估/评测LangChain推荐理由:做通用智能体开发的团队,评估策略往往被低估——LangChain 提出的两套测试集思路解决了成本与覆盖的平衡问题,建议直接参考这个框架来优化自己的评测流程。原文稍后读已读值得跟进有用关注 智能体
16:57Hunyuan@TXhunyuan腾讯混元团队开源了 Chronicles-OCR,这是一个专门评估视觉大语言模型(VLLM)对古代汉字视觉感知能力的基准。该数据集跨越 3000 年文字演变,涵盖从甲骨文到草书的 7 种历史字体,包含 2800 张均衡分布的图像。基准评估模型在字符定位、细粒度识别、古代文本解析和字体分类四个核心任务上的表现。该工作揭示了视觉分布偏移如何影响模型对古代文字的感知能力,为相关研究提供了重要参考。论文视觉大语言模型OCR古代汉字推荐理由:做 OCR 或古籍数字化的团队终于有了一个针对古代汉字的专业评估基准,可以直接用来测试自家 VLLM 的视觉感知能力,值得关注。原文稍后读已读值得跟进有用关注 视觉大语言模型