12:04官方账号arXiv cs.AI@Noam Koren, Roy Bar-Haim, Abigail Goldsteen该研究提出一种无参考评估框架,利用LLM评判员从一致性、复杂度和策略覆盖三个维度检查对话代理基准质量。框架与独立人工标注结果吻合,并在不同能力LLM生成的基准及受控降质扰动的基准上验证了区分效果。实验表明该指标能稳定区分基准质量等级,且适用于手工精选基准。论文基准评估对话代理LLM评判推荐理由:这篇论文教你如何判断一个评测集靠不靠谱,用LLM当裁判自动挑毛病,省人工还靠谱。原文稍后读已读值得跟进有用关注 基准评估
08:39官方账号OpenAI@OpenAIOpenAI指出基准得分不仅反映模型本身,还依赖于测试工具和设置。对于长期运行智能体,保留推理和压缩上下文可帮助模型基于已有内容持续学习。该观点来自OpenAI官方博文,涉及评估方法论。论文OpenAI智能体基准评估10 个信源在谈事件专题推荐理由:OpenAI聊了基准测试的细节:得分高低不只靠模型,还跟你用的工具和设置有关,长期智能体还能靠压缩上下文学得更久。原文稍后读已读值得跟进有用关注 OpenAI
11:32官方账号arXiv cs.LG@Malena Loza, David Chushig-Muzo, Eva Milara, Luis Bote-Curiel, Luis Estrada-Petrocelli, Felipe Grijalva论文评估了9种表格基础模型(TabPFNv2、TabICL、Mitra等)在分布偏移下的表现。使用了HELOC、Voting和Childhood Lead三个真实数据集,涵盖标签、社会经济和地理偏移类型。结果显示所有模型性能均系统性下降,偏移差距在0.003到0.060之间,且高性能模型需要大幅计算资源。论文TabPFNTabICL表格基础模型推荐理由:想知道表格模型换了数据还灵不灵?这篇论文测了9个主流模型,结果全都不乐观,性能差距最小也有0.003。原文稍后读已读值得跟进有用关注 TabPFN
11:29官方账号arXiv cs.AI@Zhaokai Wang, Tianlin Gui, Jiayuan Rao, Shangzhe Di, Yihong Tang, Dingli LiangWorldCupArena是一个动态基准,用于评估语言模型和深度研究代理在足球预测上的表现。它首次基于2026年FIFA世界杯的104场比赛和13个系统进行评测,模型需预测结果、比分、球员和事件等。基准报告结果准确率、精确比分准确率和比分线得分,其中比分线得分在预测接近时给予部分分数。最佳系统相比博彩市场和球迷基线在结果和精确比分准确率上仅小幅提升,但在比分线得分上表现更优。代码、提示、预测和评估脚本已在GitHub开源。论文WorldCupArena语言模型深度研究代理推荐理由:如果你想看语言模型在世界杯预测上的硬核评测,这个基准用104场真实比赛对比了13个系统,结果比博彩市场强得有限,但细节预测有亮点。原文稍后读已读值得跟进有用关注 WorldCupArena
09:39官方账号arXiv cs.AI@Xixuan Hao, Zeyu Zhang, Zehao Lin, Yihang Sun, Ziliang Guo, Xichong Zhang, Yuxuan Liang, Feiyu Xiong, Zhiyu LiMemOps基准将对话记忆重新定义为生命周期操作序列,包括记住、遗忘、更新、反思及其组合。它通过可控生成流水线在长任务对话中嵌入操作,产生六类操作级探针,并在相邻证据与长上下文两种设置下评估。实验对比了长上下文、检索、参数化和托管记忆系统,发现会话级检索优于回合级检索,而长上下文模型在重构有序记忆状态轨迹上表现明显较弱。该基准揭示出仅靠最终答案准确度无法暴露的多种失败模式,推动记忆评估向可解释的操作级诊断转变。论文MemOpsLLM记忆操作推荐理由:想测AI的记忆系统到底靠不靠谱?这个新基准MemOps把记忆拆成6种操作来测,比只看最终答案准多了,搞记忆研究的必读。原文稍后读已读值得跟进有用关注 MemOps
10:13官方账号arXiv cs.AI@Jiabei Cheng, Jingbo Zhou, Jun Xia, Changkai Li, Zhen Lei, Chang Yu, Stan Z. Li精选单细胞多组学数据同时测量多种模态,但实验成本高、噪声大,催生了多种计算翻译方法。然而,现有方法缺乏系统性的基准评估。为此,研究者提出了scTranslation基准,包含多样化数据集、集成最新模型并提供全面评估指标。该基准还评估了特征选择、特征质量和小样本设置等影响因素,这些因素此前很少被系统研究。通过大规模实验,scTranslation揭示了多项重要发现,为未来研究开辟了新方向。基准已开源,代码可在GitHub获取。论文单细胞组学多模态翻译基准评估推荐理由:单细胞组学研究者终于有了系统评估翻译模型的工具——scTranslation覆盖了数据、指标和影响因素,做多模态分析的团队可以直接用这个基准来对比方法,省去自己搭建评估流程的麻烦。原文稍后读已读值得跟进有用关注 单细胞组学