7月30日
08:39
08:39官方账号OpenAI@OpenAI
OpenAI指出基准得分不仅反映模型本身,还依赖于测试工具和设置。对于长期运行智能体,保留推理和压缩上下文可帮助模型基于已有内容持续学习。该观点来自OpenAI官方博文,涉及评估方法论。
事件专题

推荐理由:OpenAI聊了基准测试的细节:得分高低不只靠模型,还跟你用的工具和设置有关,长期智能体还能靠压缩上下文学得更久。
7月29日
11:32
11:32官方账号arXiv cs.LG@Malena Loza, David Chushig-Muzo, Eva Milara, Luis Bote-Curiel, Luis Estrada-Petrocelli, Felipe Grijalva
论文评估了9种表格基础模型(TabPFNv2、TabICL、Mitra等)在分布偏移下的表现。使用了HELOC、Voting和Childhood Lead三个真实数据集,涵盖标签、社会经济和地理偏移类型。结果显示所有模型性能均系统性下降,偏移差距在0.003到0.060之间,且高性能模型需要大幅计算资源。
推荐理由:想知道表格模型换了数据还灵不灵?这篇论文测了9个主流模型,结果全都不乐观,性能差距最小也有0.003。
6月3日
10:13
10:13官方账号arXiv cs.AI@Jiabei Cheng, Jingbo Zhou, Jun Xia, Changkai Li, Zhen Lei, Chang Yu, Stan Z. Li
精选
单细胞多组学数据同时测量多种模态,但实验成本高、噪声大,催生了多种计算翻译方法。然而,现有方法缺乏系统性的基准评估。为此,研究者提出了scTranslation基准,包含多样化数据集、集成最新模型并提供全面评估指标。该基准还评估了特征选择、特征质量和小样本设置等影响因素,这些因素此前很少被系统研究。通过大规模实验,scTranslation揭示了多项重要发现,为未来研究开辟了新方向。基准已开源,代码可在GitHub获取。
推荐理由:单细胞组学研究者终于有了系统评估翻译模型的工具——scTranslation覆盖了数据、指标和影响因素,做多模态分析的团队可以直接用这个基准来对比方法,省去自己搭建评估流程的麻烦。