6月11日
11:03
11:03官方账号arXiv cs.AI@Hui Wang, Tianyu Ren, Joseph Butler, Christopher Baker, Karen Rafferty, Simon McDade
针对生物科学应用中多模态数据常部分缺失的问题,研究者提出Latent World Recovery (LWR)框架。LWR通过将不同模态的嵌入对齐到共享潜在空间,并仅融合实际可用的模态嵌入来构建统一表示,避免了传统缺失模态重构带来的误差传播。该方法无需固定模态集或显式插补缺失数据,在真实多组学基准上对癌症表型分类和生存预测等下游任务表现有效。
推荐理由:做多模态学习或生物信息学研究的团队,LWR解决了缺失模态下的鲁棒表示学习痛点,直接利用可用模态避免误差累积,值得关注其实验结果。
6月4日
11:32
11:32官方账号arXiv cs.LG@Luca Thale-Bombien, Jan Ewald, Ralf König, Aaron Klein
精选
BBOmix 是首个针对真实生物数据的无监督表示学习超参数优化(HPO)开源表格基准。它包含来自 TCGA 和 SCHC 数据集的 105,000 次评估,涵盖四种自编码器架构和七种多组学模态。该基准量化了重建损失与下游任务性能之间的相关性,并评估了多种 HPO 方法,为无监督生物表示学习研究建立了严格基线。
推荐理由:做生物信息学或组学数据降维的团队,终于有了一个标准化的 HPO 测试场——BBOmix 帮你省去从头调参的试错成本,做自编码器研究的可以直接用它验证方法。
5月12日
19:11
19:11官方账号arXiv cs.AI@Edward De Brouwer, Carl Edwards, Alexander Wu, Jenna Collier, Graham Heimberg, Xiner Li, Meena Subramaniam, Ehsan Hajiramezanali, David Richmond, Jan-Christian Hütter, Sara Mostafavi, Gabriele Scalia
AssayBench是一个面向LLM和智能体的表型筛选基准,基于1920个公开CRISPR筛选数据构建,覆盖5类细胞表型。它将任务转化为基因排名预测,并引入adjusted nDCG指标来评估不同实验间的性能。评估显示现有方法距离理论上限较远,且零样本通用LLM优于生物专用LLM和可训练基线。该基准为虚拟细胞模型和药物发现提供了标准化测试平台。
推荐理由:为LLM在生物表型筛选任务中的能力评估提供了首个标准化基准,揭示了当前方法的不足和通用LLM的潜力,对药物研发自动化有实际参考价值。