7月22日
12:05
12:05官方账号arXiv cs.LG@Lance Kennedy, Hossein Amiri, Yueyang Liu, Riyang Bao, Hanqi Chen, Mohammad Hashemi, Ruochen Kong, Xiaotong Liu, Joon-Seok Kim, Shengpu Tang, Liang Zhao, Andreas Züfle
该论文引入了16个大规模模拟数据集,每个数据集包含数千个智能体的轨迹及带注释的驻留点,并涵盖不同的轨迹噪声水平。作者评估了9种驻留点检测算法,包括现有最优方法和新提出的方法。结果显示,现有算法在真实噪声条件下表现较差,而提出的无监督方法有显著改进,监督方法则大幅超越现有基线。该论文指出,这些数据集和方法仅作为未来研究的起点。
推荐理由:这篇论文提供了16个带噪声的轨迹数据集和9种驻留点检测算法评估,发现现有方法在真实噪声下效果差,而他们的新方法提升明显,对做轨迹分析的人很有参考价值。
7月9日
09:53
09:53官方账号arXiv cs.LG@Hyunjae Kim, Dain Kim, Pan Xiao, Serina S. Applebaum, Younjoon Chung, Xuguang Ai, Yu Yin, Roy Jiang, Yuexi Du, Yawen Wei, Yiming Kong, Tuo Guo, Zhiyuan Cao, Mengmeng Du, Yuelei Fu, Yan Hu, Rui Shi, Gui Yang, Kevin W. Jin, Yuntian Liu, Yuxuan Tian, Jonathan Marquez, Zhen Chen, Sheng Zhang, Hoifung Poon, Hua Xu, Jaewoo Kang, Qingyu Chen
精选
MedPMC从610万篇PMC文章中自动筛选出1100万医学图像-文本对。人工评估中,95.3%的图像具有医学相关性,而此前数据集仅19.7%。在26项基准测试中,基于MedPMC训练的CLIP-style模型零样本AUC平均提升7.1个百分点。作为MLLM的视觉编码器,其医学VQA准确率提升1.9和16.9个百分点。在1万张真实临床照片中,形态到图像检索Recall@5提升11.7个百分点。
推荐理由:想训练医学多模态模型但缺高质量数据?MedPMC从610万篇论文里筛出1100万对数据,效果比现有数据集好5倍。