11:19官方账号arXiv cs.AI@Yuni Susanti, Moritz Schubotz该研究探讨科学公式的语法与语义两种模态的对应关系,发现其原生表示空间虽存在潜在相关性,但可观察对应极弱。作者用图编码器表示语法结构、文本编码器表示语义信息,并通过对比学习构建共享空间。实验表明,学习到的对齐显著提升跨模态检索性能。论文科学公式跨模态检索对比学习推荐理由:这篇论文把科学公式的语法和语义分开建模再对齐,发现原生表示差异很大,但对比学习能救回来,做检索的可以看看。原文稍后读已读值得跟进有用关注 科学公式
11:29官方账号arXiv cs.AI@Mingfei Chen, Zijun Cui, Ruoke Zhang, Hyeonggon Ryu, Eli ShlizermanSceneBind 是一种全模态表示方法,通过联合语义和 3D 空间理解来建模真实场景。它使用全局语义嵌入与对象中心语义-空间槽,显式编码对象级语义、空间属性和不确定性。SceneBind Matching 方案整合全局场景相似性与对象对齐,支持跨模态场景检索和对象定位。在场景检索和空间检索基准上达到 SOTA,并在音频-视觉定位任务上实现零样本迁移。论文SceneBind全模态表示3D场景理解推荐理由:SceneBind 把场景的“是什么”和“在哪里”一起建模,场景和空间检索都做到了 SOTA,还能零样本搞定音视频定位。原文稍后读已读值得跟进有用关注 SceneBind