8月13日
17:48
17:48官方账号arXiv cs.AI@Zile Zhou, Huining Yuan, Weichen Zhang, Xinlei Chen, Xiao-ping Zhang
SCOUT 提出结构化思维链框架,显式建模 3D 环境感知以增强空间理解。其强化学习算法引入多目标过程奖励和定制的优势估计方法,实现推理轨迹的细粒度信用分配。研究者构建了 SCOUT-24k 结构化空间推理数据集。SCOUT-3B 在通用空间基准上提升 16.85%,在复杂空间推理任务上提升 6.3%。SCOUT-7B 超出 GPT-4o 4.28%,且能泛化到多图像和视频场景。
推荐理由:空间推理一直是视觉语言模型的硬伤,SCOUT 用新的训练方法把 3D 理解做得更准,7B 规模直接超过 GPT-4o,还能迁移到视频上。
01:27
01:27官方账号Microsoft Research@MSFTResearch
精选
微软研究院发布MindTopo基准测试,专门检验AI模型对拓扑关系的理解能力。该基准通过路径、围栏、绳结等图形化任务,考察模型在空间推理和规划上的表现。MindTopo旨在发现当前模型在拓扑认知层面的短板,为后续改进提供测试依据。
推荐理由:微软出了个新基准MindTopo,专测AI懂不懂拓扑关系,像路径绕圈、绳结这种空间题,看看模型会不会犯晕。
8月10日
11:27
11:27官方一手arXiv: OpenAI@Ivan Majic, Zexian Huang, Franziska Hübl, Krzysztof Janowicz, Meilin Shi, Mina Karimi, Zilong Liu, Alexandra Fortacz-Lazan
论文提出一种模态转移任务,要求LMM先用文本描述规则网格中的彩色方块图像,再用新的LMM实例根据文本描述重新生成原空间场景。实验采用OpenAI的近期LMM,结果显示其在重新生成简单彩色方块网格图像时仍存在困难。研究表明,LMM的强健地理空间理解需要严格的多模态对齐,当前模型在图像和文本模态间转移空间信息的能力仍是瓶颈。
事件专题

推荐理由:这篇论文拿彩色方块网格考OpenAI的多模态模型,让它们看图写话再画图,结果画不对,做自动GIS得先解决这问题。
7月24日
6月18日
10:56
10:56官方账号arXiv cs.LG@Bartłomiej Baranowski, Dave Zhenyu Chen, Matthias Nießner
OneCanvas将多视角patch特征投影到等距柱状全景画布,并添加3D坐标的位置嵌入。无需复杂几何编码器或大量训练预算。在SQA3D和VSI-Bench上达到SOTA准确率,在SPBench上泛化到分布外数据。训练计算量比最强竞争方法少一个数量级。
推荐理由:OneCanvas用全景投影做3D理解,训练少10倍,在SQA3D上SOTA,适合机器人和具身AI。
6月12日
10:51
10:51官方账号arXiv cs.AI@Seokju Cho, Ryo Hachiuma, Abhishek Badki, Hang Su, Byung-Kwan Lee, Chan Hee Song, Sifei Liu, Subhashree Radhakrishnan, Seungryong Kim, Yu-Chiang Frank Wang, Min-Hung Chen
SpatialClaw 提出了一种无需训练的空间推理框架,通过将代码作为动作接口,让 VLM 智能体能够逐步执行并观察中间结果,从而灵活组合感知和几何操作。现有空间智能体要么单次执行代码(无法中途调整),要么依赖结构化工具调用(灵活性不足),限制了复杂 3D/4D 推理。SpatialClaw 维护一个状态化 Python 内核,预加载输入帧和感知原语,智能体每步写一个可执行单元,基于之前输出调整策略。在 20 个空间推理基准上,SpatialClaw 平均准确率 59.9%,比最新空间智能体高 11.2 个百分点,且跨 6 个 VLM 骨干网络表现一致。
推荐理由:做 3D 视觉或机器人空间推理的团队,终于有了一个无需微调就能显著提升 VLM 空间理解能力的框架——SpatialClaw 用代码接口解决了灵活性和中间反馈的痛点,值得在现有模型上直接试试。
6月9日
11:48
11:48官方账号arXiv cs.AI@Hongcheng Gao, Hailong Qu, Jingyi Tang, Jiahao Wang, Zihao Huang, Hengkang Qiao, Shihong Huang, Junming Yang, Yi Li, Hongyixuan Yuan, Wenjie Li, Bohan Zeng, Wenbo Li, Bo Wang, Jianhui Liu, Olive Huang, Haoyang Huang, Wentao Zhang, Guoqing Huang, Nan Duan, Yinpeng Dong
精选
多模态大模型在物理世界中的空间推理能力至关重要,但现有基准多依赖静态问答或特定模拟器,无法评估真实交互场景。研究者提出SpatialWorld,一个统一基准,整合8种异构仿真后端,包含760个人工标注任务,覆盖家务、旅行、社交协作等领域。智能体需在仅视觉部分可观测条件下主动收集证据,并通过统一文本接口做出决策。评估15个先进智能体发现,最强模型GPT-5平均任务成功率仅17.4%,开源模型Qwen-3.5为14.1%,表明主动探索和长程规划仍是瓶颈。
事件专题

推荐理由:做多模态智能体或空间推理研究的团队,这个基准直接暴露了当前模型在真实交互任务上的短板——GPT-5都只有17.4%成功率,值得用来检验自家模型。
5月30日
16:46
16:46Stanford AI Lab@StanfordAILab
斯坦福AI实验室(SAIL)发布了新基准Theory of Space,旨在测试基础模型是否能够通过主动探索来构建、修正和利用空间信念(即心智地图),而不仅仅是被动处理给定的观察数据。该基准挑战AI在未知环境中主动导航、推理空间关系并更新认知模型的能力。这一研究对于推动AI在机器人、自动驾驶等需要空间理解领域的自主性具有重要意义。
推荐理由:做机器人或空间AI的开发者值得关注——这个基准直接测试模型能否像人类一样主动探索并建立空间认知,而不是被动接收数据,看完会对当前模型的局限性有更清晰的认识。
5月19日