全部 AI 动态 · AI 热点

6月18日

10:56

10:56

arXiv cs.LG@Bartłomiej Baranowski, Dave Zhenyu Chen, Matthias Nießner

OneCanvas将多视角patch特征投影到等距柱状全景画布，并添加3D坐标的位置嵌入。无需复杂几何编码器或大量训练预算。在SQA3D和VSI-Bench上达到SOTA准确率，在SPBench上泛化到分布外数据。训练计算量比最强竞争方法少一个数量级。

论文 OneCanvas SQA3D VSI-Bench 3D场景理解空间推理

推荐理由：OneCanvas用全景投影做3D理解，训练少10倍，在SQA3D上SOTA，适合机器人和具身AI。

6月16日

20:46

AITOP6月16日 20:46

600亿美元买下Cursor，xAI终于拿到了编程工具，但真正值得跟踪的或许不是AI

600亿美元买下Cursor，xAI终于拿到了编程工具，但真正值得跟踪的或许不是AI

6月12日

12:57

AITOP6月12日 12:57

Claude代码里藏了个20260612，18个月后的AI记忆革命已经开始倒计时

6月11日

15:28

AITOP6月11日 15:28

1107 vs 303：谷歌悄悄开源了一个“拆打字机”的模型，把大模型速度翻了4倍

15:23

AITOP6月11日 15:23

DiffusionGemma颠覆文本生成？自回归模型的“统治”要结束了

15:07

AITOP6月11日 15:07

每秒1107个token，Google开源的扩散模型为什么能改变本地推理格局？

5月19日

11:28

11:28

arXiv cs.AI@Pawat Chunhachatrachai, Gueter Josmy Faure, Hung-Ting Su, Winston H. Hsu

精选

SpatioRoute 是一种无需训练或微调的动态提示生成方法，用于提升视觉语言模型在零样本设置下对第一人称视频的空间问答能力。它通过规则或大语言模型驱动的路由，将每个问题映射到语义定制的提示模板，在 SQA3D 基准上相比固定提示基线提升高达 5% 的准确率，且无需 3D 点云输入。研究还发现，链式思维提示在 Qwen 系列模型上反而会降低性能，表明问题感知路由比统一推理指令更有效。

论文零样本推理空间问答提示工程视觉语言模型 SQA3D

推荐理由：做零样本视频空间推理的团队终于有了一个即插即用的提升方案——SpatioRoute 无需额外训练就能涨点 5%，做 VLM 应用的开发者可以直接在 SQA3D 上试试。