全部 AI 动态 · AI 热点

6月16日

20:46

AITOP6月16日 20:46

600亿美元买下Cursor，xAI终于拿到了编程工具，但真正值得跟踪的或许不是AI

600亿美元买下Cursor，xAI终于拿到了编程工具，但真正值得跟踪的或许不是AI

11:21

11:21

arXiv cs.AI@Dongbin Na, Chanwoo Kim, Soonbin Rho, Giyun Choi, Gangbok Lee, Dooyoung Hong

BinTrack是一种全开源的空间定位智能体，利用机器人轨迹的时间顺序进行二进制搜索。在SpaceLocQA基准的全局类别上，BinTrack将准确率提升22.8%，甚至匹配了GPT-4o的闭源模型结果。其推理策略带来超过1.5倍的加速。论文还发布了GangnamLoop，一个在真实街道上用四足机器人采集的多行程室外基准数据集。

论文 BinTrack 空间问答导航 SpaceLocQA GangnamLoop 开源模型

推荐理由：想让你家机器人找到干洗店？BinTrack用开源VLM做空间问答，性能追平GPT-4o还更快，代码数据全公开。

6月12日

12:57

AITOP6月12日 12:57

Claude代码里藏了个20260612，18个月后的AI记忆革命已经开始倒计时

6月11日

15:28

AITOP6月11日 15:28

1107 vs 303：谷歌悄悄开源了一个“拆打字机”的模型，把大模型速度翻了4倍

15:23

AITOP6月11日 15:23

DiffusionGemma颠覆文本生成？自回归模型的“统治”要结束了

15:07

AITOP6月11日 15:07

每秒1107个token，Google开源的扩散模型为什么能改变本地推理格局？

5月19日

11:28

11:28

arXiv cs.AI@Pawat Chunhachatrachai, Gueter Josmy Faure, Hung-Ting Su, Winston H. Hsu

精选

SpatioRoute 是一种无需训练或微调的动态提示生成方法，用于提升视觉语言模型在零样本设置下对第一人称视频的空间问答能力。它通过规则或大语言模型驱动的路由，将每个问题映射到语义定制的提示模板，在 SQA3D 基准上相比固定提示基线提升高达 5% 的准确率，且无需 3D 点云输入。研究还发现，链式思维提示在 Qwen 系列模型上反而会降低性能，表明问题感知路由比统一推理指令更有效。

论文零样本推理空间问答提示工程视觉语言模型 SQA3D

推荐理由：做零样本视频空间推理的团队终于有了一个即插即用的提升方案——SpatioRoute 无需额外训练就能涨点 5%，做 VLM 应用的开发者可以直接在 SQA3D 上试试。