全部 AI 动态 · AI 热点

6月16日

20:46

AITOP6月16日 20:46

600亿美元买下Cursor，xAI终于拿到了编程工具，但真正值得跟踪的或许不是AI

600亿美元买下Cursor，xAI终于拿到了编程工具，但真正值得跟踪的或许不是AI

6月12日

12:57

AITOP6月12日 12:57

Claude代码里藏了个20260612，18个月后的AI记忆革命已经开始倒计时

6月11日

15:28

AITOP6月11日 15:28

1107 vs 303：谷歌悄悄开源了一个“拆打字机”的模型，把大模型速度翻了4倍

15:23

AITOP6月11日 15:23

DiffusionGemma颠覆文本生成？自回归模型的“统治”要结束了

15:07

AITOP6月11日 15:07

每秒1107个token，Google开源的扩散模型为什么能改变本地推理格局？

5月21日

09:46

09:46

arXiv cs.AI@Junsung Park, Hyunjung Shim

精选

现有驾驶视觉-语言-动作模型（Driving VLA）在轨迹预测时严重忽视视觉特征，原因是任务定义存在结构性缺陷。研究者从逆运动学角度重新设计，要求模型预测未来视觉状态作为边界条件，并引入独立逆运动学网络（交叉注意力条件扩散模型）来抑制对自车状态和文本指令的捷径依赖。仅用0.5B参数，该模型在NAVSIM-v2和nuScenes基准测试中达到7B-8B大模型的轨迹规划性能，尤其在动态驾驶场景（如转弯）中视觉特征利用显著提升。

论文 Driving VLA 逆运动学轨迹预测自动驾驶视觉特征

推荐理由：这篇论文用逆运动学原理解决了Driving VLA忽视视觉特征的顽疾，做自动驾驶轨迹规划的团队值得关注——0.5B模型就能达到7B-8B的效果，意味着更低的部署成本和更好的视觉鲁棒性。