13:08
官方账号arXiv cs.AI@Mingkang Dong, Muxin Pu, Jie Li, Bohan Guo, Songruo Chen, Bin Ren, Xu Zheng, Chen Zhao, Tianwen Qian, Mohamed Elhoseiny, Yuqian Fu ObjectStream 是面向流式视频理解的无训练框架,把潜在目标作为记忆锚点。它直接从冻结的 Video-LLM 表征中提取空间连贯的潜在目标,跨帧链接为持久锚点,无需外部检测器或分割模型。在 OVO-Bench Real-Time Visual Perception 上,ObjectStream 使 Qwen2.5-VL-7B 提升 10.0 分,峰值 GPU 内存和 TTFT 均降低约 50%。在离线长视频基准上,它超越全 token 基线,同时丢弃 82.5% 的视觉 token。
推荐理由:论文提出 ObjectStream,用目标当锚点压缩视频记忆,免训练提升理解,显存延迟减半,性能还涨 10 分。