11:22官方账号arXiv cs.AI@Vanodhya G. Warnasooriya, Amir Hajian, Watchara Ruangsang, Supavadee Aramvith73°研究人员提出了一种轻量级两阶段框架,用于实时视频异常检测。第一阶段使用YOLO v11n-pose检测人物并提取17个骨骼关键点。第二阶段通过CLIP ViT-B/32编码每个裁剪的人物区域,并计算与预定义异常行为文本描述的余弦相似度。该架构在NVIDIA Titan XP GPU上实现了约51 FPS的端到端吞吐量,比多特征基线快3.36倍,同时在CUHK Avenue、ShanghaiTech Campus和朱拉隆功大学自建数据集上分别保持了89.26%、70.26%和84.13%的帧级AUROC值。论文YOLOCLIP视频异常检测推荐理由:新方法结合YOLO和CLIP,无需光流和独立姿态估计器,实时检测异常行为,速度提升3倍多。原文稍后读已读值得跟进有用关注 YOLO