10:15官方账号arXiv cs.AI@Longtian Wang, Zhengyu Zhao, Chenhao Lin, Le Yang, Shiwei Wang, Yuhan Zhi, Xiaofei Xie, Chao Shen目标检测模型在安全场景下易遭后门攻击,现有检测手段对场景级攻击效果有限。 DistScan 通过预 NMS 预测分布偏移来识别后门,无需获取模型权重。 实验在 MS-COCO 和 PASCAL VOC 基准上表现突出,平均准确率提升 27.32 个百分点。论文DistScan目标检测AI安全推荐理由:你试试 DistScan,它能检测目标检测模型的后门,不用搞复杂步骤,比以前方法效果强不少。原文稍后读已读值得跟进有用关注 DistScan
16:56官方账号arXiv cs.AI@Ismail Ismail Tijjani, Sunusi Muhammad Ibrahim, Amina Ibrahim Khaleel, Lanre Olusegun Akinola, Fatima Isa Jibrin, Muhammad Bashir Aliyu, Abdullahi Abdussalam Dalhat, Abdullahi Suiudeen一项研究在非洲尼日利亚农田采集的AgriAISeg数据集上,对比了YOLOv5、YOLOv8、YOLO11、YOLO26、Faster R-CNN和RT-DETR六种目标检测模型。数据集包含3,382张芝麻、卷心菜和番茄图像,覆盖光照变化、遮挡和视角差异等真实条件。RT-DETR表现最佳,精度达0.768,mAP@0.5:0.95为0.624;YOLOv8和YOLO11表现稳定。Faster R-CNN的mAP@0.5仅0.466,准确率明显偏低。YOLO系列模型训练效率也优于Faster R-CNN。论文YOLOv8RT-DETRFaster R-CNN推荐理由:想看真实农田里哪个检测模型靠谱?这篇用非洲实地数据测了六个模型,RT-DETR和YOLO系赢了,Faster R-CNN掉队,结论直接。原文稍后读已读值得跟进有用关注 YOLOv8
12:30官方账号arXiv cs.AI@Zihan Yang, Yang Guo, Hongxing Zhang, Dan Lu, Siyuan YaoDyFrDet 是一个专为小目标检测设计的新模型,提出动态频域感知特征金字塔网络(DyFrFPN)来压制背景干扰。动态频带预测器(DBP)可自适应抑制低频冗余和过度高频噪声。标签消歧模块(LDM)通过概率分布显式建模标签歧义,改善低分辨率小目标的定位精度。论文已在 arXiv 公开(编号 2608.02495v1),代码发布于 GitHub。AI模型DyFrDet小目标检测目标检测推荐理由:新模型 DyFrDet 专治小目标检测,压频域噪声和标签歧义,代码开源了,跑个基准试试。原文稍后读已读值得跟进有用关注 DyFrDet
09:25官方账号arXiv cs.AI@Xizhe Zhang, Fan Shi, Mianzhao Wang, Jiangpeng Zheng, Xu Cheng, Shengyong Chen该论文针对红外小目标检测中像素级掩码标注成本高且不确定性大的问题,提出HALO(Hotspot-Anchored Label Optimization)方法。HALO在框内定位辐射锚点,并基于局部背景统计合成物理锚定高斯(PAG)软标签,将含噪框监督转化为连续像素级软标签。实验在公共数据集上显示,标准紧框下HALO与代表性盒监督方法竞争力相当,而在更宽松或偏移框条件下(更贴近实际场景),HALO鲁棒性显著提升,且不同骨干网络下表现一致。论文还引入污染感知工作区间分析,揭示内在信杂比与性能的关系。论文HALOPAGIRSTD推荐理由:这篇论文提出了HALO,能用带噪框标注解决红外小目标检测,比现有方法更扛标注不准确,适合实际场景。原文稍后读已读值得跟进有用关注 HALO
10:21官方账号arXiv cs.AI@Chao Tian, Zikun Zhou, Chao Yang, Guoqing Zhu, Zhenyu He本文提出一种稀疏跨模态融合机制用于RGB-T目标检测,避免传统方法中双重骨干网络和全局融合的高计算成本。该方法先通过轻量级单模态检测器快速扫描图像,生成高召回率的候选区域(RoI),再对稀疏的候选区域进行跨模态特征融合以精化检测结果。两阶段框架显著降低了参数和计算成本,同时在高分辨率图像上保持可扩展性。实验证明该方法在保持竞争力的前提下实现高效检测。论文RGB-T稀疏融合目标检测推荐理由:这篇论文找到了一种聪明的方法:先快速扫一遍图像找出可能的目标区域,再只对这几个区域做多模态融合,省了很多计算。适合想做轻量级多模态目标检测的人读。原文稍后读已读值得跟进有用关注 RGB-T
10:28官方账号arXiv cs.AI@Shihao Wang, Shilong Liu, Yuanguo Kuang, Xinyu Wei, Yangzhou Liu, Zhiqi Li, Yunze Man, Guo Chen, Andrew Tao, Guilin Liu, Jan Kautz, Lei Zhang, Zhiding Yu精选LocateAnything 提出并行框解码(PBD)方法,将边界框和点作为原子单元单步解码,替代传统序列化坐标生成,解决了几何结构耦合性差和推理瓶颈问题。该方法在保持框内几何一致性的同时,显著提升解码吞吐量和定位精度。团队还构建了包含1.38亿训练样本的大规模数据集 LocateAnything-Data,增强数据多样性。实验表明,LocateAnything 在多个基准上实现了速度与精度的新前沿,高IoU定位质量显著提升。这项工作展示了并行解码与大规模数据在统一视觉定位与检测中的互补优势。论文视觉定位目标检测并行解码推荐理由:做视觉定位或目标检测的开发者,LocateAnything 的并行解码思路能直接提升推理效率,建议关注其开源数据和模型。原文稍后读已读值得跟进有用关注 视觉定位
08:05berryxia@berryxiaYoLo作为传统目标检测模型,在AI浪潮推动下迭代速度和优化支持不断提升。最新应用案例显示,YoLo被用于交通信号灯智能辅助系统,通过识别红绿灯状态和等待时间来优化交通管理。这一进展展示了传统模型在AI时代焕发新活力,为智能交通系统提供了更高效的解决方案。AI模型YoLo目标检测智能交通推荐理由:YoLo在AI时代持续进化,做交通或视觉应用的开发者可以关注其最新优化,直接用于智能辅助系统开发。原文稍后读已读值得跟进有用关注 YoLo