coco·general

coco

别名
首次出现
2026-06-08
最近出现
2026-07-21
累计提及
8
§ 01综述

COCO(Common Objects in Context)是计算机视觉领域最广泛使用的对象检测、分割和图像描述基准数据集之一,包含超过33万张图片和250万个标注实例。近年来,围绕COCO的研究不再局限于传统任务,而是向更高效的嵌入学习和视觉语言对齐方向延伸。

COCO相关研究近期进展

  • CoCo损失函数:灵活且几何最优的嵌入与更快收敛:该工作提出一种名为CoCo的损失函数,通过几何最优的嵌入策略加速模型收敛,并在多个数据集上包括COCO的子集上取得提升。
  • 对象级LeJEPA:利用SAM掩码提升自监督学习效率:引入SAM分割掩码构建对象级表示,在COCO等数据集上预训练的自监督模型在下游任务中表现出更高效的特征学习。
  • TEVI:用稀疏自编码器优化CLIP图文对齐:通过稀疏自编码器改善CLIP的图文对齐,在COCO图像描述和检索基准上显示出更准确的匹配。
  • 当前焦点与观察点

    当前,COCO数据集正从单纯的评测基准转向训练范式的验证平台。一方面,新的损失函数(如CoCo)和自监督方法(如LeJEPA)都依赖COCO的丰富标注来检验其通用性;另一方面,视觉语言模型(如CLIP)的优化(如TEVI)持续利用COCO场景多样性来强化跨模态理解。值得注意的是,COCO的物体共现模式和长尾分布仍然是模型鲁棒性的关键挑战,而上述研究恰恰在这些方面提供了新的解决路径。
    § 02相关报道06 条在档
    1. 01
      CoCo损失函数:灵活且几何最优的嵌入与更快收敛
      arXiv cs.LG
    2. 02
      约束在线凸优化中OGD+Projection算法的累积约束违反下界
      arXiv cs.LG
    3. 03
      十年视觉语言AI模型进化:准确性与视觉认知错误分析
      arXiv cs.AI
    4. 04
      对象级LeJEPA:利用SAM掩码提升自监督学习效率
      arXiv cs.LG
    5. 05
      Gaze Heads:视觉语言模型如何注视它们描述的对象
      arXiv cs.LG
    6. 06
      TEVI:用稀疏自编码器优化CLIP图文对齐
      arXiv cs.AI
    § 03邻近话题

    本页综述由 AITOP 基于公开报道整理。原报道版权归各自来源所有。

    /topic/coco