13:31IT之家(博客/媒体)8月9日,2026国际基础科学大会在北京开幕,主题是“聚焦基础科学,引领人类未来”,千余名中外科学家参会。为期两周的会议将举办500余场学术会议,覆盖生成式大模型推理、计算机视觉、人机交互、量子信息等方向。8月10日至12日,克莱尔·瓦赞、姚鸿泽、张寿武等9位基础科学奖章得主将在北京雁栖湖应用数学研究院A2报告厅带来9场基础科学报告。报告涉及随机矩阵理论、拓扑序、仿生电子皮肤、新型基因编辑系统等数学、物理、材料与生命科学前沿成果。行业国际基础科学大会量子信息计算机视觉推荐理由:千名科学家、500多场报告,9位奖章得主开讲,数学物理到AI都有,适合想追科研前沿的人。原文稍后读已读值得跟进有用关注 国际基础科学大会
11:12官方账号arXiv cs.AI@Hui Wei, Hao Yu, Guoying Zhao该综述首次统一覆盖物理域(可穿戴设备)、传感器域(集成隐私机制)和数字域(像素/外观级修改)的人脸去识别方法。数字域方法包括早期像素级修改和近期基于生成模型的保属性匿名化。传感器域方法在图像采集时嵌入隐私保护,弥合传感系统与下游视觉算法的鸿沟。物理域方法通过穿戴配件在现实环境中隐藏身份信息。现有评估协议缺乏标准化,该综述呼吁建立综合性基准。论文Face De-Identification隐私保护计算机视觉推荐理由:这篇综述把物理遮挡、传感器级和后期处理这三类人脸去识别方法都串起来了,想入行或找方案的读这篇就够了。原文稍后读已读值得跟进有用关注 Face De-Identification
18:27Ate-a-Pi@svpino一款AI代理通过计算机视觉循环实时分析健身视频中的动作,并逐帧纠正姿势。用户暂停视频后可以提问“为什么”,代理会扩展解释内容。在购物视频中,用户可点击商品进行近距离查看。该代理使屏幕上的任何内容都可点击、可询问、可修改。AI产品智能体视频交互计算机视觉推荐理由:这个AI agent能实时纠正健身动作,还能点视频里的商品,真的挺实用。原文稍后读已读值得跟进有用关注 智能体
15:05IT之家(博客/媒体)79°谷歌 DeepMind 发布 GenCeption,基于阿里巴巴开源视频模型 Wan2.1 训练。该模型将预训练视频生成器逆向改造,可同时完成深度估计、图像分割、3D 姿态估计等任务。与传统扩散模型需多步去噪不同,GenCeption 一次前向传播完成预测,小模型处理81帧视频约需6秒,14B大模型约需10秒。训练仅用7500段合成视频,但可泛化到真实多人视频及动物、类人机器人。输出细节可保留猫胡须和单根发丝边缘,部分结果甚至优于训练数据渲染质量。AI模型GenCeptionWan2.1DeepMind推荐理由:谷歌 DeepMind 用阿里 Wan2.1 搞了个逆天改造,一个模型能同时搞深度估计、分割、姿态估计,速度还快,搞 CV 和生成模型的值得一看。原文稍后读已读值得跟进有用关注 GenCeption
13:54berryxia@berryxia精选Supervision是Roboflow出品的计算机视觉开源工具包,已获45K GitHub Stars,近三周增长5K。它提供模型无关的推理、标注、数据集加载、跟踪和区域统计等可复用组件。用户使用YOLO或RF-DETR等检测模型后,只需几行代码即可完成标注和可视化。该工具包大幅降低重复造轮子的成本,以前需要数百行的检测+跟踪+统计Pipeline现可快速搭建。AI产品SupervisionRoboflowYOLO推荐理由:Roboflow把CV工作流做成了搭积木:几行代码搞定检测、跟踪、统计,模型随便换。GitHub涨星飞快,省去重复造轮子。原文稍后读已读值得跟进有用关注 Supervision
09:44官方账号arXiv cs.LG@Luke J. Zachmann, David D. Diaz, Vincent A. Landau, Chelsey Walden-Schreiner, Tony Chang, Nathan E. Rutenbeck, Katharyn A. Duffy, Kiarie Ndegwa, Andreas Gros, Scott Conway, Guy BayesVibrantForests框架融合国家森林清查、机载激光雷达和卫星图像,以10米分辨率生成美国本土全区域的森林结构属性图。该模型同时估计冠层覆盖、冠层高度、地上活树生物量、断面积和二次平均直径五项指标。模型扩展了常见被动传感器模型的饱和范围,并减少了回归均值行为(稀疏条件下高估、密集条件下低估)。该框架能以年度节奏提供连贯的全区域森林管理相关属性估计。论文VibrantForests激光雷达卫星图像推荐理由:VibrantForests搞了个新框架,用卫星和激光雷达做出全美10米分辨率森林地图,比老模型更准,不饱和不回归均值。原文稍后读已读值得跟进有用关注 VibrantForests
02:45官方账号Microsoft Research@MSFTResearch精选ResNet在CVPR 2026上获得Longuet-Higgins奖,表彰其持久影响力。该论文发表十年,残差连接已成为现代AI系统的基础组件。其引用量超过32万次,并在持续增长。残差连接解决了深层网络退化问题,推动了计算机视觉和整个深度学习领域的发展。AI模型ResNetCVPRLonguet-Higgins Prize推荐理由:ResNet的残差思想直到今天还在被所有大模型使用,32万引用不是白来的,这个奖实至名归。原文稍后读已读值得跟进有用关注 ResNet
11:12官方账号arXiv cs.AI@Nicole Villavicencio-Garduño, Maksim Ekin Eren, Milo Prisbrey, Ben Migliori, Michael Teti研究表明,针对计算机视觉应用的声学对抗攻击可利用20千赫兹以下的可听声波共振商用摄像头,导致AI模型(如YOLO11)出现误分类、漏检或幻觉。相比先前使用超声波(>20千赫兹)的短距离攻击,低频声波传播距离更远。实验分析了图像分辨率、目标尺寸等特征对攻击成功率的影响,为防御策略提供了依据。论文YOLO11声学攻击对抗攻击推荐理由:可听声波让YOLO11误判原文稍后读已读值得跟进有用关注 YOLO11
20:51IT之家(博客/媒体)精选OpenCV 团队正式发布 OpenCV 5,这是该计算机视觉库的重大现代化升级。新版本引入了基于图的 DNN 引擎,支持算子融合、广泛的 ONNX 算子(覆盖率从 23% 提升至 80%),并原生支持 Transformer、VLM 和 LLM 等大模型。此外,OpenCV 5 改进了 Python 集成、硬件加速层、3D 视觉功能,并弃用了传统 C API,使代码更紧凑。该库在 GitHub 拥有超 86,000 星,日安装量超百万次,此次更新旨在巩固其作为计算机视觉基础库的地位。AI产品OpenCV计算机视觉DNN引擎1 个信源在谈事件专题推荐理由:做计算机视觉、机器人或 AI 应用开发的团队,OpenCV 5 的 DNN 引擎和 ONNX 支持能直接提升模型部署效率,值得立即升级体验。原文稍后读已读值得跟进有用关注 OpenCV
11:35官方账号arXiv cs.LG@Gandhimathi Padmanaban, Fred Feng精选该研究提出一个开源的两阶段计算机视觉流水线,用于从自然道路视频中细粒度分类车辆类型(轿车、SUV、皮卡、小型货车、大型货车、商用卡车),以评估自行车事故中骑车人受伤严重程度。第一阶段使用预训练的RT-DETR检测器进行粗略车辆定位,第二阶段使用微调的Vision Transformer(ViT-Base/16)进行六类车身类型分类。引入基于置信度的弃权机制(softmax输出低于0.60时输出“未知”标签),避免静默误分类。在密歇根州安阿伯市自行车道走廊的3805个超车事件(分布内)上,流水线准确率达0.94,各类F1分数在0.91(小型货车)到0.97(SUV)之间。在独立的外部数据集(311个事件,无再训练)上,准确率为0.89,其中三个常见类别F1仍保持在0.90以上,小型货车因弃权率从2.4%升至25.0%导致F1降至0.72,但未出现主动误分类。完整流水线(含推理脚本、训练代码、评估工具和模型权重)已开源,支持道路视频档案和骑行安全研究的复现与复用。论文计算机视觉细粒度分类Vision Transformer推荐理由:做交通安全分析或自动驾驶细粒度感知的团队,可以直接用这个开源流水线替代粗粒度检测,它用弃权机制解决了域迁移下的误分类问题,值得在真实道路视频上试试。原文稍后读已读值得跟进有用关注 计算机视觉
08:12Stanford AI Lab@StanfordAILab斯坦福大学人工智能实验室(SAIL)发布博客,汇总了其团队在CVPR 2026上被接收的多篇论文。这些论文涵盖了计算机视觉的前沿研究方向,包括图像生成、视频理解、3D视觉等。该汇总为研究者提供了了解SAIL最新成果的便捷入口,也反映了当前CV领域的热点趋势。论文CVPR 2026计算机视觉斯坦福SAIL推荐理由:做计算机视觉研究或关注顶会动态的开发者,可以快速了解斯坦福SAIL实验室的最新工作,找到与自己方向相关的论文。原文稍后读已读值得跟进有用关注 CVPR 2026
11:10官方账号arXiv cs.AI@Matvei Shelukhan, Timur Mamedov, Aleksandr Chukhrov, Karina Kvanchiani多视角目标关联是计算机视觉中的关键问题,常用于多摄像头感知任务。该任务本质上是约束的一对一匹配问题,但近期研究却依赖成对排名指标(如AP和FPR-95)来评估模型。论文指出这些指标与实际分配目标之间存在根本性错配:理论上,即使分配正确,AP和FPR-95也可能不完美;而最优的成对排名仍可能导致错误分配。通过Sinkhorn归一化作为后处理测试,作者发现优化少量参数能显著提升AP和FPR-95,但分配级指标(如ACC和IPAA)并未相应改善。这提醒研究者需谨慎选择评估指标,避免被表面性能提升误导。论文多视角目标关联评估指标Sinkhorn归一化推荐理由:这篇论文点破了多视角目标关联领域的一个常见误区——用排名指标评估分配任务可能得出虚假结论。做多摄像头感知或目标关联的开发者,看完会重新审视自己的模型评估方式,建议点开了解如何用Sinkhorn归一化做压力测试。原文稍后读已读值得跟进有用关注 多视角目标关联
10:40官方账号arXiv cs.AI@Eric Liang该论文提出一种自适应特征优化视觉前端,用于3D场景重建。传统方法使用固定特征阈值和均匀特征预算,在重复纹理、低视差区域会浪费计算资源。新方法通过纹理、重复性、独特性、三角测量角度和空间覆盖度对候选特征评分,并为每视图分配特征预算以最大化有效轨迹。在走廊、立面、物体桌面和杂乱场景的测试中,自适应策略相比随机、仅纹理和均匀网格基线,获得了最佳质量感知完整性和最低重建RMSE。该方法可作为模块化前端策略,让经典和学习的3D重建管道更智能地选择计算投入的视觉证据。论文3D重建特征优化自适应策略推荐理由:做3D重建的团队终于有了一个能自动节省计算资源的特征选择策略——不用再手动调阈值或忍受均匀采样的浪费,直接集成到现有管线就能提升重建精度,值得一试。原文稍后读已读值得跟进有用关注 3D重建
22:00官方账号Decoder@Maximilian Schreiner中国警方正在升级数百万老旧监控摄像头,加入AI功能。海康威视和华为等制造商现在出货的摄像头内置计算机视觉和语言模型,能自动检测人群、可疑行为或未经授权的访问。警官不再需要手动查看录像,只需输入文本查询即可。人权观察警告称,这创造了前所未有的规模行为监控。行业AI监控计算机视觉海康威视推荐理由:这篇报道揭示了AI监控技术的实际应用规模,对关注隐私、公共安全或技术伦理的读者来说,了解中国如何将老旧基础设施转化为智能监控系统,值得一读。原文稍后读已读值得跟进有用关注 AI监控
22:16官方账号Clement Delangue@ClementDelangueHugging Face CEO Clement Delangue发推宣布UFO数据集已通过MTSlive上传至Hugging Face平台。该数据集包含UFO相关图像,旨在推动计算机视觉模型训练。此举动可能激发开发者利用公开数据集进行异常目标检测等CV任务,扩展AI在非传统领域的研究边界。目前尚未有公开训练结果,但已引发社区关注。AI产品数据集计算机视觉Hugging Face推荐理由:UFO数据集作为非传统视觉数据资源,为CV研究者提供了探索异常检测、低置信度场景的新材料,有助于推动AI在开放世界感知中的鲁棒性研究。原文稍后读已读值得跟进有用关注 数据集