#自监督学习
Efros、Damen、Manling Li 三个人在 CVPR 2026 聊机器还能从人类学什么,从数据增广聊到空间推理缺口,观点挺尖锐。
超图嵌入要训几百轮太慢了,HyperFuse 只要 100 轮,快 13 到 179 倍,精度还不输 TriCL 和 SE-HSSL,做图研究的可以看看。
一篇研究 NVS 架构选择的论文:SNAP 只靠限制 decoder 表达力加 latent 重建,五个几何任务上就追平了专门监督方法,做 3D 视觉的可以看看。
一篇时间序列方向的新论文,给 transformer 加了可写记忆层,能同时捕捉局部波动和全局趋势,低标注场景下分类效果不错,做时序的朋友可以看看。
用 22 万条极光光谱做掩码预训练,不用标签就超过专家手工特征和监督基线,还对比了 SpectraFM 和 SpecFormer 的可迁移性,做科学数据自监督的可以看看。
这篇论文用大量数据和对照实验拆解了医学基础模型表征收敛的真正原因,发现关键不是临床标签而是自监督目标,对训练和评估模型很有启发。
这篇论文用SAM掩码改进了LeJEPA,让自监督学习在数据少时更管用。跟踪、分类、分割结果都比原版强,适合想提升视觉特征效率的同学看。
想用少量标注数据做心电图分析?这篇论文提出的ER-JEPA用18万条无标注ECG预训练,在ST-MEM基准上跑出SOTA,计算量还比同类方法小。
Transformer预测隐状态而不是token能加速3.3倍,还能形成世界模型。Jayden Teoh的新框架值得看看。
做多智能体系统编排的团队终于有了一个低成本、高回报的训练方案——OrchRM 省去了人工标注和子智能体回滚,直接提升 8% 准确率,建议做 MAS 的开发者试试这个开源框架。
睡眠医学和生理信号分析的研究者终于有了一个无需大量标注数据就能学到通用表征的基础模型——Hypnos 用下一词预测解决了多模态生理数据的学习难题,做睡眠分期或房颤检测的团队可以直接用它生成嵌入,大幅降低标注成本。
做大规模优化或运筹学的团队终于有了加速Benders分解的实用方案——Proxy-BD用代理模型替代重复求解,理论保证不变但速度提升百倍,处理2000x2000规模问题的可以直接试。
多模态数据解耦是AI理解复杂场景的关键,但双模态瓶颈长期未解。做多模态学习、跨模态推理的团队可以直接用RePercENT的即插即用架构,无需重新训练基础模型,值得关注。
科学图像分析团队终于有了不用手动标注就能适配大模型的方法——FINO 用已有的元数据就能提升效果,做显微镜、卫星或医学影像的开发者可以直接试试。
RayDer 解决了自监督 NVS 难以规模化的问题,做 3D 视觉和场景重建的研究者可以关注其简洁的缩放规律和零样本能力,值得在真实视频数据上试试。
这篇论文给自监督学习社区一个清晰的数学答案:什么条件下模型真的在学世界模型。做表征学习或世界模型研究的开发者,看完会对 LeJEPA 的能力边界有更硬核的理解。
做脑机接口或神经信号处理的团队终于有了能实时处理长序列 EEG 的工具——CaMBRAIN 解决了注意力机制的计算瓶颈,吞吐量提升 10 倍,做实时监测或临床诊断的开发者可以直接用。