12:08官方账号arXiv cs.LG@Gaoyue Zhou, Zichen Jeff Cui, Ada Langford, Bowen Tan, Yann LeCun, Lerrel PintoPatch Policy是一种轻量级架构扩展,让基于Transformer的机器人策略直接使用预训练的ViT密集补丁特征,避免全量视觉语言模型(VLM)的计算开销。该方法引入块因果注意力掩码,在保持时间因果性的同时处理多个补丁令牌。在4个仿真和3个真实环境套件中,Patch Policy相比使用全局池化表示的策略实现了40%的相对提升。此外,它仅用OpenVLA-OFT约0.7%的参数,就超越了微调后的OpenVLA-OFT 18%的性能。论文Patch PolicyViT机器人控制推荐理由:机器人控制不用再扛百亿参数VLM了,用ViT密集补丁特征直接训练,速度更快、参数量少99.3%,性能还涨18%。想轻量高效做具身策略的可以看这篇。原文稍后读已读值得跟进有用关注 Patch Policy
12:16官方账号arXiv cs.LG@Siwon Kim本文提出Event Reconstruction Joint-Embedding Predictive Architecture (ER-JEPA),一种用于多变量时间序列的轻量级自监督学习框架。其两阶段层次结构受心脏病专家诊断方法启发,先构建每个时间间隔的表示,再将表示作为单变量时间序列处理,层次整合两个JEPA和Vision Transformer (ViT) 骨干。在约18万条10秒12导联ECG数据上预训练后,模型在ST-MEM基准上达到下游任务SOTA,且计算快速、资源占用极低。论文ER-JEPAH-JEPAViT推荐理由:想用少量标注数据做心电图分析?这篇论文提出的ER-JEPA用18万条无标注ECG预训练,在ST-MEM基准上跑出SOTA,计算量还比同类方法小。原文稍后读已读值得跟进有用关注 ER-JEPA
11:13官方账号arXiv cs.LG@Kaustubh Kapil, Kishor P. Upla研究者提出Transformer Geometry Observatory (TGO) 系统框架,用于探索视觉Transformer的表征几何与动力学。TGO-I聚焦光谱几何,使用ViT-Small/16模型在ImageNet-100上训练,分析有效秩、稳定秩、参与比、光谱熵、光谱平坦度、光谱各向异性等指标。结果发现训练中维度利用率持续增加,各向异性降低,光谱熵和参与比上升,特征谱趋于平坦。与直觉相反,方差在表征维度上再分配,CLS token表征展现出最高有效维度和最低各向异性。论文Vision TransformersViT表征几何推荐理由:这篇论文用TGO框架搞清楚了ViT的维度在训练中怎么变化——不是集中而是越来越分散,尤其CLS token最明显,对理解视觉Transformer内部机制很有参考价值。原文稍后读已读值得跟进有用关注 Vision Transformers
11:45官方账号arXiv cs.AI@Maoyang Xiang, Bo Wang, Tao Luo精选OrpQuant提出了一种名为正交残差投影(ORP)的算法-硬件协同设计框架,用于解决低比特Power-of-Two(PoT)量化中的低角度分辨率问题。该方法通过双基几何投影自适应合成更高分辨率的残差格点,仅使用移位和加法操作,避免了乘法器。在LLaMA-2-7B上,3比特量化(W3/A16)下困惑度达到6.10,与AWQ等MAC密集型方法相当,且全模型校准仅需约15分钟。在28nm工艺下,RTL综合表明ORP有效缓解了密集乘法器树的时序瓶颈。该工作适用于LLM和ViT的边缘部署。论文量化边缘部署LLM推荐理由:OrpQuant解决了低比特量化中特征流形退化的问题,做边缘部署的开发者可以直接用这个15分钟校准的方案替代传统MAC密集型方法,硬件效率显著提升。原文稍后读已读值得跟进有用关注 量化