10:36官方账号arXiv cs.LG@Jiaming Li研究提出解析先验学习框架,在86个仿真标注几何和8998个解析几何上训练。直接SVR的MAE为3.375 Hz,残差SVR降至0.426 Hz。直接MLP的MAE为1.109 Hz,解析先验预训练后全模型微调降至0.371 Hz。在20到70个仿真标注样本的训练预算下,该方法均比直接学习更省数据。该框架可用于仿真数据稀缺时的高保真声学预测。论文Helmholtz谐振器SVRMLP推荐理由:这个论文用便宜的解析模型帮机器学习打底,仿真数据少也能把误差从3.375Hz压到0.371Hz,做声学仿真的可以看看。原文稍后读已读值得跟进有用关注 Helmholtz谐振器
18:26官方账号arXiv cs.LG@Changhao Xiang, Shangyu Xing, Zhen Wu, Jianbing Zhang, Xinyu DaiMMCS是一种新的多模态预训练方法,通过将文本实体替换为对应视觉对象,提供显式的对象级监督。该方法仅用50K样本就能匹配或超越在600K图像-文本对上训练的模型,数据效率提升12倍。MMCS在773K样本的预训练数据集上验证了有效性,并持续提升不同规模模型的视觉定位和感知能力。该研究针对现有MLLMs中图像级对齐的指称歧义问题,提出了更精确的局部视觉-语言对齐方案。论文MMCS多模态预训练推荐理由:这篇论文提出MMCS,用50K样本就干翻别人600K的效果,做多模态预训练的可以看看这个新思路。原文稍后读已读值得跟进有用关注 MMCS
10:23官方账号arXiv cs.AI@Bishwas Mandal, Shmuel Berman, Akshay Vegesna, Samip Dahal随着计算资源增长快于高质量文本供给,多轮训练成为新常态,但单模型在几轮后即饱和。论文提出“超时代预训练”(q0),将多轮预算转化为多样模型群体并聚合预测,达到比单模型更低的验证损失。q0包含三个核心原语:反相关学习率与权重衰减的循环调度、链式蒸馏、以及基于学习先验的模型选择与加权。在1.8B参数模型、100M FineWeb tokens上,q0仅用约56轮就匹配了256轮强集成基线,效率提升约4.6倍,在Slowrun设置下累积数据效率达12.9倍。该方法还给出了不同预算下的最优分配策略,从单轮到最大预算均可适用。论文预训练数据效率模型集成推荐理由:多轮训练效率瓶颈是当前大模型预训练的痛点,q0用群体模型替代单模型精炼,做预训练或数据效率优化的研究者可以直接复现并应用到自己的训练流程中。原文稍后读已读值得跟进有用关注 预训练