7月14日
12:22
12:22官方账号arXiv cs.LG@Shikai Qiu, Marc Finzi, Yujia Zheng, Kun Zhang, Andrew Gordon Wilson
精选
传统参数压缩方法如量化产生码长随模型参数缩放,而prequential coding码长取决于数据熵。本文提出的requential coding使码长独立于参数数和数据熵,通常比prequential短数个数量级。在PAC-Bayes界中,该方法为十亿参数LLM提供了当前最优的泛化保证。实验还发现低熵文本比高熵图像包含更多可学习结构。
推荐理由:这篇论文提出Requential Coding,码长不跟着模型大小和数据熵跑,比之前的方法短好几个数量级,还给十亿参数大模型给出了最牛的泛化保证。
6月19日
09:40
09:40官方账号arXiv cs.LG@Jian Xu, Delu Zeng, John Paisley, Qibin Zhao
该论文指出量子视觉Transformer和量子卷积网络有两个未解释现象:纠缠更多的ansatz泛化更好,注入量子噪声可提升测试准确率。作者通过量子核视觉模型证明两者由有效维度d_eff控制,去极化噪声使d_eff收缩至1,振幅阻尼在倒U型区间提升准确率最高+13%。论文提供了容量/对齐风险分解,将两个孤立现象统一为可测量原则。
推荐理由:这篇论文把量子视觉模型里两个反直觉现象(纠缠越多越好、加噪声反而更好)归结成一个可测量的有效维度,你读完就能抓住设计关键。