09:34官方账号arXiv cs.LG@Quentin Luquet de Saint-Germain, Massil Ait Abdeslam, Jean Pierre David该方法利用训练集上累积和的分布,在累加过程中提前预测最终符号。在VGG11应用于CIFAR-10时,最深层卷积可去除86.6%的累加项,精度仅下降0.37个百分点。同时作用于三个最深卷积时,减少全网络25%的算术操作,精度下降1.36个百分点。全程无需重新训练模型参数。论文二值神经网络VGG11CIFAR-10推荐理由:这篇论文提出一个后训练技巧,能在二值网络里提前跳过大量累加计算,VGG11在CIFAR-10上最多省86.6%运算,精度损失很小。原文稍后读已读值得跟进有用关注 二值神经网络
19:12官方一手arXiv: DeepSeek@Joel Schreiber, Ariel Goldstein精选75°该研究对微调导致的大模型“突发性错位”(EM)现象进行了迄今最全面的分析。研究复现了GPT-4o上的EM现象,并扩展至12个开源模型(Llama、Qwen、DeepSeek、GPT-OSS,8B-671B参数),评估了超过100万条模型响应。结果发现EM仅在17%的开源模型中稳定复现,且与模型规模显著相关。通过检查点分析,研究者发现EM出现在训练后期、主任务收敛之后,本质上是“过度训练”而非“错误对齐”。早期停止和谨慎选择学习率可消除EM,同时保留平均93%的任务性能。该发现将EM从不可预见的微调风险重新定义为可避免的训练产物。论文突发性错位微调安全早期停止推荐理由:做LLM微调的团队终于有了避免“突发性错位”的实操指南——早期停止就能保留93%性能,建议所有做安全对齐的工程师点开看看具体阈值。原文稍后读已读值得跟进有用关注 突发性错位