11:22官方账号arXiv cs.LG@Sajib Hossain, Md Kamrus Samad, Anan Ghosh, Labib Imam Chowdhury, Nabeel Mohammed该论文提出BnBERT-iPET,一种面向孟加拉语的稀疏少样本语言建模方法。通过迭代模式利用训练和彩票假设剪枝,模型仅保留初始BERT网络10%的边,实现90%稀疏度。在孟加拉语标准基准数据集上,该轻量模型与Bangla Electra、Indic-BERT、XLM-RoBERTa等大规模模型表现相当。该方法降低了资源受限语言训练大模型的计算成本和碳排放门槛。论文BnBERT-iPETBengali模型剪枝推荐理由:这篇论文用剪枝把BERT砍到只剩10%参数,孟加拉语任务上还能和大模型打平,做低资源语言NLP的可以看看。原文稍后读已读值得跟进有用关注 BnBERT-iPET
11:33官方账号arXiv cs.LG@Pere Martra, Eugenio Martínez Cámara, Alfonso Ureña LópezFairness Pruning是一种轻量结构干预方法,用于定位大语言模型中的群体偏见。实验在Llama-3.2系列和Salamandra-2B等最大3B参数模型上进行,结合标准基准和定性生成测试。在Llama-3.2-1B上归零最多40个神经元(不到总MLP宽度的0.031%),推理和通用知识能力保留均值达99.49%。由于BiasScore无符号,候选集混合了促进和抑制刻板印象的神经元,干预导致双向偏见失稳。结果证实群体偏见处理与模型能力运行在可分离的电路上。论文Llama-3.2Salamandra-2B模型剪枝推荐理由:这篇论文教你用剪枝定位偏见:最多剪40个神经元,Llama-3.2-1B能力保住99.49%,但偏见不是消失而是换了方向。原文稍后读已读值得跟进有用关注 Llama-3.2
12:03官方账号arXiv cs.LG@Raktim Bhattacharya研究团队为Mamba等选择性状态空间模型开发了一种精确测量状态使用的工具,该工具基于对角状态矩阵将输出分解为每个模态贡献,并通过Gram张量计算任意子集剪枝的精确误差。在Mamba-1家族(130M至2.8B参数)上验证,与参考实现相对误差仅2.3×10⁻⁷;该工具预测一层剪枝误差的中位相对偏差为5×10⁻⁷(基于4,464个配置)。分析Mamba-1、已部署的7B Falcon-Mamba及Mamba-2发现,模型会随输入重新分配状态空间,哪些模态承载信号会随上下文迁移;基于输入调度的模态剪枝在各级别(130M至7B)均优于静态、Hankel及自适应排名,在半预算下匹配未剪枝模型性能。论文Mamba选择性状态空间模型模型剪枝推荐理由:这篇论文给出了一个能精确测量Mamba状态使用情况的工具,还发现模型会根据输入动态调整哪些状态起作用——基于这个发现做剪枝,效果比之前的方法好很多,7B模型上预算减半性能不变。原文稍后读已读值得跟进有用关注 Mamba
11:26官方账号arXiv cs.LG@Marco Deano, Filippo Ziche, Nicola Bombieri论文提出S4oP,一种增量式运算符级剪枝方法,针对S4和S4D结构状态空间模型。该方法通过交替结构化掩码和微调逐步剪枝运算符。实验在多个基准数据集上表明,剪枝70%的模型运算符仍能保持原模型性能,同时显著降低推理延迟。这是首次系统研究SSM的结构化运算符剪枝。论文S4oPS4S4D推荐理由:这篇论文把S4模型剪掉70%计算量还能保持性能,想在小设备上跑S4模型可以看看。原文稍后读已读值得跟进有用关注 S4oP
09:11官方一手arXiv: DeepSeek@Leonard Engmann, Christian Medeiros Adriano, Holger Giese精选这篇论文对混合专家模型(MoE)中的专家重要性评估方法进行了因果审计。研究者发现,当前广泛使用的路由统计指标(如利用率、激活范数、路由权重分布)无法预测哪些专家可以被移除而不影响模型功能。他们在 OLMoE-1B-7B-0924、Qwen1.5-MoE-A2.7B 和 DeepSeek-V2-Lite 三个高冗余 MoE 架构上进行了 token 级干预实验,结果在所有 60 个指标-层组合中,观测指标与因果重要性之间的效应量均低于 Cohen's d = 0.17。现有剪枝方法之所以有效,并非因为它们识别出了可去除的专家,而是因为早期层的冗余性使得大多数选择标准可以互换。这项研究为可解释性领域提供了一个明确的反例,说明从总体观测统计到 token 级干预结论的推理步骤需要更严格的因果验证。论文MoE/混合专家模型剪枝因果推断推荐理由:MoE 模型剪枝的常用假设被实验证伪了——做模型压缩或可解释性研究的团队,建议重新审视你的专家选择策略,别再依赖路由统计指标。原文稍后读已读值得跟进有用关注 MoE/混合专家