Pivot-SD:用自蒸馏提升掩码扩散语言模型推理能力
只拿 200 道题微调,就让 LLaDA-8B-Instruct 的数学和代码成绩跑赢 SFT 和扩散 RL,方法还挺省算力,做扩散模型训练的可以看看。
只拿 200 道题微调,就让 LLaDA-8B-Instruct 的数学和代码成绩跑赢 SFT 和扩散 RL,方法还挺省算力,做扩散模型训练的可以看看。
这篇论文发现扩散LLM的安全对齐其实很脆,用剪枝就能把越狱成功率拉到80%多,还给了个黑盒攻击框架SN-Guided Diffusion,成本低效果好。
扩散LLM的并行解码效率一直是痛点,这篇工作直接戳中计算冗余的核心,做模型推理加速或长上下文应用的开发者值得关注,压缩方法可以直接集成到现有dLLM中。