10:54官方账号arXiv cs.LG@Elena Dumitrescu, Gert Lek, Lydia Y. Chen, Jérémie Decouchant论文揭示Diffusion LLM的安全对齐机制稀疏且可迁移,自剪枝可将LLaDA攻击成功率从2.6%提升至73.8%,Dream从1.9%升至86.6%。作者提出SN-Guided Diffusion黑盒越狱框架,通过加权安全神经元损失引导扩散过程,在良性提示与越狱提示判别上AUROC达1.0。该框架在Llama-3-8B-Instruct上迁移成功率77.1%,Qwen2.5-7B-Instruct达86.9%,Gemini-2.5-Flash-Lite为74.3%,每个提示仅需20次生成。相比此前越狱框架,生成成本降低数个数量级。论文Diffusion LLMAI安全LLaDA推荐理由:这篇论文发现扩散LLM的安全对齐其实很脆,用剪枝就能把越狱成功率拉到80%多,还给了个黑盒攻击框架SN-Guided Diffusion,成本低效果好。原文稍后读已读值得跟进有用关注 Diffusion LLM
11:08官方账号arXiv cs.AI@Tong Ling, Hang Lei, Feng Xiao, Changhui Sun, Jiahang Xie, Hao Liu, Lu Liu, Yanlong DuMDLMPE 将掩码扩散模型中 token 的可见/掩码状态编码为二进制序列,结合高斯权重与余弦基投影生成位置特征,再经轻量 MLP 映射为角度偏移来调制 RoPE 相位。在 LLaDA 和 DREAM 上的实验覆盖监督微调、预训练、零样本评测和块扩散设置,整体优于传统位置编码。消融实验表明,可用性状态、高斯局部性、频谱基与嵌入注入的组合效果最强。论文MDLMPELLaDADREAM推荐理由:掩码扩散模型的位置编码一直照搬自回归那套,MDLMPE 第一个把遮盖状态算进去,在 LLaDA 和 DREAM 上效果更好。原文稍后读已读值得跟进有用关注 MDLMPE
02:52elvis@omarsar0LLaDA 2.2 是首个大规模扩散语言模型,能够作为智能体自主完成规划、工具调用和错误修正。它在长多轮对话轨迹中保持稳定表现,并凭借块并行解码实现更快推理速度。该模型标志着扩散模型从静态生成向主动代理任务的关键跨越。AI模型LLaDA扩散语言模型智能体推荐理由:可以把扩散模型当成真智能体用,规划工具自己纠错,解码还比自回归快,不试试?原文稍后读已读值得跟进有用关注 LLaDA
09:37官方账号arXiv cs.AI@Longxuan Yu, Yunshu Wu, Yu Fu, Siheng Xiong, Rob Brekelmans, Hui Liu, Yue Dong, Greg Ver Steeg72°离散掩码扩散语言模型在少步解码时面临长度与质量的权衡:固定步数下,要么生成短而高质量的输出,要么生成长但重复的文本。连续去噪通过在嵌入空间联合演化所有位置来规避此问题,但大规模从头构建此类模型仍是难题。本文证明,预训练的掩码DLM可轻量适配以支持连续嵌入空间去噪:从LLaDA-8B-Instruct出发,仅用1000步继续预训练(离散随机定位DSL),将二元掩码替换为连续逐token高斯噪声作为软掩码。适配后的模型支持连续推理,在嵌入空间联合演化所有位置,并在最后一步才做出硬token承诺。在低步数(≤16次前向传播)的零样本摘要任务中,DSL-LLaDA-SDE在所有四个基准上取得最佳ROUGE-1,并大幅避免了迭代去掩码的提前终止/重复权衡。该适配还带来选择性噪声状态鲁棒性:模型能纠正被破坏的token,同时保留干净的token。对照实验表明,使用相同计算量的标准掩码扩散训练无法产生这两种行为。论文扩散语言模型连续去噪LLaDA推荐理由:这项研究解决了扩散语言模型在少步解码时的质量-长度权衡问题,做文本生成或摘要的开发者可以直接用DSL-LLaDA获得更好的零样本效果,值得关注。原文稍后读已读值得跟进有用关注 扩散语言模型
11:07官方账号arXiv cs.LG@Junyi Wu, Tianchen Zhao, Shaoqiu Zhang, Linfeng Zhang, Guohao Dai, Yu Wang精选扩散语言模型(dLLM)通过联合去噪一批[MASK]令牌实现并行解码,但大块掩码令牌导致大量计算冗余。研究发现,许多计算花费在重复处理前文上下文和特征表示相同的[MASK]令牌上。为此,提出位置保持的[MASK]令牌压缩和终端感知增强方法,通过压缩冗余计算加速解码,并自然扩展到长上下文场景。在LLaDA-8B-Instruct和LLaDA-1.5等全序列dLLM上验证了效果,对LLaDA2.0-mini等块dLLM,通过保护终端[MASK]令牌增强上下文,以极小开销提升生成质量。论文扩散语言模型上下文压缩并行解码推荐理由:扩散LLM的并行解码效率一直是痛点,这篇工作直接戳中计算冗余的核心,做模型推理加速或长上下文应用的开发者值得关注,压缩方法可以直接集成到现有dLLM中。原文稍后读已读值得跟进有用关注 扩散语言模型