arXiv 上这篇论文教扩散语言模型同时建模 token 和粗粒度聚类表示,H-CoBit 在 LM1B 上 GenPPL 比基线低 24.2 分,代码也放出来了。
#扩散语言模型
共 21 条 · 7 天 2 条 · 30 天 5 条
信息流里打上「扩散语言模型」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月7日
H-CDLM:分层联合扩散框架提升连续扩散语言模型
10月5日
Pivot-SD:用自蒸馏提升掩码扩散语言模型推理能力
只拿 200 道题微调,就让 LLaDA-8B-Instruct 的数学和代码成绩跑赢 SFT 和扩散 RL,方法还挺省算力,做扩散模型训练的可以看看。
10月2日
9月17日
9月14日
CanvasAnneal框架提升扩散语言模型推理能力
这是篇研究论文,作者提出了一种叫CanvasAnneal的新框架,专门用来提升扩散语言模型做复杂推理的能力,比如数学题和用工具,效果比之前的方法好。
8月5日
7月26日
7月17日
7月3日
英伟达开源 TwoTower AI 模型:保留 98.7% 质量,Token 生成提速 2.42 倍
英伟达放出了一个双塔扩散模型,生成速度比普通模型快 2.4 倍,质量只掉了 1.3%,权重和代码都已经开源了。
7月2日
NVIDIA推出Nemotron-Labs-TwoTower:将30B模型拆二并行生成token
NVIDIA把30B模型劈成两半,并行写token,速度翻倍还保质量,不是新训模型是复用预训练,挺聪明的做法。
7月1日
6月30日
论文10:03
自适应块扩散:解决扩散语言模型中的训练-推理不匹配这篇论文解决了扩散语言模型在训练和推理时配置不一致的痛点,用ABD方法在多种配置下训练一个模型就能通用,不用再为不同解码策略分别训练了。
6月27日
字节跳动与人大发布扩散语言模型iLLaDA,8B参数媲美Qwen2.5
字节跳动发了新模型iLLaDA,8B参数用扩散方式生成文本,基础性能不输Qwen2.5,微调后稍弱,适合想了解非自回归路线的读者。
6月23日
6月12日
GoogleDeepMind 发布 DiffusionGemma:26B 扩散语言模型,vLLM 原生支持
DiffusionGemma 用并行去噪替代逐 token 生成,大幅提升推理速度,做大规模文本生成或实时应用的团队可以直接在 vLLM 中体验,值得关注。
6月5日
SARDI:扩散语言模型的自增强检索方法
SARDI巧妙利用了扩散模型去噪过程中的“废料”token,为RAG提供了一种零成本的前瞻信号,做问答系统或检索增强生成的团队值得关注,可以直接集成到现有扩散模型中提升效果。
6月2日
5月19日
Elastic-dLLM:位置保持的扩散LLM上下文压缩与增强
扩散LLM的并行解码效率一直是痛点,这篇工作直接戳中计算冗余的核心,做模型推理加速或长上下文应用的开发者值得关注,压缩方法可以直接集成到现有dLLM中。
5月17日
Don’t Retrain, Align:训练Diffusion LLM速度提升4倍
做扩散模型或生成式AI的团队,终于不用从零训DLM了——对齐预训练AR模型就能省4倍训练成本,低数据场景尤其划算,建议直接看论文和代码。