09:47官方账号arXiv cs.LG@Zhihua Liang精选该论文提出一个连续几何框架,将Transformer的离散代数操作建模为语义纤维丛上的积分-微分方程,涉及RMSNorm、RoPE、Softmax Attention等组件。实验覆盖Qwen3、LLaMA-3.1、Gemma-3、GPT-2、Mistral五种架构,参数规模从124M到8B。几何预测与实证一致:Lipschitz缩放校准精度达R²=1.000,且验证了Poincaré递归的热力学抑制、上下文极限相变等六个现象。论文Transformer架构微分几何Qwen3推荐理由:用微分几何重新理解Transformer,给出了注意力机制是薛定谔桥、SGD是违反细致平衡的伊藤扩散等新视角,并有大模型实测验证。原文稍后读已读值得跟进有用关注 Transformer架构
12:20官方账号arXiv cs.LG@Sanghyun Lee, Chunsan Hong, Seungryong Kim, Jonghyun Lee, Jongho Park, Dongmin Park精选本文提出 LoopMDM(Looped Masked Diffusion Model),通过在掩码扩散模型的早期-中间层选择性循环,显著提升训练效率和模型性能。训练时循环层产生深度缩放效果而不增加参数,推理时可变循环次数实现灵活计算缩放。在多个预训练语料上,LoopMDM 匹配同尺寸 MDM 性能但节省高达 3.3 倍训练 FLOPs,在 GSM8K 等推理基准上提升最多 8.5 分,甚至超越更深层非循环模型。注意力分析表明,循环促进了掩码位置间的交互。代码和权重将开源。论文掩码扩散模型Transformer架构训练效率推荐理由:做扩散语言模型或高效 Transformer 架构的开发者值得关注——LoopMDM 用简单循环层技巧同时省训练算力、提推理性能,直接可复现。原文稍后读已读值得跟进有用关注 掩码扩散模型