AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

Transformer架构

共 2 条相关 AI 资讯
7月21日
09:47
09:47官方账号arXiv cs.LG@Zhihua Liang
精选
该论文提出一个连续几何框架,将Transformer的离散代数操作建模为语义纤维丛上的积分-微分方程,涉及RMSNorm、RoPE、Softmax Attention等组件。实验覆盖Qwen3、LLaMA-3.1、Gemma-3、GPT-2、Mistral五种架构,参数规模从124M到8B。几何预测与实证一致:Lipschitz缩放校准精度达R²=1.000,且验证了Poincaré递归的热力学抑制、上下文极限相变等六个现象。
论文Transformer架构微分几何Qwen3

推荐理由:用微分几何重新理解Transformer,给出了注意力机制是薛定谔桥、SGD是违反细致平衡的伊藤扩散等新视角,并有大模型实测验证。
原文
5月26日
12:20
12:20官方账号arXiv cs.LG@Sanghyun Lee, Chunsan Hong, Seungryong Kim, Jonghyun Lee, Jongho Park, Dongmin Park
精选
本文提出 LoopMDM(Looped Masked Diffusion Model),通过在掩码扩散模型的早期-中间层选择性循环,显著提升训练效率和模型性能。训练时循环层产生深度缩放效果而不增加参数,推理时可变循环次数实现灵活计算缩放。在多个预训练语料上,LoopMDM 匹配同尺寸 MDM 性能但节省高达 3.3 倍训练 FLOPs,在 GSM8K 等推理基准上提升最多 8.5 分,甚至超越更深层非循环模型。注意力分析表明,循环促进了掩码位置间的交互。代码和权重将开源。
论文掩码扩散模型Transformer架构训练效率

推荐理由:做扩散语言模型或高效 Transformer 架构的开发者值得关注——LoopMDM 用简单循环层技巧同时省训练算力、提推理性能,直接可复现。
原文
精选全部日报登录