09:47官方账号arXiv cs.LG@Zhihua Liang精选该论文提出一个连续几何框架,将Transformer的离散代数操作建模为语义纤维丛上的积分-微分方程,涉及RMSNorm、RoPE、Softmax Attention等组件。实验覆盖Qwen3、LLaMA-3.1、Gemma-3、GPT-2、Mistral五种架构,参数规模从124M到8B。几何预测与实证一致:Lipschitz缩放校准精度达R²=1.000,且验证了Poincaré递归的热力学抑制、上下文极限相变等六个现象。论文Transformer架构微分几何Qwen3推荐理由:用微分几何重新理解Transformer,给出了注意力机制是薛定谔桥、SGD是违反细致平衡的伊藤扩散等新视角,并有大模型实测验证。原文稍后读已读值得跟进有用关注 Transformer架构