这篇论文发现Transformer学算术的方式跟人很像,用教人算术的策略来调模型,效果还真不错,想了解LLM推理机制和可解释性的话值得一看。
#Transformer
VAIOM 是专门处理金融连续数据的解码器模型,在汇率数据上比 LightGBM 强 0.03 比特以上,创新点是把连续输入和离散输出分开建模,值得做时序预测的人一看。
这篇论文揭示了量子电路合成里Transformer的一个关键问题:自回归漂移让长电路精确匹配率从88%几乎归零,即使数据翻倍也只能部分缓解,值得搞量子计算和AI交叉的人看。
这篇论文用数学方法搞清楚了Transformer在归纳推理任务中怎么学习不同策略,还解释了in-context和in-weights学习谁赢跟数据统计有关,挺有启发性。
这篇论文告诉你,不用几千GPU天也能搜出好架构,普通3060显卡3小时就能找到比ResNet-20更小的CIFAR-10模型,还能直接优化欺诈检测的F1分数。
这篇论文讲了Transformer的理论短板——表达性研究够了,但学不学得会还不知道。他们用C-RASP给出了样本复杂度的初步界限,对想深挖模型理论的人很有用。
这篇论文搞清楚了Transformer线性化为什么delta式更厉害,还给出了具体修补方案,在LLaMA和Qwen上跑到了32B,MMLU成绩比之前的后验方法好。
这篇论文提出了一个统一的采样框架,帮你理解模型在不同大小输入上的泛化能力,还能把大输入压缩成小输入来节省计算,例子涵盖Transformer和图神经网络。
卡帕西、李飞飞、辛顿都投了这家做Transformer专用芯片的公司,刚签下10亿美元大单,芯片已流片,值得一看。
这篇论文用几何视角解释了神经网络为什么先死记硬背后突然泛化,还找到了一个简单技巧(约束隐藏层半径)让 grokking 快 6 倍,值得搞训练的人看看。
这篇论文告诉你如何在不牺牲性能的前提下大幅降低多模态大模型的计算量。他们在Qwen3-VL上砍了33.7%的算力,性能只掉了0.5%,方法很巧妙。
GloVe和Transformer的创造者Manning要讲语言模型怎么和机器人结合了,想了解具身智能世界模型的可以听听。
Allen AI 搞了个新模型 DiScoFormer,一个 Transformer 既能算密度又能算得分,比 NICE 这些老方法误差更低。想省事搞密度估计的可以看看。
Transformer预测隐状态而不是token能加速3.3倍,还能形成世界模型。Jayden Teoh的新框架值得看看。
富士通新架构PHOTON在多查询任务上比Transformer快475倍,1.2B小模型实测,省内存省GPU。
NVIDIA 搞了个 NeMo AutoModel,能自动帮你加速微调 Transformer 模型,省去手动调参的麻烦,速度还快很多,适合想快速出结果的人。
这篇论文发现了一个简单技巧:同等算力下,把更多参数分给前几层、少给后几层,模型效果就能更好,试了多种架构都管用。
这家日本AI公司有Transformer论文作者和前Google Brain负责人,主打集体智能,背景扎实值得看。