全部 AI 动态 · AI 热点

6月16日

20:46

AITOP6月16日 20:46

600亿美元买下Cursor，xAI终于拿到了编程工具，但真正值得跟踪的或许不是AI

600亿美元买下Cursor，xAI终于拿到了编程工具，但真正值得跟踪的或许不是AI

6月12日

12:57

AITOP6月12日 12:57

Claude代码里藏了个20260612，18个月后的AI记忆革命已经开始倒计时

6月11日

15:28

AITOP6月11日 15:28

1107 vs 303：谷歌悄悄开源了一个“拆打字机”的模型，把大模型速度翻了4倍

15:23

AITOP6月11日 15:23

DiffusionGemma颠覆文本生成？自回归模型的“统治”要结束了

15:07

AITOP6月11日 15:07

每秒1107个token，Google开源的扩散模型为什么能改变本地推理格局？

6月8日

10:35

10:35

arXiv cs.LG@Simon Schug

该研究提出了一种名为Sgatlin（稀疏门控线性神经元）的新型网络结构，通过将每个专家缩小为单个神经元并移除非线性激活函数，在保持稀疏性的同时提升了计算效率。在等计算量对比中，用Sgatlin替换Transformer的前馈层可改善语言模型的困惑度。此外，稀疏性和线性结构使得模型更易解释，无需额外训练即可分析前馈电路，发现其形成语义聚类并参与事实回忆。这项工作为构建计算高效且可解释的Transformer前馈层提供了新思路。

论文稀疏门控线性专家 Transformer 可解释性计算效率

推荐理由：这项研究用极简设计同时提升了Transformer的计算效率和可解释性，做模型压缩或可解释性研究的团队值得关注，尤其是对MoE稀疏化方向感兴趣的开发者可以看看。