#Transformer
共 195 条 · 7 天 7 条 · 30 天 28 条 · 话题观测 →
信息流里打上「Transformer」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月9日
10月8日
QCATS:查询上下文感知的 Transformer 切片框架加速数据库内预测查询
一篇数据库方向的论文:把 Transformer 剪成 FFN 切片塞进数据库里跑预测查询,用 BERT-base 和 Qwen-0.6B 实测延迟降到 1/4.42,精度不掉。做数据库+ML 的人可以看看。
10月7日
10月6日
MatrixFormer:面向矩阵补全的基础模型
团队训练了一个专做矩阵补全的 Transformer,一次前向就能补全整块缺失数据,零样本用在推荐、表格插补和因果推断上都行,思路和 TabPFN 这类逐条预测的表格模型不一样。
10月5日
斯坦福新课 CME 295 开讲:138 页讲义拆解从 Transformer 到 GPT 的演进
斯坦福 138 页 LLM 讲义免费公开,从缩放定律讲到 RoPE 和 GQA,想系统补基础的直接看这份。
10月2日
10月1日
9月29日
斯坦福 2026 秋季新课 CME 295:Transformers 与 LLM 开讲,第一讲公开
斯坦福这门新课 9 讲把 LLM 从 RoPE 到 RLHF、MCP 全讲一遍,第一讲课件和视频已经免费公开,自学党可以直接开刷。
9月28日
Progressive Memory Transformer:多尺度记忆注意力改进时间序列学习
一篇时间序列方向的新论文,给 transformer 加了可写记忆层,能同时捕捉局部波动和全局趋势,低标注场景下分类效果不错,做时序的朋友可以看看。
9月27日
9月26日
用 Claude Code + Opus 5.5 一句话生成《什么是 Transformer》科普视频
有人用一条提示词让 Claude Code 自己做了支讲 Transformer 的动画视频,提示词全文都贴出来了,照抄就能玩。
9月25日
9月24日
论文10:54
arXiv 论文分析排斥性自注意力的非平衡动力学:混沌、注意力凝聚与局域化把 transformer 注意力当成动力系统来分析的物理论文,找出了混沌、凝聚这些相变结构,做理论或注意力机制研究的可以看看。
论文提出共享全局 KV 加层级本地历史方案,降低语言模型困惑度
arXiv 上一篇讲 KV 缓存的新论文,用本地历史替换当前 token 分支,126M 模型上困惑度降了约 1.4%,做推理优化的人可以看看。
9月22日
像物理学家一样剪枝 LLM:把删 Block 变成 Ising 优化问题
Multiverse Computing 把“LLM 该删哪些层”写成 Ising 模型用物理方法解,比逐层打分剪枝的思路新鲜。
9月21日
9月18日
9月16日
9月10日
9月9日
9月8日
9月7日
9月4日
9月3日
9月2日