8月12日
8月7日
7月28日
7月23日
11:22
11:22官方账号arXiv cs.AI@Mahdi Heidari, Mohammad Mahdi Rahimi, Jaekyun Moon
ELSAA提出一种结合稀疏和低秩分支的注意力近似方法,避免显式计算完整的N×N注意力矩阵。稀疏分支捕捉高相似度交互,低秩分支压缩全局信息,并通过分母感知融合项平衡两者。该方法旨在支持更长上下文训练,同时保留token级交互和上下文混合能力。在多个长序列基准上验证了其效率与效果。
推荐理由:这篇论文把稀疏和低秩两种思路拧在一起,解决Transformer的长序列瓶颈。不用算完整的注意力矩阵,就能同时抓住局部和全局信息。
7月17日
07:54
07:54官方一手marktechpost@Asif Razzaq
83°
2026年7月16日,Moonshot AI 发布了 Kimi K3 模型,参数规模达2.8万亿。该模型采用 MoE 架构,包含896个专家,每次推理激活其中16个。Kimi K3 引入了 Kimi Delta Attention 和 Attention Residuals 机制,支持100万token的上下文窗口。模型以开源形式发布。
事件专题

推荐理由:Moonshot AI 把 2.8 万亿参数的 Kimi K3 开源了,用了新注意力机制,还有 1M 上下文,直接看技术细节就对了。
7月15日
7月5日
23:51
23:51官方账号Decoder@Jonathan Kemper
精选
百度发布了Unlimited OCR模型,一次性可处理数十页文档,而以往系统最多处理约10页。该模型通过改进注意力机制,使内存使用量不随页数增加而增长。Unlimited OCR目前在最重要的OCR基准测试中排名第一。

推荐理由:百度出了个Unlimited OCR,一次扫描几十页文档,内存不涨还拿了OCR基准第一,处理长文档效率提升明显。
6月18日
10:57
10:57官方账号arXiv cs.LG@Amiri Hayes, Belinda Li, Jacob Andreas
研究者提出用程序合成方法反向工程Transformer注意力头。他们先计算注意力矩阵,再让预训练语言模型生成Python程序来重现注意力模式。在GPT-2、TinyLlama-1.1B和Llama-3B上,不到1000个程序实现了平均IoU>75%。替换25%的注意力头仅导致16%的困惑度增加,并在下游问答基准上保持性能。
推荐理由:这篇论文用Python程序解释了注意力头怎么工作,还能直接用程序替换掉原始头,精度很高,想看模型内部机制的可以读。
6月16日
09:42
09:42官方一手arXiv: DeepSeek@Jiakai Li, Ke Qin, Rongzheng Wang, Yizhuo Ma, Qizhi Chen, Muquan Li, Shuang Liang
大推理模型(LRM)常因过度思考生成冗余token,降低准确率。ASAG方法通过分析注意力分布推断推理状态,自适应调整生成策略。该方法无需训练,可即插即用,在DeepSeek-R1-Distill和Qwen3系列等主流模型上测试。在Qwen3-8B上,ASAG平均准确率提升3.2%,生成token减少约40%。
推荐理由:想减少推理模型输出废话?ASAG免费即插即用,在Qwen3-8B上准确率升3.2%还省近40%token,实打实的效果。
6月9日
11:06
11:06官方账号arXiv cs.LG@Mikele Milia, Louis Fabrice Tshimanga, Henning Mueller, Manfredo Atzori, Barbara Di Camillo
精选
研究人员提出scTransformer,这是首个将已知基因调控关系作为先验知识融入Transformer注意力机制的方法。通过约束信息流遵循已知调控结构,模型学习到的细胞表示更具生物学意义。在疾病相关的单核RNA-seq数据集上,scTransformer在细胞类型分类任务中提升了准确率,增强了嵌入空间中细胞类型的分离度,并产生了与已知调控程序一致的注意力模式。该方法在不牺牲性能的前提下增强了模型可解释性,为构建生物学基础的单细胞组学基础模型迈出了原则性的一步。
推荐理由:做单细胞转录组分析的团队终于有了一个能同时提升性能和可解释性的Transformer方案——scTransformer把基因调控先验直接嵌入注意力机制,比黑盒模型更可信,建议做生物信息学基础模型的研究者点开看看。
6月2日
11:09
11:09官方账号arXiv cs.AI@Adrián Cánovas-Rodriguez, Miguel A. González-Illán, Maria Fernanda García-Cruz, Pedro Nortes Tortosa, José Salvador Rubio-Asensio, Miguel A. Zamora Izquierdo, Juan Antonio Martínez Navarro, Antonio F. Skarmeta
研究者提出基于注意力机制和迁移学习的桃叶损伤分类方法,解决不同田间环境下的域迁移问题。他们构建了包含 1,366 张桃叶、6 类损伤的公开基准数据集,并评估多种深度学习架构。EfficientNetB5 结合 CBAM 注意力模块取得最佳准确率 93.3%,在少数类上表现更强。针对本地 180 张图像的域迁移测试,EfficientNetB3+CBAM 通过微调策略达到 93% 的宏 F1 分数,证明注意力机制能提升模型跨域泛化能力。
推荐理由:农业 AI 落地常卡在域迁移上——不同果园的光照、品种会让模型失效。这篇用 CBAM 注意力+迁移学习把桃叶病害分类的跨域准确率拉到 93%,做作物病害检测的团队可以直接参考其微调策略。
6月1日
10:14
10:14官方账号arXiv cs.LG@Jiefang Xiao, Maolin Gao, Simon Weber, Guandao Yang, Daniel Cremers
本文提出 Functional Attention,一种将 Transformer 注意力机制重新解释为自适应基函数之间函数对应关系的方法。受几何函数映射启发,该方法用结构化线性算子替代 softmax 亲和度,从而获得紧凑、可泛化、分辨率不变的表示,显式捕捉全局依赖。实验表明,在求解 PDE、3D 分割和回归等算子学习任务中,Functional Attention 达到最先进性能,且对不同离散化方式保持鲁棒。项目代码已开源。
推荐理由:做算子学习或 PDE 求解的团队,终于有办法让 Transformer 不再把连续场当离散 token 处理了——Functional Attention 用函数对应替代 token 注意力,既提升泛化又保持分辨率不变,值得一试。
5月28日
5月27日