8月25日
11:28
11:28官方一手arXiv: Google DeepMind@Joshua Nunley
TANGO模型通过跨token门控残差更新替代了传统的Transformer块,在FineWeb-Edu、Lean和DeepMind Mathematics等基准测试中表现出色,与WANGO模型相比,在序列长度线性复杂度下计算效率更高。TANGO和WANGO均优于Recurrent和Untied Transformer++、full-attention GAU和FLASH模型。
推荐理由:TANGO模型在自然和形式语言建模中表现出色,计算效率高,值得关注。与WANGO相比,在序列长度线性复杂度下表现更优。
11:02
11:02官方账号arXiv cs.LG@Federico Stella, Fei Jiang, Zhongshi Jiang, Zohar Barzelay, Emanuel Garbin, Amin Jourabloo, Liuhao Ge
Next-Scale Transformer模型在人脸多视角合成方面取得进展,通过高分辨率、多视角输出和跨视角一致性,实现更真实的人脸视图合成。模型在合成数据集上训练,无需2D预训练,使用通用预训练,最终生成清晰、逼真的3D人脸模型。
推荐理由:Next-Scale Transformer模型在人脸合成方面表现出色,与现有模型结合,生成更精确的3D人脸模型,值得关注。
8月24日
09:53
09:53官方账号arXiv cs.LG@Mieszko Komisarczyk, Saurabh Mathur, Maurice Kraus, Sriraam Natarajan, Kristian Kersting
Tydra,一种混合Transformer-State Space Model架构,在30个OpenML数据集上,相较于TabPFN减少30%的推理时间,同时保持大部分预测性能,优于Hydra模型,表明混合架构是表格基础模型的有前景方向。
推荐理由:Tydra模型在保持预测性能的同时大幅降低推理时间,比Hydra模型更高效。
8月22日
08:34
8月18日
8月17日
10:27
10:27官方账号arXiv cs.AI@Pin-Yen Huang, Sachin Chhabra, Prasanth Sai Gouripeddi, Abhinav Kumar, Baoxin Li
RecipeNet是一种层级Transformer架构,用于编码配方数据中步骤内的字段交互和步骤间的顺序依赖。实验在多个配方数据集和任务上进行,结果显示RecipeNet持续优于现有表格模型,证明了层级与顺序建模对配方表示学习的价值。该研究来自arXiv论文2608.14505v1。
推荐理由:论文提出了RecipeNet,专门处理材料合成、制药配方这类结构化步骤数据,比通用表格模型更能捕捉层级和顺序信息。
8月15日
10:11
8月7日
8月6日
06:48
06:48官方账号Cohere@cohere
Cohere 官方账号发布视频,配文称“学生 Transformer 已变成大师”,并引用了 Aidan Gomez 的推文。Aidan Gomez 在推文中写道“Time to bring back Google Brain”。这条互动推文在 X 平台获得 22 个点赞、2529 次浏览。
推荐理由:Cohere 拿学生 Transformer 玩梗,Aidan Gomez 接话说要复活 Google Brain,这俩人到底在暗示啥,点开视频不就知道了。
8月5日
8月4日
8月3日
7月31日
12:37
12:37官方账号arXiv cs.LG@Jonathan J. Heckman, Shani Meynet, Alessandro Mininno, Gary Shiu
该论文用机器学习判定超对称quiver规范理论中的Seiberg对偶,数学上等价于判断quiver的突变。在约10个节点的quiver上,Transformer和多层感知机架构的表现优于确定性算法。加入pathfinder算法(作者称之为“quiver版Google Maps”)后,搜索效率和准确率进一步提升。论文认为这类问题可作为前沿AI模型用于理论物理的基准测试。
推荐理由:这篇论文用AI判断两个物理系统是否对偶,在约10节点quiver上比传统算法快,还配了“quiver版谷歌地图”提高准度。
7月27日
12:13
12:13官方账号arXiv cs.AI@Alex Koziell-Pipe, Jasmine Brewer, Jem Guhit, Marwa H. Farag, Kripa Panchagnula, Gabriel Laude, Fabian Finger, Carlo Gaggioli, Ludmila Szulakowska, Oliver J. Backhouse, Christos Papalitsas, Jason G. Mustakis, Thomas Soini, David Munoz Ramo, Stephen Clark, Elica Kyoseva, Enrico Rinaldi
ADAPT-GQE是一个生成式AI框架,利用ADAPT-VQE生成的参考电路训练模型,再通过强化学习提升电路生成精度。在抗抑郁药分子imipramine上测试,电路生成时间比ADAPT-VQE减少一个数量级,准确度相当或更优。生成的电路已在Quantinuum Helios-1量子硬件上成功执行,这是AI生成量子化学电路在先进量子硬件上的里程碑。
推荐理由:这个框架能自动设计量子化学电路,比传统ADAPT-VQE快10倍,还在真实量子计算机上跑了实验。搞量子计算化学的可以看看。
11:58
11:58官方账号arXiv cs.AI@Hai-Long Nguyen, Trung Thanh Nguyen, Lars Holm, Dennis Alveringh, Duc Viet Le
PRIMS是一种物理感知的多模态Transformer,通过三个模块将物理知识融入表示学习和注意力机制。在五流体基准上,PRIMS达到98.92%平均F1分数,参数量仅0.46M,比最先进Transformer方法缩小14倍。在未见过的温度范围和流速范围分布外偏移下,PRIMS持续优于现有最佳模型,展现出对未训练工况的强鲁棒性。
推荐理由:PRIMS把物理规则直接写进模型结构,用0.46M参数在5种流体识别上拿到98.92% F1,比大模型小14倍还更抗干扰,适合微流控场景。
7月23日
13:07
13:07Stanford AI Lab@StanfordAILab
斯坦福团队提出一种无需梯度下降即可将事实知识写入Transformer MLP的封闭形式方法。该方法可直接将事实编码进Transformer块,无需训练。相关论文已被COLM 2026接收。研究者包括Jerry Liu、Garctrob、Ronny Junkins等。
推荐理由:斯坦福团队搞了个新招:不用梯度下降,直接把事实写进Transformer的MLP里,论文被COLM 2026收了,想了解怎么不训练就灌知识的可以看看。
11:22
11:22官方账号arXiv cs.AI@Mahdi Heidari, Mohammad Mahdi Rahimi, Jaekyun Moon
ELSAA提出一种结合稀疏和低秩分支的注意力近似方法,避免显式计算完整的N×N注意力矩阵。稀疏分支捕捉高相似度交互,低秩分支压缩全局信息,并通过分母感知融合项平衡两者。该方法旨在支持更长上下文训练,同时保留token级交互和上下文混合能力。在多个长序列基准上验证了其效率与效果。
推荐理由:这篇论文把稀疏和低秩两种思路拧在一起,解决Transformer的长序列瓶颈。不用算完整的注意力矩阵,就能同时抓住局部和全局信息。
7月21日
09:56
09:56官方账号arXiv cs.LG@Rong Fu, Yongtai Liu, Xiaowen Ma, Haoyu Zhao, Shuo Yin, Yiqing Lyu, Long Zhang, Wangyu Wu
精选
DynImmune-BERT是一种连续时间免疫组库模型,用于患者免疫状态预测。该模型结合了深度自适应中心对数比初始化、克隆存在门控神经ODE动态和边界邻域自注意力。它通过低秩元适配器初始化复发克隆型,参数数量独立于观察到的克隆数。在纵向T细胞受体库数据集上的评估显示,事件感知的时间建模能增强静态编码器性能,但小规模外部队列需谨慎解读。
推荐理由:你要是做免疫组库时间序列分析,这个模型把神经ODE和Transformer揉在一起,能处理克隆动态和复发,比静态模型强。
7月17日
10:00
09:50