#Transformer
LoGo让模型智能决定哪些token需要全局注意力,大幅提升长文本处理效率,比传统Transformer更聪明。
TANGO模型在自然和形式语言建模中表现出色,计算效率高,值得关注。与WANGO相比,在序列长度线性复杂度下表现更优。
Next-Scale Transformer模型在人脸合成方面表现出色,与现有模型结合,生成更精确的3D人脸模型,值得关注。
放疗圈看过来,这个模型把左前降支动脉分割做得更准,比nnU-Net和Swin UNETR都强,还用了LoRA省显存,值得试试。
作者盘点了11条2026年AI趋势,说3/4已经应验,断言Agent接管产品、toA爆发、Transformer到头,想抓风口的可以看看。
RepairFormer用Transformer自动修复损坏的JSON等文件,保留内容,修复率88%,速度比现有方法快5倍。
Cohere 拿学生 Transformer 玩梗,Aidan Gomez 接话说要复活 Google Brain,这俩人到底在暗示啥,点开视频不就知道了。
不用贴探头就能测电池状态,深圳先进院这套激光超声方案SoC误差不到6%,还发了Science Advances,搞电池的值得看看。
这篇论文把Transformer的上下文管理建模成带Pop的栈,证明两个可弹出的通道就够模拟一切可计算函数,比只看参数规模有意思多了。
如果你关注医疗预测或时间序列,这篇论文的HierSTT模型用一个框架搞定多层级预测,WAPE降了32%,还开源了数据集和代码。
斯坦福团队搞了个新招:不用梯度下降,直接把事实写进Transformer的MLP里,论文被COLM 2026收了,想了解怎么不训练就灌知识的可以看看。
这篇论文把稀疏和低秩两种思路拧在一起,解决Transformer的长序列瓶颈。不用算完整的注意力矩阵,就能同时抓住局部和全局信息。