09:50官方账号arXiv cs.AI@Katie Everett该论文揭示了Transformer前馈块中跳接和归一化不仅控制幅度,还通过调整分支与跳接的比例来保留梯度的秩。实验表明Pre-Norm使秩趋于平稳,而Post-Norm导致秩崩溃。双矩阵结构的宽度扩展遵循Marchenko-Pastur律,在CIFAR-10上输入-输出雅可比矩阵的初始化秩可预测网络训练性能。论文Transformer秩崩溃初始化推荐理由:想搞懂Transformer为什么深了还能训练?这篇从秩角度拆解跳接、归一化、双矩阵的设计逻辑,比堆实验更透彻。原文稍后读已读值得跟进有用关注 Transformer
00:55官方账号Microsoft Research@MSFTResearch微软CVP Doug Burger与研究员Subutai Ahmad、Nicolò Fusi讨论人类记忆与机器智能的根本差异。他们指出人类在分心数小时后难以记住新密码,而Transformer模型能轻松完成。该讨论对比了神经科学与人工智能的核心区别。行业微软Transformer人类记忆推荐理由:微软大佬们聊了个有趣的话题:为啥你记个密码这么费劲,Transformer却轻轻松松,值得一看原文稍后读已读值得跟进有用关注 微软
10:05官方账号arXiv cs.LG@Sigma Jahan研究者提出ROBIN方法,通过敏感度分析排序注意力头并移除偏见子空间。在四个模型的实验中,ROBIN在所有模型上降低了WinoBias差距,同时保持了语言建模质量,优于整体置零方法。这些初步结果表明头级偏见修复不仅要考虑选择哪些头,还要考虑如何修改。论文TransformerROBINWinoBias推荐理由:这篇论文给出了一个白盒方法ROBIN,能精准定位模型中的偏见注意力头并修复,比直接抹掉整个头效果好。原文稍后读已读值得跟进有用关注 Transformer
09:18官方账号arXiv cs.AI@Mehdi Saeedi, Eddie Richter, Paul Hartke本文研究用44.8M参数的编码器-解码器Transformer进行量子电路合成。在参数化电路(2-6 qubits)上,混合方法(结构来自Transformer,角度来自经典优化)对3-6 qubit电路实现中位数保真度1.000。在Clifford+T电路(3-6 qubits)上,模型虽能学习有效语法和准确T计数,但精确等价率从≤9门的88%跌至超过26门时接近零。推理时生成多候选并通过等价验证选择,将精确匹配率从7%提升至22.5%;训练数据扩展2.5倍则提升至39.5%,但长电路退化仍存在。结论:当需要完全离散正确性时,自回归漂移限制可靠性,推理时搜索和数据扩展有效,而微调和模型多样化无效。论文Transformer量子电路Clifford+T推荐理由:这篇论文揭示了量子电路合成里Transformer的一个关键问题:自回归漂移让长电路精确匹配率从88%几乎归零,即使数据翻倍也只能部分缓解,值得搞量子计算和AI交叉的人看。原文稍后读已读值得跟进有用关注 Transformer
03:07Ate-a-Pi@svpino精选一本包含50个动手项目的书籍,用Python、PyTorch、Scikit-Learn等工具教你理解大型语言模型内部机制。项目覆盖分词、嵌入、输出logits、Transformer输出、注意力、MLP等核心主题。每个项目配有解决方案,如运用HellaSwag评估模型、用cosine相似度分析嵌入、实现logit lens等方法。完成全部项目可进入该领域前0.01%的水平。技巧LLMPyTorch实战项目推荐理由:想扎实掌握LLM原理?这50个实战项目从基础分词到高级注意力分析,用PyTorch一步步搭出来,比看论文快多了。原文稍后读已读值得跟进有用关注 LLM
12:20官方账号arXiv cs.LG@Tiberiu Musat, Tiago Pimentel, Nicholas Zucchet, Thomas Hofmann这篇论文提出了一个理论框架,解释Transformer语言模型如何涌现归纳推理能力。它统一了包括in-context n-grams和多跳推理在内的多种合成任务。作者证明,注意力模型的训练动力学可以限制在高度可解释的低维不变流形上,该流形用少量坐标而非数百万参数描述学习过程。利用该框架,他们分析了数据统计如何决定in-context学习与in-weights学习的竞争,并展示了流形坐标可自动检测模型学到的电路。这为预测Transformer学习行为提供了理论步骤。论文Transformer归纳推理学习动力学推荐理由:这篇论文用数学方法搞清楚了Transformer在归纳推理任务中怎么学习不同策略,还解释了in-context和in-weights学习谁赢跟数据统计有关,挺有启发性。原文稍后读已读值得跟进有用关注 Transformer
12:10官方账号arXiv cs.LG@Romain Amigon该论文提出了一种结合自回归Transformer控制器(强化学习训练)和人工蜂群算法(ABC)的混合NAS框架,可在消费级GPU(NVIDIA RTX 3060)上运行。在CIFAR-10数据集中,该方法用3小时搜索到参数量约17.4万的架构,达到84.85%准确率,规模和搜索成本均低于ResNet-20。在信用卡欺诈检测任务上,优化F1-Score达到0.71,模型仅需约4600参数。该框架解决了元启发式方法的冷启动问题,并通过深度惩罚抑制模型臃肿。论文NASTransformer神经架构搜索2 个信源在谈事件专题推荐理由:这篇论文告诉你,不用几千GPU天也能搜出好架构,普通3060显卡3小时就能找到比ResNet-20更小的CIFAR-10模型,还能直接优化欺诈检测的F1分数。原文稍后读已读值得跟进有用关注 NAS
12:00官方账号arXiv cs.LG@Michael Rizvi-Martel, Satwik Bhattamishra, Guillaume Rabusseau, Michael Hahn这篇论文聚焦Transformer的理论理解,指出已有研究大多分析其表达性,但很少涉及可学习性。受损失景观分析启发,作者初步提出了学习C-RASP构造的样本复杂度边界。该工作为理解Transformer在有限样本下的学习能力提供了理论基础。论文TransformerC-RASP样本复杂度推荐理由:这篇论文讲了Transformer的理论短板——表达性研究够了,但学不学得会还不知道。他们用C-RASP给出了样本复杂度的初步界限,对想深挖模型理论的人很有用。原文稍后读已读值得跟进有用关注 Transformer
10:56官方账号arXiv cs.LG@Byung Gyu Chae该研究在Pythia语言模型中提取Transformer层雅可比矩阵的松弛谱,直接测量了弛豫态密度(TDOS)、记忆自能、遗忘间隙、记忆核和红外临界指数。测量发现慢弛豫模式呈现红外累积,产生近似平坦的TDOS(ρ(λ)~λ^{-0.1})和标度无关的记忆核(K(t)~t^{-1})。记忆自能在早期优化中出现瞬态最大值,随后松弛到近临界亚稳态,此时遗忘间隙最小、集体磁化率最大。这些定量实验证据表明Transformer动力学受红外集体组织支配,且该行为在不同训练阶段、网络深度和模型规模下均可复现。论文PythiaTransformer认知场理论推荐理由:这篇论文用Pythia模型实测了Transformer内部动力学的红外组织现象,发现记忆核呈标度无关性,挺硬核的理论研究。原文稍后读已读值得跟进有用关注 Pythia
09:40官方账号arXiv cs.LG@Gabriel Mahuas, Victoria Shevchenko, Ugo Tanielian, Yassir Bendou, Richard Gao该论文提出CoCoT-EEG,一种对比预训练的多尺度卷积Transformer模型,用于脑电图解码。在多个异构电极配置的基准任务上,CoCoT匹配或超越了基于掩码重构预训练的最先进模型。从零开始训练的CoCoT也优于先前单任务解码模型,展现出数据效率。通过系统消融实验,作者验证了对比学习用于构建EEG基础模型的可行性,并指出关键架构设计考量。论文CoCoT-EEG对比学习EEG解码推荐理由:这篇论文用对比学习做EEG预训练,比传统掩码重构效果好,架构设计很实在,搞脑机接口的可以看看。原文稍后读已读值得跟进有用关注 CoCoT-EEG
18:08AI Will@FinanceYF5该视频教程通过5个阶段(LLM入门、Transformer架构、训练过程、模型现代化改造、扩展)完整演示如何从零构建大语言模型。作者全程边讲边敲代码,覆盖ChatGPT、Claude等模型的核心原理。视频时长3小时,代码全程可见,适合想深入理解LLM工作原理的开发者。技巧LLMTransformer训练过程推荐理由:想搞懂ChatGPT和Claude怎么造出来的?这个3小时教程从零敲代码,全程干货,比看书快多了。原文稍后读已读值得跟进有用关注 LLM
10:15官方账号arXiv cs.LG@Anna Kuzina, Paul N. Whatmough, Babak Ehteshami Bejnordi72°论文揭示了因果自注意力二次复杂度对长上下文推理的瓶颈,在冻结骨干网络下隔离了状态更新设计的效果。研究表明Softmax依赖key相关的秩1正交投影,解释了为何delta式网络优于纯门控累积。作者通过引入sink token、短卷积和固定预算缓存路由等结构干预,减少了近似误差。在LLaMA和Qwen模型上扩展至32B参数,MMLU基准超越了先前后验线性化方法,长上下文检索匹配复杂自适应缓存框架。论文LLaMAQwenTransformer1 个信源在谈事件专题推荐理由:这篇论文搞清楚了Transformer线性化为什么delta式更厉害,还给出了具体修补方案,在LLaMA和Qwen上跑到了32B,MMLU成绩比之前的后验方法好。原文稍后读已读值得跟进有用关注 LLaMA
09:57官方账号arXiv cs.LG@Eitan Levin, Venkat Chandrasekaran该论文提出使用随机采样映射(如替换采样、随机分箱、物种采样)来比较不同大小的输入(如点云点数量不同、序列token长度不同、图节点数不同)。通过分析领域内问题实例的对称性,确定了每种采样类型的适用场景。框架给出了函数类连续性的显式泛化率和草图化率,涵盖序列、图和张量上的函数族。具体例子包括矩多项式、同态密度、置换不变Transformer和图神经网络。论文采样泛化图神经网络推荐理由:这篇论文提出了一个统一的采样框架,帮你理解模型在不同大小输入上的泛化能力,还能把大输入压缩成小输入来节省计算,例子涵盖Transformer和图神经网络。原文稍后读已读值得跟进有用关注 采样
09:34官方账号arXiv cs.AI@Azwar Abdulsalam, Nishil Patel, Andrew Saxe论文在可观测的符号重写语法环境中研究RL后训练能否组合原始技能。Transformer在原始符号重写链上预训练,后通过二元最终答案奖励的Trace推理任务进行RL训练。RL能解决预训练模型即使加大采样预算也极少解决的难题,而拒绝微调早期有提升但随后停滞。Trace分析显示RL通过阶段性组合机制:先强化原始缩减,再发现有效组合过程,包括顺序组合和并行组合。对比表明RL相较于拒绝微调的关键差异不在于探索量,而在于选择性——RL将探索聚焦于有效可复用结构。论文TransformerRLrejection fine-tuning推荐理由:这篇论文用可控实验证明了RL后训练能从头组合出高级推理策略,不是只增强已有技能,对理解强化学习训练机制很有启发。原文稍后读已读值得跟进有用关注 Transformer
10:02官方账号arXiv cs.LG@Jie Huang, Pengfei Yin, Zihan Xu, Daniel Capurro, Mike Conway, Ting Dang电子健康记录基础模型(FEMR)预训练于大规模结构化患者数据,但缺乏可解释性。X-FEMR训练一个Transformer代理模型来近似FEMR在两个预测任务上的行为。该方法识别最影响预测的token,揭示患者历史不同方面的重要性。引入临床对齐度量,量化代理模型关键token与临床验证特征的一致性。实验表明代理模型能很好近似FEMR预测,token级解释与临床知识对齐。论文FEMRX-FEMRTransformer推荐理由:这篇论文用Transformer代理模型给医疗AI做局部解释,还能直接对齐临床知识,让黑箱诊断更可信。原文稍后读已读值得跟进有用关注 FEMR
12:04官方账号arXiv cs.LG@Sanjeev Shrestha, Hui Liu, Yifan ZhangExformer提出极端自适应注意力机制,包含Local、Stride和Extreme三个稀疏组件,分别捕捉短期、周期性和事件依赖。在4个真实水文数据集上,Exformer在3天预报任务中优于State-of-the-Art基线。该模型显式建模正常与极端流模式的依赖关系,提升了在高度偏态分布数据上的预测能力。AI模型ExformerTransformer时间序列预测推荐理由:这篇论文的Exformer模型专门处理时间序列中的极端事件,比如洪水,比普通Transformer在3天预报上表现更好。原文稍后读已读值得跟进有用关注 Exformer
12:35官方账号arXiv cs.LG@Zijian Zhang, Rizhen Hu, Athanasios Glentis, Dawei Li, Chung-Yiu Yau, Hongzhou Lin, Mingyi Hong本文基于Qwen3和Qwen2.5共7个模型,使用GRPO、GiGPO、Dr. GRPO三种RL算法,在数学推理、代码生成和智能体决策任务上实验。研究发现训练单层Transformer即可恢复全参数RL训练大部分甚至全部改进。作者引入“层贡献”指标量化单层训练相比全参数训练的收益比例。结果显示RL收益高度集中于少数中间层,输入输出层贡献显著较低。论文Qwen3GRPOTransformer推荐理由:这篇论文发现RL训练只需调优一层Transformer就能接近全参数效果,还揭秘中间层才是关键,刷新认知。原文稍后读已读值得跟进有用关注 Qwen3
11:04官方账号arXiv cs.AI@Giovanni Monea, Nathan Godey, Kianté Brantley, Yoav Artzi该论文提出状态-预测分离假设,认为Transformer中预测下一个token与存储有用状态可被分离。作者设计双流Transformer变体,将两个功能分配到不同计算流。在多个规模下的预训练实验中,该方法在数据和计算效率上持续优于标准Transformer,验证损失更低,下游任务平均提升2-3个百分点。额外实证分析排除了潜在混淆因素,揭示了设计带来的梯度差异。论文Transformer状态-预测分离语言建模推荐理由:这篇论文把Transformer的预测和记忆分开了,实验证明效果更好,下游任务平均提了2-3个点,搞LLM架构的值得细看。原文稍后读已读值得跟进有用关注 Transformer
16:57量子位@衡宇卡帕西、李飞飞、辛顿等AI领域知名人物共同投资了这家开发Transformer专用芯片的公司。该芯片针对Transformer架构进行了硬件优化,专为加速AI推理设计。公司已签下一份价值10亿美元的大订单。目前芯片已成功流片,进入量产准备阶段。AI产品Transformer卡帕西李飞飞推荐理由:卡帕西、李飞飞、辛顿都投了这家做Transformer专用芯片的公司,刚签下10亿美元大单,芯片已流片,值得一看。原文稍后读已读值得跟进有用关注 Transformer
10:32官方账号arXiv cs.AI@Srijan Tiwari, Aditya Chauhan, Manjot Singh该论文对神经网络在算法任务上的延迟泛化(grokking)现象进行几何分析,发现交叉熵优化下隐藏表示的径向膨胀是延迟的主因。作者提出径向-角分解并推导三个可检验命题,引入单一超参数范数惩罚将激活约束在 sqrt(d) 半径超球面上。在模算术任务上,该惩罚使 MLPs 和 Transformers 的 grokking 加速高达 6 倍;对 10M 参数的 nanoGPT 在 3 位数加法上训练步数减半。论文Grokking泛化几何分析推荐理由:这篇论文用几何视角解释了神经网络为什么先死记硬背后突然泛化,还找到了一个简单技巧(约束隐藏层半径)让 grokking 快 6 倍,值得搞训练的人看看。原文稍后读已读值得跟进有用关注 Grokking
10:08官方账号arXiv cs.AI@Zhaoyang Luo, Runmin Dong, Miao Yang, Fan Wei, Yushan Lai, Bin Luo, Haohuan Fu论文提出一种操作级视觉令牌跳过框架,将Transformer层分解为注意力与FFN操作,选择性跳过冗余计算。实验覆盖3种MLLM架构(含Qwen3-VL)和10个VQA基准,实现精度-效率权衡:在Qwen3-VL上减少33.7% TFLOPs,保留99.5%的原始性能。关键发现是晚期视觉令牌更新对答案表示影响很小,且有效计算具有操作主导性和层依赖性。论文MLLMQwen3-VL推理加速推荐理由:这篇论文告诉你如何在不牺牲性能的前提下大幅降低多模态大模型的计算量。他们在Qwen3-VL上砍了33.7%的算力,性能只掉了0.5%,方法很巧妙。原文稍后读已读值得跟进有用关注 MLLM
14:30AI Will@FinanceYF5Christopher Manning(GloVe词向量、Transformer注意力机制联合发明人)将于Stanford HAI发表演讲。他曾获2024年IEEE John von Neumann Medal。演讲主题聚焦世界模型,探讨语言模型遇上具身智能。他是Stanford NLP Group创始人及CS224N课程创建者。行业Christopher ManningGloVeTransformer推荐理由:GloVe和Transformer的创造者Manning要讲语言模型怎么和机器人结合了,想了解具身智能世界模型的可以听听。原文稍后读已读值得跟进有用关注 Christopher Manning
09:59官方账号arXiv cs.LG@Peilin Liu, Ding-Xuan Zhou论文提出一个基于分布回归的Transformer学习框架,将两阶段采样过程与自然语言处理关联。定义了注意力算子,证明Transformer可无损压缩分布为函数表示。相比卷积神经网络和全连接网络,Transformer在更复杂结构的功能学习上表现更强。该框架还为大语言模型中的提示调优、参数高效微调、高效缩放等技术提供理论洞见。论文Transformer注意力机制分布回归推荐理由:这篇论文给Transformer的提示调优、微调等技术找到了数学理论,解释了为什么注意力机制能压缩信息。原文稍后读已读值得跟进有用关注 Transformer
02:49官方一手Hugging Face: Blog(博客/媒体)精选Allen AI 发布 DiScoFormer,一种基于 Transformer 的架构,同时学习任意数据分布的密度函数和得分函数。传统方法如 NICE、MAF、ResFlow 需分别建模或使用归一化流,DiScoFormer 通过单一模型完成且无需显式归一化。在 2D 环形、高维高斯混合等多个基准分布上,DiScoFormer 的密度估计和得分误差均低于这些基线。该论文已被 NeurIPS 2024 接收,代码和预训练模型已在 GitHub 开源。AI模型DiScoFormerAllen AITransformer推荐理由:Allen AI 搞了个新模型 DiScoFormer,一个 Transformer 既能算密度又能算得分,比 NICE 这些老方法误差更低。想省事搞密度估计的可以看看。原文稍后读已读值得跟进有用关注 DiScoFormer
10:10官方账号arXiv cs.AI@Abdolazim Rezaei, Mehdi Sookhak, Mahboobeh Haghparast论文提出参数高效混合Transformer(PEHT),将LoRA集成到Transformer编码器中以减少可训练参数,同时在解码器中融合外部移动性和拥堵特征。在Telecom Italia Milan数据集和多个合成拥堵场景上的实验显示,PEHT在RMSE、MAE和R²指标上优于现有基线。该模型针对动态城市蜂窝网络中的资源分配优化,代码已在GitHub开源。AI模型PEHTLoRA网络流量预测推荐理由:想用Transformer预测城市网络流量?这个PEHT用LoRA大幅减少参数,还能融合拥堵数据,实测精度超过现有方法。原文稍后读已读值得跟进有用关注 PEHT
11:01AI Will@FinanceYF5精选Jayden Teoh提出Next-Latent Prediction(NextLat),一种自监督学习方法。该方法教Transformer预测下一个隐状态而非直接预测token。NextLat使模型形成紧凑的世界模型,在推理和规划任务上表现更好。通过自speculative decoding,推理速度最高提升3.3倍。AI模型NextLatTransformer推理模型推荐理由:Transformer预测隐状态而不是token能加速3.3倍,还能形成世界模型。Jayden Teoh的新框架值得看看。原文稍后读已读值得跟进有用关注 NextLat
18:03IT之家(博客/媒体)富士通发布了PHOTON架构,在多查询场景下性能最高可达Transformer架构的475倍。该架构通过语义分层处理替代词元级分割,降低计算复杂度并提升并行性。测试显示,在600M、900M和1.2B参数模型上,PHOTON实现了更高的迭代吞吐量和更低的内存占用。其中1.2B模型性能提升475倍,但质量略有下降。AI模型富士通PHOTONTransformer推荐理由:富士通新架构PHOTON在多查询任务上比Transformer快475倍,1.2B小模型实测,省内存省GPU。原文稍后读已读值得跟进有用关注 富士通
00:51官方一手Hugging Face: Blog(博客/媒体)精选NVIDIA 发布 NeMo AutoModel,通过自动化模型并行、混合精度训练和梯度检查点,简化 Transformer 模型微调流程。该工具可自动检测硬件配置,支持多 GPU 分布式训练,无需手动调整参数。在微调 BERT-base 模型时,相比标准 PyTorch 实现,NeMo AutoModel 将训练时间缩短约 40%,并保持相同精度。技巧NVIDIANeMoAutoModel2 个信源在谈事件专题推荐理由:NVIDIA 搞了个 NeMo AutoModel,能自动帮你加速微调 Transformer 模型,省去手动调参的麻烦,速度还快很多,适合想快速出结果的人。原文稍后读已读值得跟进有用关注 NVIDIA
11:40官方账号arXiv cs.LG@Jinghan Wang, Feng Cheng, Wentao Wu, Hang Li, Gaoliang Peng, Tianchen Liu该论文提出一种知识引导的两阶段迁移学习框架,核心是一个轻量级GPT-2风格Transformer,利用因果自注意力从振动信号中分层提取特征。框架通过多源预训练学习通用表示,并借助原型知识调制和分类自适应实现跨域迁移。在4个真实数据集上,仅用10%标签数据即达92.61%平均准确率,比现有最佳方法高17.24个百分点。该方法为工业4.0低成本预测性维护提供了可行方案。论文GPT-2Transformer轴承故障诊断推荐理由:这篇论文把GPT-2用在轴承故障诊断上,只用10%的标签数据就比SOTA高了17个百分点,工业场景下很实用。原文稍后读已读值得跟进有用关注 GPT-2
09:38官方一手arXiv: Anthropic@Guruprakash J, Krithika L. B该综述将Transformer架构分为encoder-only、decoder-only、encoder-decoder、长上下文、置换基与生成对抗等变体,并涵盖2023年后指令微调、RLHF、DPO、MoE、RAG等进展。它梳理了OpenAI、Anthropic、Google、Meta、Mistral、DeepSeek等主流模型家族。在应用侧调研了医疗、金融、法律、教育等7个领域的部署。论文从参数规模与能耗的权衡、对齐方法、数据溯源及基准饱和四个维度评估模型。它还点名了值得关注的开放研究问题。论文Transformer语言模型综述10 个信源在谈事件专题推荐理由:想快速搞懂主流Transformer架构和各家模型?这篇综述帮你理清了架构分类和应用场景,还比较了参数和能耗,适合做调研入门。原文稍后读已读值得跟进有用关注 Transformer
13:13官方账号arXiv cs.AI@Reza Bayat, Ali Behrouz, Aaron Courville当前语言模型在深度上均匀分配参数,但研究表明各层贡献不同。该论文在固定预算下实验发现,将更多参数分配给前层、减少后层可以改进困惑度。提出Tapered Language Models(TLMs),通过余弦调度平滑锥形化MLP宽度。在Transformer、Gated Attention、Hope-attention和Titans四种架构上,三个模型尺度均一致提升困惑度和下游基准性能,且不增加参数或计算量。论文Tapered Language ModelsTransformerTitans推荐理由:这篇论文发现了一个简单技巧:同等算力下,把更多参数分给前几层、少给后几层,模型效果就能更好,试了多种架构都管用。原文稍后读已读值得跟进有用关注 Tapered Language Models
12:49官方账号arXiv cs.LG@Tianyi Li, Zhiqiang Shen现有线性模式连通性方法通常只从一个模型端点优化插值路径,难以扩展到大型Transformer。我们提出新框架,应用功能保持的权重变换对齐等价解,并让两个模型双向学习向共享线性插值路径的变换。双向优化大幅减少插值障碍,在中等参数规模语言模型上实现了WikiText近零损失屏障(首次展示该规模下近无屏障线性连通)。视觉领域ViT-L在插值路径上保持ImageNet top-1准确率超69%,十亿参数LLM只表现出小损失屏障。这些结果表明解决参数对称性能使大预训练Transformer通过简单线性路径连通和合并。AI模型Linear Mode ConnectivityTransformer模型合并推荐理由:新方法让十亿参数Transformer通过双向学习实现线性合并,损失屏障极低,视觉和语言模型都验证有效。原文稍后读已读值得跟进有用关注 Linear Mode Connectivity
00:42berryxia@berryxiaSakana AI是一家2023年在东京成立的AI研发公司,由David Ha(前Google Brain日本团队负责人)、Llion Jones(Transformer论文共同作者)和Ren Ito(前日本外交官、Mercari早期员工)联合创立。公司核心定位是开发“自然启发”的AI模型,强调集体智能和演化方法,旨在摆脱单一大模型限制。该公司的创办背景体现了日本AI主权的战略需求,团队和运营完全基于东京。行业Sakana AIDavid HaLlion Jones推荐理由:这家日本AI公司有Transformer论文作者和前Google Brain负责人,主打集体智能,背景扎实值得看。原文稍后读已读值得跟进有用关注 Sakana AI
12:57官方一手歸藏(guizang.ai)@op7418精选71°Noam Shazeer(Transformer论文作者之一、MoE架构提出者)加入OpenAI,负责模型架构研究。谷歌此前以27亿美元收购Character.AI换取他加入谷歌。但Shazeer在谷歌停留短暂后即转投OpenAI。行业Noam ShazeerTransformerMoE10 个信源在谈事件专题推荐理由:Transformer论文作者Noam Shazeer,MoE提出者,跑到OpenAI研究模型架构了,谷歌27亿美元白花了?原文稍后读已读值得跟进有用关注 Noam Shazeer
11:43官方账号arXiv cs.LG@Qingyang Zhu, Eric Karl Oermann, Kyunghyun Cho该研究提出多任务上下文学习框架用于分层贝叶斯预测推理,将先验信息表示为上下文数据集的前缀。使用Transformer在序列先验和目标任务上训练,学会跨先验家族调整预测。在包含元分布外先验和高维潜在结构的评估中,该方法匹配oracle贝叶斯预测器,速度提升数个数量级。在真实世界时空温度预测基准上验证了实际效果。论文贝叶斯推理上下文学习多任务学习推荐理由:这篇论文提出多任务贝叶斯ICL框架,速度比传统方法快几个数量级,还能适应新先验,在温度预测上表现很好。原文稍后读已读值得跟进有用关注 贝叶斯推理
00:35官方账号Microsoft Research@MSFTResearch微软研究院的Subutai Ahmad和Nicolò Fusi与公司副总裁Doug Burger探讨人类记忆与机器智能的差异。他们发现Transformer架构能通过持续五小时的故事输入记住一个新密码。这项对比研究揭示了机器在长期信息保留上的独特优势。相关讨论视频已在Twitter上发布。行业Transformer微软记忆机制推荐理由:微软研究员拿Transformer和人类比记忆:听五小时故事,它能记住新密码,你行吗?看看具体差异在哪。原文稍后读已读值得跟进有用关注 Transformer
18:19Aadit Sheth@aaditsh88°据X用户aaditsh透露,谷歌在2024年支付27亿美元,这笔交易的主要目的是将Transformer论文合著者Noam Shazeer从Character.ai带回。但Noam在谷歌工作不到两年后,于2026年宣布加入OpenAI。这相当于每月超过1亿美元的人才成本。Noam曾用几行训练代码拯救了Gemini项目,现在将参与OpenAI的架构建设。行业Noam ShazeerGoogleOpenAI10 个信源在谈事件专题推荐理由:Noam Shazeer刚加入OpenAI,之前谷歌花27亿签他都没留住。你想知道AI圈顶级人才有多贵吗?点开看看。原文稍后读已读值得跟进有用关注 Noam Shazeer
17:29官方账号Amazon Science@AmazonScience亚马逊AI、芯片与量子负责人Peter DeSantis在VivaTech表示,最大的AI突破尚未到来。他认为Transformer不会是最后一个AI架构,现有模型架构将被超越。芯片和模型必须协同进化,才能实现未来突破。这一观点挑战了当前以Transformer为主流的AI发展路径。行业AmazonPeter DeSantisTransformer推荐理由:亚马逊的AI老大说了,Transformer不是终点,芯片和模型得一起进步才能搞出大新闻。原文稍后读已读值得跟进有用关注 Amazon
15:25官方账号Decoder@Matthias BastianNoam Shazeer是2017年Transformer论文《Attention Is All You Need》的合著者,曾共同领导Google Gemini模型。2024年他作为27亿美元交易的一部分从Character.AI重返Google,现又转投OpenAI。这是继Andrej Karpathy跳槽Anthropic后,今年AI行业第二次重大高管变动。行业Noam ShazeerOpenAIGoogle10 个信源在谈事件专题推荐理由:Transformer论文作者Noam Shazeer从Google跳到OpenAI了,他去年刚从Character.AI回归Google,这次跳槽节奏很快。原文稍后读已读值得跟进有用关注 Noam Shazeer
13:13IT之家(博客/媒体)88°Noam Shazeer是2017年Transformer论文主要作者,曾因谷歌拒绝发布聊天机器人Meena(后演变为LaMDA)于2021年离职创办Character.AI。2024年8月,谷歌以27亿美元技术许可协议将其请回,他担任Gemini项目技术负责人并推动Gemini 3登顶多项排行榜。2026年2月他当选美国国家工程院院士。如今他宣布加入OpenAI,促使OpenAI CEO Sam Altman称其为最想合作的人之一。至此Transformer论文八位作者全部离开谷歌。行业TransformerOpenAI谷歌10 个信源在谈事件专题推荐理由:Transformer之父二度出走,从谷歌跳到OpenAI。他发明了现代大模型的核心架构,这次跳槽说明顶级AI人才争夺有多激烈。原文稍后读已读值得跟进有用关注 Transformer