10:07官方账号arXiv cs.LG@Nayeon Kim, Hojin Lee, Yunju Bak, Jaesun Park, Boseop Kim该研究提出一种计算高效的两步超参数迁移框架,用于为大型 MoE 模型估算最优学习率。首先,通过 MuP 适应和 Muon 优化器,证明了最优学习率在宽度缩放模型间可一致迁移。其次,通过建立预测性缩放定律,将小模型在有限预算下的最优值线性回归,成功外推至万亿 token 规模(R²=0.95)。该方法在 155B 总参数的 MoE 基础模型预训练中得到验证。论文Mixture-of-ExpertsMoE超参数推荐理由:研究人员提出了一种方法,能通过小模型实验,准确预测万亿 token 规模 MoE 模型的最优学习率,省去了大量计算成本。他们用 155B 参数的模型验证了方法的有效性。原文稍后读已读值得跟进有用关注 Mixture-of-Experts
15:05Amjad Masad@amasad针对“AI因算力密集而结构性集中权力”的说法,有观点指出计算机算力性价比过去125年呈超指数增长,缩放定律并非物理定律。Anthropic CEO Amodei回应称,监管不等于权力集中,公平的制度过程可以分散权力。他举例Anthropic支持的加州SB53对收入低于5亿美元的公司完全豁免,而SB1047的豁免门槛更低。Anthropic在CAISI和白宫推动的测试流程对前沿模型更严格,以利于小型挑战者。行业AnthropicAmodeiAI监管10 个信源在谈事件专题推荐理由:Amodei下场聊AI权力集中,用自家支持的SB53法案做例子,说监管能帮小公司而不是只帮巨头。挺有料的。原文稍后读已读值得跟进有用关注 Anthropic
04:03AI Will@FinanceYF5一项新研究首次证明,模型从未在机器人轨迹上训练,却能通过人类数据提升机器人任务表现。研究显示,人类数据量越大,模型在未见过的机器人任务上表现越好。这证实了跨越“具身鸿沟”的缩放定律存在。该发现为机器人学习提供了新路径,减少对机器人数据采集的依赖。论文具身智能缩放定律机器人学习推荐理由:这篇讲的是用人类数据直接训练机器人,不用机器人轨迹数据也能变强,跨具身缩放定律首次被证明,值得搞机器人的朋友看看。原文稍后读已读值得跟进有用关注 具身智能
00:40AI Will@FinanceYF5精选Dyna Robotics 发布世界动作模型 Dyna-2,仅用 100 万小时人类视频预训练,从未接触过任何机器人轨迹数据。实验发现,人类视频数据量从 1000 小时增至 100 万小时,模型在未见过的机器人任务上表现持续提升,呈现跨四数量级的缩放规律。这表明具身差距更像适应问题而非知识问题,可能改写机器人预训练范式。AI模型Dyna-2Dyna Robotics世界动作模型推荐理由:Dyna Robotics 发了 Dyna-2,只靠看人类视频就能学会机器人操作,没碰过机器人数据也能越看越强,跟以前的做法很不一样。原文稍后读已读值得跟进有用关注 Dyna-2
07:52elvis@omarsar0Meta新论文提出Skaling law,通过单一交互指数耦合模型容量与训练数据。该定律将平均绝对百分比误差在插值和外推中降低1.5倍至3倍。在数据稀缺和重度过训练区域,Chinchilla与Kaplan传统定律的预测会漂移,Skaling law的修正幅度最大。配合稀疏网格,只需约十分之一计算量即可外推完整训练网格。论文预印本编号为arXiv:2608.07222。论文MetaSkaling lawChinchilla推荐理由:Meta新论文搞了个Skaling law,比Chinchilla和Kaplan那套准1.5到3倍,而且小规模跑就能算准,预算算力能省不少。原文稍后读已读值得跟进有用关注 Meta
03:32elvis@omarsar0精选Dyna Robotics发布世界动作模型Dyna-2,在100万小时人类第一视角视频上预训练。该模型能联合预测未来视频和未来动作,在行动前推理结果。研究首次发现,从1000到100万小时的人类数据上,世界动作模型呈现四个数量级的缩放定律。该缩放定律还能迁移到从未见过的机器人数据上,且视频数据与世界建模对跨具身缩放迁移至关重要。AI模型Dyna-2Dyna Robotics世界模型推荐理由:Dyna Robotics放出了个叫Dyna-2的世界动作模型,用100万小时人类视频训的,能预测未来再行动,还发现了数据量越大越强的缩放规律,值得看看。原文稍后读已读值得跟进有用关注 Dyna-2
14:09向阳乔木@vista8Scaling Laws(缩放定律)描述了模型性能随计算量、数据量和参数规模变化的幂律关系。该定律由OpenAI在2020年提出,指导了大模型训练的资源分配。理解Scaling Laws有助于设计更高效的模型训练策略。技巧Scaling Laws缩放定律训练策略2 个信源在谈事件专题推荐理由:想搞懂大模型为什么越训越大?这个视频用动画讲清Scaling Laws的缩放规律,比看论文容易多了。原文稍后读已读值得跟进有用关注 Scaling Laws
11:50官方账号arXiv cs.LG@Jingwei Song, Haofeng Xu, Jie Xiao, Chengke Bao, Jingwei Shi, Pengbin Feng, Weixun Wang, Yuhang Han, Chuan Wu, Linfeng Zhang, Bill Shi该论文研究异步GRPO(群体相对策略优化)中陈旧rollout对策略优化的影响。作者将行为策略显式纳入GRPO替代目标,并区分学习器使用的替代梯度映射与依赖分布的总体目标的真实全导数。在局部有界性、分布平滑性和行为策略平滑性假设下,证明陈旧rollout引入的每步替代梯度偏差为O(S * eta),其中S是最大rollout滞后,eta是学习率。进一步导出条件性崩溃时间缩放定律:当周期内漂移低于批量级裁剪半径时,崩溃主要由累积学习器漂移T * eta决定;当陈旧rollout约束激活时,稳定性显式依赖于S * eta。从而得到双约束稳定性条件eta << min{R_batch/(S*G_upd), R_crit/(T*G_upd)},解释了在有限时间范围内最大稳定学习率对陈旧性依赖较弱的原因。论文RLHFGRPO异步训练推荐理由:想搞异步RLHF训练的可以看这篇,把陈旧rollout对学习率的影响定量化了,推导了缩放条件,比经验调参更靠谱。原文稍后读已读值得跟进有用关注 RLHF
13:28官方账号Together AI@togethercompute精选Dan Fu在斯坦福CS336课程中讲解了推理时的KV缓存、prefill/decode分离技术,以及大规模推理的架构。他介绍了Megakernels,通过融合GPU操作实现接近光速的LLM解码。还讨论了Parcae,解释了循环Transformer的扩展问题及其修复方法,并提出了新的缩放定律,暗示现有方法可能未充分利用智能潜力。论文KV缓存MegakernelsParcae推荐理由:Dan Fu讲KV缓存和Parcae新缩放定律原文稍后读已读值得跟进有用关注 KV缓存
11:02官方账号arXiv cs.AI@Zhen Yang, Xiaogang Xu, Wen Wang, Cong Chen, Xander Xu, Ying-Cong Chen精选76°多智能体推理系统通常采用“先生成再传输”的范式,导致端到端延迟随流水线深度线性增长。StreamMA 提出流式方案,每个推理步骤生成后立即流式传输给下游智能体,实现流水线并行,显著降低延迟。令人意外的是,这种流水线还提升了效果:因为多步推理质量不均匀,早期步骤更可靠,使用早期步骤而非完整链条可防止错误后期步骤误导下游智能体。在数学、科学和代码等八个推理基准上,StreamMA 平均提升 7.3 个百分点,最高提升 22.4 个百分点。研究还发现了“步骤级缩放定律”:增加每个智能体的步骤数能同时提升效果和效率,这是一个与智能体数量缩放正交的新维度。论文多智能体推理系统流式通信推荐理由:做多智能体系统或推理管线的开发者,StreamMA 用流式通信同时解决了延迟和效果问题,值得直接参考实现思路。原文稍后读已读值得跟进有用关注 多智能体
10:46官方账号arXiv cs.LG@Amil Dravid, Yasaman Bahri, Alexei A. Efros, Yossi Gandelsman精选该研究探讨了神经网络中神经元群体是否随模型规模可预测地演化,扩展了缩放定律至损失等宏观可观测指标之外。通过分析高达30B参数的语言模型和5B参数的视觉模型,发现Rosetta神经元(跨独立训练模型激活模式相似的神经元)数量随规模呈亚线性幂律增长,但占总神经元比例缩小。研究还观察到“神经元极化效应”:Rosetta神经元随规模增加变得更选择性、更单语义,而非Rosetta神经元则保持较低选择性。一个平衡特征效用与有限神经元容量的分析模型解释了这种亚线性缩放和极化效应。结果表明存在可解释的、共享的神经元级结构缩放定律,将模型大小与神经元普遍性、选择性和专门化的系统性变化联系起来。论文缩放定律神经元可解释性Rosetta神经元推荐理由:这项研究揭示了模型规模如何影响神经元的可解释性和专门化,对理解大模型内部机制和设计更高效架构的AI研究者有直接参考价值,建议关注其缩放定律的实践意义。原文稍后读已读值得跟进有用关注 缩放定律
10:30官方账号arXiv cs.AI@Yanbei Chen, Hanxian Huang, Ernie Chang, Jacob Szwejbka, Digant Desai, Zechun Liu, Vikas Chandra, Raghuraman Krishnamoorthi精选76°MobileMoE 是一系列专为移动设备设计的混合专家(MoE)语言模型,活跃参数在0.3B到0.9B之间,总参数1.3B到5.3B。研究团队首次提出了面向设备端的MoE缩放定律,在内存和计算约束下优化架构,找到了中等稀疏度与细粒度共享专家的最佳平衡点。模型采用四阶段训练流程(预训练、中训练、指令微调、量化感知训练),全部基于开源数据集。在14个基准测试中,MobileMoE以2-4倍更少的推理FLOPs匹配或超越领先的密集模型,并以最多60%更少的参数超越SOTA MoE模型OLMoE-1B-7B。在商用智能手机上,MobileMoE-S在INT4权重内存下比密集基线MobileLLM-Pro实现1.8-3.8倍更快的预填充和2.2-3.4倍更快的解码。论文MoE移动端部署缩放定律推荐理由:MobileMoE解决了移动端大模型部署的算力与内存瓶颈,做端侧AI应用或手机端推理的开发者可以直接参考其架构和训练方案,实测性能提升显著。原文稍后读已读值得跟进有用关注 MoE
11:12官方账号arXiv cs.AI@Xu Ouyang, Deyi Liu, Yuhang Cai, Jing Liu, Yuan Yang, Chen Zheng, Thomas Hartvigsen, Yiyuan Ma精选现有的大语言模型缩放定律(如单调幂律)无法解释灾难性过训练和量化退化等非单调现象。研究者提出香农缩放定律,将LLM训练建模为噪声信道上的信息传输,基于香农-哈特利定理,将模型参数映射为信道带宽,训练token映射为信号功率。该理论揭示了LLM的香农容量:若缩放模型或数据时未保持足够信噪比,噪声放大将导致性能从单调提升转为U形退化。在Pythia和OLMo2上的实验验证了该定律,其预测准确率优于经典缩放定律,并能外推到未见模型。论文缩放定律香农容量噪声信道推荐理由:香农缩放定律统一解释了LLM训练中的非单调退化现象,做模型缩放和训练优化的研究者可以直接用这个框架预测性能拐点,避免盲目增加计算量。原文稍后读已读值得跟进有用关注 缩放定律
14:27官方账号arXiv cs.AI@Matthew L. Smith, Jonathan P. Shock, Samuel T. Segun, Iyiola E. Olatunji, Tegawendé F. Bissyandé精选该研究揭示了大型语言模型(LLM)的事实回忆能力与模型参数数量和训练数据中主题频率之间存在可预测的缩放规律。研究团队评估了38个模型在超过8900个学术参考文献上的表现,发现回忆质量遵循模型参数与主题表示的对数线性组合的S形曲线。这两个变量单独解释了16个密集模型(来自四个模型家族)中60%的方差,在单个家族内解释力升至74-94%。该规律符合一种基于信号噪声比的解释:信号强度随概念频率增加,噪声基底随模型容量增加。论文缩放定律事实回忆模型大小推荐理由:这项研究为LLM的事实回忆能力提供了可预测的缩放规律,做模型评估或训练数据设计的团队可以直接用这个规律来预估模型表现,值得关注。原文稍后读已读值得跟进有用关注 缩放定律
14:05官方账号Clement Delangue@ClementDelangue精选73°Datadog 发布了 Toto 2.0 系列时间序列基础模型,参数规模从 4M 到 2.5B,采用 Apache 2.0 开源协议。该系列模型在 BOOM、GIFT-Eval 和 TIME 等主流基准测试中均取得领先成绩,且每个更大规模的模型性能都优于较小的模型。这是时间序列领域首次出现清晰的缩放定律曲线,意味着研究人员可以像语言和视觉模型那样,通过增加数据和计算量来可靠地提升模型性能。2.5B 和 4M 参数的模型权重已在 Hugging Face 上开源。AI模型时间序列基础模型缩放定律开源/仓库推荐理由:时间序列领域终于有了可预测的缩放定律,做时序预测的团队可以像训练语言模型一样放心堆数据和算力,建议直接下载权重试试。原文稍后读已读值得跟进有用关注 时间序列基础模型
08:58Ethan Mollick@emollickEthan Mollick 指出,第二条缩放定律(Second Scaling Law)依然未被打破:只要增加 LLM 的思考 token(thinking tokens),就能在黑客攻击、数学、科学、填字游戏等任务上获得更好表现。目前尚未观察到性能平台期。这一发现对依赖推理能力的 AI 应用开发者有直接指导意义,意味着通过增加计算资源(而非仅扩大模型规模)即可持续提升模型在复杂任务上的表现。论文缩放定律推理模型思考 token推荐理由:做 LLM 推理优化或复杂任务应用的团队,这条定律意味着你不需要等更大模型——加思考 token 就能直接提升效果,值得在现有模型上试试。原文稍后读已读值得跟进有用关注 缩放定律
18:29官方账号Meta AI@AIatMeta精选Meta 宣布其新模型 Muse Spark 在预训练、强化学习和测试时推理三个维度上实现了可预测且高效的扩展。通过重建预训练栈,包括改进模型架构、优化和数据整理,Muse Spark 在达到相同能力水平时所需的计算量比前代 Llama 4 Maverick 减少了一个数量级。Meta 分享了其缩放定律研究方法,展示了 Muse Spark 在效率上的显著提升,旨在构建个人超级智能。AI模型Muse SparkLlama 4预训练推荐理由:Meta 用实际数据证明了 Muse Spark 的预训练效率比 Llama 4 提升 10 倍以上,做模型训练或资源优化的团队值得关注其缩放定律方法,可以直接借鉴来评估自己的模型效率。原文稍后读已读值得跟进有用关注 Muse Spark