10:20官方账号arXiv cs.LG@Zachary Speck, Asa Shepard使用124M参数的GPT - 2模型在OpenWebText数据集上训练32个模型,每个模型在第200步时替换一行批次数据测试示例影响,发现示例暴露后50步预测更好但最终无差异,跨熵等基准测试也显示无显著差异。论文GPT - 2OpenWebText预训练推荐理由:GPT - 2团队做了小规模单例反事实实验,测试示例学习后效果,和其他条件对比结果很有意思。原文稍后读已读值得跟进有用关注 GPT - 2
11:39官方账号arXiv cs.LG@Nour Shaheen, Junwei Ma, Alex Labach, Frank Hutter, Valentin Thomas, Anthony L. Caterini研究显示,表格基础模型(TFMs)通过单表格自监督预训练即可实现强迁移能力。表格的有用性取决于特征数量而非实例数量,且与下游任务无关。列级预处理能持续提升下游性能,而数据集级别的过滤或去重则无改善。研究认为TFMs的泛化主要基于检索机制,模型需学会识别相关示例并进行有效聚合。论文表格基础模型自监督学习迁移学习推荐理由:这篇论文揭示了表格基础模型如何通过单表格预训练实现强迁移,颠覆了传统大规模数据训练的认知。原文稍后读已读值得跟进有用关注 表格基础模型
18:32官方账号Logan Kilpatrick@OfficialLoganKGemini 4 被推文称为迄今最雄心勃勃的预训练项目。相关推文获得 1092 次点赞、77 条评论和 19 次转发。发布者 @OfficialLoganK 未提及任何基准名称或参数规模。AI模型Gemini 4Google预训练推荐理由:Gemini 4 终于有信了,说是最狠的一次预训练,虽然还没细节,先围观。原文稍后读已读值得跟进有用关注 Gemini 4
11:33官方账号arXiv cs.LG@Fanfei Li, Jana Zeller, Manuel Prada-Corral, Thaddäus Wiedemer, Prasanna Mayilvahanan, Ryan Cotterell, Wieland Brendel研究者推出LITTLECURRICULUM,一个包含880亿token的预训练语料库,内容限定为美国小学五年级以下的知识范围。他们用该语料从头训练出5B参数的LittleLearner模型,模型语言能力足以进行开放式评测,但知识边界清晰对应课程大纲。实验表明,通过后训练和上下文学习注入新知识,LittleLearner能更好利用已有知识,但无法提升超出课程范围的能力。该研究为可控条件下研究模型知识获取提供了沙盒环境。论文LittleLearnerLITTLECURRICULUM预训练推荐理由:想搞懂模型知识边界怎么控制?这篇论文用小学课程语料训练了个5B模型,还公开了数据和模型,适合研究预训练数据影响的人看。原文稍后读已读值得跟进有用关注 LittleLearner
10:38官方账号arXiv cs.LG@Julian Minder, Viktor Moskvoretskii, Raghav Singhal, Difan Jiao, Andy Arditi, Shaobo Cui, Yiderigun Borjigin, Kartik Bali, Stefan Krsteski, Harsh Raj, Huu Nguyen, Jannik Brinkmann, Ashton Anderson, Roland Aydin, Robert West论文提出合成人格预训练(SPP),在预训练阶段就从第一个 token 开始植入目标助手人格,而非等预训练后叠加价值观。方法先用价值规范给预训练文档标注第一人称反思,再在标准文档和反思上以交叉熵损失训练,最后用对话数据做人格绑定。在 3B 参数、500B token 的预训练中,SPP 提高了宪法遵循和越狱鲁棒性,降低了分布外道德困境中的错位率,同时保持能力。实验显示,仅在预训练末期引入 SPP 效果明显更弱,且优势随预训练预算增加而增大。论文SPP合成人格预训练对齐推荐理由:这篇把对齐提前到了预训练第一步,3B 模型跑 500B token,越狱更难破,值得搞 AI 安全的人看一眼。原文稍后读已读值得跟进有用关注 SPP
17:49官方账号arXiv cs.AI@Arda Uzunoglu, Benjamin van Durme, Daniel Khashabi精选一篇arXiv论文提出信息丰裕悖论,认为训练上下文中相关信息过多会降低模型将其参数化编码的动机。预训练阶段扩大上下文窗口虽能提升语言建模、自然语言理解和closed-book MCQA,但只在中间最优值内有效,之后持续下降。监督微调时,更多任务相关上下文虽能提升带支持场景的表现,却削弱了测试时缺少或误导上下文时的鲁棒性。机制分析显示,长上下文将梯度压力从前馈网络转向注意力模块,导致推理时更依赖上下文。结论表明,追求无限上下文并非简单堆数据。论文长上下文参数化知识上下文学习推荐理由:这篇论文说长上下文训练反而会让模型记不住知识,上下文越长越依赖临时找资料。想调长上下文的人建议先看看。原文稍后读已读值得跟进有用关注 长上下文
18:26官方账号arXiv cs.LG@Changhao Xiang, Shangyu Xing, Zhen Wu, Jianbing Zhang, Xinyu DaiMMCS是一种新的多模态预训练方法,通过将文本实体替换为对应视觉对象,提供显式的对象级监督。该方法仅用50K样本就能匹配或超越在600K图像-文本对上训练的模型,数据效率提升12倍。MMCS在773K样本的预训练数据集上验证了有效性,并持续提升不同规模模型的视觉定位和感知能力。该研究针对现有MLLMs中图像级对齐的指称歧义问题,提出了更精确的局部视觉-语言对齐方案。论文MMCS多模态预训练推荐理由:这篇论文提出MMCS,用50K样本就干翻别人600K的效果,做多模态预训练的可以看看这个新思路。原文稍后读已读值得跟进有用关注 MMCS
01:45AI Will@FinanceYF5该推文介绍了一种机器人训练方法,沿用人类预训练,后训练仅需数小时数据,成功率随预训练规模从20%提升至53%。通过10分钟遥操作微调,机器人能用双手拧开瓶盖。在新客户现场零样本测试中,成功率从46%跃升至87%。AI模型机器人后训练预训练推荐理由:看这个,机器人训练只要几小时数据就能干活,成功率还翻倍,零样本也能上手,挺神的。原文稍后读已读值得跟进有用关注 机器人
07:52elvis@omarsar0Meta新论文提出Skaling law,通过单一交互指数耦合模型容量与训练数据。该定律将平均绝对百分比误差在插值和外推中降低1.5倍至3倍。在数据稀缺和重度过训练区域,Chinchilla与Kaplan传统定律的预测会漂移,Skaling law的修正幅度最大。配合稀疏网格,只需约十分之一计算量即可外推完整训练网格。论文预印本编号为arXiv:2608.07222。论文MetaSkaling lawChinchilla推荐理由:Meta新论文搞了个Skaling law,比Chinchilla和Kaplan那套准1.5到3倍,而且小规模跑就能算准,预算算力能省不少。原文稍后读已读值得跟进有用关注 Meta
11:43官方账号arXiv cs.LG@Tongle Wu, Huanyu Dong, Ying Sun, Ziye MaMALT在Muon基础上加入轻量对角预条件器,以感知损失曲率并降低对曲率各向异性的敏感度。它使用Newton-Schulz迭代正交化预条件后的动量,并通过范数嫁接控制更新幅度。进一步提出的MALTER通过自适应步长重缩放提升对随机梯度噪声的鲁棒性。在GPT-2 Small、Medium、Large预训练实验中,MALT和MALTER均优于Muon,且内存占用和耗时几乎不变。论文MALTMuonGPT-2推荐理由:MALT优化器给Muon加了轻量对角预条件,在GPT-2上比Muon更快更好,内存几乎没增加,适合大模型预训练。原文稍后读已读值得跟进有用关注 MALT
10:11官方账号arXiv cs.LG@Junlin Han, Shengbang Tong, David Fan, Minghao Chen, Philip Torr, Filippos Kokkinos, Mike Lewis该论文通过合成和真实数据上的受控实验,揭示了多模态预训练中语言、视觉理解与视觉生成之间的非对称知识流。研究发现数据复杂度决定模态协同,共享注意力与归一化能促进协同,而早期联合训练优于晚期对齐。实验还发现“视觉懒惰”现象,即延迟融合会导致模型依赖语言先验。作者提出的高效配方仅用5%计算预算即可达到强生成性能,并训练了13.5B MoE模型在2T tokens上验证结论。论文多模态预训练MoE推荐理由:这篇论文把多模态预训练的内部机制拆开了,告诉你模态之间怎么互相影响、什么时候协同、什么时候拖后腿,还有省算力的训练配方,值得看看。原文稍后读已读值得跟进有用关注 多模态
11:37官方账号arXiv cs.AI@Jo-Ku Cheng, Nikolaos Aletras, Marco Valentino71°Logic-PPT 用形式推导作为预训练前置任务,为语言模型注入变量绑定、量词关联等结构偏置。在 100B token 规模下,该方法在语言任务上达到 80% 准确率,比标准初始化少用 36B token。相比 Dyck 和程序算法等基线,形式推导带来更持久的表征重组。其表征空间呈现更低秩、谱集中分布,在约 33% 稀疏度剪枝下仍能匹配稠密模型性能。论文Logic-PPT形式推导预训练推荐理由:用形式推导预训练,能在语言任务上少花36B token达标,剪枝33%还不掉点。做预训练或模型压缩的可以看看。原文稍后读已读值得跟进有用关注 Logic-PPT
03:14AK@_akhaliq这篇论文提出'探索性建模'(Explorative Modeling)方法,在已有的两个预训练轴之外引入第三个轴向。研究还实现了端到端生成方式。相关论文已发布在Hugging Face平台上。论文Explorative Modeling预训练端到端生成推荐理由:这篇论文给预训练加了第三条轴,叫'探索性建模',还能直接做端到端生成,搞生成模型或预训练研究的可以看看。原文稍后读已读值得跟进有用关注 Explorative Modeling
12:14向阳乔木@vista8预训练是深度学习模型训练的关键步骤,利用大规模无标注数据让模型学习通用特征。这一方法能显著提升模型后续微调的效率。预训练得到的模型参数可作为高质量起点。技巧预训练深度学习机器学习推荐理由:想快速搞懂预训练是啥?这个视频用大白话解释,适合AI新手入门。原文稍后读已读值得跟进有用关注 预训练
11:35官方账号arXiv cs.LG@Perry Dong, Ron Polonsky, Dorsa Sadigh, Chelsea Fin论文研究了在线RL微调时预训练Q函数的效果。发现预训练Q函数相比随机初始化提升有限,因为预训练的Q函数目标与在线微调收敛的Q函数存在根本性不匹配。作者提出策略集成初始化(IPE)方法,通过训练多个多样策略并用其滚动数据引导Q函数学习。在连续控制基准上,IPE相比朴素Q函数预训练平均提升1.26倍微调性能。论文Q函数强化学习预训练推荐理由:如果你做强化学习微调,这篇论文告诉你预训练Q函数可能没用,还给了更高效的IPE方法,实测效果更好。原文稍后读已读值得跟进有用关注 Q函数
12:26官方账号arXiv cs.AI@Zhen Huang, Yikun Wang, Shijie Xia, Pengfei LiuDataOrchestra提出针对每个数据样本定制处理流程,统一丢弃、保留或清洗操作。清洗时选择程序化编辑或LLM重写,并生成具体指令。在0.5B至7B模型上从零预训练,11个基准平均提升优于单个处理方法。数学持续预训练中超过更强基线,且跳过不必要操作减少计算量。论文DataOrchestra大语言模型数据清洗推荐理由:这篇论文提出了DataOrchestra,能针对每个数据样本定制清洗流程,在多个模型和基准上都有提升,还节省算力。原文稍后读已读值得跟进有用关注 DataOrchestra
10:48官方账号Logan Kilpatrick@OfficialLoganK精选LoganK在推文中感谢Tibo,并提及TPU和预训练团队正在积极研发。目前没有公布具体模型名称或基准数据。团队专注于TPU基础设施与预训练流程的优化。行业TPU预训练团队10 个信源在谈事件专题推荐理由:如果你关注AI基础设施和预训练进展,这条信息告诉你某个团队正在努力,具体成果可以期待后续。原文稍后读已读值得跟进有用关注 TPU
03:18@koltregaskes@koltregaskes83°Google 已开始对 Gemini 4 进行预训练,但尚未公布 Gemini 3.5 Pro 的时间表。目前 Gemini 3 是 2024 年 12 月发布的版本,其迭代节奏引发外界关注。AI模型Gemini 4Google预训练2 个信源在谈事件专题推荐理由:Google 开始训 Gemini 4 了,但 3.5 还没影,想了解最新模型动态的可以留意。原文稍后读已读值得跟进有用关注 Gemini 4
00:04官方账号Logan Kilpatrick@OfficialLoganK78°谷歌宣布启动Gemini 4的预训练,这是其迄今为止最雄心勃勃的训练项目。该模型目前处于早期阶段,具体参数和完成时间尚未公布。外界预期Gemini 4将在多模态和推理能力上实现显著提升。这一训练规模可能超过此前所有Gemini版本,对标GPT-5等竞品。AI模型Gemini 4Google预训练2 个信源在谈事件专题推荐理由:谷歌官宣Gemini 4开练,号称最大规模训练,想看看它能做到多强吗?原文稍后读已读值得跟进有用关注 Gemini 4
18:37Geek@geekbb精选该教程逐行解析 MiniMind 源码,涵盖 Tokenizer、模型结构、预训练、SFT、DPO、PPO、GRPO 共 10 章内容,每章标注对应源码文件和函数名。附录17篇进阶文章补充量化、投机解码、RLHF 等 MiniMind 未涉及的主题。适合希望从代码层面理解大模型全流程的读者。技巧MiniMind源码预训练推荐理由:想用代码搞懂大模型训练全流程?这个教程把 MiniMind 的源码一行行讲透,从 Tokenizer 到 GRPO 都有,还附赠量化、RLHF 等进阶知识。原文稍后读已读值得跟进有用关注 MiniMind
09:27官方账号arXiv cs.AI@Jingyan Shen, Ang Li, Salman Rahman, Yifan Sun, Micah Goldblum, Matus Telgarsky, Pavel Izmailov该论文以国际象棋为受控测试平台,对5M至1B参数的语言模型进行预训练、监督微调和基于可验证奖赏的强化学习后训练。实验发现,后强化学习阶段的性能可由预训练损失准确预测,且奖励曲线斜率随预训练token数近似线性提升。强化学习并未简单锐化监督微调策略:在简单问题上增强已有正确动作,在难题上则浮现出监督微调下几乎不存在的正确动作。该规律在1B参数的数学领域语言模型上得到验证。论文推理模型强化学习预训练推荐理由:这篇论文用象棋做实验,清晰展示了预训练对强化学习效果的预测关系,1B模型验证了规律,读起来很扎实。原文稍后读已读值得跟进有用关注 推理模型
10:51官方账号arXiv cs.AI@Yiming Zhang, Zhonghan Zhao, Wenwei Zhang, Haiteng Zhao, Tianyang Lin, Yunhua Zhou, Demin Song, Kuikun Liu, Haochen Ye, Haian Huang, Yuzhe Gu, Haijun Lv, Qipeng Guo, Bin Liu, Gaoang Wang, Kai Chen这篇论文挑战语言模型必须依赖纯文本预训练的假设,系统性地比较了无监督视觉预训练与纯文本预训练在5个骨干网络和多项基准上的表现。实验表明,基于包含图形、公式和版式的视觉文档进行预训练,在相同语料下持续优于纯文本预训练,提升幅度在1.2%-4.7%之间。该方法不依赖文本提取,直接利用视觉特征学习语言智能,为大规模预训练提供了更高效的路径。论文Visual Pretraining预训练多模态1 个信源在谈事件专题推荐理由:这篇论文发现,把文档当图片直接预训练,比先转成纯文本再训练效果更好,感兴趣的可以看看实验细节。原文稍后读已读值得跟进有用关注 Visual Pretraining
23:00elvis@omarsar0推文指出大多数视频动作机器人模型是将视频生成器拼接动作头,而LingBot-VA 2.0从头预训练整个控制堆栈。该模型在技术上有多项改进,与传统方法相比在控制任务上表现更优。推文提及LingBot-VA 2.0的预训练策略使其在机器人动作预测中脱颖而出。AI模型LingBot-VA 2.0机器人视频动作模型推荐理由:如果你想了解机器人视频动作模型的新路子,LingBot-VA 2.0直接从头训练控制栈,不搞拼接,挺有看头。原文稍后读已读值得跟进有用关注 LingBot-VA 2.0
10:44Stanford AI Lab@StanfordAILab精选斯坦福AI实验室的研究(论文编号2606.24998)量化了预训练语料中残留重复数据对计算效率的影响。最坏情况下,重复结构可导致高达33%的FLOPs被浪费。该研究还发现最坏情况重复结构与模型大小存在可预测关系。论文将作为口头报告在ICML 2026深度生成模型基础研讨会上展示。论文数据重复预训练计算浪费推荐理由:预训练数据去重总留尾巴,斯坦福算了一笔账:最坏情况浪费三分之一的算力,模型越大规律越清楚。训练前值得看看。原文稍后读已读值得跟进有用关注 数据重复
11:33官方账号arXiv cs.AI@Junhao Shi, Siyin Wang, Xiaopeng Yu, Li Ji, Jingjing Gong, Xipeng QiuVLA模型受限于专家演示数据稀缺,这些数据需要观测、指令和动作的三元组,成本高昂。研究提出分解假设,将物理能力(如何移动)与语义对齐(做什么)解耦。基于此设计了TAP框架,先通过自监督逆动力学从无标签交互数据学习运动先验,再用少量专家数据将先验与语言对齐。在SIMPLER基准上,TAP匹配使用超过100万专家轨迹的模型,实现了10%的绝对提升。真实WidowX机器人平台测试中,TAP在相机扰动下保持25%成功率,而互联网规模基线降至0%。论文VLATAPSIMPLER推荐理由:这篇论文用无标签数据先学移动再学做事,SIMPLER上提升10%,真实机器人也抗干扰,思路很实用。原文稍后读已读值得跟进有用关注 VLA
13:57AI Will@FinanceYF5该方法使用结构因果模型生成数亿条合成数据,替代稀缺、敏感的真实工业数据进行预训练。这是目前唯一能规模化预训练工业模型的路径,解决真实数据不足问题。AI模型合成数据结构因果模型预训练推荐理由:这个做法用合成数据解决工业场景真实数据稀缺的问题,数亿级数据集全靠模型生成,思路挺新颖。原文稍后读已读值得跟进有用关注 合成数据
11:04官方账号arXiv cs.AI@Giovanni Monea, Nathan Godey, Kianté Brantley, Yoav Artzi该论文提出状态-预测分离假设,认为Transformer中预测下一个token与存储有用状态可被分离。作者设计双流Transformer变体,将两个功能分配到不同计算流。在多个规模下的预训练实验中,该方法在数据和计算效率上持续优于标准Transformer,验证损失更低,下游任务平均提升2-3个百分点。额外实证分析排除了潜在混淆因素,揭示了设计带来的梯度差异。论文Transformer状态-预测分离语言建模推荐理由:这篇论文把Transformer的预测和记忆分开了,实验证明效果更好,下游任务平均提了2-3个点,搞LLM架构的值得细看。原文稍后读已读值得跟进有用关注 Transformer
12:14Latent.Space@latentspacepodOpenAI首席研究官Mark Chen在播客中明确表示预训练并未过时,扩展律仍然有效。他讨论了基准测试过度优化导致的评估危机,以及OpenAI如何通过新的工程和研究洞察突破边界。他还提到模型需要处理长期现实世界任务、多模态推理,最终实现端到端AI研究。行业OpenAIMark Chen预训练10 个信源在谈事件专题推荐理由:听听OpenAI首席研究官Mark Chen聊预训练为啥没过时、评估危机怎么破,还有未来的研究路线图,很实在的讨论。原文稍后读已读值得跟进有用关注 OpenAI
10:41官方账号arXiv cs.LG@Juliana Li, Diya Sreedhar论文发现小型语言模型在预训练中学会的代词-性别规则(准确率0.94)会在3500步后自然消失,尽管训练数据仍包含该规则。这种未在损失曲线上反映的反转现象称为natural ungrokking。规则存留由支持频率预测:在2个语料、3个预算、3个种子的16次未干预运行中,支持频率决定规则命运。该动态出现在公开Pythia检查点中,遗忘顺序按模型规模排序。控制不对称:反转支持证据可破坏规则,但即使注入450倍支持也无法恢复。论文Natural UngrokkingPythia预训练推荐理由:这篇论文发现了模型训练中规则自然遗忘的规律,并且能预测和控制——破坏容易恢复难,对理解LLM行为很有启发。原文稍后读已读值得跟进有用关注 Natural Ungrokking
09:40官方账号arXiv cs.AI@Liangkai Hang, Junjie Yao, Zhiyu Li, Feiyu Xiong, Hongkang Yang, Zhi-Qin John Xu73°论文发现缩小参数初始化尺度能持续改善大语言模型的预训练效果,在推理密集型任务上提升最为显著,同时识别出两种常见训练设置会抑制该优势。研究揭示了初始化尺度的关键平衡点,并发现小初始化驱动参数先凝聚为低复杂度结构再扩展为丰富表示。基于此提出γ初始化规则——将初始化范围作为可调旋钮,默认使用小初始化几乎不增加成本即可改善训练和推理。论文初始化大语言模型推理推荐理由:发现一个几乎零成本的训练技巧:缩小初始化尺度能大幅提升大模型推理能力。原文稍后读已读值得跟进有用关注 初始化
11:04官方账号arXiv cs.LG@Kaiyue Wen, Xingyu Dang, Kaifeng Lyu, Tengyu Ma, Percy Liang论文提出Hyperball,一种简单优化器包装器,固定权重矩阵及其更新量的Frobenius范数,解决Muon等优化器在大模型(如1.2B参数Qwen3模型)上相比AdamW加速效果衰减的问题。实验表明,Muon+Hyperball实现20-30% token等效加速,并改善学习率在宽度和深度上的迁移。该方法受理论启发:权重衰减导致平衡权重范数仅依赖于超参数,进而决定角度学习率。论文HyperballMuonQwen3推荐理由:Muon在大模型上加速效果缩水?Hyperball通过固定矩阵范数,让Muon在1.2B Qwen3上又快了20-30%,还更好调参。原文稍后读已读值得跟进有用关注 Hyperball
11:02官方账号arXiv cs.AI@Ria Doshi, Tian Gao, Annie Chen, Chelsea Finn, Jeannette Bohg多机器人协作在移动场景中面临扩展性差和部分可观测性问题。CHORUS框架利用预训练视觉-语言-动作(VLA)模型的视觉运动先验,使每个机器人仅依赖自身局部观测和身份提示即可独立运行,无需推理时通信或显式对齐。在移动测量、图书交接和洗衣篮搬运等真实实验中,CHORUS相比从零训练的分散模型提升64%性能,对队友行为的反应性提高40%,并超越集中式基线。该工作表明,共享VLA骨干网络足以实现去中心化多机器人协作,无需为每个机器人单独训练策略。论文多机器人协作VLA模型去中心化推荐理由:多机器人协作的扩展性难题被VLA模型破解了——做机器人集群部署的团队可以直接参考CHORUS的零通信方案,省去复杂的对齐和通信模块。原文稍后读已读值得跟进有用关注 多机器人协作
12:14官方账号arXiv cs.AI@Akarsh Kumar, Phillip Isola精选论文提出Supervised Memory Training (SMT),一种训练非线性RNN的新方法。SMT通过将RNN训练转化为一步记忆转换标签的监督学习,完全绕过了传统的循环信用分配。它利用基于Transformer的编码器从预测状态目标中获取记忆标签,只保留预测未来所需的过去信息。SMT实现了时间并行训练,任意两个token之间的梯度路径长度稳定为O(1),无需展开RNN。实验表明,SMT在语言建模和像素序列建模等任务上优于BPTT,能更好地捕捉长程依赖关系。论文RNN预训练长程依赖推荐理由:SMT解决了RNN训练中并行性差和长程依赖难学的问题,做序列建模或时间序列分析的开发者可以直接用这个方法替代BPTT,训练效率会大幅提升。原文稍后读已读值得跟进有用关注 RNN
12:08官方账号arXiv cs.AI@Senmiao Wang, Tiantian Fang, Haoran Zhang, Yushun Zhang, Kunxiang Zhao, Alex Schwing, Ruoyu Sun精选研究人员提出了一种名为PC Layer(Preconditioning Layer)的权重参数化方法,通过在训练过程中对权重矩阵进行低阶多项式预处理,稳定其奇异值谱,从而改善大型语言模型(LLM)的预训练效果。该方法与AdamW和Muon优化器兼容,在Llama-1B模型上验证了其优于标准Transformer架构。训练后,预处理权重可合并回原始架构,不增加推理开销。理论证明,均匀限制每层奇异值能确保梯度下降在深层线性网络中收敛到全局最小值。代码已开源。论文预训练权重预处理奇异值谱推荐理由:这项研究解决了LLM训练中权重矩阵病态条件数导致的收敛不稳定问题,做预训练优化的团队可以直接在Llama等模型上尝试,无需额外推理成本。原文稍后读已读值得跟进有用关注 预训练
20:32官方一手Hugging Face: Blog(博客/媒体)精选NVIDIA 提出了一种名为 Task-Seeded Synthetic Q&A Generation 的方法,用于为 Nemotron 模型预训练生成高质量的合成问答数据。该方法通过任务种子(task seeds)引导生成多样化的问答对,解决了传统数据生成中覆盖不足和多样性低的问题。实验表明,使用该方法生成的合成数据训练的模型在多个基准测试上表现优异,甚至优于使用真实数据训练的模型。这项技术有望降低对人工标注数据的依赖,加速大语言模型的开发。论文NVIDIANemotron合成数据10 个信源在谈事件专题推荐理由:NVIDIA 用任务种子生成合成数据,解决了预训练数据稀缺和多样性不足的问题,做 NLP 和模型训练的团队可以关注,能显著降低数据标注成本。原文稍后读已读值得跟进有用关注 NVIDIA
10:23官方账号arXiv cs.AI@Bishwas Mandal, Shmuel Berman, Akshay Vegesna, Samip Dahal随着计算资源增长快于高质量文本供给,多轮训练成为新常态,但单模型在几轮后即饱和。论文提出“超时代预训练”(q0),将多轮预算转化为多样模型群体并聚合预测,达到比单模型更低的验证损失。q0包含三个核心原语:反相关学习率与权重衰减的循环调度、链式蒸馏、以及基于学习先验的模型选择与加权。在1.8B参数模型、100M FineWeb tokens上,q0仅用约56轮就匹配了256轮强集成基线,效率提升约4.6倍,在Slowrun设置下累积数据效率达12.9倍。该方法还给出了不同预算下的最优分配策略,从单轮到最大预算均可适用。论文预训练数据效率模型集成推荐理由:多轮训练效率瓶颈是当前大模型预训练的痛点,q0用群体模型替代单模型精炼,做预训练或数据效率优化的研究者可以直接复现并应用到自己的训练流程中。原文稍后读已读值得跟进有用关注 预训练
11:18官方账号arXiv cs.LG@Kazuto Fukuchi, Ryuichiro Hataya, Kota Matsui精选该论文提出了复杂度最小化框架,用于理论解释预训练数据规模增大如何降低下游样本复杂度。通过端到端分析,证明该框架能捕捉元学习中的缩放行为,即少样本适应误差率随元训练数据量增加而改善。实验表明,将复杂度正则化融入现有元学习方法能持续提升下游样本效率。论文元学习预训练复杂度最小化推荐理由:这篇论文为预训练数据规模定律提供了首个理论证明,做元学习或预训练研究的学者值得关注,可以直接参考其复杂度正则化方法改进现有模型。原文稍后读已读值得跟进有用关注 元学习
11:22官方账号arXiv cs.LG@Hongwu Peng, Ohiremen Dibua, Yuanjun Xiong, Yifan Gong, Jianming Zhang, Yan Kang精选研究者提出Complete-muE框架,解决了从密集FFN到混合专家(MoE)模型架构的超参数迁移问题。现有方法如μP和SDE无法处理MoE中专家数量变化带来的架构和每个专家token数同时改变的问题。Complete-muE通过双桥系统实现迁移:桥I利用激活宽度μP和归一化路由器尺度映射密集FFN到密集MoE;桥II通过激活专家缩放映射密集MoE到稀疏MoE,并处理一阶SDE学习率/权重衰减校正。实验表明,在语言模型和扩散模型预训练中,该框架能使超参数在多种MoE配置下保持稳定,实现“一次调参,迁移所有”的效果,显著加速MoE模型收敛。论文MoE模型超参数迁移缩放法则推荐理由:做大规模MoE模型训练的团队终于有了可靠的超参数迁移方案——不用为每个专家配置重新调参,直接复用密集模型的超参数即可,建议做预训练优化的点开看看。原文稍后读已读值得跟进有用关注 MoE模型
16:36官方账号阿里云 Alibaba Cloud@alibaba_cloud阿里云宣布将于2026年在新加坡金沙会展中心举办Qwen Conference,聚焦基础模型论坛。论坛将探讨预训练突破、推理逻辑和未来模型路线图等核心智能领域的前沿进展。该活动旨在为AI研究者和开发者提供深度交流平台,展示通义千问系列模型的最新成果。目前会议已开放报名,感兴趣者可提前锁定席位。AI产品Qwen基础模型预训练推荐理由:Qwen Conference 是了解通义千问最新技术路线和预训练突破的窗口,做基础模型研究或应用的开发者值得关注,建议提前报名锁定席位。原文稍后读已读值得跟进有用关注 Qwen
11:10官方账号arXiv cs.AI@Pilchen Hippolyte, Fabre Romain, Signe Talla Franck, Perez Patrick, Grave Edouard精选72°该研究探讨了预训练数据顺序对大语言模型获取时间敏感事实知识的影响。作者构建了包含7000多个时间锚定问题的基准测试,并训练了6B参数模型,比较了按时间顺序预训练与标准随机打乱预训练的效果。结果显示,按时间顺序训练的模型在通用语言理解和常识方面与随机基线相当,但事实知识更新、更精确。随机预训练模型在旧数据上表现更好,可能是因为事实重复更多。研究为LLM持续学习提供了基础,并开源了代码、检查点和数据集。论文大语言模型预训练数据时序性推荐理由:这项研究揭示了数据顺序对模型知识时效性的关键影响,做LLM预训练或持续学习的团队值得关注,可以直接参考其基准和训练方法。原文稍后读已读值得跟进有用关注 大语言模型