11:30官方账号arXiv cs.LG@Valentina Njaradi, Clémentine Dominé, Rachel Swanson, Marco Mondelli, Andrew Saxe精选该论文通过高维分析框架,研究了预训练表征维度对下游线性探测泛化性能的影响。作者将预训练建模为无标签数据的主成分分析,下游任务建模为有标签数据的线性回归,并推导出训练误差和泛化误差的精确表达式。研究发现,当预训练数据充足但下游数据稀缺时,最大压缩的表征最优;而当预训练数据有限时,高维表征泛化更好。论文还量化了无标签数据与有标签数据之间的替代关系,并在自编码器和预训练大语言模型中观察到类似现象。论文预训练表征学习泛化理论推荐理由:这篇论文为预训练表征的维度选择提供了理论指导,做迁移学习或模型压缩的研究者可以直接参考其结论来优化训练策略。原文稍后读已读值得跟进有用关注 预训练
11:17官方账号arXiv cs.LG@Zhen Xiong, Shang-Ling Hsu, Cyrus Shahabi精选TrajTok 是一种新型轨迹编码器,通过自适应多分辨率六边形网格分词和掩码标记预训练,从原始GPS轨迹中学习可迁移的轨迹表征。它解决了传统网格分词中细粒度导致稀疏、粗粒度混淆运动模式的问题。TrajTok 使用分解式Transformer编码器,分别处理几何和运动学特征,并通过交叉注意力融合。在Porto数据集上,冻结的TrajTok编码器配合轻量任务适配器,在轨迹相似性搜索、分类、预计到达时间等任务上超越多个专用方法。这表明多分辨率空间分词与掩码预训练是构建通用轨迹基础模型的有前景方向。论文轨迹表征空间分词Transformer推荐理由:做轨迹分析或时空数据挖掘的团队,TrajTok 提供了一种无需为每个任务单独训练模型的通用方案,值得关注其预训练权重和代码开源。原文稍后读已读值得跟进有用关注 轨迹表征
10:24官方账号arXiv cs.AI@Yuze Zhao, Junpeng Fang, Lu Yu, Zhenya Huang, Kai Zhang, Qing Cui, Qi Liu, Jun Zhou, Enhong Chen精选72°这篇论文通过控制预训练实验,重新审视了代码训练对语言模型推理能力的影响。研究发现,纯代码主要提升编程能力,而非通用推理能力,甚至与数学等知识密集型任务存在竞争关系。真正提升数学推理的是跨领域的结构化推理信号,如代码-文本和数学-文本混合数据。在固定数学预算下,增加结构化数学样本密度能显著提升复杂数学推理,同时保持编程性能。分析还显示,数据组成效应反映在专家激活模式中,为跨领域的竞争与协同提供了机制层面的证据。论文推理模型预训练数学推理推荐理由:这篇论文戳破了“代码训练提升通用推理”的迷思,做预训练数据策略的团队值得细看——它指明了如何通过结构化推理信号精准优化数学能力,而非盲目堆代码。原文稍后读已读值得跟进有用关注 推理模型
09:36SuperTechFans(博客/媒体)88°Andrej Karpathy 宣布加入 Anthropic 预训练团队,计划将 AutoResearch 理念扩展为递归训练项目,以提升 Claude 核心能力。社区对此褒贬不一,有人认为这是自动化研究的好方向,也有人质疑其创新性。Karpathy 表示仍会继续从事教育事业。此举可能加速 Anthropic 在预训练技术上的突破。AI模型AnthropicKarpathy预训练10 个信源在谈事件专题推荐理由:Karpathy 的加入可能改变 Claude 的预训练范式,关注大模型训练的开发者值得了解递归训练的具体思路。原文稍后读已读值得跟进有用关注 Anthropic
07:22IT之家(博客/媒体)83°AI 领域顶级研究员、OpenAI 创始成员 Andrej Karpathy 正式加入 Anthropic,将主导预训练团队并组建新团队,探索利用 Claude 自身能力加速预训练研究。此举被视为 Anthropic 在顶尖 AI 人才争夺中的重大胜利,也标志着 Karpathy 从教育领域重返一线研发。他曾在特斯拉领导 Autopilot 计算机视觉团队,近期提出“vibe coding”概念,此次加盟将直接参与 Claude 模型的核心能力建设。行业AnthropicAndrej Karpathy人才流动10 个信源在谈事件专题推荐理由:Karpathy 从教育回归一线研发,意味着 Anthropic 在预训练自动化上押注重磅人才。关注大模型前沿进展的开发者,可以期待 Claude 能力加速迭代的新方向。原文稍后读已读值得跟进有用关注 Anthropic
18:29官方账号Meta AI@AIatMeta精选Meta 宣布其新模型 Muse Spark 在预训练、强化学习和测试时推理三个维度上实现了可预测且高效的扩展。通过重建预训练栈,包括改进模型架构、优化和数据整理,Muse Spark 在达到相同能力水平时所需的计算量比前代 Llama 4 Maverick 减少了一个数量级。Meta 分享了其缩放定律研究方法,展示了 Muse Spark 在效率上的显著提升,旨在构建个人超级智能。AI模型Muse SparkLlama 4预训练推荐理由:Meta 用实际数据证明了 Muse Spark 的预训练效率比 Llama 4 提升 10 倍以上,做模型训练或资源优化的团队值得关注其缩放定律方法,可以直接借鉴来评估自己的模型效率。原文稍后读已读值得跟进有用关注 Muse Spark