#预训练
共 65 条 · 7 天 3 条 · 30 天 12 条
7月13日
7月11日
7月5日
7月3日
7月2日
6月27日
6月25日
6月17日
6月16日
6月11日
6月5日
6月4日
NVIDIA Nemotron 预训练:任务种子合成 Q&A 生成
NVIDIA 用任务种子生成合成数据,解决了预训练数据稀缺和多样性不足的问题,做 NLP 和模型训练的团队可以关注,能显著降低数据标注成本。
6月3日
论文10:23
q0:超时代预训练原语,多轮训练效率提升4.6倍多轮训练效率瓶颈是当前大模型预训练的痛点,q0用群体模型替代单模型精炼,做预训练或数据效率优化的研究者可以直接复现并应用到自己的训练流程中。
6月2日
5月25日
Complete-muE:MoE模型最优超参数迁移与缩放框架
做大规模MoE模型训练的团队终于有了可靠的超参数迁移方案——不用为每个专家配置重新调参,直接复用密集模型的超参数即可,建议做预训练优化的点开看看。
5月22日
Qwen Conference 2026:基础模型论坛在新加坡举办
Qwen Conference 是了解通义千问最新技术路线和预训练突破的窗口,做基础模型研究或应用的开发者值得关注,建议提前报名锁定席位。
5月20日
OpenAI 联合创始人卡帕西官宣加盟 Anthropic,重返大模型研发前线
Karpathy 从教育回归一线研发,意味着 Anthropic 在预训练自动化上押注重磅人才。关注大模型前沿进展的开发者,可以期待 Claude 能力加速迭代的新方向。
5月14日
Meta 发布 Muse Spark:预训练效率超 Llama 4 一个数量级
Meta 用实际数据证明了 Muse Spark 的预训练效率比 Llama 4 提升 10 倍以上,做模型训练或资源优化的团队值得关注其缩放定律方法,可以直接借鉴来评估自己的模型效率。