18:14官方账号arXiv cs.LG@Artyom Sabitov, Daniil Volkov, Alexey Zaytsev该论文研究内存受限下推荐系统训练中批大小与负样本数量的分配问题。理论分析表明,在固定内存预算下,增大批大小比增加负样本数量带来更快的收敛速度。作者提出将内存优先分配给更多样本的实用规则,并在MovieLens-20M等四个真实推荐基准上验证。实验显示该配置在相同内存下获得更优的收敛速度和最终推荐质量。论文推荐系统采样softmax内存优化推荐理由:推荐系统训练时内存不够用?这篇论文告诉你该加批大小还是加负样本,结论很实用。原文稍后读已读值得跟进有用关注 推荐系统
14:09向阳乔木@vista8Scaling Laws(缩放定律)描述了模型性能随计算量、数据量和参数规模变化的幂律关系。该定律由OpenAI在2020年提出,指导了大模型训练的资源分配。理解Scaling Laws有助于设计更高效的模型训练策略。技巧Scaling Laws缩放定律训练策略2 个信源在谈事件专题推荐理由:想搞懂大模型为什么越训越大?这个视频用动画讲清Scaling Laws的缩放规律,比看论文容易多了。原文稍后读已读值得跟进有用关注 Scaling Laws
18:19量子位@思邈精选智源研究院提出悟界·Orca方法,改变大模型训练顺序,先让模型学习世界动态变化规律。该方法旨在避免AI直接进入任务执行。相关论文入选Hugging Face论文月榜第一。AI模型悟界·Orca智源研究院Hugging Face推荐理由:智源搞了个新训练法Orca,不让AI一上来就干杂活,先学世界怎么变。论文上了Hugging Face月榜第一,值得看看他们的思路。原文稍后读已读值得跟进有用关注 悟界·Orca
11:54向阳乔木@vista8精选72°斯坦福大学研究团队发现,当模型规模足够大时,使用未过滤的Common Crawl数据训练效果反而优于经过清洗的数据。在15M小模型上,过滤数据全面领先;但在330M和1B模型上,未过滤数据在充分训练后超越了所有过滤版本。这表明大模型有足够参数空间将噪声与有用信息分离,颠覆了数据清洗越干净越好的传统认知。论文大模型数据清洗Common Crawl推荐理由:这项研究挑战了数据清洗的行业惯例,做大模型训练的团队值得关注——或许可以省下大量清洗成本,直接喂原始数据。原文稍后读已读值得跟进有用关注 大模型