8月26日
01:39
8月24日
01:04
8月22日
01:09
8月21日
11:05
11:05官方账号arXiv cs.AI@Christos Koutsiaris
Daedalus-150M模型采用卷积-注意力混合架构,在CPU上实现高效推理;在59.9B tokens上从头训练,五任务基准测试得分47.31,优于GPT-2 124M等模型;与全注意力模型相比,在速度上具有显著优势,同时保持相似的质量指标。
推荐理由:Daedalus-150M模型在CPU上实现了高效推理,与同类全注意力模型相比,在速度上具有显著优势,同时保持了相似的质量指标,值得一试。
10:42
8月20日
07:36
02:35
02:35Thomas Wolf@Thom_Wolf
精选
GLM - 5.3 总参数量与训练数据比例遵循Chinchilla规律,体现参数和数据的最佳关联。该模型有效深度调整后,参数达290 tokens per parameter左右,提升训练效率。对比GPT - 3等早期模型,GLM - 5.3在计算分配上更科学,减少资源浪费。
事件专题

推荐理由:你看看GLM - 5.3这发布,把模型参数和训练规律讲得很透,跟以前那些大模型比,它在参数分配上更合理,以后搞类似项目能参考下。
8月17日
23:25
23:25官方账号Nathan Lambert: Interconnects@Nathan Lambert
英伟达明确表态,希望开发者自己构建模型,而不是从Anthropic或OpenAI购买API服务。这一策略直接影响其GPU芯片的销售与AI应用生态。文章用'教人钓鱼'作比喻,对比了自建模型与购买现成API在成本和自主性上的不同取舍。
事件专题

推荐理由:英伟达喊话开发者:自己训模型,别给Anthropic/OpenAI送钱。这篇把背后的商业算盘讲明白了。
8月15日
19:59
19:59官方一手Sebastian Raschka: Ahead of AI@Sebastian Raschka, PhD
这篇教程演示了如何从零构建AI文本检测器。项目流程包括数据集构建、模型训练、本地部署和RLVR。教程以实际项目为载体,适合想学习RLVR应用的人。

推荐理由:从零搭AI文本检测器的完整教程,含数据集、训练、部署和RLVR,适合想亲手走一遍流程的朋友。
02:49
02:49Fireworks AI@FireworksAI_HQ
Fireworks与微软将于9月2日在纽约举办邀请制动手工作坊。参与者用自己的笔记本电脑训练一个真实模型。完成后可获得定制模型,并直接上传至Azure Foundry。报名需通过luma.com/fw.models.nyc进行RSVP。

推荐理由:想亲手训练个模型?9月2日纽约有Fireworks和微软办的动手工作坊,带上笔记本去,结束就能带走能放上Azure的定制模型。
8月9日
13:00
8月7日
21:00
8月5日
01:31
01:31官方账号Cursor@cursor_ai
Cursor在官方博客发布了关于混合专家(MoE)模型的构建详解。文章具体介绍了专家路由、负载均衡等关键组件的实现思路。其目标是让更多实验室能够高效训练自己的MoE模型,降低AI研究门槛。
推荐理由:Cursor把自己做MoE模型的流程写成了博客,想自己训练混合专家模型的小团队可以直接照着搞。
8月4日
02:08
02:08官方一手Meta Engineering Blog博客/媒体
Meta的生成式广告推荐模型GEM支撑着Instagram和Facebook的广告推荐,现已在数千块最新GPU上训练。该训练将端到端效率翻倍,MFU达到20-25%。训练FLOPs同时扩展4倍,使广告推荐模型达到LLM规模。
推荐理由:Meta把广告推荐模型训到LLM规模,效率翻倍,MFU到20-25%,算力扩4倍。值得做推荐训练的看看。
7月21日
7月19日
00:03
00:03@koltregaskes@koltregaskes
xAI的Grok 4.6(2T参数模型)将在下周完成初始训练。其性能可能超过Kimi K3。速度和成本与Grok 4.5相当。根据Elon Musk以往从训练完成到发布的时间,估计发布时间为9月中旬。
事件专题

推荐理由:xAI的Grok 4.6下周完成训练,号称又快又便宜,还比Kimi K3强,预计9月中旬发布,可以关注。
7月14日
05:54
6月30日
23:40
23:40官方账号Decoder@Maximilian Schreiner
76°
美团发布LongCat-2.0模型,参数量达1.6万亿,完全在国产芯片上训练完成,未使用Nvidia硬件。该模型在多个中文基准上表现优异,证明中国芯片可支撑超大规模AI训练。训练过程中采用分布式优化算法,效率接近国际主流方案。
事件专题

推荐理由:美团搞了个1.6万亿参数的大模型LongCat-2.0,全程用国产芯片,没碰Nvidia,性能还很强。想看看中国芯片能不能撑起大模型?这篇聊得清楚。
05:49
05:49@koltregaskes@koltregaskes
72°
据x平台用户确认,Grok 2T运行已开始训练,计划七月完成,八月正式发布。此前有传言称下一代训练规模为3T,但该消息被指为猜测。马斯克作为xAI及特斯拉CEO,其公开预测需更加谨慎,以免影响投资者信心。

推荐理由:x平台爆料Grok 2T开始训练,预计8月上线,比之前传的3T规模小一点。想蹲新模型的话可以关注这个时间点。
6月29日
13:51
13:51官方账号Jasper AI@heyjasperai
Jasper将Hugging Face基础设施用于其MONET系统的数据创建和存储。该方法针对随时间更新的大型训练数据集进行了优化。Jasper团队通过HF实现了更高效的数据管道管理。这一案例展示了HF在训练数据工作流中的实际应用。

推荐理由:看看Jasper怎么用Hugging Face当MONET的数据后台,对做大模型训练数据管道的团队很有启发。
13:48
6月19日
07:11
07:11官方账号OpenAI@OpenAI
OpenAI通过少量训练数据使模型在53项独立评估中的44项上取得改进,涵盖欺骗、奖励黑客、安全、健康、心理健康等领域。该表现优于计算匹配的基线模型。评估涉及多种领域、任务格式和评分方案。
事件专题

推荐理由:OpenAI发现用一点额外数据就能让模型在超多对齐测试里变好,覆盖欺骗、安全、健康等方面,挺牛的。
07:10
07:10官方账号OpenAI@OpenAI
OpenAI在真实对话中训练模型,通过强化学习强化诚实、谦逊、开放纠正、公平和关怀人类福祉等特质。该训练覆盖健康、科学、教育等12个领域,旨在提升模型的对齐与安全性。方法基于RLHF改进,专注对话场景中的具体行为。
事件专题

推荐理由:OpenAI训练模型时不止看能力,还用强化学习专门教它诚实、谦逊、愿意接受批评,覆盖12个领域,对AI安全性很有意义。
6月17日
09:34
09:34Fireworks AI@FireworksAI_HQ
Kimi 2.7 现已完全在 Fireworks 上可训练,支持 SFT、DPO、RL 等训练方式。用户可以使用自己的数据微调模型,构建比前沿模型成本更低的护城河。Fireworks 提供托管点击或原始 API,支持大上下文和巨大 LoRA 秩。

推荐理由:Fireworks 让你拿 Kimi 2.7 自己训练,便宜还能干翻前沿模型,想定制模型的赶紧试试。
00:07
6月12日
13:34
13:34官方账号Thinking Machines Lab@thinkymachines
83°
Think Machines 宣布与 NVIDIA 合作,利用其硬件和平台来训练前沿模型,并提供可定制的 AI 解决方案。这一合作将加速模型训练效率,降低开发门槛,使企业能够更灵活地部署定制化 AI。NVIDIA 的算力支持将帮助 Think Machines 在竞争激烈的 AI 市场中提升模型性能。
事件专题

推荐理由:NVIDIA 与 Think Machines 的合作意味着更强大的算力支持,做模型训练和定制 AI 的团队可以关注这一进展,看看能否利用其平台加速自己的项目。
01:36