01:39Fireworks AI@FireworksAI_HQFrontier模型展示能力后,无法在生产规模上持续交付。9月2日,纽约:学习自己训练模型,然后上传到Azure Foundry。AI模型Frontier模型模型可靠性Azure Foundry推荐理由:想了解如何训练并使用Frontier模型?这篇报道提供了实用信息。原文稍后读已读值得跟进有用关注 Frontier模型
11:22官方账号arXiv cs.LG@Erin Craig, Yiling Huang, Snigdha Panigrahi提出局部蒸馏方法,通过黑盒教师模型指导线性学生模型,提高预测准确性并保持可解释性;在17个基准数据集上,局部蒸馏接近教师模型的准确性,同时生成稀疏线性模型;在高维癌症基因表达数据中,识别出使用不同基因的患者亚组,这是全局线性模型和黑盒模型难以实现的。论文可解释AI局部蒸馏模型训练推荐理由:这篇论文提出了局部蒸馏方法,对于需要可解释性的AI模型来说是个重要进展,值得一读。原文稍后读已读值得跟进有用关注 可解释AI
09:08官方账号Andrew Ng@AndrewYNg精选Marin项目展示了AI模型训练的开放性,包括开源代码、数据、配方和实验结果。本周开始训练Marin 535B-A23B模型,整个训练过程公开。预训练和中期训练将在11个GB200 NVL72上使用18.75T标记进行,预计约3个月完成。之前进行了从1.6B-A61M到27.7B-A1.2B的4级缩放训练,以调试问题和预测主要运行。这是迄今为止最大的运行,预计会有意外。AI模型Marin项目模型训练开放性3 个信源在谈事件专题推荐理由:Percy Liang的实验室以开放的方式发布了Marin 535B-A23B模型,展示了AI训练的开放性,值得关注。原文稍后读已读值得跟进有用关注 Marin项目
01:04Stanford AI Lab@StanfordAILabStanfordAILab启动了Marin 535B-A23B模型的训练,使用11 x GB200 NVL72进行,预计3个月完成。这是迄今为止最大的训练,预计将出现意外。AI模型StanfordAILabMarin 535B-A23B模型训练3 个信源在谈事件专题推荐理由:StanfordAILab发布了Marin 535B-A23B模型的训练消息,这是他们迄今为止最大的训练项目,值得关注。原文稍后读已读值得跟进有用关注 StanfordAILab
01:09官方账号Andrew Ng@AndrewYNgAndrew Ng分享构建和部署AI应用的关键技能,涵盖模型选择、数据预处理、模型训练和部署等环节。文章提供实用技巧和最佳实践,帮助读者提升AI应用开发能力。技巧Andrew NgAI应用开发模型选择推荐理由:Andrew Ng分享构建和部署AI应用的关键技能,实用技巧和最佳实践,提升AI应用开发能力,不容错过!原文稍后读已读值得跟进有用关注 Andrew Ng
11:05官方账号arXiv cs.AI@Christos KoutsiarisDaedalus-150M模型采用卷积-注意力混合架构,在CPU上实现高效推理;在59.9B tokens上从头训练,五任务基准测试得分47.31,优于GPT-2 124M等模型;与全注意力模型相比,在速度上具有显著优势,同时保持相似的质量指标。AI模型Daedalus-150M卷积-注意力混合模型CPU推理推荐理由:Daedalus-150M模型在CPU上实现了高效推理,与同类全注意力模型相比,在速度上具有显著优势,同时保持了相似的质量指标,值得一试。原文稍后读已读值得跟进有用关注 Daedalus-150M
10:42官方账号arXiv cs.AI@Qian Kou, Xiaofeng Shi, Xiaosong Qiu, Hua Zhou研究提出IAR框架,通过三个阶段提升文档知识内化能力,在多个数据集和模型上表现优异,平均提升领域问答准确率和通用性能。论文IAR框架文档知识内化模型训练推荐理由:IAR框架在文档知识内化方面表现卓越,值得研究学习。原文稍后读已读值得跟进有用关注 IAR框架
07:36宝玉@dotey精选智谱推出的GLM-5.3模型,以GLM-5.2为底座进行后训练,编码能力较之前提升了50%;该模型为约743B参数的MoE架构,通过后训练优化后性能表现更优;与GLM-5.2版本对比,后训练方式让模型编码能力提升明显。AI模型GLM-5.3GLM-5.2智谱6 个信源在谈事件专题推荐理由:智谱这GLM-5.3后训练分享,讲了如何提升编码能力,比之前的GLM-5.2效果更强。原文稍后读已读值得跟进有用关注 GLM-5.3
02:35Thomas Wolf@Thom_Wolf精选GLM - 5.3 总参数量与训练数据比例遵循Chinchilla规律,体现参数和数据的最佳关联。该模型有效深度调整后,参数达290 tokens per parameter左右,提升训练效率。对比GPT - 3等早期模型,GLM - 5.3在计算分配上更科学,减少资源浪费。AI模型GLM - 5.3模型训练参数优化5 个信源在谈事件专题推荐理由:你看看GLM - 5.3这发布,把模型参数和训练规律讲得很透,跟以前那些大模型比,它在参数分配上更合理,以后搞类似项目能参考下。原文稍后读已读值得跟进有用关注 GLM - 5.3
11:51爱范儿@彭海星OpenAI紧急暂停了新模型训练计划,以评估AI安全风险。公司认为随着模型能力提升,潜在危险也随之增加。这一决定反映了AI行业对高级模型安全性的担忧加剧。OpenAI正重新审视其AI发展策略,平衡创新与安全。行业OpenAIAI安全模型训练10 个信源在谈事件专题推荐理由:OpenAI突然暂停训练新模型,看来AI越聪明真的越危险,这事儿值得关注。原文稍后读已读值得跟进有用关注 OpenAI
02:10AI Engineer@aiDotEngineer72°Krea 故意在训练集中移除了 AI 图像,因为蒸馏数据会导致模型走捷径。团队运行了 30 到 40 个内部分类器处理数十亿张图像,并自动替换温度超过 78 度的 GPU。专为小模型设计的框架让开源用户在 90 天内渲染了 130 万个视频。连续视频生成的成本降至 10 美元 3 小时,而旧方式约为 10 美元每分钟。技巧Krea视频生成开源模型推荐理由:听听 Krea 怎么处理训练数据和降低视频生成成本。原文稍后读已读值得跟进有用关注 Krea
23:25官方账号Nathan Lambert: Interconnects@Nathan Lambert英伟达明确表态,希望开发者自己构建模型,而不是从Anthropic或OpenAI购买API服务。这一策略直接影响其GPU芯片的销售与AI应用生态。文章用'教人钓鱼'作比喻,对比了自建模型与购买现成API在成本和自主性上的不同取舍。行业NvidiaAnthropicOpenAI10 个信源在谈事件专题推荐理由:英伟达喊话开发者:自己训模型,别给Anthropic/OpenAI送钱。这篇把背后的商业算盘讲明白了。原文稍后读已读值得跟进有用关注 Nvidia
19:59官方一手Sebastian Raschka: Ahead of AI@Sebastian Raschka, PhD这篇教程演示了如何从零构建AI文本检测器。项目流程包括数据集构建、模型训练、本地部署和RLVR。教程以实际项目为载体,适合想学习RLVR应用的人。技巧AI文本检测器RLVR数据集构建推荐理由:从零搭AI文本检测器的完整教程,含数据集、训练、部署和RLVR,适合想亲手走一遍流程的朋友。原文稍后读已读值得跟进有用关注 AI文本检测器
02:49Fireworks AI@FireworksAI_HQFireworks与微软将于9月2日在纽约举办邀请制动手工作坊。参与者用自己的笔记本电脑训练一个真实模型。完成后可获得定制模型,并直接上传至Azure Foundry。报名需通过luma.com/fw.models.nyc进行RSVP。技巧FireworksMicrosoftAzure Foundry推荐理由:想亲手训练个模型?9月2日纽约有Fireworks和微软办的动手工作坊,带上笔记本去,结束就能带走能放上Azure的定制模型。原文稍后读已读值得跟进有用关注 Fireworks
16:30IT之家(博客/媒体)闲鱼平台出现多款改装版 RTX 4080 涡轮显卡,显存从 16GB 升级至 32GB GDDR6X,售价普遍超 1 万元。显存翻倍不改变 256-bit 位宽,也不提升带宽,但更适合模型训练。外媒 VideoCardz 报道,此前已有 48GB 版 RTX 4090 和 RTX 4090D,以及 RTX 4080 SUPER 32GB 显卡。这些魔改显卡可能需修改驱动,且无原厂保修,质量无保证。AI产品RTX 4080英伟达魔改显卡推荐理由:闲鱼上有人把 RTX 4080 显存翻倍到 32GB,卖一万多,适合跑模型但没保修,想捡漏得先想清楚。原文稍后读已读值得跟进有用关注 RTX 4080
10:03Naval@naval在获得 124 个赞的推文中,Naval 表示认真对待软件的人会训练自己的模型。该推文另有 28 条回复和 14 次转发。总浏览量达到 15328 次。技巧Naval模型训练开发者推荐理由:Naval 发推说,真做软件的人得自己训模型。一句话引来 1.5 万多次浏览,够直接。原文稍后读已读值得跟进有用关注 Naval
13:00Suhail@SuhailSuhail在X平台发布的推文已有288次浏览。他称,分支团队的士气不会改善,直到模型训练达到令他满意的性能,而这条推文目前仅有0条回复。该推文同时有0次转发和0次点赞。行业SuhailX平台模型训练1 个信源在谈事件专题推荐理由:Suhail发了条推,说模型训练不到满意性能,团队士气就上不来。虽然0评论0赞,但挺扎心。原文稍后读已读值得跟进有用关注 Suhail
21:00官方账号Decoder@Maximilian Schreiner据《金融时报》报道,Bytedance正在训练一个参数高达10万亿的AI模型。该规模是Moonshot旗下Kimi K3的三倍,后者目前是中国最大的模型。这一训练项目显示Bytedance在AI竞赛中投入巨大。AI模型BytedanceKimi K3Moonshot10 个信源在谈事件专题推荐理由:字节在搞10万亿参数的模型,比Kimi K3大三倍,这下有好戏看了。原文稍后读已读值得跟进有用关注 Bytedance
21:49IT之家(博客/媒体)78°字节跳动正讨论训练参数规模超 5 万亿的模型,超过阿里 Qwen 3.8-Max 的 2.4 万亿和月之暗面 K3 的 2.8 万亿参数,为国内已知最大规模。该计划由 Seed Foundation 负责人项亮主导,目前仍处于早期阶段。张一鸣在 Seed 全员会上表示一段时间内可接受模型落后行业,但希望追求智能上限,并反对蒸馏,认为蒸馏只是复制 Claude 已有能力。行业字节跳动SeedQwen 3.8-Max推荐理由:字节要训超5万亿参数的模型,比阿里Qwen 3.8-Max和月之暗面K3都大,张一鸣表态反对蒸馏。原文稍后读已读值得跟进有用关注 字节跳动
01:31官方账号Cursor@cursor_aiCursor在官方博客发布了关于混合专家(MoE)模型的构建详解。文章具体介绍了专家路由、负载均衡等关键组件的实现思路。其目标是让更多实验室能够高效训练自己的MoE模型,降低AI研究门槛。技巧Cursor混合专家模型训练推荐理由:Cursor把自己做MoE模型的流程写成了博客,想自己训练混合专家模型的小团队可以直接照着搞。原文稍后读已读值得跟进有用关注 Cursor
02:08官方一手Meta Engineering Blog(博客/媒体)Meta的生成式广告推荐模型GEM支撑着Instagram和Facebook的广告推荐,现已在数千块最新GPU上训练。该训练将端到端效率翻倍,MFU达到20-25%。训练FLOPs同时扩展4倍,使广告推荐模型达到LLM规模。技巧GEMMeta广告推荐推荐理由:Meta把广告推荐模型训到LLM规模,效率翻倍,MFU到20-25%,算力扩4倍。值得做推荐训练的看看。原文稍后读已读值得跟进有用关注 GEM
15:58IT之家(博客/媒体)81°马斯克宣布SpaceX的工程数据将用于训练下一代Grok模型,模型规模约2万亿参数,是当前Grok 4.5(参数量约1万亿)的近两倍。受ITAR法规限制,梅林和猛禽发动机等敏感技术被排除,但Starlink硬件设计、制造工艺等数据纳入。该模型已进入最后训练阶段,预计本周完成。AI模型GrokSpaceXxAI2 个信源在谈事件专题推荐理由:马斯克要用SpaceX的火箭数据喂Grok,新模型2万亿参数比4.5翻倍,这波操作有点生猛。原文稍后读已读值得跟进有用关注 Grok
16:42shao__meng@shao__meng82°SpaceX收购了编程助手Cursor,实现模型训练的算力和数据打通。Grok 4.5之后的新模型将拥有2T参数,并在补充训练中引入SpaceX积累的世界级工程数据(不含ITAR限制)。Elon Musk称这将大幅提升Grok的工程能力,这一数据优势是OpenAI和Anthropic不具备的。AI模型GrokSpaceXCursor10 个信源在谈事件专题推荐理由:马斯克把SpaceX的工程数据喂给2T参数的Grok新模型,工程能力要起飞了,OpenAI和Anthropic可没这资源。原文稍后读已读值得跟进有用关注 Grok
00:03@koltregaskes@koltregaskesxAI的Grok 4.6(2T参数模型)将在下周完成初始训练。其性能可能超过Kimi K3。速度和成本与Grok 4.5相当。根据Elon Musk以往从训练完成到发布的时间,估计发布时间为9月中旬。AI模型Grok 4.62T模型Kimi K310 个信源在谈事件专题推荐理由:xAI的Grok 4.6下周完成训练,号称又快又便宜,还比Kimi K3强,预计9月中旬发布,可以关注。原文稍后读已读值得跟进有用关注 Grok 4.6
05:54Amjad Masad@amasad用户在X上分享在模型训练运行中获取实时进度更新的体验,称之为类似早期的vibe编码,但目标是构建个人模型。该推文获得了498次查看和1个点赞。实时监控使训练过程更直观,便于快速调整超参数。技巧模型训练实时监控vibe coding推荐理由:想实时监控你训练的模型进度?试试这个思路,像早期vibe编码一样,可以自己调参玩。原文稍后读已读值得跟进有用关注 模型训练
02:03Harrison Chase@hwchase17Harvey正在组建模型训练团队,计划从应用层扩展至模型层,并招聘各层级AI研究员,尤其关注有后训练开源或前沿模型经验者。该团队专注于大规模模型训练、合成数据生成、长 horizon 强化学习及真实部署评估。Harvey已通过后训练开源模型在代理任务中达到前沿性能,并计划在法务领域及更多垂直行业扩展。研究人员将获得数千块GPU和客户关系产生的独特训练数据。行业Harvey模型训练后训练推荐理由:Harvey在招人组建自己的模型训练团队,要把法律AI做到模型层,已有数千GPU和独特后训练数据,能提升开源模型到前沿水平,适合想做大型模型训练的AI研究员。原文稍后读已读值得跟进有用关注 Harvey
23:40官方账号Decoder@Maximilian Schreiner76°美团发布LongCat-2.0模型,参数量达1.6万亿,完全在国产芯片上训练完成,未使用Nvidia硬件。该模型在多个中文基准上表现优异,证明中国芯片可支撑超大规模AI训练。训练过程中采用分布式优化算法,效率接近国际主流方案。AI模型LongCat-2.0美团Nvidia7 个信源在谈事件专题推荐理由:美团搞了个1.6万亿参数的大模型LongCat-2.0,全程用国产芯片,没碰Nvidia,性能还很强。想看看中国芯片能不能撑起大模型?这篇聊得清楚。原文稍后读已读值得跟进有用关注 LongCat-2.0
05:49@koltregaskes@koltregaskes72°据x平台用户确认,Grok 2T运行已开始训练,计划七月完成,八月正式发布。此前有传言称下一代训练规模为3T,但该消息被指为猜测。马斯克作为xAI及特斯拉CEO,其公开预测需更加谨慎,以免影响投资者信心。AI模型GrokxAI模型训练推荐理由:x平台爆料Grok 2T开始训练,预计8月上线,比之前传的3T规模小一点。想蹲新模型的话可以关注这个时间点。原文稍后读已读值得跟进有用关注 Grok
13:51官方账号Jasper AI@heyjasperaiJasper将Hugging Face基础设施用于其MONET系统的数据创建和存储。该方法针对随时间更新的大型训练数据集进行了优化。Jasper团队通过HF实现了更高效的数据管道管理。这一案例展示了HF在训练数据工作流中的实际应用。技巧JasperHugging FaceMONET推荐理由:看看Jasper怎么用Hugging Face当MONET的数据后台,对做大模型训练数据管道的团队很有启发。原文稍后读已读值得跟进有用关注 Jasper
13:49官方账号Microsoft AI@MicrosoftAI微软AI在推文中介绍了构建编码模型的全流程,包括训练阶段的优化策略、评估方法、性能调优、安全性考量以及收集真实开发者反馈。文章深入展示了从模型设计到部署的每个环节,帮助理解如何让编码模型适配开发者的实际工作场景。AI模型微软AI编码模型模型训练推荐理由:微软AI分享了他们训练编码模型的实战细节,从评估到安全都有,做编程助手的人值得看看。原文稍后读已读值得跟进有用关注 微软AI
13:48岚叔@lufzzliz推文作者表达了对xAI下一代模型Grok 4.5的强烈期待。作者认为xAI可能拥有过多计算资源用于Grok 4.5的训练。希望Grok 4.5能训练得更出色并支持SpaceX。行业Grok 4.5xAISpaceX4 个信源在谈事件专题推荐理由:这位网友对Grok 4.5很有信心,还调侃xAI显卡太多不如自己用。看看民间对xAI新模型的态度。原文稍后读已读值得跟进有用关注 Grok 4.5
07:11官方账号OpenAI@OpenAIOpenAI通过少量训练数据使模型在53项独立评估中的44项上取得改进,涵盖欺骗、奖励黑客、安全、健康、心理健康等领域。该表现优于计算匹配的基线模型。评估涉及多种领域、任务格式和评分方案。论文OpenAI对齐AI安全10 个信源在谈事件专题推荐理由:OpenAI发现用一点额外数据就能让模型在超多对齐测试里变好,覆盖欺骗、安全、健康等方面,挺牛的。原文稍后读已读值得跟进有用关注 OpenAI
07:10官方账号OpenAI@OpenAIOpenAI在真实对话中训练模型,通过强化学习强化诚实、谦逊、开放纠正、公平和关怀人类福祉等特质。该训练覆盖健康、科学、教育等12个领域,旨在提升模型的对齐与安全性。方法基于RLHF改进,专注对话场景中的具体行为。AI模型OpenAI强化学习AI安全10 个信源在谈事件专题推荐理由:OpenAI训练模型时不止看能力,还用强化学习专门教它诚实、谦逊、愿意接受批评,覆盖12个领域,对AI安全性很有意义。原文稍后读已读值得跟进有用关注 OpenAI
09:34Fireworks AI@FireworksAI_HQKimi 2.7 现已完全在 Fireworks 上可训练,支持 SFT、DPO、RL 等训练方式。用户可以使用自己的数据微调模型,构建比前沿模型成本更低的护城河。Fireworks 提供托管点击或原始 API,支持大上下文和巨大 LoRA 秩。AI产品Kimi 2.7Fireworks微调推荐理由:Fireworks 让你拿 Kimi 2.7 自己训练,便宜还能干翻前沿模型,想定制模型的赶紧试试。原文稍后读已读值得跟进有用关注 Kimi 2.7
00:07官方账号Cursor@cursor_ai83°SpaceX以全股票交易收购Cursor AI,旨在构建全球最有用的AI模型。过去几个月,SpaceXAI与Cursor已联合训练一个模型。该模型将发布在Cursor和Grok Build中。合作将推动Cursor能力显著提升。行业SpaceXCursor收购10 个信源在谈事件专题推荐理由:SpaceX收购了Cursor,以后编程时能用上SpaceX训练的模型,效率可能会大幅提升。原文稍后读已读值得跟进有用关注 SpaceX
23:31IT之家(博客/媒体)71°开发者@0x0SojalSec 绕过苹果M4神经网络引擎的软件限制,通过逆向工程使用自定义MIL(模型中间语言)直接与芯片通信,没有调用Core ML、Metal或GPU。训练数据全程放在RAM中运行,不写入NAND闪存,速度更快。解锁后M4在iPad或Mac上可达到15.8TFLOPS的AI处理性能,用于训练模型。目前自定义MIL能否用于更新的Apple Silicon尚不明确。技巧M4Apple Silicon神经网络引擎推荐理由:有个开发者自己写了一套代码,把M4芯片的AI训练能力全开出来了,不用苹果官方工具,跑到了15.8TFLOPS。想用iPad或Mac训练模型的人可以看看。原文稍后读已读值得跟进有用关注 M4
13:34官方账号Thinking Machines Lab@thinkymachines83°Think Machines 宣布与 NVIDIA 合作,利用其硬件和平台来训练前沿模型,并提供可定制的 AI 解决方案。这一合作将加速模型训练效率,降低开发门槛,使企业能够更灵活地部署定制化 AI。NVIDIA 的算力支持将帮助 Think Machines 在竞争激烈的 AI 市场中提升模型性能。行业NVIDIAThink Machines模型训练10 个信源在谈事件专题推荐理由:NVIDIA 与 Think Machines 的合作意味着更强大的算力支持,做模型训练和定制 AI 的团队可以关注这一进展,看看能否利用其平台加速自己的项目。原文稍后读已读值得跟进有用关注 NVIDIA
01:36官方账号Clement Delangue@ClementDelangue精选Hugging Face 宣布其存储平台已成为私有和公开模型及数据集的最佳选择,支持中间和最终版本。以 @heyjasperai 为例,他们使用 HF 存储桶存储 Monet 数据集并直接在其上训练模型。这展示了 HF 在 AI 存储和训练工作流中的一体化能力。对于需要管理大型模型和数据集的团队,HF 提供了便捷的存储和训练集成方案。AI产品Hugging Face存储平台数据集推荐理由:Hugging Face 将存储与训练无缝集成,管理模型和数据集的团队可以直接在平台上完成从存储到训练的全流程,省去多平台切换的麻烦。原文稍后读已读值得跟进有用关注 Hugging Face
12:27rohanpaul_ai@rohanpaul_ai来自斯坦福、MIT、哈佛和 Anthropic 的联合研究揭示了大型语言模型能学会小模型无法掌握的技能的根本原因:大模型在训练过程中更不容易遗忘稀有技能。其额外容量能保护弱学习信号,而小模型的有限神经元会被常见任务占据,导致稀有任务在学习信号出现足够多次之前就被覆盖。研究通过控制实验和 OLMo 模型(4M 到 4B 参数)验证了这一结论,发现大模型在低频任务上表现更好,能保留更多任务特征,且梯度干扰更小。该论文为模型规模与能力涌现之间的关系提供了清晰的训练层面解释。论文大模型模型训练涌现能力5 个信源在谈事件专题推荐理由:做模型训练或理解 scaling law 的团队值得一读——这篇论文把大模型涌现能力的机制讲清楚了,不是玄学而是容量与干扰的数学问题。原文稍后读已读值得跟进有用关注 大模型
19:45官方账号Decoder@Matthias Bastian72°据报道,马斯克的 xAI 使用 Anthropic 的 Claude 模型输出来训练自己的编程模型,持续了数月。在 Anthropic 切断访问后,xAI 仍通过私人账户和 Blackbox AI 服务继续使用。与此同时,xAI 的预训练团队缩减至不到五人,多名负责人离职。马斯克购买的算力现在被租给 Anthropic 和 Google,而非用于自己的模型训练。这一事件揭示了 AI 行业在模型训练数据使用上的灰色地带和竞争紧张关系。行业xAIClaude模型训练10 个信源在谈事件专题推荐理由:这件事暴露了 AI 大模型训练中数据来源的灰色操作,做模型训练的团队和关注 AI 伦理的读者值得一看——它直接关系到训练数据的合规性和行业竞争规则。原文稍后读已读值得跟进有用关注 xAI