05:15官方账号NVIDIA AI@NVIDIAAINVIDIA AI 宣布,Harvey 与 Trajectory Labs 合作,基于 NVIDIA Nemotron 3 Super 模型进行后训练,专注于复杂法律任务。他们在 Harvey 的 Legal Agent Benchmark(LAB)上测试了 1200+ 端到端法律任务,覆盖 24 个业务领域。初始结果显示,后训练的 Nemotron 3 Super 在性能上可媲美闭源前沿模型。该项目强调开放权重、可审计性和数据主权,支持持续学习(continual learning),使法律智能体能够从反馈中不断改进。这标志着开放模型在专业领域应用的重要突破。AI模型NVIDIANemotron 3 Super法律 AI5 个信源在谈事件专题推荐理由:法律 AI 团队终于有了可审计、可定制的开放模型选择——Nemotron 3 Super 在复杂法律任务上追平闭源模型,做法律科技或合规自动化的开发者可以直接关注这个开源方案。原文稍后读已读值得跟进有用关注 NVIDIA
15:39官方一手pandaily@contact@pandaily.com (Pandaily)精选76°Sphere AI Lab 开源了 Orbit,一个强化学习后训练框架,支持在单个 8×B200 节点上对万亿参数模型(如 DeepSeek-V4)进行微调。该框架通过优化内存和计算效率,大幅降低了大规模模型训练的门槛,使得资源有限的团队也能进行高效的后训练。Orbit 的发布解决了万亿参数模型训练需要大规模集群的痛点,有望推动更多研究者和开发者参与大模型的后训练优化。AI模型开源/仓库强化学习后训练推荐理由:Orbit 让万亿参数模型的后训练不再依赖大规模集群,做 RL 微调或大模型优化的团队可以直接在单节点上跑 DeepSeek-V4,建议试试这个开源方案。原文稍后读已读值得跟进有用关注 开源/仓库
10:25Lenny Rachitsky@lennysan精选76°Trajectory 是一家研究实验室兼产品公司,宣布获得 1500 万美元融资,投资方包括 Conviction、Bessemer Venture Partners 等。该公司正在构建持续学习平台,能够从产品使用数据中提取信号,让企业持续后训练大规模智能体模型,使其性能超越前沿模型。Trajectory 已与 Clay、Harvey、Decagon 等 AI 原生公司合作,部分已进入生产阶段。团队汇聚了来自 DeepMind、OpenAI、Apple、Meta 等机构的顶尖研究人员。AI产品持续学习智能体后训练10 个信源在谈事件专题推荐理由:持续学习是智能体落地的关键瓶颈,Trajectory 用产品使用数据后训练模型,做 AI 智能体的团队值得关注其技术路线。原文稍后读已读值得跟进有用关注 持续学习
10:30官方账号arXiv cs.AI@Yi Jing, Zao Dai, Jinwu Hu, Zijun Yao, Lei Hou, Juanzi Li, Xiaozhi Wang精选论文提出SAERL框架,利用稀疏自编码器(SAE)提取模型内部信号,用于强化学习(RL)后训练的数据工程。SAERL建模了数据的多样性、难度和质量三个内在属性,分别实现批次多样性控制、易到难课程排序和数据过滤。在Qwen2.5-Math-1.5B上,SAERL相比原始GRPO平均准确率提升3%,训练步数减少20%,且在不同模型规模和RL算法上表现一致。实验表明SAE可跨模型族和规模迁移,是一种轻量可复用的数据工程工具。论文稀疏自编码器数据工程强化学习推荐理由:做LLM后训练数据工程的团队终于有了从模型内部获取信号的方法——SAERL用SAE直接指导数据排序和过滤,比依赖外部信号更高效,做RL训练优化的开发者值得一试。原文稍后读已读值得跟进有用关注 稀疏自编码器
12:38官方一手arXiv: DeepSeek@Andreas Opedal, Francesco Ignazio Re, Abulhair Saparov, Mrinmaya Sachan, Bernhard Schölkopf, Ryan Cotterell精选研究者将自然语言推理建模为搜索问题,利用 A* 搜索算法指导 LLM 生成正确且高效的推理步骤。通过监督微调(基于 A* 执行轨迹)和强化学习(结合 A* 过程奖励模型),Llama-3.2 1B-3B 模型从近乎零准确率提升至超越 DeepSeek-V3.2。研究发现,简单正确性奖励最大化准确率,而 A* 信号能平衡准确率与效率。在更大搜索空间下,基于不完美启发式的训练反而带来更优准确率。这项工作展示了经典搜索算法指导 LLM 推理的潜力。论文推理模型A* 搜索后训练推荐理由:A* 搜索让小模型推理能力大幅跃升,做推理优化或小模型部署的团队值得关注,可以直接参考其训练方法。原文稍后读已读值得跟进有用关注 推理模型
07:36Y Combinator@ycombinatorBioStack 是一家初创公司,其平台能将真实的临床数据(如病历、实验室检测、笔记和长期结果)转化为医疗 AI 的后训练循环,包括数据、评估、奖励和基准测试。该平台通过模拟环境让 AI 模型在真实临床数据上练习,从而提升其准确性和可靠性。这一创新解决了医疗 AI 训练中数据稀缺和模拟环境不真实的问题。BioStack 已获得 Y Combinator 支持,并正式发布。AI产品医疗 AI模拟环境临床数据推荐理由:医疗 AI 开发者终于有了一个能模拟真实临床数据流的训练环境——BioStack 把杂乱病历和长期结果变成可迭代的后训练循环,做医疗 AI 的团队可以直接用它来提升模型可靠性。原文稍后读已读值得跟进有用关注 医疗 AI
13:25官方账号Logan Kilpatrick@OfficialLoganK88°Google 的 Gemini 3.5 Flash 模型在 GDPval 基准测试中相比 3.1 Pro 取得了显著进步,性能已接近前沿水平。这表明后训练(post-training)技术仍在持续提升模型能力。该消息由开发者 Logan Kilpatrick 在 X 上分享,引发社区关注。Gemini 3.5 Flash 作为轻量级模型,其竞争力提升对开发者选择高效模型具有参考价值。AI模型Gemini 3.5 FlashGDPval后训练推荐理由:轻量模型逼近前沿,做推理或成本敏感应用的开发者值得关注——Flash 系列可能成为性价比新选择。原文稍后读已读值得跟进有用关注 Gemini 3.5 Flash
11:23官方账号arXiv cs.AI@Mark Obozov, Maxime Griot, Joseph Cummings, Evan Smothers, Felipe Mello, Rafi Ayub, Philip John Bontrager, Salman Mohammadi, Ariel Kwiatkowski, Nathan Azrak, Mircea Mironenco精选72°torchtune 是一个 PyTorch 原生的后训练库,旨在简化大语言模型(LLM)的微调、实验和部署流程。与 Axolotl、Unsloth 等框架相比,torchtune 强调模块化、可定制性和对底层 PyTorch 组件的直接访问,而非牺牲透明度和可扩展性。论文展示了其模型构建器、训练配方和分布式训练栈的设计,并在多种后训练场景中评估了性能。结果表明,torchtune 在保持强性能和内存效率的同时,足够灵活以支持快速研究迭代。该库为可复现的 LLM 后训练研究提供了实用基础。AI模型torchtunePyTorchLLM 微调推荐理由:做 LLM 微调的研究者或工程师,如果受够了黑盒框架的调试痛苦,torchtune 的模块化设计和 PyTorch 原生体验值得一试,能让你在保持性能的同时自由定制训练流程。原文稍后读已读值得跟进有用关注 torchtune
21:49向阳乔木@vista8本文用简洁的图示对比了三种主流大语言模型后训练技术:SFT(监督微调)让模型学会遵循指令;DPO(直接偏好优化)使输出更符合人类偏好;GRPO(群体相对策略优化)进一步激发模型的推理和思考能力。三者在训练目标和方法上层层递进,是当前LLM对齐和增强推理能力的关键技术路径。对于想了解模型训练流程或优化模型输出的开发者,这是一份直观的入门参考。AI模型LLM后训练SFT推荐理由:想搞懂LLM后训练技术栈的开发者,这张图帮你三分钟理清SFT、DPO、GRPO的关系和演进逻辑,建议收藏。原文稍后读已读值得跟进有用关注 LLM
19:12官方账号arXiv cs.AI@Yuanda Xu, Hejian Sang, Zhengze Zhou, Ran He, Zhipeng Wang, Alborz Geramifard精选75°该论文提出了一种新的语言模型后训练原则:将稀缺的标注验证数据优先用于最强模型(教师)进行稀疏奖励强化学习(如GRPO),然后通过稠密奖励蒸馏(如OPD)将行为迁移到小模型(学生)。实验表明,在固定学生模型大小(Qwen3-1.7B)下,先对8B教师进行RL再蒸馏,效果优于直接在学生上运行GRPO。该原则强调避免在未准备好的策略上使用稀缺数据,而是通过“稀疏奖励发现→稠密迁移→学生侧稀疏奖励”的流程优化资源分配。论文后训练强化学习知识蒸馏推荐理由:这篇论文为资源受限的团队提供了明确的训练策略——用最强模型做探索、用小模型做部署,做模型压缩或后训练的开发者可以直接参考这个稀疏到稠密的分配原则来提升效率。原文稍后读已读值得跟进有用关注 后训练