#持续学习
做模型持续训练的必看:不用贵的 on-policy 采样,靠 grafting 三步就能加新能力还不忘旧本事,比 SFT 和 OPSD 都强。
这篇论文给微调遗忘问题做了套几何理论,还造了个按单元的投影器,在 OPT-1.3b 上把 Adam-NSCL 的遗忘压到最多 4.3 倍更低,做持续学习的朋友可以看看。
Boltzbit 给出了智能体自我改进的第二条路:直接改权重而不是堆记忆,理论上算力省约 1000 倍,思路很值得琢磨。
朋友,NeoCognition 新出的 ApprenticeBench 很有意思,他们让 Fable 5.1 和 GPT-6 Astra 在真实工作中持续学习,结果比人类专家还强,而且系统自己部署,不用 FDEs。
Perplexity AI 招募了 Andrew Gordon Wilson,他将领导持续学习和合成数据等前沿研究,如果你对加入这个团队感兴趣,不妨联系他。
Trajectory 一键后训练 Nemotron 3.5 Lightning,测试冲到 8.3% 超 Opus 4.6,小模型按客户定制能落地。
想了解怎么让模型部署后还能继续学?Macaron-V1用LoRA组合和递归改进做到了,744B大模型加四个专家LoRA,还开源。
这篇论文给了一套测试方法,来验证 LLM 智能体到底会不会把经验变成可复用的技能,而不是光靠记住上下文。
如果你在用 LangSmith 做智能体,想测试 Engine 能不能自动改进,这个评估套件能帮你量化效果,值得一看。
这篇论文用Terminal-Bench 2.0测试三种Agent优化方法,发现只有RELAI-VCL能持续累积提升,终身平均76.4%远超其他。做智能体持续学习的人必看。
Skyfall AI搞了个叫Morpheus的模拟环境,永不重置,专门测LLM能不能持续学习,结果发现它们根本不行。