训练终端智能体的朋友看这篇:监督窗口选 12K 反而比 16K 好,还能省 30% 训练时间,作者给的选择性精调方法直接可用。
#模型训练
共 63 条 · 7 天 1 条 · 30 天 9 条
信息流里打上「模型训练」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月6日
研究提出 selective long-horizon refinement,提升终端智能体训练效率与可靠性
10月2日
10月1日
Fulcrum 使用 Fireworks API 训练 Echo 模型
Fulcrum 用 Fireworks API 和 Kimi K3 训练 Echo,成本仅 4500 美元,还分享了角色训练技巧。
9月28日
9月25日
9月22日
9月20日
9月15日
RLHF 首部系统专著:沿“指令微调 → 奖励模型 → 强化学习”主线,覆盖 DPO、RLVR、合成数据、过度优化与模型性格塑造
朋友,Nathan Lambert 写了一本 RLHF 的系统专著,从指令微调讲到强化学习,还覆盖了 DPO、RLVR 这些具体方法,核心论点是数据比算法重要,书和代码都开源了。
9月10日
9月8日
8月31日
8月30日
8月28日
8月26日
8月25日
8月24日
8月22日
8月21日
模型11:05
Daedalus-150M:专为CPU推理设计的卷积-注意力混合模型Daedalus-150M模型在CPU上实现了高效推理,与同类全注意力模型相比,在速度上具有显著优势,同时保持了相似的质量指标,值得一试。
论文10:42
Inject, Align, Recover: Staged Post-Training for Retrieval-Free Document Knowledge InternalizationIAR框架在文档知识内化方面表现卓越,值得研究学习。
8月20日
8月19日
8月17日
8月15日
8月11日
8月9日
8月7日
8月6日
8月5日
8月4日
7月22日
7月21日
7月19日
7月14日