一篇做 Solidity 代码生成的训练方法论文,思路挺有意思:训练时检索、推理时不检索,再用语义扰动造 DPO 数据,Qwen2.5-Coder 等模型上验证有效。
#DPO
针对智能合约代码生成难保语义一致的问题,这篇论文用 RAFT 加 SAP 扰动构造的 DPO,在 SolidityBench 上让三个 7B 级模型都拿到了最好成绩,做合约生成的人可以看看方法细节。
训练偏好模型的老问题:DPO 训到后面梯度就没劲了。这篇把 sigmoid 因子当成可调信号来动态控制,三个基准上都比 DPO 强,搞对齐训练的可以看看实现思路。
朋友,Nathan Lambert 写了一本 RLHF 的系统专著,从指令微调讲到强化学习,还覆盖了 DPO、RLVR 这些具体方法,核心论点是数据比算法重要,书和代码都开源了。
做蛋白质结构预测的可以看看这篇,它对比了四种 oracle 预算分配方法,告诉你低预算用 O3,高预算用 FK-steering 和 DPO,挺实用。
Nathan Lambert 出书讲 RLHF,还配了 13 讲免费课和 PPT,零基础也能跟着学,想入门后训练可以看看。
想 Fine-tune MiniMax M3 的话,Fireworks 现在直接支持 LoRA 和 DPO,还能自定义 RL 训练,省事不少。
这篇论文用LLM智能体模拟政党结盟谈判,设计了MILT和CIS两个新指标来追踪条款来源和影响力,在比利时选举数据上验证了有效性,对政治学和AI研究都很有参考价值。
这篇论文用Qwen3-14B和DPO实验证明,离线训练越保守,在线适应越容易翻车,还在GSM8K上给出了最优保守度公式。做RLHF的值得一读。
想用最强开源编码模型但通用版不顺手?Fireworks 让你微调 GLM 5.2,SFT/DPO/RL 全包,训练完直接上线,不用折腾。
别光看用户点了什么赞,鼠标和眼睛动的方向才是真心话。这篇论文用59人的眼动和鼠标轨迹数据训练奖励模型,准确率从55%飙到64,还开源了数据集。
做健康/情感类推荐系统的团队终于有了一个可落地的离线优化方案——用世界模型模拟用户情感反馈,避免在线实验的伦理风险,做医疗或老年人应用的开发者可以直接参考其方法论。
做文本到图像生成的团队终于有了更稳定的对齐方法——Linear-DPO 统一了扩散和流匹配,解决了 DPO 在生成任务中的目标不匹配问题,做图像生成微调的建议试试。
该研究从图论视角重新审视偏好对齐,解决了DPO在多响应数据上的局限性,对提升模型训练效率和稳定性具有实际指导意义。