论文精选11:05Target-SFT:通过目标分布设计统一监督微调视角做LLM微调的团队终于有了一个更系统的设计框架——Target-SFT直接告诉你如何选择目标分布,而不是盲目拟合每个token。做推理模型优化的开发者建议试试,效果在多个数据集上都有提升。#监督微调#目标分布设计#Q-target框架#推理模型aarXiv cs.LG@Tong Xie 等 6 人原文稍后读已读值得跟进有用关注 监督微调