论文11:46TCPO:回合级信用分配策略优化TCPO把验证器分数拆成每一步的信用,让模型知道哪个回合真正有用,在数学、代码和Agent任务上都有效果。#TCPO#强化学习#多轮推理#AppWorldaarXiv: DeepSeek@Sicong Liao 等 3 人原文稍后读已读值得跟进有用关注 TCPO
论文09:18模型合并 vs 联合多任务强化学习:任务向量几何分析这篇论文用Qwen3-8B做了AppWorld上的合并vs联合训练对比,发现合并效果不输联合训练,而且解释了为什么不同合并方法结果差不多。#Qwen3-8B#AppWorld#TIES#RAM+aarXiv cs.AI@S. Aaron McClendon原文稍后读已读值得跟进有用关注 Qwen3-8B