论文10:40多步工具使用强化学习为何崩溃及监督信号如何修复这篇论文分析了多步工具RL训练容易崩溃的原因,并实验证明交错SFT与RL能有效提升稳定性,对做智能体RL的人很有参考价值。#LLM#强化学习#工具使用#SFTaarXiv cs.LG@Yupu Hao 等 5 人原文稍后读已读值得跟进有用关注 LLM