论文精选12:02LMSYS 发布 TITO 技术:确保 RL 训练中每个 token 都在策略上做 RL 训练或大模型推理的团队终于有了解决策略偏移的实用方案——TITO 让每个 token 都对齐,计算量还能省 10 倍,搞 Agent 训练的开发者值得点开看看。#强化学习#TITO#Miles#token 对齐官方账号LMSYS Org (SGLang)@lmsysorg原文稍后读已读值得跟进有用关注 强化学习