论文中美对照11:27InfoPPO:用信息密度替代token计数重参数化LLM强化学习训练LLM做推理的看这篇:InfoPPO把RL时间步从token数换成信息密度,Qwen3数学基准五项全升,比PPO稳。#InfoPPO#Qwen3#PPO#强化学习aarXiv cs.AI@Yongcheng Zeng 等 12 人原文稍后读已读值得跟进有用关注 InfoPPO