论文中美对照09:22LongStraw:固定GPU预算下超200万token的长上下文强化学习后训练LongStraw 能让你在固定 GPU 预算下做百万 token 级别的强化学习后训练,比现有 256K 的方法多处理 8 倍上下文,而且内存增长极低。#LongStraw#GRPO#Qwen#GLMaarXiv cs.LG@Changhai Zhou 等 20 人原文稍后读已读值得跟进有用关注 LongStraw