论文09:07
DTR 动态张量重计算被曝对内存预算极度敏感:0.10% 差异导致 7.3 倍开销一个 arXiv 预印本,用 DTR 官方模拟器实测发现显存预算只差 0.10%,训练开销能差 7.3 倍,还复现了奇怪的可逆 OOM 区间,做省显存训练的可以看看细节。
一个 arXiv 预印本,用 DTR 官方模拟器实测发现显存预算只差 0.10%,训练开销能差 7.3 倍,还复现了奇怪的可逆 OOM 区间,做省显存训练的可以看看细节。
长文本推理的显存瓶颈被 FlashMemory 大幅缓解,做 LLM 推理优化或部署长上下文模型的团队可以直接参考论文方法,效果甚至比原版更好。
长上下文训练一直是显存大户,Untied Ulysses 让单节点就能跑 3M token,做 LLM 训练和推理优化的团队值得关注,能省下不少 GPU 预算。