论文精选12:32DeepSeekV4 上下文内存压缩至1/10,FlashMemory 显存占用仅1.3GB长文本推理的显存瓶颈被 FlashMemory 大幅缓解,做 LLM 推理优化或部署长上下文模型的团队可以直接参考论文方法,效果甚至比原版更好。#FlashMemory#DeepSeekV4#显存优化#长上下文karminski-牙医 (AI工具)@karminski3原文稍后读已读值得跟进有用关注 FlashMemory+2