12:03官方账号arXiv cs.LG@Anusha Madan Gopal, Aras Pirbadian, Kristofor D. Carlson, M Anthony Lewis, Jonathan Tapson精选论文提出PRECOG,把语料库离线预编码为SSM隐藏状态,查询时将最优状态直接注入,省去RAG的上下文重新读取。在带192KB隐藏状态的1.2B参数TENNs-LLM上,PRECOG将prefill延迟从约27秒降到6毫秒以下,约4500倍加速,并保持与上下文RAG相当的答案质量。配套的SMC用认知域聚类构建层级持久记忆,支持保真度/存储调节和O(1)会话初始化。该机制依赖SSM固定长度、与位置无关的循环状态,Transformer的KV缓存因位置纠缠且随上下文线性增长而无法实现。论文PRECOGTENNs-LLMRAG推荐理由:论文把RAG预填充从27秒压到6毫秒,1.2B模型在边缘也能交互式检索,Transformer做不了。原文稍后读已读值得跟进有用关注 PRECOG