10:06官方账号arXiv cs.LG@Zeyun Zhong, Joya Chen, Manuel Martin, Frederik Diederichs, Juergen Gall, Juergen Beyerer精选测试时训练(TTT)通过推理过程中的连续权重更新实现长上下文处理,但现有方法难以平衡每token更新动态的表达性与分块近似硬件效率。我们提出E$^2$-TTT(表达性和高效TTT)以弥合这一差距。在标准分块近似梯度取自块起始权重的情况下,我们推导出封闭形式的态转换,精确地重现了每token递归的块末快速权重和动量状态。这使块级训练可以完全并行化,同时保留了先前块方法丢弃的更新规则的时间结构。通过从头训练高达1.3B参数的模型验证E$^2$-TTT。它在语言建模方面与先前TTT和混合注意力基线表现相当,但在上下文检索方面表现更优。其优势在长度外推方面最为明显:在标准的“针插麦堆”passkey测试中,它在8倍训练上下文长度下保留了超过90%的准确率。同时,E$^2$-TTT可以匹配高效分块方法的训练吞吐量,表明它有效地协调了表达性和效率。代码可在https://github.com/zeyun-zhong/E2-TTT获取。论文测试时训练表达性效率推荐理由:E$^2$-TTT模型在语言建模和上下文检索方面表现优异,且在长度外推方面具有明显优势,值得一看。原文稍后读已读值得跟进有用关注 测试时训练
07:40AI Engineer@aiDotEngineerNeo4j 的 Steve 在视频中解释了为什么基于图的上下文是智能体系统的下一个突破。传统 RAG 只能检索文档,而上下文图可以检索关系,为智能体提供更丰富的结构化信息。这种方法有望提升智能体在复杂任务中的推理和决策能力。视频展示了图数据库在 AI 系统中的实际应用价值。AI产品RAG图数据库智能体1 个信源在谈事件专题推荐理由:做智能体或 RAG 系统的开发者,图上下文能解决关系理解瓶颈,值得看看 Neo4j 的实战思路。原文稍后读已读值得跟进有用关注 RAG