09:29官方账号arXiv cs.AI@Utopia Meng, Unicornt Zhao, Derek Li, Goalen Gao, Frank DuTalaria是一个会话感知的无服务器多模型推理系统,针对工具使用代理的会话连续性优化。在单台TP=8服务器上,用30个SWE-Bench会话(960次调用)测试三个超百亿参数模型。相比轮询调度器(无会话预填充、主机KV恢复和D2D分段),p50会话完成时间从1000秒降至189秒(加速5.3倍),p95从2296秒降至867秒(加速2.6倍)。论文TalariaSWE-BenchLLM推荐理由:这篇论文的Talaria系统把工具代理场景下百亿参数模型的p50延迟从1000秒降到189秒,挺实用的加速方案。原文稍后读已读值得跟进有用关注 Talaria