10:09官方账号arXiv cs.LG@Vladimir Bataev, Lilit Grigoryan, Andrei Andrusenko, Nikolay Karpov, Vitaly Lavrukhin, Boris GinsburgTurboBias 2.0是一个针对生产级自动语音识别系统的框架,通过流式推理和批处理解码,实现个性化上下文偏置,提高识别准确率,同时保持低延迟和高吞吐量。AI模型TurboBias 2.0ASR系统上下文偏置推荐理由:想了解如何提升ASR系统准确率的同时保持高效?试试TurboBias 2.0,它为多用户个性化上下文偏置提供了新方案。原文稍后读已读值得跟进有用关注 TurboBias 2.0
08:22官方账号Simon Willison’s Weblog(博客/媒体)精选llm-gemini 0.32a0 版本发布,与 llm>=0.32a0 alpha 兼容。新版本增加了流式传输推理令牌的能力,让用户能实时看到模型的思考过程。这对于需要理解模型推理逻辑的开发者来说是一个重要更新。该版本主要面向使用 Gemini 模型的 LLM 命令行工具用户。AI产品GeminiLLM流式推理推荐理由:流式推理令牌让开发者能实时观察模型思考过程,做 AI 调试或教学演示的团队可以直接升级体验。原文稍后读已读值得跟进有用关注 Gemini
13:26官方账号arXiv cs.LG@Victor Norgren精选70°传统 Transformer 推理引擎在流式工作负载中,每次查询都需要 O(n) 的预填充成本,随着上下文增长成本急剧上升。本文提出基于状态会话的数据驱动计算模型,通过持久化 KV 缓存增量更新,将预填充移出关键路径,使查询延迟降至 O(|q|),与累积上下文大小无关。Flash Queries 机制利用数据到达间的空闲 GPU 周期预评估注册问题并缓存答案,这在无状态引擎中无法实现。多租户连续批处理调度器支持数十个状态会话在单 GPU 上共存,同时保持完整二次自注意力。在流式市场数据基准测试中,参考实现相比 vLLM、SGLang、TensorRT-LLM、llama.cpp 等传统引擎实现最高 5.9 倍加速,且查询延迟不随上下文增长而增加。论文推理优化流式推理KV缓存推荐理由:流式推理场景(如实时数据监控、金融交易、对话系统)的开发者终于有了降低延迟的可行方案——把预填充移出关键路径,查询延迟与上下文大小解耦。做高吞吐低延迟推理服务的团队值得关注这个新范式。原文稍后读已读值得跟进有用关注 推理优化