№floor·general
Floor
别名
- 首次出现
- 2026-05-22
- 最近出现
- 2026-07-28
- 累计提及
- 23
§ 01综述
Floor 是一种针对大语言模型(LLM)服务的分流策略,通过在网格搜索前引入“先思考后分流”的机制,显著降低推理延迟和计算成本。近期,DeepSeek 团队在 arXiv 上连续发布两篇论文(2607.05876v1 和 v2),系统阐述了 Floor-First 方法的原理与实验效果。
Floor 近期进展
[2607.05876v1] 网格搜索前的思考:面向LLM服务的Floor-First分流方法 (arXiv: DeepSeek)提出一种分层分流架构:先对请求进行轻量级“思考”(如问题复杂度评估),再根据结果动态选择适配的 LLM 模型,避免无差别网格搜索。实验显示,该方法在保持输出质量的前提下,可将系统吞吐量提升 40% 以上。(原文链接)
[2607.05876v2] 网格搜索前先思考:LLM服务的Floor-First分诊方法 (arXiv: DeepSeek)进一步优化了分流决策模型,引入在线学习机制,使 Floor 策略能适应实时负载变化。新版本在多个基准测试中平均降低推理延迟 35%,特别在长尾请求场景下优势更明显。(原文链接)
当前焦点与观察点
Floor 方法的关注点集中在两个方向:一是与现有 LLM 推理框架(如 vLLM、TGI)的集成难度,二是如何平衡“思考”阶段的计算开销与整体收益。此外,Thomas Wolf 提到的百智能体协作优化(2025 年 5 月推文)虽不直接讨论 Floor,但暗示了多智能体场景下类似预分流思路的潜力——通过智能协作代替盲目搜索。整体来看,Floor-First 为 LLM 服务效率优化提供了一个轻量级但有效的范式,未来可能成为生产系统的标配组件。