floor·general

Floor

别名
首次出现
2026-05-22
最近出现
2026-07-28
累计提及
23
§ 01综述

Floor 是一种针对大语言模型(LLM)服务的分流策略,通过在网格搜索前引入“先思考后分流”的机制,显著降低推理延迟和计算成本。近期,DeepSeek 团队在 arXiv 上连续发布两篇论文(2607.05876v1 和 v2),系统阐述了 Floor-First 方法的原理与实验效果。

Floor 近期进展

  • [2607.05876v1] 网格搜索前的思考:面向LLM服务的Floor-First分流方法 (arXiv: DeepSeek)提出一种分层分流架构:先对请求进行轻量级“思考”(如问题复杂度评估),再根据结果动态选择适配的 LLM 模型,避免无差别网格搜索。实验显示,该方法在保持输出质量的前提下,可将系统吞吐量提升 40% 以上。(原文链接
  • [2607.05876v2] 网格搜索前先思考:LLM服务的Floor-First分诊方法 (arXiv: DeepSeek)进一步优化了分流决策模型,引入在线学习机制,使 Floor 策略能适应实时负载变化。新版本在多个基准测试中平均降低推理延迟 35%,特别在长尾请求场景下优势更明显。(原文链接
  • 当前焦点与观察点

    Floor 方法的关注点集中在两个方向:一是与现有 LLM 推理框架(如 vLLM、TGI)的集成难度,二是如何平衡“思考”阶段的计算开销与整体收益。此外,Thomas Wolf 提到的百智能体协作优化(2025 年 5 月推文)虽不直接讨论 Floor,但暗示了多智能体场景下类似预分流思路的潜力——通过智能协作代替盲目搜索。整体来看,Floor-First 为 LLM 服务效率优化提供了一个轻量级但有效的范式,未来可能成为生产系统的标配组件。

    § 02相关报道04 条在档
    1. 01
      时序图生成中分布漂移的观测校正不可能性
      arXiv cs.LG
    2. 02
      网格搜索前的思考:面向LLM服务的Floor-First分流方法
      arXiv: DeepSeek
    3. 03
      网格搜索前先思考:LLM服务的Floor-First分诊方法
      arXiv: DeepSeek
    4. 04
      百智能体协作优化Gemma 4推理速度5倍
      Thomas Wolf
    § 03邻近话题

    本页综述由 AITOP 基于公开报道整理。原报道版权归各自来源所有。

    /topic/Floor