主要来源arXiv: OpenAI
查看原文事件专题 ·官方一手
谁为 KV Cache 买单?unalloc 拆解共享推理成本归属
论文提出开源工具 unalloc,把 OpenCost、LiteLLM 以及 OpenAI、Anthropic 的成本数据合并成一本精确台账,并标出无人认领的支出占比。在构造的多 pod 部署场景中,只给 LeaderWorkerSet 的 leader pod 打 owner 标签会让该部署 66% 的 GPU 账单无主,默认回退键则把 61% 的支出归到一个 Helm chart 名下,未分配比例表面降至 4%。数据源口径同样有坑:同时开启所有来源会把网关支出全部重复计算,只读一页账单 API 只能看到约四分之一的支出。在 NVIDIA H100 上跑 vLLM 时,按 token 计量比按时间份额计量让检索密集型租户多摊 12-14 个百分点的账单,而各负载下 GPU 利用率读数都停在 97-99%。论文还把这组结果与近期的 Shapley 能耗归因研究做了对照。
当前结论
unalloc 把 Kubernetes 和 LLM API 账单拼成一本账,还量化出按 token 和按时间计费能差 12 个点。
11 个信源36° AI 热度最后更新 2026/9/21 17:57:40
证据链
11 个信源冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。