技巧81°

Databricks 控制 AI 编程成本:开源模型迁移、动态路由等四招最高省 90%

国内外大厂在疯狂 tokenmaxxing、token 消耗排名的 AI 大跃进后,后来 token 账单暴涨,又纷纷限定 token 额度,甚至有讽刺的说法「高管发现还是人便宜」、「token 不能...

精选理由

Databricks 把自家压成本的套路公开了:换便宜模型、动态路由、限流、砍上下文,最高省 90%,还开源了工具。

AI 摘要

Databricks 根据自身实践和 Stripe、Coinbase、Uber 的经验,总结出四个降低 AI 编程成本的杠杆:迁移到开源/低成本模型、动态路由、渐进式摩擦和削减 Token 开销。实测中,任务级路由让成本下降 30% 以上,上下文压缩让 Token 量减少近 50%,组合策略最高可省 90%。Stripe 测试 Opus 4.7 后认为其性价比不足,拒绝上线。Databricks 将 Unity AI Gateway 和 Omnigent 以开源或免费形式放出。

原文 · shao__meng

国内外大厂在疯狂 tokenmaxxing、token 消耗排名的 AI 大跃进后,后来 token 账单暴涨,又纷纷限定 token 额度,甚至有讽刺的说法「高管发现还是人便宜」、「token 不能...

国内外大厂在疯狂 tokenmaxxing、token 消耗排名的 AI 大跃进后,后来 token 账单暴涨,又纷纷限定 token 额度,甚至有讽刺的说法「高管发现还是人便宜」、「token 不能欠费,但人能」😄 这些怪相都指向一个问题:AI Agent 能力强了,效率上去了,但一旦规模化推开,成本也上去了,甚至会改过效率的提升! @databricks 团队基于自身实践,以及与 Stripe、Coinbase、Uber、Ramp 等数字化原生企业基础设施负责人的交流,要解决这个“既要又要”的问题,实现"双重使命": · 广泛、低摩擦地向开发者开放 AI 工具; · 把人均总成本控制在相对固定的区间内。 核心概念:效率前沿 ≠ 智能前沿 通常所说的"前沿模型"指的是智能最高水平的模型——能解数学新题、发现新型安全漏洞的那种。前沿实验室的主攻方向也是推高智能上限。 但规模化部署时,真正重要的是另一条曲线——效率前沿:在给定智能水平上,价格最优的那组模型。 关键洞察在于:日常编程工作绝大多数不需要证明数学定理,只需要"够好"的模型。而效率前沿的推进速度远快于智能前沿——几乎每周都有新模型以更高的"智能/价格比"出现。因此,最大的成本杠杆不是谈判降价,是持续把用量迁移到效率更高的新模型上。 # DataBricks 提出的四大成本杠杆 杠杆 1:迁移到开源和低成本模型 收益最大的杠杆。效率前沿(同等智能下价格最优)几乎每周都在推进,但公开基准不可信,必须自建贴近内部场景的评测来验证新模型。反面案例同样重要:Stripe 测出 Opus 4.7 质平价升,拒绝上线。配套条件是 harness 与模型解耦——用元 harness(如 Omnigent)统一入口、底层自由切换,避免工具锁定模型。 杠杆 2:动态请求与任务路由 不让用户选模型,让系统选。三个层次:请求级(代理把每个请求发给"够用的最便宜模型",如 Smart Routing)、任务级(按任务复杂度整体派发,如 Omnigent)、升级/委派(便宜模型主导、难题升级,或贵模型主循环、杂活外包)。Databricks 实测:成本降 30%+,质量持平最贵模型。 杠杆 3:可见性、绊线与渐进式摩擦(而非硬预算) 硬预算几乎无人采用——断供伤害生产力,且高消费用户往往正是最高产的人。主流做法是阶梯式:实时花费可见(跨工具统一展示)→ 可自清除的花费闸门(防意外超支)→ 需审批的闸门 → 降档到便宜模型(不中断工作)→ 极限情况才暂停。 杠杆 4:削减 Token 开销 成本大头不是用户输入,而是代理自动收集的上下文。手段:更频繁压缩上下文、选用/调优"话少"的 harness、审计工具输出冗长度、拆小任务、调优提示缓存命中率。Databricks 实测:token 量降近 50%,质量无损。 # 收口:AI Gateway 设计模式 上面所有技术背后有共同的基础设施需求——集中管理"模型菜单"、跨工具的统一成本可观测性、上下文膨胀的观测与压缩、会话轨迹的日志记录。这些需求催生了一类新的基础设施软件:AI Gateway,它的职责包括: · 底层模型(专有 + 开源)的容量管理与访问代理; · 预算追踪与执行,包括渐进式摩擦、模型降档等复杂策略; · 终端工具的配置管理(模型白名单、压缩设置等); · 编程会话轨迹日志,用于下游效率分析和基准测试。 Databricks 自身重度依赖 Unity AI Gateway 承载这些能力,并已将其与 Omnigent 以开源或免费形式放出。 Omnigent - Github github.com/omnigent-ai/om… 1 Unity AI Gateway - Github github.com/databricks/uco… S Managing AI Coding Costs at Scale databricks.com/blog/managing-… e Patrick Wendell @pwendell Today @databricks we're publishing a detailed analysis of techniques we used to drastically reduce our internal AI spend while aggressively growing adoption. Savings come from layering in several techniques, which combine to drive unit costs down as much as 90% in some scenarios. Tl;dr, the wins come from: 1. Shifting defaults to more efficient models, including OSS models such as GLM. Maximum intelligence models simply aren't needed for many coding tasks, and "good enough" models are quickly becoming very cheap. We shift traffic between models using Unity AI Gateway. Approximate savings: 50% or more. 2. Using smart routing to automate model selection. Routing can further squeeze efficiency by dynamically selecting the model or harness that can most efficiently execute a particular task. Our task-level routing leverages @omnigent_ai . Approximate savings: 30%. 3. Providing user visibility and adaptive budgeting. Every user can see how much they spend, and users receive hints on how to contain spend. Heavy spenders encounter progressive friction as they ratchet spend above certain levels. Approximate savings: 10%. 4. Managing context bloat by pruning tool call results and tuning harness settings. Extraneous context costs $$ and delivers no value. Tuning cache settings also help lower average token costs. Approximate savings: 10%. 🔗 View Quoted Tweet 💬 0 🔄 0 ❤️ 0 👀 21 ⚡

Databricks 控制 AI 编程成本:开源模型迁移、动态路由等四招最高省 90% · AI 热点