00:01Clement Delangue@ClementDelangueBrian Armstrong在推文中分享了Coinbase控制AI成本的实践。他提到,通过将默认模型切换到开源模型如GLM 5.2和Kimi 2.7,91%的员工从未触及使用上限。通过改进缓存,LibreChat的缓存命中率从5%提升到60%。这些措施使AI支出减少近一半,同时token用量仍在增长。他还强调路由优化和精简上下文的重要性。技巧Hugging FaceGLM 5.2Kimi 2.7成本优化缓存推荐理由:Coinbase创始人Brian Armstrong分享了一套实际操作方案:用更便宜的默认模型、优化缓存和路由,能把AI成本砍半。开源模型GLM 5.2和Kimi 2.7是主角,缓存命中率从5%跳到60%。原文
12:17Harrison Chase@hwchase17Coinbase CEO Brian Armstrong在推文中介绍了公司通过更优默认设置、智能路由和缓存来控制AI支出增长。他们默认使用开源模型如GLM 5.2和Kimi 2.7,使91%员工未触发使用上限。缓存命中率在LibreChat中从5%提升至60%。这些措施使AI支出降低近一半,同时token使用量持续增长。技巧成本优化缓存CoinbaseGLM 5.2Kimi 2.7推荐理由:Coinbase用缓存和默认模型省了一半钱,还让token随便用,想省成本的团队可以照抄作业。原文
22:46LangChain@LangChainAI精选Jeff Barg在Interrupt会议上透露,Clay每月运行3.5亿个GTM智能体。他指出,缓存可将LLM调用成本降低高达70%。限制工具调用范围不仅能节省成本,还能提升输出质量。在多租户负载下,引入公平队列机制至关重要。技巧ClayGTM agentsLLM成本缓存工具调用推荐理由:做AI智能体上线的小伙伴必看,Clay的AI负责人亲自讲了怎么降本70%和优化队列,干货12分钟。原文
08:17Patrick Loeber@patloeber在Tech Europe举办的Applied AI大会上,Patrick Loeber与同事Lucia分享了如何规模化降低AI成本的策略,涵盖缓存、批量API和灵活层级等实用方法。演讲现场座无虚席,受到广泛关注。演讲者已将演示代码开源至GitHub,方便开发者直接参考使用。这些策略帮助团队在保持AI性能的同时显著降低调用成本,适合正在优化AI服务成本的工程团队。行业AI成本优化缓存批量API开源/仓库Tech Europe推荐理由:做AI应用开发的团队,缓存和批量API是降本最直接的手段,建议直接看GitHub上的demo代码,能省不少钱。原文
15:34orange.ai@oran_geDeepSeek V4 Pro模型在性能上并非最佳,但其缓存技术几乎免费,可大幅降低推理成本。Opus模型应用该技术后成本下降10倍。V4.1版本将使用真实harness数据训练,有望快速提升性能。AI模型大模型DeepSeek缓存成本优化推荐理由:缓存技术让成本降10倍原文