AITP
精选全部 AI 动态AI 日报Agent 接入关于更新日志信源提报反馈
登录 / 注册
AITOP
全部 AI 动态
AI 相关资讯全量信息流
全部博客资讯推文论文
全部模型产品行业论文技巧
标签:缓存×
6月29日
00:01
00:01Clement Delangue@ClementDelangue
Brian Armstrong在推文中分享了Coinbase控制AI成本的实践。他提到,通过将默认模型切换到开源模型如GLM 5.2和Kimi 2.7,91%的员工从未触及使用上限。通过改进缓存,LibreChat的缓存命中率从5%提升到60%。这些措施使AI支出减少近一半,同时token用量仍在增长。他还强调路由优化和精简上下文的重要性。
技巧Hugging FaceGLM 5.2Kimi 2.7成本优化缓存

推荐理由:Coinbase创始人Brian Armstrong分享了一套实际操作方案:用更便宜的默认模型、优化缓存和路由,能把AI成本砍半。开源模型GLM 5.2和Kimi 2.7是主角,缓存命中率从5%跳到60%。
原文
6月27日
12:17
12:17Harrison Chase@hwchase17
Coinbase CEO Brian Armstrong在推文中介绍了公司通过更优默认设置、智能路由和缓存来控制AI支出增长。他们默认使用开源模型如GLM 5.2和Kimi 2.7,使91%员工未触发使用上限。缓存命中率在LibreChat中从5%提升至60%。这些措施使AI支出降低近一半,同时token使用量持续增长。
技巧成本优化缓存CoinbaseGLM 5.2Kimi 2.7

推荐理由:Coinbase用缓存和默认模型省了一半钱,还让token随便用,想省成本的团队可以照抄作业。
原文
6月24日
22:46
22:46LangChain@LangChainAI
精选
Jeff Barg在Interrupt会议上透露,Clay每月运行3.5亿个GTM智能体。他指出,缓存可将LLM调用成本降低高达70%。限制工具调用范围不仅能节省成本,还能提升输出质量。在多租户负载下,引入公平队列机制至关重要。
技巧ClayGTM agentsLLM成本缓存工具调用

推荐理由:做AI智能体上线的小伙伴必看,Clay的AI负责人亲自讲了怎么降本70%和优化队列,干货12分钟。
原文
6月16日
20:46
AITOP6月16日 20:46
600亿美元买下Cursor,xAI终于拿到了编程工具,但真正值得跟踪的或许不是AI600亿美元买下Cursor,xAI终于拿到了编程工具,但真正值得跟踪的或许不是AI
6月12日
12:57
AITOP6月12日 12:57
Claude代码里藏了个20260612,18个月后的AI记忆革命已经开始倒计时
6月11日
15:28
AITOP6月11日 15:28
1107 vs 303:谷歌悄悄开源了一个“拆打字机”的模型,把大模型速度翻了4倍
15:23
AITOP6月11日 15:23
DiffusionGemma颠覆文本生成?自回归模型的“统治”要结束了
15:07
AITOP6月11日 15:07
每秒1107个token,Google开源的扩散模型为什么能改变本地推理格局?
5月29日
08:17
08:17Patrick Loeber@patloeber
在Tech Europe举办的Applied AI大会上,Patrick Loeber与同事Lucia分享了如何规模化降低AI成本的策略,涵盖缓存、批量API和灵活层级等实用方法。演讲现场座无虚席,受到广泛关注。演讲者已将演示代码开源至GitHub,方便开发者直接参考使用。这些策略帮助团队在保持AI性能的同时显著降低调用成本,适合正在优化AI服务成本的工程团队。
行业AI成本优化缓存批量API开源/仓库Tech Europe

推荐理由:做AI应用开发的团队,缓存和批量API是降本最直接的手段,建议直接看GitHub上的demo代码,能省不少钱。
原文
5月24日
15:34
15:34orange.ai@oran_ge
DeepSeek V4 Pro模型在性能上并非最佳,但其缓存技术几乎免费,可大幅降低推理成本。Opus模型应用该技术后成本下降10倍。V4.1版本将使用真实harness数据训练,有望快速提升性能。
AI模型大模型DeepSeek缓存成本优化

推荐理由:缓存技术让成本降10倍
原文
精选全部日报登录