01:33lmarena.ai@lmarena_aiArena 发布视频探讨 Agentic AI 的成本计算逻辑。内容重点讲解了如何利用缓存机制来降低推理开销。演示中展示了具体的计费公式和成本核算步骤。技巧Arena智能体缓存推荐理由:想算清 Agentic AI 账单?看 Arena 怎么用缓存机制省钱。原文稍后读已读值得跟进有用关注 Arena
15:08shao__meng@shao__meng71°Claude Code 成本由模型、输入输出类型和提示词缓存决定,其中输出 token 价格约为输入的 5 倍,thinking token 占输出大头。缓存读取仅 0.1× 价格,但切换 /model、/effort 或开启 Fast mode 会击穿缓存,导致全价重新 prefill。会话中读过的文件和命令输出会在每轮重复计费,第 40 轮需重读前 39 轮,长会话成本超直觉。建议任务间用 /clear、@提及文件省去 Read 调用、给命令加静默参数,并在缓存 1 小时过期前用 /compact 压缩。技巧Claude CodeSubagent编程助手推荐理由:这篇把 Claude Code 的省钱门道讲透了:缓存怎么省、什么时候切模型便宜、哪些命令输出是隐形开销。适合天天用 Claude Code 写代码的人照着调。原文稍后读已读值得跟进有用关注 Claude Code
14:34shao__meng@shao__mengZCode 宣布用户数达到 100 万,为庆祝这一里程碑,所有 GLM Coding Plan 用户的使用限制已被重置。同时,ZCode 推出更新,提升真实工程工作流中的智能水平,实现 98% 的缓存命中率,使用量增加约 1.8 倍。用户可通过 zcode.z.ai 下载。AI产品ZCodeGLM Coding PlanZ.ai推荐理由:ZCode 用户破百万,还重置了 GLM Coding Plan 的使用限制,缓存命中率 98%,用起来更省更爽。原文稍后读已读值得跟进有用关注 ZCode
11:21官方一手arXiv: Anthropic@Maxim Khailo前沿大模型提供商(如Anthropic、OpenAI、Google、DeepSeek)缓存已处理的提示前缀,后续相同前缀请求仅需支付约10%输入价格并跳过大部分预填充延迟。然而智能体工作流因工具调用或等待常间隔数分钟,导致缓存被清除而需全额重新预填充。本文提出客户端保活机制,在空闲期间定时重放前缀以保持缓存热度,在Anthropic的5分钟TTL下最优为4分钟间隔,可将后续请求成本降低最多12.5倍。盈亏平衡分析显示,对于Anthropic,若空闲超过约46分钟则保活不再优于重新预填充。论文AnthropicOpenAIDeepSeek10 个信源在谈事件专题推荐理由:智能体程序调用API因中间等待导致缓存失效重复收费?这篇论文给出简单解法:每隔4分钟发个ping请求保持缓存,能省12倍成本,很实用。原文稍后读已读值得跟进有用关注 Anthropic
11:40AI Will@FinanceYF5精选71°Claude Managed Agents 新增子代理模式,支持向上升级为 Fable 5 担任顾问,或向下分派为 Sonnet 5 执行具体工作。每个子代理维持独立缓存,重复调用同一上下文时无需重新支付完整成本。该设计既提升灵活性,又降低长期使用开销。该系统已在 platform.claude.com 上线。AI产品Claude Managed AgentsFable 5Sonnet 59 个信源在谈事件专题推荐理由:Claude Managed Agents 现在能用Fable 5当参谋、Sonnet 5干活,每个子代理还自带缓存省钱,挺实用。原文稍后读已读值得跟进有用关注 Claude Managed Agents
00:01官方账号Clement Delangue@ClementDelangueBrian Armstrong在推文中分享了Coinbase控制AI成本的实践。他提到,通过将默认模型切换到开源模型如GLM 5.2和Kimi 2.7,91%的员工从未触及使用上限。通过改进缓存,LibreChat的缓存命中率从5%提升到60%。这些措施使AI支出减少近一半,同时token用量仍在增长。他还强调路由优化和精简上下文的重要性。技巧Hugging FaceGLM 5.2Kimi 2.7推荐理由:Coinbase创始人Brian Armstrong分享了一套实际操作方案:用更便宜的默认模型、优化缓存和路由,能把AI成本砍半。开源模型GLM 5.2和Kimi 2.7是主角,缓存命中率从5%跳到60%。原文稍后读已读值得跟进有用关注 Hugging Face
12:17Harrison Chase@hwchase17Coinbase CEO Brian Armstrong在推文中介绍了公司通过更优默认设置、智能路由和缓存来控制AI支出增长。他们默认使用开源模型如GLM 5.2和Kimi 2.7,使91%员工未触发使用上限。缓存命中率在LibreChat中从5%提升至60%。这些措施使AI支出降低近一半,同时token使用量持续增长。技巧成本优化缓存Coinbase推荐理由:Coinbase用缓存和默认模型省了一半钱,还让token随便用,想省成本的团队可以照抄作业。原文稍后读已读值得跟进有用关注 成本优化
22:46官方账号LangChain@LangChainAI精选Jeff Barg在Interrupt会议上透露,Clay每月运行3.5亿个GTM智能体。他指出,缓存可将LLM调用成本降低高达70%。限制工具调用范围不仅能节省成本,还能提升输出质量。在多租户负载下,引入公平队列机制至关重要。技巧ClayGTM agentsLLM成本推荐理由:做AI智能体上线的小伙伴必看,Clay的AI负责人亲自讲了怎么降本70%和优化队列,干货12分钟。原文稍后读已读值得跟进有用关注 Clay
08:17Patrick Loeber@patloeber在Tech Europe举办的Applied AI大会上,Patrick Loeber与同事Lucia分享了如何规模化降低AI成本的策略,涵盖缓存、批量API和灵活层级等实用方法。演讲现场座无虚席,受到广泛关注。演讲者已将演示代码开源至GitHub,方便开发者直接参考使用。这些策略帮助团队在保持AI性能的同时显著降低调用成本,适合正在优化AI服务成本的工程团队。行业AI成本优化缓存批量API推荐理由:做AI应用开发的团队,缓存和批量API是降本最直接的手段,建议直接看GitHub上的demo代码,能省不少钱。原文稍后读已读值得跟进有用关注 AI成本优化
15:34orange.ai@oran_geDeepSeek V4 Pro模型在性能上并非最佳,但其缓存技术几乎免费,可大幅降低推理成本。Opus模型应用该技术后成本下降10倍。V4.1版本将使用真实harness数据训练,有望快速提升性能。AI模型大模型DeepSeek缓存推荐理由:缓存技术让成本降10倍原文稍后读已读值得跟进有用关注 大模型