Runway 搞了个新工具 Media Router,能根据场景自动帮你选最合适的模型,省心又省 token。
#成本优化
阿里云晒出真实客户案例:EaseMate用他们AI服务,内容审核准到99.5%以上,还省了20%成本,做AI平台的人都该看看。
Google DeepMind 出了个更轻量的 Gemini 3.5 Flash-Lite,专门跑重复性任务,又快又便宜,适合批量处理场景。
Cursor 团队晒出的 swarm 实战:用 Opus 规划、Composer 执行,四小时从零写出能通过全套测试的 SQLite,成本只要一千刀出头。工程细节很硬核,值得看他们怎么解决多 agent 的协调问题。
Meta 发了 Muse Spark 1.1,代码生成得分1541,成本只要350万美元,比同类便宜不少,适合做前端开发的玩家。
Anthropic 教你两种搭配方案,用便宜好用的 Sonnet 5 分担大部分活,成本降到一半甚至更低,性能几乎不掉。
LlamaParse 现在会根据页面难度自动选解析方式,简单文档用 OCR 省成本,复杂表格才上 VLM,想省钱又不想降精度的话可以试试。
Matei Zaharia刚透露Databricks实测:用Pi harness成本省一半,效果和Opus、GPT一样好;GLM 5.2这个开源模型也追上来了。
想低成本跑DeepSeek?有第三方用SGLang和AMD MI300把API成本压到官方的五分之一,技术方案公开,值得参考。
想省Claude Code的token费?试试pxpipe,把提示藏进PNG,据说能省70%,不过会慢点。
Coinbase创始人Brian Armstrong分享了一套实际操作方案:用更便宜的默认模型、优化缓存和路由,能把AI成本砍半。开源模型GLM 5.2和Kimi 2.7是主角,缓存命中率从5%跳到60%。
Coinbase用GLM 5.2和Kimi 2.7替换了西方模型,成本砍半,缓存命中率翻了12倍。想知道为什么中国模型更便宜?
LangChain 新成员 Alex 手把手教你给 Deep Agents 加缓存,省下一半 API 钱,实用技巧别错过。
大厂AI账单太高了,UBS说60%的企业已经在换更便宜的模型,像DeepSeek、Qwen这些中国开源模型成了新选择。想省钱的企业可以看看这个趋势。
LangChain联合Qwen和FireworksAI出了个办法:从每条trace里低成本挖出关键信号,性能还不打折,适合做可观测性的团队看。
LlamaIndex 手把手教你用 traces 优化 Claude 的 PDF 解析,成本直降 37%,答案还更准了,值得一试。
频繁用Claude Code的开发者最怕触限额——这个分层策略用Fable 5做调度、Opus只干重活,算力省一半效果不变,建议直接抄作业。