买 GPU 只是冰山一角,CoreWeave 这场 45 分钟分享会掰开揉碎讲训练推理的真实开销和 TCO 怎么算,做成本测算的可以去听。
#推理成本
共 41 条 · 7 天 5 条 · 30 天 16 条
信息流里打上「推理成本」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月10日
CoreWeave 与 Signal65 举办线上活动,拆解 AI 基础设施隐性成本
10月8日
Theo 估算 Cursor 重度用户年 Token 成本仅约 300 万美元,明年或降至 1200 美元
Theo 拆解了那个流传很广的年烧 1.3 亿美元 Token 的说法,数据讲得挺细,做 AI 产品算成本前建议看看。
10月6日
10月4日
9月27日
9月26日
Goldman Sachs:AI 智能体 Token 消耗量到 2030 年预计增长 24 倍
智能体一次请求能吃掉普通对话几十倍的 Token,Uber 和 Microsoft 都开始算这笔账了,Goldman 给了具体数字。
9月25日
Epoch AI 数据:AI 成本每季度下降约 47%,快于历史上任何变革性技术
Epoch AI 给了组狠数字:同性能下 AI 成本每季降 47%,比当年电力便宜 54 倍的速度下滑,值得对比下自己行业的降本曲线。
9月24日
9月23日
Goldman: 中美 AI 竞争走向规模对效率
Goldman 拆了组数据:美国 2026 年 AI 资本开支约是中国 7 倍,但 DeepSeek V4.1 Flash 把 KV-cache 省了 437 倍,看效率派怎么打。
Growing Harness:把重复控制逻辑从模型上下文挪进代码
这篇论文教你让 harness 自己从失败里长出控制代码,省掉七到九成 LLM 调用,4B 小模型也能跑 WebArena,做 agent 工程的值得细看。
9月22日
9月20日
9月10日
9月7日
8月13日
CodeRabbit联合Baseten微调Nemotron 3.5 Lightning:3小时不到100美元,准确率提升4%
CodeRabbit用不到100美元和三小时微调了NVIDIA新模型,比原来的GPT级模型准确率高4%,推理成本还省一半,想省钱的可以看看。
8月4日
8月1日
7月31日
7月22日
7月20日
7月19日
7月15日
7月14日
7月8日
7月7日
7月3日
7月2日
7月1日
Anthropic 提出“compute multipliers”,OpenAI 发现可减半推理成本
Anthropic 内部保密的一种效率提升方法“compute multipliers”曝光,OpenAI 抢先实现推理成本减半,还自研了 Jalapeño 芯片,值得关注。
6月30日
6月13日
6月8日
行业23:49
OpenRouter 融资 1.13 亿美元,AI 推理成本暴跌趋势确认AI 推理成本断崖式下跌正在重塑行业格局,做 AI 应用或基础设施的团队值得关注——路由策略能直接省下 80% 成本,建议尽早布局。
6月3日
6月2日
5月28日