Rohan Paul 转的 SemiAnalysis 估算:Anthropic 订阅用户每美元算力是 API 用户的 4 倍多,订阅按 50% 算力利润率补贴,整体混合利润率 88%。
#推理成本
共 45 条 · 7 天 8 条 · 30 天 20 条
信息流里打上「推理成本」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月11日
Anthropic 订阅用户每美元算力或为 API 用户 4 倍
10月10日
CoreWeave 与 Signal65 举办线上活动,拆解 AI 基础设施隐性成本
买 GPU 只是冰山一角,CoreWeave 这场 45 分钟分享会掰开揉碎讲训练推理的真实开销和 TCO 怎么算,做成本测算的可以去听。
10月8日
Theo 估算 Cursor 重度用户年 Token 成本仅约 300 万美元,明年或降至 1200 美元
Theo 拆解了那个流传很广的年烧 1.3 亿美元 Token 的说法,数据讲得挺细,做 AI 产品算成本前建议看看。
10月6日
10月4日
9月27日
9月26日
Goldman Sachs:AI 智能体 Token 消耗量到 2030 年预计增长 24 倍
智能体一次请求能吃掉普通对话几十倍的 Token,Uber 和 Microsoft 都开始算这笔账了,Goldman 给了具体数字。
9月25日
Epoch AI 数据:AI 成本每季度下降约 47%,快于历史上任何变革性技术
Epoch AI 给了组狠数字:同性能下 AI 成本每季降 47%,比当年电力便宜 54 倍的速度下滑,值得对比下自己行业的降本曲线。
9月24日
9月23日
Goldman: 中美 AI 竞争走向规模对效率
Goldman 拆了组数据:美国 2026 年 AI 资本开支约是中国 7 倍,但 DeepSeek V4.1 Flash 把 KV-cache 省了 437 倍,看效率派怎么打。
Growing Harness:把重复控制逻辑从模型上下文挪进代码
这篇论文教你让 harness 自己从失败里长出控制代码,省掉七到九成 LLM 调用,4B 小模型也能跑 WebArena,做 agent 工程的值得细看。
9月22日
9月20日
9月10日
9月7日
8月13日
CodeRabbit联合Baseten微调Nemotron 3.5 Lightning:3小时不到100美元,准确率提升4%
CodeRabbit用不到100美元和三小时微调了NVIDIA新模型,比原来的GPT级模型准确率高4%,推理成本还省一半,想省钱的可以看看。
8月4日
8月1日
7月31日
7月22日
7月20日
7月19日
7月15日
7月14日
7月8日
7月7日
7月3日
7月2日
7月1日
Anthropic 提出“compute multipliers”,OpenAI 发现可减半推理成本
Anthropic 内部保密的一种效率提升方法“compute multipliers”曝光,OpenAI 抢先实现推理成本减半,还自研了 Jalapeño 芯片,值得关注。
6月30日
6月13日
6月8日
行业23:49
OpenRouter 融资 1.13 亿美元,AI 推理成本暴跌趋势确认AI 推理成本断崖式下跌正在重塑行业格局,做 AI 应用或基础设施的团队值得关注——路由策略能直接省下 80% 成本,建议尽早布局。