17:48官方账号NVIDIA AI@NVIDIAAICodeRabbit与Baseten合作,用CodeRabbit自身的路由决策数据微调了NVIDIA Nemotron 3.5 Lightning。整个微调过程耗时不到3小时,花费低于100美元。微调后的模型相比此前的GPT级模型,准确率提升约4%,推理成本下降约50%。详细技术解析已发布在CodeRabbit官方博客。AI模型CodeRabbitNemotron 3.5 LightningBaseten10 个信源在谈事件专题推荐理由:CodeRabbit用不到100美元和三小时微调了NVIDIA新模型,比原来的GPT级模型准确率高4%,推理成本还省一半,想省钱的可以看看。原文稍后读已读值得跟进有用关注 CodeRabbit
11:54量子位@克雷西精选一家拥有亿级日活App的出海AI团队,因推理成本倒挂陷入算力压力。他们通过重构为跨云架构,将GPU集群规模砍掉75%。文章拆解了这套跨云方案的实施路径,以及如何应对出海场景下的“三重算力锁链”。技巧跨云架构推理成本GPU集群推荐理由:一家出海AI团队靠跨云架构把GPU集群砍掉75%,推理成本倒挂的解法都拆开了,做AI应用的真该看看。原文稍后读已读值得跟进有用关注 跨云架构
01:57a16z@a16z72°Decagon CEO Jesse Zhang 表示,企业开源模型采用率当前在下滑,开源推理占比正在走低,但这并非拒绝开源,而是采用扩散前的信号。企业启动新用例时会先用前沿模型,待流程跑通后,再迁移到更便宜、更快的开源模型。他透露 Decagon 自身 90% 的业务已运行在开源模型上。他还提到,客户支持需求永远超过供给,降低使用成本会带来更多购买。行业DecagonAI开源模型企业采用推荐理由:CEO说开源推理占比下降是好事:新用例先用前沿模型,成熟后换开源省钱。Decagon九成业务跑开源。原文稍后读已读值得跟进有用关注 DecagonAI
00:09官方一手AWS Machine Learning Blog@Melanie Li75°OpenAI GPT-5.6 的 Sol、Terra 和 Luna 三个模型已在 Amazon Bedrock 上正式可用。新推出的显式提示缓存功能允许用户精确指定缓存哪些部分。缓存复用可降低推理成本。AWS 提供了上手指南和迁移现有 GPT 工作负载的步骤。AI产品Amazon BedrockGPT-5.6OpenAI10 个信源在谈事件专题推荐理由:亚马逊Bedrock现在支持GPT-5.6,还能自己控制缓存哪些提示,省成本又灵活。原文稍后读已读值得跟进有用关注 Amazon Bedrock
17:41官方账号Together AI@togethercompute72°rox_ai构建了自主搜索代理,在生产环境运行超过6个月。该代理达到了91.3%的准确率,每次查询成本仅为1.03美分。Together AI为其提供了推理算力支持。这展示了强推理经济学带来的效率提升。AI产品rox_aiTogether AI搜索代理推荐理由:rox_ai用Together AI做的搜索代理,准确率91.3%,每次才1分钱,效率真高!原文稍后读已读值得跟进有用关注 rox_ai
14:54IT之家(博客/媒体)微软正内部测试月之暗面 Kimi K3 大模型,评估将 Copilot 部分推理请求从 OpenAI GPT-4 系列和 Anthropic Claude 系列迁移至 Kimi K3。微软估算若切换可每年减少约 6 亿美元云基础设施成本(约 40.66 亿元人民币)。Kimi K3 在代码生成、逻辑推理等任务中表现有竞争力,推理成本低于 GPT-4 和 Claude。最终决策取决于技术验证、用户体验和数据合规等多方面因素,预计两个月内完成初步验证。行业微软Kimi K3Copilot10 个信源在谈事件专题推荐理由:微软在偷偷试 Kimi K3,一旦切换每年能省40多亿,比用OpenAI便宜不少。原文稍后读已读值得跟进有用关注 微软
20:51@koltregaskes@koltregaskes74°Emad Mostaque声称美国供应商能以中国十分之一价格运行Kimi K3,但分析显示实际约2-5倍便宜。美国电力成本更高(9美分/千瓦时 vs 中国工业6美分/千瓦时),电力占推理成本约25%。Blackwell系统每瓦可用算力是华为Ascend集群两倍,Nvidia成熟工具链在开放权重后数周内可降低2-5倍成本。中国在数据中心建设和劳动力成本有优势,但硅效率主导前沿推理。行业Kimi K3NvidiaBlackwell10 个信源在谈事件专题推荐理由:别信10倍差价,实际2-5倍。美国硬件强但电费贵,看Blackwell vs 华为Ascend谁更划算。原文稍后读已读值得跟进有用关注 Kimi K3
13:10AI Will@FinanceYF578°Deedy指出,Kimi K3上线2天即成为OpenRouter第10大模型,每日处理约1400亿token。但由于基础设施承压,吞吐量从30tok/s降至13tok/s,端到端延迟增至72秒,首token延迟超20秒。部署K3最低需购买8块B300(成本约50万美元),推荐配置GB300 NVL72机架耗资约400万美元。Moonshot及多数美国推理提供商均面临算力瓶颈,Meta拥有约7GW算力但无明确模型规划,成为最大变数。算力需求增长超3个数量级,前沿智能性能按METR任务时间提升32倍,算力锁定者受益显著。行业Kimi K3MoonshotOpenRouter10 个信源在谈事件专题推荐理由:算力才是AI的硬通货。看看K3上线两天就崩了,部署成本百万美金起,未来谁有算力谁说了算。原文稍后读已读值得跟进有用关注 Kimi K3
09:51AI Will@FinanceYF5据 X 平台用户爆料,xAI 的 Grok 4.5 模型参数规模为 1.5 万亿,而 Kimi K3 参数达 2.8 万亿。但 Grok 4.5 每项任务的成本比 Kimi K3 低 3 倍。该推文称 xAI 已突破智能效率瓶颈,并展望 3 万亿参数版本的 Grok 性能更强。AI模型GrokKimi K3参数规模10 个信源在谈事件专题推荐理由:xAI 的 Grok 4.5 用不到一半的参数实现更低成本,对比 Kimi K3 的效率差异值得关注。原文稍后读已读值得跟进有用关注 Grok
07:40Fireworks AI@FireworksAI_HQFireworks 的 yuan_sihan 介绍了通过开源智能体使用前沿模型作为审查器(reviewer)的方法,在不支付前沿模型全程推理成本的情况下达到更高输出质量。Cognee 的 KovacVeljko 探讨了智能体记忆中的事实消歧与信息检索问题。Wordware 的 mat_pichler 展示了智能体协作文件系统,实现任务协调与持久化。该活动由 Workato 主办,聚焦生产级智能体系统的实用挑战。行业Fireworks智能体推理成本推荐理由:听听 Fireworks、Cognee、Wordware 怎么用低成本方法让智能体更靠谱,还有记忆和协作的实战方案。原文稍后读已读值得跟进有用关注 Fireworks
03:24elvis@omarsar0actAVAai推出Cura,一个1T参数的医疗智能体模型,采用递归自我改进(RSI)训练。该模型专为长临床和健康管理流程设计,推理成本比前沿模型低20-100倍,性能相当。企业可定制并拥有模型。试用可获得20美元信用额度。AI模型CuraactAVARSI推荐理由:1T参数的医疗模型,推理成本比前沿模型低20-100倍,性能却差不多,企业还能自己定制,医疗AI这波挺实在。原文稍后读已读值得跟进有用关注 Cura
01:54官方一手Berkeley BAIR Blog(博客/媒体)精选AI推理成本急剧下降:GPT-4级能力从2023年初每百万token约30美元降至目前低于1美元,部分供应商甚至低于0.10美元。每年推理价格下降9至900倍,中位数约50倍。低成本智能已能满足绝大多数知识工作,催生数据系统三大方向:为智能体设计数据系统、由智能体组成的数据系统、由智能体构建数据系统。行业智能体数据系统推理成本推荐理由:UC Berkeley教授深入分析AI成本暴跌后数据系统怎么变,三个方向很有启发。原文稍后读已读值得跟进有用关注 智能体
19:51官方账号Decoder@Maximilian Schreiner据CNBC报道,中国AI模型在美国公司中越来越受欢迎,因为其成本远低于OpenAI和Anthropic的系统。在OpenRouter平台上,中国模型的调用份额经常超过30%,且与西方模型的成本差距正在扩大。这反映出中国AI厂商在价格竞争力上的显著优势,可能影响全球AI服务定价格局。行业OpenRouter中国AI模型推理成本10 个信源在谈事件专题推荐理由:中国模型在OpenRouter上抢了近三分之一流量还便宜一大截,看看谁在降价抢客户原文稍后读已读值得跟进有用关注 OpenRouter
20:49@koltregaskes@koltregaskes作者研究后发现,在Together AI或Fireworks上对7-16B模型做LoRA微调,计算成本仅需£10-50,70B QLoRA也不超过£200。推理方面,托管端点按基模型费率收费约£0.20-0.90/百万token,自托管spot H100约£1-2.50/小时,但流量波动时容易超支。数据准备和GDPR合规仍需投入时间。整体门槛已大幅降低,适合企业用自有数据试点。技巧微调Together AIFireworks推荐理由:这位工程师给算了一笔账:微调7B模型只要几十英镑,而且托管推理按量付费,建议老板们别再犹豫了。原文稍后读已读值得跟进有用关注 微调
05:48@koltregaskes@koltregaskes精选79°OpenAI近期通过纯软件优化将推理成本降低了约50%,工程师利用更好的批处理和KV-cache管理提升了GPU利用率。该优化已部署到ChatGPT的登录用户流量中,GPU需求降至仅数百块。部分人猜测这是通过量化实现,并可能关联到近期ChatGPT质量下降的投诉。行业OpenAI推理成本KV-cache10 个信源在谈事件专题推荐理由:OpenAI没换硬件,靠软件就把推理成本砍了一半。这对模型成本和用户体验可能都有影响,值得了解。原文稍后读已读值得跟进有用关注 OpenAI
00:57The Rundown AI@therundownai精选76°Anthropic CEO Dario Amodei 将“compute multipliers”定义为AI领域高度保密的效率提升方法,并限制公司内部知情人数以防止泄露给竞争对手。The Information 报道,OpenAI 已发现一个可将其推理成本减半的 compute multiplier。同时,OpenAI 近期与 Broadcom 合作推出了自研 Jalapeño 芯片,旨在进一步提升推理效率并降低成本。行业AnthropicOpenAIcompute multipliers10 个信源在谈事件专题推荐理由:Anthropic 内部保密的一种效率提升方法“compute multipliers”曝光,OpenAI 抢先实现推理成本减半,还自研了 Jalapeño 芯片,值得关注。原文稍后读已读值得跟进有用关注 Anthropic
22:36IT之家(博客/媒体)OpenAI 工程师透露,通过一系列系统底层优化,AI 模型推理成本已降低超过50%。优化主要依靠提升现有服务器资源利用率,而非新增计算芯片。此举可减少英伟达芯片使用量,节省的成本可能用于降低API定价或提高用户使用限额。行业OpenAI推理成本系统优化10 个信源在谈事件专题推荐理由:OpenAI 不靠堆芯片,靠系统优化就把推理成本砍半,API 用户很快能享受降价或更高额度。原文稍后读已读值得跟进有用关注 OpenAI
00:19OpenRouter@OpenRouterAIOpenRouter 宣布本月为“成本削减月”,将每周至少推出一次重大功能更新,帮助用户降低推理成本。他们基于过去三年的数据发现,每次重大技术突破后,用户都会面临成本压力。首批策略包括多种优化方法,已在客户中广泛使用。这些措施旨在让开发者更经济地使用 AI 模型。AI产品推理成本OpenRouter成本优化推荐理由:OpenRouter 直接瞄准 AI 推理成本痛点,做模型调用的团队可以每周关注其新功能,能省下真金白银。原文稍后读已读值得跟进有用关注 推理成本
23:49Aadit Sheth@aaditshOpenRouter 完成 1.13 亿美元融资,其收入在三个月内翻倍以上,验证了 AI 推理成本快速下降的趋势。GPT-4 每百万 token 价格从三年前的 30 美元降至不到 1 美元,80/20 路由分流已成标准实践。Coinbase CEO Brian Armstrong 预测,12-18 个月内 80% 的 AI 工作负载将运行在便宜 99% 的模型上,仅 20% 需要最新高端模型。Coinbase 已通过路由策略将成本基本持平,而 token 使用量仍在指数增长。这暗示未来瓶颈将是能源和算力,而非模型本身。行业OpenRouter融资推理成本推荐理由:AI 推理成本断崖式下跌正在重塑行业格局,做 AI 应用或基础设施的团队值得关注——路由策略能直接省下 80% 成本,建议尽早布局。原文稍后读已读值得跟进有用关注 OpenRouter
20:09官方一手pandaily@contact@pandaily.com (Pandaily)Moffett AI 发文批评当前 AI 硬件行业“堆算力”的惯性思维,认为万亿参数模型并不总是需要同等规模的昂贵基础设施。他们提出,推理成本优化应聚焦于“匹配任务需求”,避免过度配置。文章以“别用大炮打蚊子”比喻,强调针对不同场景选择合适算力,而非一味追求高端 GPU。这一观点挑战了 NVIDIA 主导的高性能硬件路线,为中小企业和边缘计算场景提供了更经济的 AI 部署思路。行业推理成本硬件优化Moffett AI7 个信源在谈事件专题推荐理由:Moffett AI 戳破了“算力越大越好”的行业泡沫,做 AI 部署和成本控制的团队看完会重新审视自己的硬件采购清单,值得点开反思。原文稍后读已读值得跟进有用关注 推理成本
10:32AI Will@FinanceYF5本周7篇顶级论文集中攻克AI Agent的三大核心问题:prompt设计依赖猜测、推理成本高昂、上下文无限膨胀。每篇论文都提供了可落地的工程启示,旨在降低AI Agent的部署和运行成本。这些研究有望推动AI Agent从实验走向实际应用,尤其对开发者和研究者具有重要参考价值。论文AI Agent论文周报prompt优化推荐理由:做AI Agent开发的团队终于有了解决prompt猜测和推理烧钱的工程方案,7篇论文直击痛点,值得逐篇拆解。原文稍后读已读值得跟进有用关注 AI Agent
06:14rohanpaul_ai@rohanpaul_aiThe Grid 是一个智能推理路由层,它根据任务复杂度自动选择最合适的模型,并按实时市场价格计费,而非固定费率。用户只需定义任务等级(标准、高级、最大),The Grid 会在多个供应商中动态选择最便宜的可用模型。这避免了为简单任务支付高端模型费用,也摆脱了对单一供应商的依赖。新用户可免费使用前 2 亿 token。作者演示了如何将 Hermes Agent 与 The Grid 集成,在本地运行代理但通过 The Grid 调用 AI。AI产品推理成本模型路由供应商管理推荐理由:做 AI 应用开发的团队,如果还在为推理成本头疼,The Grid 的思路值得一试——它用市场机制替代了固定定价,简单任务不再花冤枉钱。原文稍后读已读值得跟进有用关注 推理成本
16:11AI Will@FinanceYF5DeepSeek 宣布将 V4-Pro 模型的 API 价格永久下调 75%,降至原价的 25%。此举被认为与中国 AI 基础设施从受限的 NVIDIA GPU 转向华为昇腾 950 芯片有关,供应链改善推动了推理成本下降。路透社报道指出,虽然 DeepSeek 未明确确认昇腾 950 供应增加是降价主因,但时间点暗示了中国 AI 成本曲线正在持续下移。这一变化意味着中国 AI 模型在价格竞争力上进一步逼近甚至超越国际对手。AI产品DeepSeekV4-Pro华为昇腾推荐理由:DeepSeek 把 V4-Pro 价格砍到原价四分之一,做 API 调用的开发者和企业可以直接省下大笔推理成本,建议关注华为昇腾生态的性价比变化。原文稍后读已读值得跟进有用关注 DeepSeek