8月13日
17:48
17:48官方账号NVIDIA AI@NVIDIAAI
CodeRabbit与Baseten合作,用CodeRabbit自身的路由决策数据微调了NVIDIA Nemotron 3.5 Lightning。整个微调过程耗时不到3小时,花费低于100美元。微调后的模型相比此前的GPT级模型,准确率提升约4%,推理成本下降约50%。详细技术解析已发布在CodeRabbit官方博客。
事件专题

推荐理由:CodeRabbit用不到100美元和三小时微调了NVIDIA新模型,比原来的GPT级模型准确率高4%,推理成本还省一半,想省钱的可以看看。
8月4日
11:54
11:54量子位@克雷西
精选
一家拥有亿级日活App的出海AI团队,因推理成本倒挂陷入算力压力。他们通过重构为跨云架构,将GPU集群规模砍掉75%。文章拆解了这套跨云方案的实施路径,以及如何应对出海场景下的“三重算力锁链”。
推荐理由:一家出海AI团队靠跨云架构把GPU集群砍掉75%,推理成本倒挂的解法都拆开了,做AI应用的真该看看。
7月31日
00:09
00:09官方一手AWS Machine Learning Blog@Melanie Li
75°
OpenAI GPT-5.6 的 Sol、Terra 和 Luna 三个模型已在 Amazon Bedrock 上正式可用。新推出的显式提示缓存功能允许用户精确指定缓存哪些部分。缓存复用可降低推理成本。AWS 提供了上手指南和迁移现有 GPT 工作负载的步骤。
事件专题

推荐理由:亚马逊Bedrock现在支持GPT-5.6,还能自己控制缓存哪些提示,省成本又灵活。
7月20日
7月19日
7月14日
03:24
03:24elvis@omarsar0
actAVAai推出Cura,一个1T参数的医疗智能体模型,采用递归自我改进(RSI)训练。该模型专为长临床和健康管理流程设计,推理成本比前沿模型低20-100倍,性能相当。企业可定制并拥有模型。试用可获得20美元信用额度。
推荐理由:1T参数的医疗模型,推理成本比前沿模型低20-100倍,性能却差不多,企业还能自己定制,医疗AI这波挺实在。
7月2日
05:48
05:48@koltregaskes@koltregaskes
精选79°
OpenAI近期通过纯软件优化将推理成本降低了约50%,工程师利用更好的批处理和KV-cache管理提升了GPU利用率。该优化已部署到ChatGPT的登录用户流量中,GPU需求降至仅数百块。部分人猜测这是通过量化实现,并可能关联到近期ChatGPT质量下降的投诉。
事件专题

推荐理由:OpenAI没换硬件,靠软件就把推理成本砍了一半。这对模型成本和用户体验可能都有影响,值得了解。
7月1日
6月30日