8月13日
18:14
18:14官方账号NVIDIA AI@NVIDIAAI
72°
NVIDIA Nemotron 3.5 Lightning 已在 Baseten 上线,定位为长时运行智能体设计。相比同类开源模型,其吞吐量提升 4 倍,成本降低 50%。在生产测试中,输出 token 数量减少 63.4%。该模型采用 30B MoE 架构,仅激活 3B 参数,支持 100 万 token 上下文。
事件专题

推荐理由:跑长时任务的智能体注意了,Nemotron 3.5 Lightning 上线 Baseten,吞吐翻 4 倍、成本砍半,输出还更精简。
17:48
17:48官方账号NVIDIA AI@NVIDIAAI
CodeRabbit与Baseten合作,用CodeRabbit自身的路由决策数据微调了NVIDIA Nemotron 3.5 Lightning。整个微调过程耗时不到3小时,花费低于100美元。微调后的模型相比此前的GPT级模型,准确率提升约4%,推理成本下降约50%。详细技术解析已发布在CodeRabbit官方博客。
事件专题

推荐理由:CodeRabbit用不到100美元和三小时微调了NVIDIA新模型,比原来的GPT级模型准确率高4%,推理成本还省一半,想省钱的可以看看。
7月17日
00:18
00:18Harrison Chase@hwchase17
精选
LangChain 发布新视频,演示如何通过 Baseten 运行 NVIDIA 的 Nemotron 3 Ultra 模型,该模型拥有 550B 参数,每秒可生成 300 token。视频展示了构建终端智能体、子智能体以及支持 MCP 协议的过程,所有追踪都通过 LangSmith 完成。这是一个实用的开源模型工作流教程。
事件专题

推荐理由:想看 550B 参数的 Nemotron 3 Ultra 怎么跑智能体?LangChain 出了教程,支持 MCP 和子智能体,速度 300 tok/s,值得动手试试。
00:07
00:07官方账号LangChain@LangChainAI
精选
该视频演示了如何通过 Baseten 结合 Deep Agents Code 部署 NVIDIA Nemotron 3 Ultra 模型。该模型拥有550B参数,推理速度可达每秒300 tokens。视频还展示了构建终端智能体,支持技能调用、子智能体及 MCP 协议。全程通过 LangSmith 进行追踪调试。
事件专题

推荐理由:想跑Nemotron 3 Ultra?这个视频手把手教你用Baseten部署,还演示了带MCP的终端智能体,挺实用的。
7月9日
07:40
07:40Notion@NotionHQ
Baseten每天处理数十亿次AI推理调用,因一名AE(Katz)成为全公司知识瓶颈而效率受阻。他们用Notion的Custom Agents构建了Katz的数字分身,将回答时间从平均30分钟降至20秒。该Agent全天候运行,让整个公司能即时获取答案,而Katz得以专注于只有他能完成的交易。
事件专题

推荐理由:Baseten用Notion的Custom Agents把员工Katz的脑子装进了数字分身,原本半小时的答疑现在20秒搞定,全员自取答案,Katz终于可以去干正事了。
6月17日
04:34
04:34Notion@NotionHQ
Notion 宣布在其平台上推出开放权重模型 GLM 5.2。该模型专门为长周期任务优化,通过 Baseten 提供服务。用户可直接在 Notion 中使用该模型,其权重公开可用于自定义部署。
事件专题

推荐理由:Notion 上多了个新模型 GLM 5.2,专搞长周期任务,通过 Baseten 提供服务,想试试开放权重模型的可以看看。