02:15官方一手AWS Machine Learning Blog@Venu Kanamatareddy精选NVIDIA Nemotron 3.5 Lightning 已可在 Amazon SageMaker JumpStart 中部署。这是一款面向高并发智能体工作负载的开源模型,采用 30B 参数的 MoE 架构,其中活跃参数为 3B。该模型可提供最高 4 倍的吞吐量提升,以及最高 30% 更快的任务完成速度。开发者可通过 SageMaker JumpStart 一键启动部署。AI模型Nemotron 3.5 LightningNVIDIASageMaker JumpStart5 个信源在谈事件专题推荐理由:英伟达的新开源模型,30B MoE 但只跑 3B 活跃参数,放在 SageMaker 上直接部署,专为智能体高频调用设计,吞吐量翻 4 倍,适合跑大批量任务的人。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning
01:55官方一手AWS Machine Learning Blog@Andy Peng精选本文介绍如何利用Amazon SageMaker AI中的P-EAGLE方法并行化推测解码,加速生成式AI推理。用户可从SageMaker JumpStart目录中选择兼容模型,并配置并行草稿生成参数。通过部署优化的实时SageMaker AI端点,可显著降低推理延迟。P-EAGLE基于EAGLE框架,支持多头并行推测,适用于Llama等主流模型。技巧P-EAGLEAmazon SageMaker AISageMaker JumpStart推荐理由:AWS教你用P-EAGLE在SageMaker上把推理加速好几倍,选模型调参数就能部署,简单实用。原文稍后读已读值得跟进有用关注 P-EAGLE