#推理
共 31 条 · 7 天 3 条 · 30 天 7 条
信息流里打上「推理」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月6日
10月4日
10月1日
9月25日
vLLM 团队亮相阿里云 Apsara Conference 2026,谈开源推理与 Agent 工作负载
vLLM 的人跑去阿里云大会分享推理经验,讲的是 Agent 时代开源推理怎么演进,做推理部署的可以看看
9月14日
LLM 优化面试笔记:KV Cache、投机解码、ZeRO 与 DualPipe,训练与推理的核心考点一次讲透(附多方学习资源)
这是 @gauri__gupta 为 AI 实验室技术面试准备的笔记,系统梳理了训练和推理中的关键优化技术,比如 KV Cache、ZeRO 和 DualPipe,对准备面试的人很有帮助。
9月13日
NVIDIA 官方 LLM 推理基准指标定义,把 LLM 推理的每个指标概念都搞清楚!
NVIDIA 官方出了一套 LLM 推理指标体系,把 prefill 和 decode 阶段的延迟、吞吐等概念讲得特别清楚,对选型或容量规划很有帮助。
7月30日
7月29日
7月24日
7月19日
行业15:40
摩尔线程在WAIC 2026公开训练推理成果,三大AI工厂释放算力摩尔线程这次一口气端出了训练、推理和算力工厂的硬核数据,2000PFLOPS真实落地产能,性能提升3.5倍,国产GPU玩家越来越能打了。
7月15日
7月14日
7月10日
SageMaker HyperPod 推理增强:数据捕获、Hugging Face、NVMe 和 Route 53
AWS 把 SageMaker HyperPod 的推理能力补全了,能抓数据做审计、直接从 Hugging Face 拉模型、用 NVMe 加速启动,还有自定义域名和细粒度权限,搞企业部署可以看看。
7月9日
Cognition RL训练跨越三大洲四数据中心 结合自有GPU与FireworksAI
Cognition分享了RL训练的新玩法:跨三大洲四数据中心混用自有GPU和FireworksAI,靠压缩权重差异同步,挺有意思。
7月1日
6月29日
6月26日
6月19日
用 SageMaker 详细指标和 CloudWatch Insights 监控生成式 AI 推理
AWS 教你用 CloudWatch 盯着 SageMaker 上的生成式 AI 推理,有详细指标和仪表盘,调性能抓问题都好使。
6月17日
6月16日
6月8日
论文09:28
人类视角视频理解综述:MLLM 的观看、记忆与推理做视频理解或 MLLM 研究的同学,这篇综述帮你把碎片化的方法统一到“观看-记忆-推理”框架下,省去自己梳理文献的时间,值得收藏作为 roadmap。
6月4日
OpenShell v0.0.55 发布:支持 Google Vertex AI 推理
OpenShell 新增 Vertex AI 支持,让多云 AI 智能体部署更灵活,做跨平台推理的团队可以直接用起来。
6月2日
5月24日
5月21日
英伟达 Vera Rubin 超级 AI 芯片下半年推出,黄仁勋称比 Blackwell 更成功
英伟达下一代 AI 芯片 Vera Rubin 将推动推理和训练性能飞跃,做 AI 基础设施的团队值得关注其交付节奏和生态支持。
IT之家原文
5月20日