7月13日
11:12
11:12官方账号Together AI@togethercompute
Together Compute 在 AI Engineer World's Fair 上进行了2小时深度剖析,分享了如何构建推理引擎以服务智能体工作负载。这些引擎需要处理万亿token的生产规模。幻灯片详细展示了架构设计和优化策略。
推荐理由:想了解万亿token级别的推理引擎怎么搭建?Together Compute 把他们的实战经验做成幻灯片公开了。
7月10日
04:53
04:53官方账号vLLM@vllm_project
精选
vLLM项目与Inferact合作,在Ray Summit(8月24-26日于旧金山)举办首届vLLM Conference。会议将讨论vLLM路线图、如何最大化NVIDIA/AMD/TPU等加速器性能、将vLLM集成到训练与推理管线、以及生产级推理经验。演讲嘉宾来自Inferact、NVIDIA、AMD、Google TPU、Anyscale、PyTorch、Meta、Red Hat等。
事件专题

推荐理由:vLLM社区第一次线下大会,想了解高性能推理前沿和开源生态的朋友别错过,直接和NVIDIA、AMD、Google TPU的工程师面对面。
7月9日
02:44
02:44官方账号Clement Delangue@ClementDelangue
HuggingFace CEO Clement Delangue 表示开源模型推理在速度、质量和成本上还有巨大提升空间。ZML AI 公司由 Steeve 创立,其推理引擎已与 HuggingFace 作为存储层集成。该引擎旨在让开源模型的推理变得更高效、更便宜。

推荐理由:HuggingFace 和 ZML AI 搞了个新推理引擎,集成在 HuggingFace 上,专为开源模型提速降本,可以直接用。
6月29日
13:51
13:51官方账号Together AI@togethercompute
Together AI 工程师将在 AI Engineer World’s Fair 举办 hands-on workshop,讨论 Agentic Coding 如何改变推理引擎需求。workshop 将讲解推理引擎的工作原理及服务生产级 agentic workloads 的要点。活动时间为6月29日上午9-11点,地点在 Room 2020。

推荐理由:想了解 agentic coding 对推理引擎的新要求?Together AI 的这个实操 workshop 直接带你上手,时间是6月29日上午。
6月12日
12:08
12:08官方账号vLLM@vllm_project
精选
vLLM-Omni 项目在 GitHub 上达到 5000 星标,从去年 11 月社区启动至今,已发展为支持 30 多种多模态模型的高效推理引擎。它覆盖 Qwen3-Omni、HunyuanImage-3.0、Wan 2.2、BAGEL、MiMo-Audio 和 Flux2 等模型,并兼容 NVIDIA、AMD、华为昇腾、Intel 等多种硬件。该项目致力于提供可扩展、开源的多模态推理方案,吸引了大量社区贡献。
事件专题

推荐理由:多模态推理开发者终于有了一个统一的高效引擎——vLLM-Omni 支持 30+ 模型和多种硬件,做多模态应用或推理优化的团队可以直接拿来用,省去重复造轮子的时间。
5月29日