有意思的观察:GLM-5.3-Flash 已经有三人写了专属推理引擎,作者判断未来每个模型都会有自己的深度优化版本,做推理优化的可以关注这个方向。
#推理引擎
共 20 条 · 7 天 4 条 · 30 天 7 条
信息流里打上「推理引擎」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月10日
GLM-5.3-Flash 推理引擎已有人写出三个,作者称中推还没人动手
10月7日
10月4日
开发者自研推理引擎 tqllm,单卡 RTX 3090 跑 Qwen 27B 达每秒 273 token
一张 RTX 3090 把 27B 模型跑到每秒 273 token,作者自己写的引擎,速度直接把普通部署方案甩开了。
10月2日
9月18日
9月12日
8月31日
8月29日
7月13日
7月10日
首届vLLM大会将在Ray Summit举办,8月24-26日旧金山
vLLM社区第一次线下大会,想了解高性能推理前沿和开源生态的朋友别错过,直接和NVIDIA、AMD、Google TPU的工程师面对面。
7月9日
产品02:44
HuggingFace 与 ZML AI 集成推理引擎,降低开源模型推理成本HuggingFace 和 ZML AI 搞了个新推理引擎,集成在 HuggingFace 上,专为开源模型提速降本,可以直接用。
7月1日
6月29日
Together AI 将举办 Agentic Coding 推理引擎 Workshop
想了解 agentic coding 对推理引擎的新要求?Together AI 的这个实操 workshop 直接带你上手,时间是6月29日上午。
6月16日
vLLM v0.23.0 发布:408 次提交,DeepSeek-V4 支持增强
vLLM v0.23.0 大更新,DeepSeek-V4 和 Llama 用户值得升级,新的 KV 缓存卸载能省显存,推理与工具调用解析也更顺了。
6月13日
6月12日
vLLM-Omni 获 5K GitHub Stars,支持 30+ 多模态模型
多模态推理开发者终于有了一个统一的高效引擎——vLLM-Omni 支持 30+ 模型和多种硬件,做多模态应用或推理优化的团队可以直接拿来用,省去重复造轮子的时间。
5月29日
5月20日
Together AI 推理引擎:比 Claude Opus 成本低 76%
做多智能体编码或高并发推理的团队,终于有基准测试对准真实负载了——Together AI 的引擎在成本和速度上都有明显优势,值得跑一下自己的场景试试。