vLLM Semantic Router 发布 Decision 2.0
vLLM 的语义路由更新了,0.6B 到 27B 的开源模型一次前向就能判断 64 个请求属性,Apache-2.0 直接可用。
vLLM 的语义路由更新了,0.6B 到 27B 的开源模型一次前向就能判断 64 个请求属性,Apache-2.0 直接可用。
NVIDIA 开源了个说话人追踪模型,1秒语音就能分清谁在说话,还能让 Reachy Mini 机器人认人记名字,商用许可也友好。
Hugging Face 把 Transformers 模型直接跑进 vLLM,性能不输手写,以后搞推理不用重复造轮子了。
vLLM和Hugging Face搞了个大活:Transformers v0.25.0直接兼容vLLM,450多个模型自动加速,不用自己写适配代码了,开箱即用!
做文档智能或 RAG 的团队终于不用在 OCR 和 Transformer 之间搭桥了,PaddleOCR 3.5 直接跑在 Hugging Face 上,省掉一堆服务栈,建议做 Document AI 的开发者点开试试。
PaddleOCR 拥抱 Transformers 生态,做文档解析和 OCR 的团队可以更灵活地选模型,不用被框架绑死,值得升级试试。