开发者自研推理引擎 tqllm,单卡 RTX 3090 跑 Qwen 27B 达每秒 273 token
一张 RTX 3090 把 27B 模型跑到每秒 273 token,作者自己写的引擎,速度直接把普通部署方案甩开了。
一张 RTX 3090 把 27B 模型跑到每秒 273 token,作者自己写的引擎,速度直接把普通部署方案甩开了。
PrismML 把 Qwen3.6-27B 压到 5.9GB,手机都能本地跑,还全开源,适合离线使用。
想用Unsloth量化模型上AWS?这篇教你四种部署方式,从直接跑EC2到托管SageMaker,还能用K8s跑,生产技巧也全。