产品多源确认

Atomic Chat 接入 NVIDIA TensorRT,本地推理比 llama.cpp 快 206%

精选理由

Atomic Chat 把 NVIDIA TensorRT 接进自家引擎,RTX 5090 上跑 Qwen 系列模型比 llama.cpp 快一倍多,本地部署党可以看看实测数据。

Atomic Chat 将 NVIDIA TensorRT 接入其本地推理引擎,在 Blackwell RTX 5090 上测试 Qwen3.5-4B 和 Qwen 3-8B。实测耗时 3.43 秒,对比 llama.cpp 的 10.49 秒,速度快 206%。测试通过 CUDA 运行,覆盖两款 Qwen 系列 4B/8B 级别模型。

原文 · @atomic_chat_hq

TensorRT 206% faster than llama.cpp ✳️

We wired @NVIDIAAI's TensorRT into Atomic Chat's engine and tested Qwen3.5-4B/Qwen 3-8B via CUDA on a Blackwell RTX 5090, measuring 3.43s vs 10.49s with llama.cpp

Run AI models locally -> https://t.co/RbcCOIgVkj https://t.co/j8kCqJYzSE