PrismML 发布 Bonsai 2 27B,以 1/9 内存占用实现 Qwen3.8 98.2% 性能
PrismML 再出手:Bonsai 2 27B 以 1/9 内存占用保留 Qwen3.8 27B 98.2% 性能
PrismML 新出的 Bonsai 2 27B 模型,内存占用只有 Qwen3.8 的 1/9,性能还比 Qwen3.6 更好,适合本地部署做编程智能体。
PrismML 推出 Bonsai 2 27B 模型,将基础模型升级至 Qwen3.8 27B。该模型以不到 1/9 的内存占用在综合基准测试中达到 98.2% 的分数。它支持 262K 上下文窗口,在 RTX 5090 上拥有 143TPS 的词元吞吐量。
PrismML 再出手:Bonsai 2 27B 以 1/9 内存占用保留 Qwen3.8 27B 98.2% 性能
IT之家 9 月 18 日消息,人工智能实验室 PrismML 今年早些时候推出了微调模型 Bonsai 27B,以显著更低的内存占用实现了 Qwen3.6 27B 基础模型 95% 的性能。 而在当地时间 27 日,PrismML 宣布推出三值量化版本的 Bonsai 2 27B。该模型将基础模型升级至 Qwen3.8 27B,推理、编程、视觉、长程智能体性能全面提升, 以不到 1/9 的内存占用在综合基准测试中得到了基础模型 98.2% 的分数 ,整体表现甚至好于 Qwen3.6 27B。 PrismML 表示,Bonsai 2 27B 足以在本地承担编程智能体循环、计算机使用工作流、私有文档解析、多模态调试、混合编排等“真正的知识工作”,仅在需要时才调用云端 API。 Bonsai 2 27B 三值量化采用 FP16 分组缩放,每个权重的有效比特为 1.76,模型总大小为 5.9GB,支持 262K 上下文窗口。 其在 NVIDIA GeForce RTX 5090 上拥有 143TPS 的词元吞吐量,在 Apple Silicon M5 Max 上则可达 46.8TPS。这款模型在 GeForce RTX 4090 上的能效为 0.714mWh / Token,比全精度 8B 模型低 40%。 Bonsai 2 27B 可通过 CUDA 在 NVIDIA GPU 上运行,也可通过 MLX 在 Apple 设备上运行;其以 Apache 2.0 许可证开放权重。