12:45Hunyuan@TXhunyuan腾讯混元发布了Hy3的1-bit和4-bit量化版本,该模型拥有295B参数。通过1-bit和4-bit量化,模型可在单张GPU上运行,大幅降低硬件门槛。支持使用llama.cpp进行推理,并启用MTP(多token预测)功能。模型以GGUF格式提供下载,用户可快速体验。AI模型Hy3TencentHunyuan量化模型推荐理由:腾讯把295B的模型压到1-bit和4-bit,单卡就能跑,用llama.cpp就能玩,赶快试试。原文稍后读已读值得跟进有用关注 Hy3
09:52berryxia@berryxia作者基于Qwen3模型进行2bit量化,得到Ternary-bonsai-27b-mlx-2bit模型。在M1 Pro 32G笔记本上通过LM Studio加载并开启本地服务器,直接接入业务产品。回答速度较快,多模态功能表现良好,无大问题。技巧Qwen3Ternary-bonsaiLM Studio推荐理由:给想低成本跑大模型的开发者参考:用Qwen3量化版,M1 Pro就能流畅做本地任务。原文稍后读已读值得跟进有用关注 Qwen3
07:00官方一手marktechpost@Asif RazzaqPrismML 推出了 Bonsai 27B,这是对 Qwen3.6-27B 进行低比特量化得到的模型,不修改原架构。三元版本使用 {−1, 0, +1} 权重,每个参数仅 1.71 bits,理想大小 5.9GB。1-bit 版本采用二进制 {−1, +1} 权重。两个版本均以 Apache 2.0 许可开源,可在笔记本和手机上本地运行。AI模型PrismMLBonsai 27BQwen3.6-27B推荐理由:PrismML 把 Qwen3.6-27B 压到 5.9GB,手机都能本地跑,还全开源,适合离线使用。原文稍后读已读值得跟进有用关注 PrismML
23:29官方一手AWS Machine Learning Blog@Michael Battaglia精选Unsloth量化的模型可通过四种模式在AWS部署:直接使用Amazon EC2实例、托管SageMaker AI推理端点、以及集成Amazon EKS或Amazon ECS容器编排。文章详细介绍了每种模式的配置步骤和适用场景。还涵盖了生产环境中的运维最佳实践,如自动扩缩容和监控。技巧UnslothAmazon SageMaker AIAmazon EC2推荐理由:想用Unsloth量化模型上AWS?这篇教你四种部署方式,从直接跑EC2到托管SageMaker,还能用K8s跑,生产技巧也全。原文稍后读已读值得跟进有用关注 Unsloth
02:59官方一手marktechpost@Asif Razzaq精选Google DeepMind 推出 Gemma 4 的 QAT(量化感知训练)检查点,包含 Q4_0 格式(4-bit 量化)和新开发的移动格式。与 BF16 版本相比,Q4_0 可将模型内存占用降低约 75%,而移动格式进一步优化至适合手机等设备。这些检查点面向边缘计算场景,平衡了精度和推理速度。AI模型Gemma 4Google DeepMindQAT10 个信源在谈事件专题推荐理由:Gemma 4 量化版来了,内存省 75%原文稍后读已读值得跟进有用关注 Gemma 4