14:23Geek@geekbb精选MLX-Serve 是一个用 Zig 编写的原生 Apple Silicon LLM 推理服务器,兼容 OpenAI、Anthropic 和 Ollama API。它可以加载 MLX 与 GGUF 格式模型,且无需 Python 环境,并附带 macOS 菜单栏应用。开发者 David Dalcu 在 Qwen 3 8B/27B 的 MLX-Serve 4bit 模型上跑 Pagoda 测试,称获得目前最佳结果。他用 @pidotdev 作为编码智能体,以 MLX-Serve 作为后端完成推理。AI产品MLX-ServeZigQwen10 个信源在谈事件专题推荐理由:Mac 本地跑模型试试这个 Zig 写的 MLX-Serve,免 Python 还带菜单栏,配 Qwen 3 跑 Pagoda 测试比之前都强。原文稍后读已读值得跟进有用关注 MLX-Serve
17:23Hunyuan@TXhunyuan75°腾讯开源翻译模型Hy-MT2自5月发布以来下载量已超70万次。Hy-MT2-1.8B登上Hugging Face趋势榜第一,Hy-MT2-30B-A3B位列第四。目前已有70多个产品和项目完成集成,并支持Apple MLX-LM、Microsoft ONNX Runtime、NVIDIA NeMo等框架。B站直播评论的实时多语言翻译已使用该模型。Hy-MT2-30B-A3B现已提供GGUF格式,便于本地推理。AI模型Hy-MT2腾讯混元机器翻译8 个信源在谈事件专题推荐理由:Hy-MT2是腾讯开源的翻译模型,现在30B版本有GGUF格式,下载就能在本地跑,冲榜第一,试试呗。原文稍后读已读值得跟进有用关注 Hy-MT2
16:20官方一手marktechpost@Sana Hassan本教程使用PrismML分支的llama.cpp部署1-bit Bonsai-27B模型。该分支提供了专门CUDA内核,用于解码模型的Q1_0_g128 GGUF量化格式。教程展示了如何设置本地服务器,并通过兼容OpenAI的API接口进行推理调用。整个过程省去了云端依赖,适合低成本本地部署。技巧Bonsai-27BPrismMLllama.cpp推荐理由:想本地跑Bonsai-27B?用PrismML的llama.cpp加上1位量化,速度起飞,还能直接用OpenAI API调用。原文稍后读已读值得跟进有用关注 Bonsai-27B
16:33berryxia@berryxiaUnslothAI 创始人 Daniel Han 发布了 Qwen3.6 的实验性 MTP GGUF 版本,通过投机解码技术大幅提升推理速度。27B 模型在单 GPU 上达到 140 tokens/s,35B-A3B 版本更达 220 tokens/s,比原版 GGUF 快 1.4 倍且精度无损。最佳 draft tokens 设为 2,过高会导致接受率下降。这一突破显著提升了本地大模型的性能上限,让消费级显卡能更高效运行 30B+ 参数模型。AI模型Qwen3.6GGUF投机解码推荐理由:本地大模型性能天花板被再次抬高,玩 llama.cpp、跑本地 Agent 或日常 coding 的开发者可以直接用上,体验 30B+ 模型在消费级显卡上的流畅速度。原文稍后读已读值得跟进有用关注 Qwen3.6
22:16官方账号Clement Delangue@ClementDelangueHugging Face联合创始人Clement Delangue透露,Hugging Face上公开GGUF模型总数已达17.6万个。2024年10月至2月,月均新增约5100个GGUF模型;3月至4月跃升至约9200个/月,近乎翻倍。3月成为转折点(环比增长55%),4月维持9700个的高位,表明增长并非暂时现象。这一趋势得益于llama.cpp工具改进、自动化量化流程以及更多模型原生支持GGUF,社区量化模型速度创历史新高。行业开源/仓库模型量化GGUF推荐理由:GGUF模型数量的快速增长反映了本地AI部署的实际需求和技术成熟度的提升。对于开发者和企业,这意味着更丰富的开源模型选择和更便捷的本地推理实践,推动AI应用向边缘设备转移。原文稍后读已读值得跟进有用关注 开源/仓库