13:41官方账号阿里通义 Qwen@Alibaba_Qwen阿里推出的Qwen3.8 - 27B新模型,借助Unsloth技术后,在Div - 300基准测试中表现更优;该模型采用1 - bit量化方式,能在8GB内存下运行,保持77%准确率;相比其他模型,它在KLD等更多基准上领先超10%AI模型Qwen3.8 - 27BUnsloth阿里2 个信源在谈事件专题推荐理由:阿里和Unsloth一起发布了Qwen3.8 - 27B模型,用新方法让它运行更好,比其他模型好超10%。原文稍后读已读值得跟进有用关注 Qwen3.8 - 27B
10:38shao__meng@shao__meng82°阿里开源了 Qwen3.8-27B,这是原生多模态稠密模型,27B 参数在综合表现上超过 Qwen3.7-Plus。该模型原生支持 262K 上下文,可通过 YaRN 扩展到 1M。它兼容 vLLM、SGLang、TokenSpeed,并提供官方 FP8 版本。Unsloth 的量化方案只需 17GB RAM 即可本地运行。此外,Max 级 Qwen3.8-2.4T-A95B 的权重也已开放。AI模型Qwen3.8-27BQwen3.8多模态5 个信源在谈事件专题推荐理由:阿里把 27B 开源了,原生多模态,整体超 Qwen3.7-Plus,17GB 内存就能本地跑,适合自己部署。原文稍后读已读值得跟进有用关注 Qwen3.8-27B
01:59官方账号阿里通义 Qwen@Alibaba_QwenQwen3.8-27B 是阿里 Qwen 团队的新模型,Unsloth 已支持其在 17GB 内存下通过 Dynamic GGUF 格式本地运行。Unsloth 还上传了 NVFP4 量化版本,模型文件已发布到 Hugging Face 的 unsloth/Qwen3 仓库。官方称该模型在同尺寸中表现最强,但原文没有给出具体基准分数。用户可以参考 Unsloth 文档中的运行指南来部署。AI模型Qwen3.8-27BUnslothQwen4 个信源在谈事件专题推荐理由:Qwen3.8-27B 现在靠 Unsloth 动态量化,17GB 内存就能跑,还有 NVFP4 量化版,适合本地尝鲜。原文稍后读已读值得跟进有用关注 Qwen3.8-27B
01:20Geek@geekbb精选71°Unsloth AI推出DSpark加速方案,让DeepSeek-V4-Flash-0731的GGUF模型在本地生成速度提升约1.4至2倍。根据Unsloth官方实测,该模型在本地可达到每秒120 tokens,精度没有变化。相关GGUF文件已发布在Hugging Face上,完整指南见Unsloth官方文档。AI模型DeepSeek-V4-FlashUnslothDSpark9 个信源在谈事件专题推荐理由:Unsloth搞了个DSpark,能让DeepSeek-V4-Flash在本地跑快一两倍,每秒120 tokens,精度不变,自己部署更爽了。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash
17:25官方一手marktechpost@Asif RazzaqUnsloth通过重写底层内核加速训练。Axolotl组合多种并行策略优化多GPU效率。TRL提供了被其他框架依赖的标准训练器API。LLaMA-Factory以支持最广泛的模型覆盖为目标。这四个框架均基于PyTorch和HuggingFace生态。AI模型UnslothAxolotlTRL推荐理由:想微调LLM选框架?这篇对比了Unsloth、Axolotl、TRL和LLaMA-Factory,讲清了各自的速度、显存和多GPU表现,帮你快速决策。原文稍后读已读值得跟进有用关注 Unsloth
22:19berryxia@berryxia精选73°Google更新Gemma 4,修复历史轮次处理、思考保留、工具输出延续和工具调用一致性问题。预填充速度提升25-70%。Unsloth跟进发布GGUF、MLX和NVFP4量化版本,支持本地部署。此次更新解决了Gemma之前工具调用不稳定或卡住的痛点。AI模型Gemma 4GoogleUnsloth3 个信源在谈事件专题推荐理由:Google刚修了Gemma 4工具调用的老毛病,速度还快了25-70%,Unsloth立马出了量化版能本地跑,做Agent的兄弟可以试试。原文稍后读已读值得跟进有用关注 Gemma 4
23:29官方一手AWS Machine Learning Blog@Michael Battaglia精选Unsloth量化的模型可通过四种模式在AWS部署:直接使用Amazon EC2实例、托管SageMaker AI推理端点、以及集成Amazon EKS或Amazon ECS容器编排。文章详细介绍了每种模式的配置步骤和适用场景。还涵盖了生产环境中的运维最佳实践,如自动扩缩容和监控。技巧UnslothAmazon SageMaker AIAmazon EC2推荐理由:想用Unsloth量化模型上AWS?这篇教你四种部署方式,从直接跑EC2到托管SageMaker,还能用K8s跑,生产技巧也全。原文稍后读已读值得跟进有用关注 Unsloth
17:26berryxia@berryxiaUnsloth团队将GLM-5.2模型压缩至1-bit量化版本,在Mac Studio M3 Ultra(256GB RAM)上实现约21 tok/s的推理速度。该量化模型在创意输出任务(如HTML/设计生成)上,能与Claude Opus和GPT-5.5正面对比且不落下风。这显示极端量化后的大模型仍能保留较强表现,展示了开源模型通过优化缩小与闭源前沿模型在实际可用性上的差距。AI模型UnslothGLM-5.2量化推荐理由:Unsloth把GLM-5.2压到1-bit,Mac Studio上跑21 tok/s,创意性居然不输Claude Opus,本地部署党有福了。原文稍后读已读值得跟进有用关注 Unsloth
00:02Geek@geekbb精选Unsloth AI 将最强开源模型 GLM-5.2 从 1.51TB 压缩至 238GB(缩小 84%),2-bit 量化版本保留约 82% 准确率。该模型可在 256GB Mac 或同等 RAM/VRAM 配置上本地运行。官方指南和 GGUF 文件已在 Hugging Face 发布。AI模型GLM-5.2Unsloth本地运行推荐理由:Unsloth 把 1.5TB 的 GLM-5.2 压到 238GB,本地就能跑,准确率还能保住 82%。有 256GB 内存的 Mac 就能玩,开源模型天花板。原文稍后读已读值得跟进有用关注 GLM-5.2
14:05berryxia@berryxia78°Unsloth团队用Dynamic 2-bit方案将1万亿参数的Kimi K2.7 Code模型压缩48%,重要层保留更高精度。量化后模型仅需325GB RAM/VRAM即可本地运行,推理速度达40+ tok/s。全精度版本需要610GB显存。该优化并非粗暴量化,而是保留了模型的推理效率,尤其适合长程任务、复杂推理和agent工作流。AI模型Kimi K2.7 CodeUnsloth量化4 个信源在谈事件专题推荐理由:Unsloth把1万亿参数的Kimi K2.7 Code压到325GB本地能跑,速度40+ tok/s,长程推理和agent工作流全闭环,开源社区终于能自己跑了。原文稍后读已读值得跟进有用关注 Kimi K2.7 Code
11:24小互@imxiaohu精选DiffusionGemma 模型支持微调,Unsloth 团队已成功演示通过微调让该模型学会解数独。这利用了双向注意力的优势,解决了自回归模型在全局约束任务上的天然短板。在特定垂直任务上,微调后的 DiffusionGemma 质量有望追上甚至超越自回归模型。这一进展为扩散模型在需要全局推理的领域打开了新可能。AI模型DiffusionGemma微调双向注意力推荐理由:做垂直任务微调的开发者值得关注——DiffusionGemma 的双向注意力让数独这类全局约束问题有了新解法,建议试试在自家任务上微调对比效果。原文稍后读已读值得跟进有用关注 DiffusionGemma