#模型压缩
共 56 条 · 7 天 3 条 · 30 天 10 条
6月13日
6月12日
6月10日
6月6日
Google 发布 Gemma 4 QAT 检查点,模型从 11.4GB 缩至 1.1GB
QAT 解决了模型压缩后推理质量下降的痛点,做移动端 AI 部署的开发者可以直接用这些检查点,在手机上跑大模型不再吃内存。
6月3日
论文12:49
Self-Pruned Key-Value Attention:让LLM只保留未来有用的记忆KV缓存是长上下文推理的瓶颈,这篇论文用自学习剪枝解决了内存爆炸问题,做LLM推理优化或长文本应用的开发者可以直接参考其方法。
6月2日
SubFit:子模块级非连续替换压缩 LLM,25% 稀疏度保留 84.6% 精度
做 LLM 部署优化的团队终于有了更精细的压缩工具——SubFit 在 25% 稀疏度下精度损失比最强基线少一半,且非连续子模块选择更贴合真实冗余分布,建议做模型量化和剪枝的开发者直接试。
5月28日
5月27日
模型14:05
Bonsai Image 4B 生图模型登陆 iPhone,9.4 秒生成 512×512 图像手机端终于能跑正经的图像生成模型了,做移动端 AI 应用或创意工具的开发者可以直接在 iPhone 上体验,9.4 秒出图的速度已经可用。
IT之家原文
Bridge-Garden 理论:混合硬软标签提升 LLM 蒸馏效果
做 LLM 蒸馏的团队终于有了理论指导——Bridge-Garden 理论解释了为什么混合标签有效,并且直接给出了可落地的方案,训练成本还降了 9.7 倍,建议做模型压缩的开发者点开看看。
模型07:22
PrismML 发布 Bonsai Image 4B 端侧生图模型,1-bit 版仅 0.93GB端侧生图终于不再妥协——Bonsai Image 4B 用极致压缩把云端级质量塞进手机,做移动端 AI 应用或离线创作工具的开发者可以直接在 iPhone 上试,无需联网和付费。
5月25日
5月21日
5月20日
5月18日
层等价性测试方法不同,结果天差地别:Qwen3-8B和Llama-3.1-8B案例
做模型压缩或剪枝的团队,如果只用一种等价性测试就决定删层,可能会踩坑——这篇论文用Qwen3-8B和Llama-3.1-8B的对比告诉你,测试方法选错,安全剪枝的层数能差好几倍。建议在剪枝前先跑一下两种swap-KL诊断。
5月13日
NVIDIA Nemotron 3 Nano Omni 专家问答
对于关注边缘AI部署和模型压缩的开发者,Nemotron系列的技术细节具有实际参考价值,尤其适合了解NVIDIA在小模型领域的最新动态。