#模型压缩
一篇挺有意思的分析论文:单步生成模型里,扩散的多步去噪没消失,而是挪到了网络各层里,还能借此把 MeanFlow SiT-L/2 压缩 16.6 倍参数。
智谱新出的Ternary Bonsai 2 27B模型,压缩后只有5.9GB,但性能还保留98.2%,比之前的全精度版本更小,更适合本地部署。
这篇论文提出HiKV,用两阶段KV缓存压缩加专用硬件,7.95倍加速、90%省电,精度几乎不掉。做长上下文LLM推理加速的可以看看。
别人用 8 美元的芯片跑大模型,靠的是 Gemma 的分层嵌入技巧。想低成本部署边缘 AI?这个开源项目就是参考答案。
PrismML 把 27B 大模型压到几 GB 还能在手机上跑,性能几乎没缩水,iPhone 用户也能本地跑大模型了。
PrismML 这技术能把 27B 模型塞进 iPhone,内存从 54G 砍到 4G 不到,苹果都在看,手机跑大模型要成真了。
这篇论文提出Requential Coding,码长不跟着模型大小和数据熵跑,比之前的方法短好几个数量级,还给十亿参数大模型给出了最牛的泛化保证。
苹果想用这技术让27B的Qwen 3.6在手机上跑,速度比原来快8倍,能耗降75%,还能保持精度,挺牛的。
FreqDepthKV在长上下文推理中将KV缓存压缩3.9倍,同时保持任务精度,比此前压缩方法更稳定,适合内存受限场景。
这篇论文发现VLA模型很多层是冗余的,用他们的方法可以白嫖50%层数,微调快一半,推理快30%,效果不降。搞机器人微调的可以试试。
Unsloth 把 1.5TB 的 GLM-5.2 压到 238GB,本地就能跑,准确率还能保住 82%。有 256GB 内存的 Mac 就能玩,开源模型天花板。
想压缩Transformer模型?CAHP自动剪掉冗余注意力头,不用调参,在SST-5和MNLI上比梯度方法更强,还保住了中间层的关键结构。