17:47官方账号arXiv cs.LG@Junyi Ye, Ivy Gateri Wanjiku该论文系统研究了后训练量化(PTQ)中激活值校准对S&P 500横截面波动率预测的影响,涵盖7种神经网络架构、8个walk-forward测试年(2018-2025)和560个训练模型。结果显示,8比特下校准影响很小,但4比特时校准成为预测性能的主要决定因素。在默认abs-max校准下,静态4比特量化权重和激活值会使受影响架构的全精度平均信息系数损失11-62%。改用百分位校准可恢复四种受影响最严重架构中53-94%的退化。论文指出激活值校准是金融预测中可靠4比特PTQ的一级部署决策,剩余退化严重时可选用8比特激活值或仅权重4比特量化。论文PTQ量化金融预测推荐理由:论文用560个模型实测了4比特量化在S&P 500波动率预测上的效果,发现校准方式能决定性能好坏,做量化部署的可以看看。原文稍后读已读值得跟进有用关注 PTQ
09:20官方账号arXiv cs.LG@Juan Amboage, Pablo Monteagudo-Lago, Ian Colbert, Giuseppe Franco, Nicholas Fraser精选后训练量化(PTQ)通过将权重映射到低位表示来压缩大语言模型,但量化网格的缩放因子通常使用简单的无数据启发式方法选择。本文提出 PiSO(分段尺度优化)算法,利用校准数据在四舍五入量化下精确高效地计算最优通道级权重尺度。PiSO 将尺度搜索空间划分为有限区间,每个区间上目标函数有闭式解。实验表明,在 Llama 和 Qwen 模型上,PiSO 在困惑度和下游零样本准确率上均有一致提升,且位宽越窄收益越明显。论文后训练量化模型压缩大语言模型推荐理由:大模型量化部署的团队终于有了一个理论扎实的尺度优化方法——PiSO 在低位宽下效果尤其显著,做模型压缩的开发者可以直接参考论文中的算法实现。原文稍后读已读值得跟进有用关注 后训练量化
19:12官方账号arXiv cs.LG@Tanmaey Gupta, Hayden Prairie, Xiaoxia Wu, Reyna Abhyankar, Qingyang Wu, Austin Silveria, Pragaash Ponnusamy, Jue Wang, Ben Athiwaratkun, Leon Song, Tri Dao, Daniel Y. Fu, Chris De Sa精选量化是加速生成模型推理的标准技术,但传统块浮点(BFP)格式使用基于块最大幅度的固定缩放因子,可能导致量化误差次优。本文提出ScaleSearch方法,通过细粒度搜索利用微缩放格式的尾数位,最小化量化误差。ScaleSearch可集成于后训练量化(PTQ)和低精度注意力机制,实验显示NVFP4量化误差降低27%,Qwen3-8B在MATH500上PTQ提升15点。此外,ScaleSearchAttention算法在Llama 3.1 70B上实现Wikitext-2困惑度降低0.77点,几乎无性能损失。论文量化块浮点NVFP4推荐理由:做模型量化和推理加速的团队终于有了更优的缩放策略——ScaleSearch直接提升精度且兼容现有方法,建议做低精度部署的开发者试试。原文稍后读已读值得跟进有用关注 量化