02:35官方一手marktechpost@Sana Hassan78°教程演示如何在PyTorch中配置NVIDIA Transformer Engine的融合GPU内核。使用FP8延迟缩放和BF16混合精度训练GPT风格因果语言模型。文章提供了可运行的代码示例,并给出不同GPU上的基准测试对比。还解释了FP8延迟缩放的数值稳定性调参方法。技巧NVIDIA Transformer EnginePyTorchFP8推荐理由:想让你自己训练的Transformer跑得更快?这篇手把手教你用NVIDIA Transformer Engine和FP8,还有代码和GPU跑分对比。原文稍后读已读值得跟进有用关注 NVIDIA Transformer Engine
09:37官方账号arXiv cs.LG@Mariya Pavlova, Harrison Bo Hua Zhu, Elizsveta Semenova, Yingzhen Li该论文提出了一种名为轨迹量化敏感度分数(TQS)的新指标,将时序模型的量化问题重新定义为动力系统的稳定性分析。TQS通过将模型推理视为离散时间动力系统,量化了量化误差在时间步上的传播和放大效应。与传统的后训练量化方法不同,TQS可以独立于量化器选择和位宽分配进行敏感度估计,适用于黑盒或编译后的网络。基于TQS,作者提出了TQS-PTQ框架,无需校准数据或二阶近似即可实现混合精度量化。实验表明,该视角在资源受限场景下提供了稳健且高性能的低精度部署方案。论文量化时序模型动力系统推荐理由:时序模型部署时量化误差会随时间累积,TQS用动力系统理论解决了这一痛点,做边缘设备或IoT部署的工程师可以直接参考。原文稍后读已读值得跟进有用关注 量化