亚马逊EKS上使用NVRx实现容错分布式训练
Fault tolerant distributed training on Amazon EKS using NVRx
亚马逊的NVRx工具能帮你解决分布式训练中的GPU故障问题,让训练更稳定,恢复速度更快。
亚马逊将NVIDIA Resiliency Extension (NVRx)集成到PyTorch FSDP训练中,实现检查点I/O与训练重叠,并在H100上2到8节点测试中达到99%+的训练效率,GPU故障恢复时间缩短至秒级。
Fault tolerant distributed training on Amazon EKS using NVRx
Integrate NVIDIA Resiliency Extension (NVRx) into PyTorch FSDP training on Amazon EKS to overlap checkpoint I/O with training and recover from GPU faults in seconds. This post covers async checkpointing, in-process restart, and ft_launcher in-job restart, with H100 benchmarks at 2 to 8 nodes showing 99%+ training efficiency and second-scale recovery.