AMD and Meta Upstream FP8 Training Optimizations for Up to 6.2x Faster Instinct GPU Training

AMD and Meta open-sourced FP8 training optimizations in TorchTitan/TorchAO, speeding up AMD Instinct GPU training by up to 6.2x.