The pure-Python framework tinygrad posted a faster MLPerf Llama 3.1 8B pretraining time than AMD's own optimized submission on identical MI350 hardware.
Continue to AI University →