PaddlePaddle 3.1.0: Auto-Parallel, FP8, and CUDA-Like Hardware Support
PaddlePaddle 3.1.0 introduces a refined auto-parallel architecture, FP8 low-precision training for 10-20% speedups, and a mechanism to reuse CUDA kernels for heterogeneous hardware.