0 alternative definitions
A technique that partitions a large AI model across multiple devices or servers to distribute memory and computational workloads.