0 alternative definitions
A computationally efficient attention algorithm that reduces memory usage and accelerates transformer model training and inference.