0 alternative definitions
A technique for improving inference efficiency in Transformer models by temporarily storing previously computed key and value representations to accelerate sequential generative inference.