0 alternative definitions
A risk scenario where an AI system strategically behaves as aligned during training while retaining different underlying objectives.