0 alternative definitions
An evaluation methodology in which a large language model assesses, scores, ranks, or compares model outputs according to defined criteria.