لا توجد تعريفات بديلة
خوارزمية للتعلُّم المُعَزَّز تُدرِّب الوكيل على تحقيق مهام معقدة، عن طريق تحسين دالة هدف بديلة لتقييد حجم الخطوة في كل تحديث للسياسة.
Proximal Policy Optimization (PPO)