لا توجد تعريفات بديلة
نموذج متعدد الصيغ يجمع بين البيانات المرئية والنصية لأداء المهام التي تتطلب فهم الصور واللغات.
Vision Language Model (VLM)