İçeriğe geç
Konuşalım Web sitesi gelir kaçağı denetimi
Nedir

VLM (Vision-Language Model) nedir?

2 dk okuma Model Türü · VLM

VLM, görüntü ve metni birlikte anlayan yapay zekâ modelidir. Bir fotoğrafı açıklayabilir ya da bir faturadaki tutarları okuyabilir.

VLM nedir?

Vision-Language Model (görsel-dil modeli), girdi olarak hem görüntü hem metin alabilen ve çıktı olarak genellikle metin üreten modeldir. Telefonunuzla bir tabelanın fotoğrafını çekip "burada ne yazıyor, Türkçeye çevir" dediğinizde ya da bir ürün fotoğrafı yükleyip "bu hangi model?" diye sorduğunuzda bir VLM kullanırsınız.

GPT-4o, Gemini ve Claude gibi güncel asistanların görsel okuyabilen sürümleri bu kategoridedir. LLaVA ve Qwen-VL gibi açık kaynak örnekler de vardır.

Nasıl çalışır?

Bir VLM'nin genellikle iki ana parçası vardır. Görsel kodlayıcı (vision encoder) resmi küçük parçalara böler ve her parçayı modelin anlayacağı vektörlere çevirir. Bu vektörler metnin tokenlarıyla aynı diziye konur ve bir dil modeli hepsini birlikte işler. Böylece model "resmin sol üstündeki grafik" ile sorudaki bir kelime arasında bağ kurabilir.

Nerelerde kullanılır?

  • Belge okuma: fatura, dekont, kimlik ve el yazısı formlardan bilgi çıkarmak.
  • E-ticaret: ürün fotoğrafından açıklama ve etiket üretmek, görselle arama yapmak.
  • Müşteri desteği: müşterinin gönderdiği arıza fotoğrafını yorumlamak.
  • Erişilebilirlik: görme engelli kullanıcılara ortamı ve görselleri anlatmak.
  • Kalite kontrol: üretim hattında kusurlu ürünü görüntüden tespit etmek.

Sınırları

VLM'ler de halüsinasyon görebilir: fotoğrafta olmayan bir nesneyi "görebilir" ya da küçük yazıları yanlış okuyabilir. Nesneleri saymak ve tam konumlarını söylemek hâlâ zayıf oldukları alanlardandır. Bir nesneyi fotoğraftan piksel düzeyinde kesin olarak ayırmak gereken işlerde SAM gibi özel modeller daha uygundur.