SAM (Segment Anything Model) nedir?
SAM, bir görüntüdeki herhangi bir nesneyi tek tıkla piksel düzeyinde ayırabilen, Meta tarafından geliştirilen segmentasyon modelidir.
SAM nedir?
Segment Anything Model, Meta'nın 2023'te tanıttığı bir bilgisayarlı görü modelidir. Segmentasyon, bir görüntüde bir nesnenin tam olarak hangi piksellerden oluştuğunu belirlemektir. Nesnenin etrafına kabaca bir kutu çizmekle yetinilmez, sınırı kesin olarak çıkarılır.
SAM'e bir noktaya tıklayarak ya da bir kutu çizerek ne istediğinizi gösterirsiniz; model o nesnenin maskesini çıkarır. Bir fotoğrafta köpeğin üzerine tıkladığınızda köpeğin kulağından kuyruğuna kadar bütün pikselleri seçilir.
Neden önemli?
SAM'den önce segmentasyon modelleri genellikle belirli nesne türleri için ayrı ayrı eğitilirdi: bir model yalnız araçları, bir diğeri yalnız tıbbi görüntüdeki belirli dokuları ayırırdı. SAM, daha önce görmediği nesne türlerinde de ek eğitim gerektirmeden çalışabilen genel bir model olarak tasarlandı.
Meta bunun için 11 milyon görüntü üzerinde 1 milyardan fazla maske içeren SA-1B veri setini oluşturdu ve modeli açık kaynak olarak yayımladı. 2024'te çıkan SAM 2 aynı yeteneği videoya taşıdı: bir karede seçilen nesne video boyunca takip edilir.
Nerelerde kullanılır?
- Fotoğraf ve video düzenleme: arka plan silme ve tek tıkla nesne seçme.
- E-ticaret: ürün fotoğraflarını arka plandan temiz biçimde ayırmak.
- Tıp: görüntülerde organ ve lezyon sınırlarını işaretlemeyi hızlandırmak (uzman kontrolüyle).
- Tarım ve uydu görüntüleri: tarlaları, binaları ve su alanlarını ayırmak.
- Veri etiketleme: yeni yapay zekâ modellerini eğitmek için gereken etiketli görselleri çok daha hızlı hazırlamak.
SAM ile VLM farkı
VLM bir görüntüyü anlar ve kelimelerle anlatır: "masada kırmızı bir fincan var". SAM ise nesnenin ne olduğunu söylemez, nerede başlayıp nerede bittiğini piksel piksel gösterir. İkisi birlikte güçlü sonuç verir: VLM neyin arandığını anlar, SAM onu görüntüden kesip çıkarır.