MoE (Mixture of Experts) nedir?
MoE, bir modeli birçok uzman alt ağa bölen ve her adımda yalnız ilgili uzmanları çalıştıran mimaridir. Büyük modelleri ucuzlatır.
MoE nedir?
Mixture of Experts (uzmanlar karışımı), bir modelin içini tek büyük bir blok yerine birçok "uzman" alt ağa bölen bir mimaridir. Her girdi için bir yönlendirici (router) hangi uzmanların çalışacağına karar verir. Bütün uzmanlar modelin içinde durur ama her adımda yalnız birkaçı çalışır.
Büyük bir hastaneyi düşünün. Her hasta bütün doktorlara görünmez; danışma, hastayı şikâyetine göre iki üç uzmana yönlendirir. Hastanede yüzlerce doktor olsa da tek bir hasta için harcanan zaman sınırlı kalır.
Nasıl çalışır?
Dil modellerinde yönlendirme token düzeyinde yapılır: cümledeki her token için router uzmanlara puan verir ve en uygun birkaçını seçer. Örneğin Mistral'in açık kaynak Mixtral 8x7B modelinde her katmanda sekiz uzman vardır ve her token için bunlardan ikisi çalışır.
Uzmanlar "tarih uzmanı" ya da "kod uzmanı" gibi insanın anlayacağı konulara göre ayrılmaz. Hangi tür örüntüde iyi olacaklarını eğitim sırasında kendileri öğrenirler.
Avantajı ne?
Modelin toplam kapasitesi (parametre sayısı) çok büyük olabilir ama her token için yapılan hesap yalnız çalışan uzmanlar kadardır. Bu, aynı bütçeyle daha büyük ve daha yetenekli modeller çalıştırmayı mümkün kılar; inference daha hızlı ve ucuz olur. DeepSeek, Mistral ve Alibaba'nın Qwen serisindeki birçok model MoE mimarisini kullanıyor. Google da Gemini 1.5'in MoE mimarisine dayandığını açıkladı.
Dezavantajları
Çalışmayan uzmanlar da bellekte durmak zorundadır; bu yüzden MoE modelleri hesap açısından ucuz, bellek açısından ağırdır. Eğitimleri de daha zordur: router bazı uzmanlara fazla iş verip diğerlerini boşta bırakabilir, bunu dengelemek için ek teknikler gerekir. Buna rağmen en büyük modellerin önemli bir kısmı bugün bu mimariye yöneliyor.