İçeriğe geç
Konuşalım Web sitesi gelir kaçağı denetimi
Nedir

Latency nedir? Yapay zekâda gecikme ve hız

2 dk okuma Performans · Latency

Latency, bir isteği gönderdiğiniz an ile cevabın gelmesi arasında geçen süredir. Yapay zekâ ürünlerinde kullanıcı deneyimini belirler.

Latency nedir?

Latency (gecikme), bir sisteme istek gönderdiğiniz an ile cevabın size ulaştığı an arasındaki süredir. Web sitelerinde sayfanın açılma süresi olarak bilinir. Dil modellerinde cevap parça parça geldiği için gecikme iki ayrı ölçüyle takip edilir.

Yapay zekâda gecikme nasıl ölçülür?

  • İlk token süresi (time to first token, TTFT): isteği gönderdikten sonra ekrana ilk kelimenin gelmesine kadar geçen süre. Kullanıcının "sistem çalışıyor" hissini bu belirler.
  • Üretim hızı: modelin saniyede ürettiği token sayısı. Cevabın tamamının ne kadar sürede biteceğini bu belirler.

Toplam süre kabaca ilk token süresine, cevap uzunluğunun üretim hızına bölümünün eklenmesiyle bulunur. Uzun bir rapor isteyen kullanıcı, kısa bir cevap isteyene göre doğal olarak daha uzun bekler.

Gecikmeyi neler artırır?

Büyük modeller küçüklere göre daha yavaş çalışır. Uzun belgeler ilk token süresini uzatır, uzun cevaplar toplam süreyi uzatır. Akıl yürüten modeller cevap vermeden önce bir süre "düşünür". Sunucunun o anki yoğunluğu ve kullanıcıyla sunucu arasındaki mesafe de süreye eklenir. Ajan sistemlerinde her araç çağrısı ayrı bir bekleme demektir ve çok adımlı görevlerde bu beklemeler üst üste biner.

Gecikme nasıl düşürülür?

Cevabı akış (streaming) halinde göstermek, yani kelimeleri üretildikçe ekrana basmak, algılanan bekleme süresini ciddi ölçüde kısaltır. Basit işlerde daha küçük bir model kullanmak, promptu kısaltmak, sık tekrar eden promptlar için önbellek (prompt caching) kullanmak ve birbirinden bağımsız adımları paralel çalıştırmak diğer yollardır. Sesli asistanlar ve canlı sohbet gibi gerçek zamanlı ürünlerde gecikme, doğruluk kadar önemsenen bir ölçüdür.

Maliyet tarafı için inference yazısına bakabilirsiniz.