Guardrail nedir? Yapay zekânın güvenlik bariyerleri
Guardrail, yapay zekâ sisteminin girdisini ve çıktısını denetleyen kurallardır. Modelin konu dışına çıkmasını ve zarar vermesini önler.
Guardrail nedir?
Otoyoldaki bariyerler aracın yoldan çıkmasını engeller. Yapay zekâda guardrail (koruma bariyeri) aynı işi görür: modelin neyi alıp neyi vereceğine sınır koyan kontrollerdir. Modellerin kendi eğitiminden gelen güvenlik davranışları vardır ama bir ürün için yetmez; ürünü kuran şirketin kendi kurallarına göre ek bir katman gerekir.
Bu katmanın neden gerekli olduğunu gösteren bir örnek: 2024'te Kanada'da bir havayolu şirketi, sohbet asistanının bir müşteriye yanlış anlattığı iade politikasından mahkeme kararıyla sorumlu tutuldu.
Hangi kontroller yapılır?
- Girdi kontrolleri: kullanıcı mesajında modeli kandırmaya yönelik talimatlar (prompt injection, jailbreak) aranır, TC kimlik ve kart numarası gibi kişisel veriler maskelenir, konu dışı istekler ayıklanır.
- Çıktı kontrolleri: cevabın zararlı, hakaret içeren ya da hukuken riskli olup olmadığına bakılır; fiyat ve stok gibi bilgilerin sistemdeki gerçek veriyle uyuştuğu ve çıktının beklenen biçimde olduğu doğrulanır.
- Eylem kontrolleri: ajanın yapabileceği işlemler sınırlanır, ödeme ve silme gibi adımlar insan onayına bağlanır.
Nasıl uygulanır?
Guardrail'lar farklı katmanlarda kurulur. En basit katman system prompt içindeki kurallardır ama tek başına güvenilir değildir. Daha sağlam yöntemler, model çağrısının önüne ve arkasına konan ayrı kontrollerdir: kelime ve kalıp filtreleri, sınıflandırıcı modeller (Meta'nın Llama Guard modeli gibi) ya da NVIDIA'nın NeMo Guardrails gibi açık kaynak araçlar. Kritik kararlarda son katman insandır.
Ölçüyü tutturmak
Guardrail'lar halüsinasyonun ve kötüye kullanımın etkisini sınırlar. Kuralların dozu da önemlidir: çok sıkı bir set, modeli masum sorulara bile cevap veremez hale getirir ve kullanıcıyı kaçırır. İyi bir guardrail seti gerçek konuşmalarla test edilerek ayarlanır ve düzenli olarak gözden geçirilir.