Anthropic, açık model GLM-5.3'ün siber saldırı gücünü ölçtü
Anthropic'e göre Zhipu'nun GLM-5.3 modeli istismar kodu yazmada Claude Mythos Preview'a yaklaşıyor. Önlemleri basit yöntemlerle yüzde 64-100 oranında aşılıyor.
Ölçüm
Chrome'un V8 JavaScript motorundaki açıklar üzerindeki testte GLM-5.3, 410 denemenin 50'sinde çalışan bir istismar zinciri kurdu; Claude Mythos Preview aynı testte 56'da başarılı oldu. Yeni duyurulan bir Chrome açığını bilinen bir kusurla birleştiren kavram kanıtı 20 dakika insan emeği ve 8 saat model zamanı aldı. Zhipu'nun API'siyle maliyeti 20,40 dolar.
Önlemler
İstek kırmızı takım tatbikatı gibi sunulunca model hedef sisteme bağlanmayı denemelerin yüzde 64'ünde denedi. Akıl yürütmesinin başı önceden doldurulunca oran yüzde 92'ye, reddetme mekanizması sökülünce yüzde 100'e çıktı. Aynı saldırılar korumalı Claude modellerinde başarılı olmadı. Anthropic, hükümetlerin yetenekli modelleri test etmesini ve savunma tarafının en az saldırgan kadar iyi araçlara sahip olmasını istiyor.
