OpenAI ruh sağlığı sohbetleri için açık test yayımladı
MentalHealthBench, 80'den fazla psikolog ve psikiyatristin 19 dilde yazdığı ölçütlerle modellerin ruh sağlığı sohbetlerindeki yanıtlarını puanlıyor.
Test ne içeriyor?
OpenAI 24 Eylül'de MentalHealthBench adlı açık bir değerlendirme seti yayımladı. Sette 1.215 yapay ama gerçekçi ruh sağlığı sohbeti ve bunlara bağlı 5.262 puanlama ölçütü var. Ölçütleri 22 ülkeden 80'i aşkın lisanslı psikolog ve psikiyatrist 19 dilde yazdı. Sohbetlerin yüzde 53,5'i acil olmayan, yüzde 18,2'si yüksek riskli, yüzde 28,3'ü acil durumlar.
Nasıl puanlıyor?
Her ölçüt yanıtın tek bir yönüne bakıyor ve eksi 10 ile artı 10 arasında ağırlık taşıyor. Yararlı davranış puan kazandırıyor, zararlı davranış puan kırıyor. Ölçülen başlıca davranışlar güvenlik, bağlamı sorma, kullanıcının karar hakkını koruma ve gerektiğinde uygulanabilir yol gösterme.
Sonuçlar
İlk tabloda GPT-6 Astra yüzde 57,3 ile önde. Onu GPT-6 Sol (yüzde 53,9), Claude Opus 5.5 (yüzde 52,4) ve GPT-6 Luna (yüzde 50,2) izliyor. Eski modellerden GPT-4o yüzde 32,1, Gemini 2.5 Pro yüzde 29,5 aldı. En iyi skorun bile yüzde 60'ın altında kalması, bu alanda modellerin hâlâ uzun bir yolu olduğunu gösteriyor. Set, başka araştırmacılar yöntemi inceleyip kendi ölçümlerini yapabilsin diye açık yayımlandı.