← Blog

Deployment Simulation serisi · 4/10 · 21 Haziran 2026 · 26 dk

Model Davranışı Nasıl Ölçülür?

Model safety ölçümünde tek bir başarı skoru yok. Asıl mesele hangi soruyu sorduğunu bilmek: davranış ne kadar yaygın, tahmin seviyesi doğru mu, artış/azalış yönünü yakalıyor mu?

İçindekilerÜç Soru, Üç ÖlçümPrevalence: Önce Düzgün SayBaseline Olmadan İyi Kötü YokCalibration: Termometre Doğru Dereceyi Gösteriyor mu?Nadir Olaylarda Lineer Düşünme BozulurDirectional Accuracy: Seviyeyi Değil, Yönü YakalamakÖlçüm Dürüstlüğü: Cevabı Görmeden Tahmin EtmekOkuma Kontrolü

Üç Soru, Üç Ölçüm

Bir davranışı ölçerken ilk soru “ne sıklıkta oluyor?”dur. Buna prevalence diyebiliriz. İkinci soru “tahmin ettiğim oran gerçekleşen orana yakın mı?”dır; bu rate calibration meselesidir. Üçüncü soru ise “hangi kategorilerde artış, hangilerinde azalış olacağını doğru yakalıyor muyum?”dur; bu directional accuracy'dir.

Görselin işi: prevalence, calibration ve directional accuracy'nin üç farklı ölçüm aleti olduğunu anlatıyor.

Prevalence: Önce Düzgün Say

“3 olay gördüm” cümlesi tek başına anlamsızdır. 10 denemede 3 olay bambaşka, 10.000 denemede 3 olay bambaşkadır. Oran, örneklem ve belirsizlik birlikte okunmalıdır.

Oran ve belirsizlik

Baseline Olmadan İyi Kötü Yok

Bir tahminin iyi olup olmadığını anlamak için karşılaştırma gerekir. Önceki modelin oranı, challenging prompt baseline'ı, sabit previous-rate tahmini veya basit bir kural: hepsi “neye göre iyi?” sorusunu cevaplamak için vardır.

Calibration: Termometre Doğru Dereceyi Gösteriyor mu?

Bir sistem “bu davranış %2 olacak” diyorsa ve uzun vadede benzer tahminler gerçekten yaklaşık %2 çıkıyorsa kalibrasyonu iyidir. Sürekli yüksek tahmin ediyorsa alarmist, sürekli düşük tahmin ediyorsa kör olabilir. Calibration, yönü değil seviyeyi sınar.

Nadir Olaylarda Lineer Düşünme Bozulur

%0.1'den %1'e çıkmak ile %1'den %10'a çıkmak ikisi de 10x artıştır. Yüzde puan farkı bunu saklar. Bu yüzden paper'da multiplicative error, median multiplicative error ve log ölçek gibi kavramlar önem kazanır.

Görselin işi: nadir olaylarda yüzde puan farkından çok çarpan/log ölçek düşünmenin neden daha doğal olduğunu gösteriyor.

Lineer fark mı, çarpan hatası mı?

Directional Accuracy: Seviyeyi Değil, Yönü Yakalamak

Bir tahmin sistemi seviyede kusurlu olabilir ama yönü iyi yakalayabilir. Mesela bütün oranları 5x yüksek tahmin eder, fakat hangi davranışın artacağını doğru söyler. Launch kararında bazen yön bilgisi bile değerlidir; ama rate calibration kadar güçlü bir kanıt değildir.

Ölçüm Dürüstlüğü: Cevabı Görmeden Tahmin Etmek

Preregistration ve outcome-blinded prediction, istatistik süsü değildir. Sonucu gördükten sonra hikaye kurmayı engeller. İyi eval sadece metrik seçmek değil, ölçümü sonradan kendine yontmayacak süreç tasarlamaktır.

Okuma Kontrolü

Prevalence, calibration ve direction neden ayrılır?