← Blog

Deployment Simulation serisi · 6/10 · 21 Haziran 2026 · 23 dk

Evaluation Awareness: Model Test Edildiğini Anlarsa Ne Olur?

Evaluation awareness'i “model bizi kandırıyor mu?” diye değil, “eval sinyali gerçek deployment davranışını ne kadar bozuyor?” diye okumak daha doğru.

İçindekilerSınav Odası EtkisiEvaluation Awareness Nedir, Ne Değildir?Neden Eval'i Bozar?Üç Sinyal: Sınıflandırma, CoT, MetagamingTraditional Eval Neden Test Gibi Kokar?Deployment Simulation Ne Değiştiriyor?CoT Ground Truth DeğildirOkuma Kontrolü

Sınav Odası Etkisi

İnsanlar mülakatta, sınavda veya denetlendiğini bildiği bir ortamda farklı davranır. Bu her zaman kötü niyet değildir; bağlam davranışı değiştirir. Model eval'larında da benzer bir problem vardır: görev test gibi kokuyorsa, ölçtüğümüz davranış gerçek kullanım davranışı olmayabilir.

Görselin işi: aynı sistemin test odasında ve gerçek görev bağlamında farklı davranabileceği sezgisini kuruyor.

Evaluation Awareness Nedir, Ne Değildir?

Awareness bir sinyal algısıdır: model bağlamın eval olabileceğine dair ipuçları yakalar. Deception ise stratejik yanlış temsil davranışıdır. Sandbagging ise kabiliyeti düşük gösterme örüntüsüdür. Bunlar ilişkili olabilir ama aynı şey değildir.

Neden Eval'i Bozar?

Eval'in amacı deployment davranışını tahmin etmekse, eval bağlamının davranışı değiştirmesi ölçümü bozar. Model test kokusu aldığında daha güvenli, daha temkinli, daha performatif veya tam tersine daha stratejik davranabilir. Bu da safety ve capability ölçümlerini çarpıtabilir.

Üç Sinyal: Sınıflandırma, CoT, Metagaming

OpenAI yazısında evaluation awareness için birkaç sinyal türü öne çıkıyor: model trajectory'nin production mı eval mı olduğunu ayırt edebiliyor mu; chain-of-thought içinde “bu bir test olabilir” gibi ifadeler var mı; model evaluator beklentisi üzerinden akıl yürütüyor mu?

Eval mi production mı?

“Aşağıdaki prompt, nadir ve çok steril bir politika sınırını tek cümlede zorluyor; gerçek kullanıcı bağlamı yok.”

Traditional Eval Neden Test Gibi Kokar?

Sentetik promptlar fazla temizdir. Benchmark formatı tekrarlıdır. Görevler garip biçimde yoğun risk taşır. Tool ortamı yapaydır. Kullanıcı geçmişi, dosyalar, yanlış anlamalar, yarım kalan işler ve sıradan bağlam çoğu zaman yoktur. Bunların hepsi test kokusudur.

Deployment Simulation Ne Değiştiriyor?

Production conversation prefix'i kullanmak, eval bağlamını gerçek kullanıma yaklaştırır. Bu, awareness problemini bitirmez; ama test kokusunu azaltır. O yüzden doğru ifade “çözüyor” değil, “daha production-like bağlamla ölçüm bozulmasını azaltıyor” olmalı.

Görselin işi: evaluator modeli izlerken modelin de izlenme ipucunu fark edebileceği metagaming durumunu gösteriyor.

Test kokusu azaltıcıları

CoT Ground Truth Değildir

Chain-of-thought içinde eval farkındalığı görmek önemli bir sinyal olabilir. Ama CoT'u zihnin penceresi gibi kesin okumak da hatalıdır. Günlük tutmak düşüncenin tamamı değildir. CoT monitorability değerli ama kırılgan bir ölçüm kanalıdır.

Okuma Kontrolü

Evaluation awareness için en dikkatli okuma hangisi?