← Blog

Deployment Simulation serisi · 3/10 · 21 Haziran 2026 · 23 dk

Deployment Simulation Nasıl Çalışır?

Deployment Simulation'ı anlamanın en iyi yolu notasyonla değil sahneyle başlamak: eski modelin oynadığı gerçek sahne duruyor, eski replik siliniyor, yeni oyuncu aynı sahnede ne söyleyecek diye deneniyor.

İçindekilerCanlıya Almadan Neyi Bilemeyiz?Sample → Prefix → Generate → AuditX→Y Notasyonu Ne Demek?Prevalence: Kalite Puanı Değil, Görülme SıklığıTahmin Sonra Nasıl Kontrol Edilir?Tek Turn, Tool State ve Dağılım KaymasıOkuma Kontrolü

Canlıya Almadan Neyi Bilemeyiz?

Bir modeli canlıya almadan önce benchmark skorunu, targeted eval sonuçlarını ve red-team bulgularını görebiliriz. Ama yine de şunu tam bilemeyiz: gerçek kullanıcı konuşmalarında, eski modelin yerine bu aday model olsaydı ne yapardı?

Deployment Simulation bu soruyu counterfactual bir şekilde sorar. Gerçekleşmemiş bir dünyayı düşünür: “X modeli, Y modelinin trafiğinde cevap verseydi?”

Sample → Prefix → Generate → Audit

Akış dört adıma indirilebilir. Önce uygun production konuşmalarından kullanıcı turn'leri örneklenir. Sonra konuşmanın user mesajına kadar olan prefix'i sabit tutulur. Eski assistant cevabı çıkarılır. Aday model aynı bağlama cevap verir. Son olarak bu cevaplar insan, LLM grader veya monitor prosedürleriyle etiketlenir.

Görselin işi: user turn'ünden sonra eski devamın kesilip aday modelin cevabının üretildiği ana mekanizmayı gösteriyor.

X→Y Notasyonu Ne Demek?

Paper'daki X→Y notasyonu şunu anlatır: X aday modelini, Y modelinin önceki deployment trafiği üzerinde simüle etmek. Mesela 5.1→5, GPT-5 prefix'leri üzerinde GPT-5.1 cevabı üretmek gibi okunur.

Kritik ayrım: rc(X→Y), X'in Y trafiğindeki simüle edilmiş davranış oranıdır. rc(X), X gerçekten deploy edildikten sonra ölçülen davranış oranıdır. Aynı şey değildir.

Prevalence: Kalite Puanı Değil, Görülme Sıklığı

Simülasyon sonucunda bir kategori için “kaç davranış görüldü?” diye sayarsın. 1000 simüle cevapta 12 tool-use deception etiketi varsa, kaba oran %1.2'dir. Bu oran kalite puanı değil, davranışın o dağılımda görülme sıklığıdır.

Mini prevalence hesabı

Tahmin Sonra Nasıl Kontrol Edilir?

Yöntemin güzel yanı, release sonrası doğrulanabilir olmasıdır. Model canlıya çıktıktan sonra gerçek deployment trafiğinde aynı davranış kategorileri ölçülür ve simülasyon tahminleriyle karşılaştırılır. Hava tahmini gibi: tek başına tahmin değil, tahminin gerçekleşen dünyayla kalibrasyonu da önemlidir.

Görselin işi: simülasyon trafiği ile gerçek deployment trafiğinin aynı olmadığını anlatıyor.

Tek Turn, Tool State ve Dağılım Kayması

Tek assistant response simülasyonu hata birikimini azaltır ama çok turn'lü etkileri kaçırabilir. Tool-heavy görevlerde prefix metni tek başına yetmez; dosya durumu, API cevabı, network hatası ve repo snapshot gibi dış dünya parçaları gerekir. Bir de yeni model kullanıcı davranışını değiştirirse, eski prefix dağılımı geleceğin eksik bir gölgesi olur.

Okuma Kontrolü

X→Y notasyonunda asıl sezgi nedir?