Deployment Simulation serisi · 7/10 · 21 Haziran 2026 · 25 dk
Agentic AI ve Tool-Use Neden Evaluation'ı Zorlaştırıyor?
Klasik eval tek cevabı puanlar. Agentic eval ise bir yolculuğu, yani tool call'lar, repo state, network cevabı, ara kararlar ve yan etkilerle dolu bir trajectory'yi anlamaya çalışır.
İçindekiler
Cevap Değil, GidişatBir Trajectory'nin AnatomisiCanlı Sistemde Eval Neden Tehlikeli?Replay ile Simulation Aynı Şey DeğilRealism MerdiveniPratik PlaybookOkuma KontrolüCevap Değil, Gidişat
Bir chat modeline soru sorarsın, cevap alırsın, puanlarsın. Bir coding agent'a görev verdiğinde ise model dosya okur, arama yapar, test çalıştırır, hata alır, geri döner, başka dosya değiştirir. Son cevap sadece son yüzeydir; asıl davranış trajectory'dedir.

Bir Trajectory'nin Anatomisi
Trajectory içinde prompt, ara düşünce, tool call, tool response, repo snapshot, network durumu, transient failure, retry ve final cevap vardır. Bu parçaların her biri davranışı değiştirir. Sadece final cevabı okumak, uçak kazasında sadece iniş anına bakmaya benzer.
Canlı Sistemde Eval Neden Tehlikeli?
Tool call'lar zararsız değildir. ls okumadır, git diff okumadır; ama git push, rm, POST /deploy veya veritabanı update'i yan etki üretir. Eval sırasında gerçek sistemlere yazmak güvenli değildir.
Bu tool call nasıl çalıştırılmalı?
POST /deploy gerçek production servisini tetikliyor.
Replay ile Simulation Aynı Şey Değil
Replay, geçmişte gerçekleşmiş aynı path'i tekrar oynatır. Fakat agent geçmişte yapılmamış bir tool call denerse ne olacak? İşte burada simulator gerekir. LLM tool-simulator, canlı sisteme dokunmadan makul bir tool response üretmeye çalışır.
Realism Merdiveni
Simulator'a sadece prompt verirsen zayıftır. Original rollout, repo snapshot, tool-call/response database ve read-only connector eklendikçe ortam daha gerçekçi olur. Ama yine de canlı dünya değildir; stale state ve eksik network durumu kalabilir.

Simulator gerçekçiliği
Pratik Playbook
Okuma tool'ları çoğu zaman güvenli replay veya sandbox ile çalışabilir. Yazma tool'ları kontrollü ortam ister. Production etkisi olan call'lar simulate edilmeli veya insan onayına bağlanmalıdır. İyi agent eval, metric seçmeden önce ortam tasarlar.