← Blog

Deployment Simulation serisi · 7/10 · 21 Haziran 2026 · 25 dk

Agentic AI ve Tool-Use Neden Evaluation'ı Zorlaştırıyor?

Klasik eval tek cevabı puanlar. Agentic eval ise bir yolculuğu, yani tool call'lar, repo state, network cevabı, ara kararlar ve yan etkilerle dolu bir trajectory'yi anlamaya çalışır.

İçindekilerCevap Değil, GidişatBir Trajectory'nin AnatomisiCanlı Sistemde Eval Neden Tehlikeli?Replay ile Simulation Aynı Şey DeğilRealism MerdiveniPratik PlaybookOkuma Kontrolü

Cevap Değil, Gidişat

Bir chat modeline soru sorarsın, cevap alırsın, puanlarsın. Bir coding agent'a görev verdiğinde ise model dosya okur, arama yapar, test çalıştırır, hata alır, geri döner, başka dosya değiştirir. Son cevap sadece son yüzeydir; asıl davranış trajectory'dedir.

Görselin işi: final cevaptan çok o cevaba giden tool-call yolunun değerlendirilmesi gerektiğini gösteriyor.

Bir Trajectory'nin Anatomisi

Trajectory içinde prompt, ara düşünce, tool call, tool response, repo snapshot, network durumu, transient failure, retry ve final cevap vardır. Bu parçaların her biri davranışı değiştirir. Sadece final cevabı okumak, uçak kazasında sadece iniş anına bakmaya benzer.

Canlı Sistemde Eval Neden Tehlikeli?

Tool call'lar zararsız değildir. ls okumadır, git diff okumadır; ama git push, rm, POST /deploy veya veritabanı update'i yan etki üretir. Eval sırasında gerçek sistemlere yazmak güvenli değildir.

Bu tool call nasıl çalıştırılmalı?

POST /deploy gerçek production servisini tetikliyor.

Replay ile Simulation Aynı Şey Değil

Replay, geçmişte gerçekleşmiş aynı path'i tekrar oynatır. Fakat agent geçmişte yapılmamış bir tool call denerse ne olacak? İşte burada simulator gerekir. LLM tool-simulator, canlı sisteme dokunmadan makul bir tool response üretmeye çalışır.

Realism Merdiveni

Simulator'a sadece prompt verirsen zayıftır. Original rollout, repo snapshot, tool-call/response database ve read-only connector eklendikçe ortam daha gerçekçi olur. Ama yine de canlı dünya değildir; stale state ve eksik network durumu kalabilir.

Görselin işi: tool simulator gerçekçiliğinin rollout, snapshot, response DB ve read-only connector ile arttığını anlatıyor.

Simulator gerçekçiliği

Pratik Playbook

Okuma tool'ları çoğu zaman güvenli replay veya sandbox ile çalışabilir. Yazma tool'ları kontrollü ortam ister. Production etkisi olan call'lar simulate edilmeli veya insan onayına bağlanmalıdır. İyi agent eval, metric seçmeden önce ortam tasarlar.

Okuma Kontrolü

Agentic eval'da neden final cevap tek başına yetmez?