Nasıl yaparlar?
AI & Ajanlar

Evals’ı nasıl kurdular?

AI özelliği yayına çıktıktan sonra “iyi mi” sorusuna nasıl cevap verdiklerini, eval’ı kendi ürününde kurmuş ekipler anlatıyor.

4
cevap
4
şirket
2
kaynak türü
güncellendi
5 Eki 2026
ALIVE SENTEZİ

Dört ekip de eval’ı ölçmek için değil, bir şeyi düzeltmek için kurdu.

Dört cevabın üçünde eval gerçek veriyle başlıyor: bir müşteri şikayeti, üretim transkriptleri ya da agent’ın yapması gereken gerçek bir görev. Hepsinde sonuç bir aksiyona bağlanıyor: doküman PR’ı, prompt değişikliği, model seçimi. Ayrıştıkları yer judge’a ne kadar güvendikleri; iki ekip kalibre etmeden güvenmiyor.

Aşağıdaki
4
cevaptan çıkarıldı · güncellendi
5 Eki 2026
01
Eval gerçek veriden başlıyor: müşteri şikayeti, üretim transkripti ya da gerçek görev.
3 / 4
02
Kodla ölçülebilen ucuz kontrol önce geliyor, LLM-as-judge gerektiği yerde kullanılıyor.
2 / 4
03
Judge kalibre edilmeden ve tutarlılığı kontrol edilmeden sonucuna güvenilmiyor.
2 / 4
04
Eval sonucu doğrudan bir düzeltmeye bağlanıyor: doküman PR’ı, prompt, orkestrasyon ya da model seçimi.
4 / 4
Kanıtlar

Cevaplar 7 / 7

YAZI
1 Eki 2026
19 dk okuma
EN
VI
Vistaly
Teresa Torres
Vistaly’nin AI sentez servislerini geliştiriyor

Tek bir müşteri şikayetinden dört eval ve 16 deney çıkardı

Bir beta müşterisi, AI’ın ürettiği opportunity solution tree’de bir dalın fazla düz kaldığından şikayet etti. Teresa Torres önce ağacın biçimini kodla ölçen bir eval, sonra kaçırılan gruplamaları LLM-as-judge ile değerlendiren ikinci bir eval yazdı. Judge laboratuvarda kusursuz çalıştı ama üretim verisinde yüzde 90’ın üzerinde hata verdi; nedeni üst adımlardaki hatalardı. Bunlar için iki eval daha kurdu ve prompt ile model değişikliklerini 16 deney varyantında denedi. Sonunda çözümü prompt’tan orkestrasyona taşıdı: ağaç biçimi eval’ını guardrail olarak kullanan bir denetle ve düzelt döngüsü kurdu. 16. varyant bir hata türünü yüzde 78, diğerini yüzde 29 azalttı.

4 New Evals and 16 Experiment Variants to Fix 1 Customer Complaint
producttalk.org · Yazı · 19 dk

Alive notu:
Eval’ı başta doğru kuramadığını ve judge’ın üretimde nasıl çöktüğünü rakamıyla anlatıyor.
VIDEO
1 Eki 2026
EN
TO
Together AI
Charles Zedlewski
Chief Product Officer

Aynı görevi üç bağlamla koşturup dokümanındaki eksikleri buldu

Together AI’da agent’lar birçok ürünün çoğunluk kullanıcısı. Ürün ekibi, Claude Code’un yalnızca doküman ve bir API anahtarıyla gerçek görevleri tamamlayıp tamamlayamadığını ölçen agent eval’ları kurdu. Aynı görevi üç biçimde koşturuyor: yalnızca dokümanla, MCP sunucusuyla ve skill’lerle. Böylece hangi bağlam katmanının işe yaradığını görüyor. Sonuçlar bir iyileştirmeler sekmesinde somut düzeltmelere dönüşüyor; örneğin fine-tuning hızlı başlangıç sayfasındaki eksik bir linki düzelten doküman PR’ı. Ekip bu döngüden onlarca doküman düzeltmesi çıkardı.

“At this point, for a lot of our products, agents are already the majority user.” (Bugün birçok ürünümüzde agent’lar çoğunluk kullanıcı.)

Alive notu:
Eval’ı modelin değil kendi dokümanının kalitesini ölçmek için kullanıyor.
VIDEO
1 Eki 2026
47 dk
EN
WA
Warp
Zach Lloyd
Kurucu ortak ve CEO

Agent koşularını LLM-as-judge ile puanladı, model seçimini işleri yeniden koşturarak yaptı

Warp, Wilson adını verdiği yazılım fabrikasıyla ayda 2.000 PR gönderiyor. Sistem Slack, Linear ve GitHub’dan gelen istekleri alıyor, agent kodu yazıyor, testler otomatik koşuyor. Ekip her agent koşusunu LLM-as-judge ile puanlıyor. Maliyet ve kalite dengesini, aynı işleri farklı model konfigürasyonlarıyla yeniden koşturarak kuruyor ve PR başına maliyeti izliyor. Başarısız koşular sistemi iyileştirmek için geri besleniyor. PR başına insan müdahalesi sayısını otomasyon göstergesi olarak kullanıyor; darboğaz hala insan incelemesi.

Alive notu:
Eval’ı ayrı bir proje olarak değil, üretim hattının içinde sürekli çalışan bir ölçüm olarak kuruyor.
YAZI
1 Eki 2026
12 dk okuma
EN
AN
Anthropic
Lance Martin

Eval’ı train ve test olarak böldü, her turda tek değişiklik denedi

Anthropic ekibi eval tasarımındaki iki riski tarif ediyor: belirsiz görevlerle ve yüksek varyansla kurulan eval ve fark edilmeden eval’a aşırı uyum. Eval’ı üretim transkriptlerinden, hata raporlarından ve elle yazılmış örneklerden kuruyor; en ucuz grader’ı seçiyor ve grader tutarlılığını kontrol ediyor. İyileştirme turlarında eval’ı rastgele train ve test olarak bölüyor, her turda tek değişiklik öneriyor ve train artıp test yerinde sayarsa değişikliği geri alıyor. Kendi claude-api skill’inde geçme oranını 66.1%’den 87.9%’a çıkardı. Müşteri destek benchmark’ında doğruluk 74.4%’ten 98.9%’a çıkarken bilet başına maliyet 4.6 sentten yaklaşık 1 sente indi; ayrı tutulan test setinde sonuç 90.5% oldu.

Automating eval design and hillclimbing with Claude
claude.dev · Yazı · 12 dk

Alive notu:
Diğer cevaplar eval’ı kurmayı anlatırken bu yazı eval’a aşırı uyumu nasıl yakaladığını anlatıyor.
Soru hakkında

Bu soruyu neden sorduk?

AI özelliği olan her ekip aynı yere geliyor: demo çalışıyor, ama yayındaki çıktının iyi olup olmadığını kimse söyleyemiyor. Eval bu sorunun cevabı olarak anlatılıyor, fakat anlatıların çoğu genel rehber. Biz kendi ürününde kurmuş ekiplerin ne yaptığını görmek istedik.

Cevaplarda ortak nokta, eval’ın bir ölçüm projesi olarak değil bir düzeltme aracı olarak kurulması. Hangi veriden başladıkları, judge’a ne zaman güvendikleri ve sonucu neye bağladıkları ekipten ekibe değişiyor; soru bu farkları yan yana koyuyor.

İzle & dinle

Bu soruyla ilgili Alive içerikleri

No items found.
Devam et

Benzer sorular

Durum stilleri
Bu blok yalnızca Designer’da görünür, yayında gizlidir. Script’in eklediği durum sınıflarını (is-active, is-alive, is-brick, is-own, is-hl) buradan düzenleyebilirsin.
DIŞ KAYNAK
ALIVE
BRICK
UB
A
B
Dış kaynak kartı
Kendi içeriğimiz · is-own
Vurgulu · is-hl
Alive Bülten

Canlı kalmanın iki haftalık dozu.

Tasarım, ürün ve yapay zekadan seçtiğimiz en iyi okumalar, iki haftada bir çarşamba posta kutunda.

E-posta
Teşekkürler! Kaydın alındı, ilk bülten çarşamba posta kutunda.
Bir şeyler ters gitti. Lütfen tekrar dene.
© 2026 Alive Medya