Ana Sayfa
>
İçerikler
>
Bu cevap doğru mu? AI ürününde yanlış soru

Bu cevap doğru mu? AI ürününde yanlış soru

October 1, 2026
8
DK OKUMA
Rufat Mirza
AI Senior Product Manager

Yandex'te Yazeka'nın ürün tarafını yöneten Rufat Mirza, AI cevaplarını doğru-yanlış yerine daha iyi-daha kötü ekseninde ölçüyor: yönerge, sorgu sepeti, LLM hakemler, kör rakip karşılaştırması ve hatayı sepete geri taşıyan bir döngü.

Bir AI ürünü için yazdığın cevap doğru mu, yanlış mı? Yandex'te Türkiye aramasının ve AI asistanı Yazeka'nın ürün tarafını yöneten Rufat Mirza'ya göre bu soru baştan yanlış. AI'da doğru ya da yanlış yok; daha iyi ya da daha kötü var. Ölçmenin işi de tam burada başlıyor.

Rufat konuşmaya ürün yönetiminin eski bir kuralıyla girdi: ölçmediğin şeye sahip değilsin. AI ürünlerinde bu kural daha da sert işliyor, çünkü klasik yazılımdan bir noktada ayrılıyorlar. Deterministik değiller. Aynı soruya her seferinde aynı cevabı vermiyorlar. Rufat'ın ifadesiyle, bu yüzden bir AI ürününe olduğu haliyle güvenemezsin. Güveni sistematik bir yöntemle kurman gerekiyor.

Problem

Tek bir tarif sorgusu

Konuşmanın tamamı tek bir sorgunun etrafında döndü. Rufat salona Azerbaycan pazarı için bir yemek uygulaması geliştirdiğimizi hayal ettirdi ve şu sorguyu gösterdi: “Elimde tavuk filetosu, patates, soğan, domates ve zeytinyağı var. İki kişilik, en fazla 30 dakikada hazırlanan bir yemek tarifi yaz.”

İlk cevap iki kısa paragraftı. Malzemeler ve pişirme adımları aynı metnin içinde. Rufat salona sordu: bu cevap yanlış mı? Birkaç el kalktı. Doğru mu? Yine birkaç el. Asıl soruyu sonra sordu: bu cevap daha iyi olabilir mi? Bu sefer salonun çoğu el kaldırdı.

Aynı tarif sorgusuna üç cevap: solda iki paragraflık düz metin, ortada malzemeleri ve adımları ayrı listeleyen ChatGPT cevabı tek başparmakla, sağda fotoğraflı, kalori ve süre bilgili Yazeka cevabı çift başparmakla işaretli
Aynı sorguya üç cevap. Soldaki yanlış değil; sadece daha iyileri var. Kaynak: Alive Baku sunumu.

Ortadaki ChatGPT cevabı malzemeleri ve hazırlanışı ayrı bölümlerde veriyor; Rufat buna bir başparmak verdi. Sağdaki ise Yandex Türkiye ekibinin geçen yıl kurduğu cevap: birden fazla tarif seçeneği, malzemelerin tek tek görselleri, hazırlanışı anlatan videolar, kalori ve süre bilgisi. Üstüne tarifin malzemelerini tek tıkla bir market teslimat uygulamasından sipariş etme imkanı. Rufat bunun bir övünme olmadığını, sadece çift başparmağı neyin hak ettiğini göstermek istediğini söyledi.

Bu ürün daha iyi olabilir mi? Bu soruyu sormak senin işin. Bugün en iyi kabul edilen cevabı alıp yarın daha iyisine itmek.

Rufat Mirza, Yandex · Senior Product Manager

Rufat'a göre insan muhakemesinin ve zevkin hala değerli olduğu yer burası: her şey bu kadar hızlı değişirken, iyi kabul edilen bir şeyi alıp ileri taşımak.

Spektrum

Doğru ya da yanlış değil, beş basamak

Kötü tarafın da dereceleri var. Rufat aynı tarifi bu kez İngilizce gösterdi. İçerik neredeyse ChatGPT cevabı kadar düzgündü ama Azerbaycan'da mutfağında yemek yapan bir kullanıcı için yanlış dildeydi. Bunun bir altı da var: İngilizce cevabın içine Çince karakterler karışmış bir versiyon. Bu sadece dil hatası değil, itibar hatası. Kullanıcıya eski ve ucuz bir model kullandığını söylüyor. Bir girişim için tolere edilebilir, büyük bir şirket için edilemez.

İki kötü cevap: solda İngilizce tarif içine Çince karakterler karışmış, çift aşağı başparmakla; sağda düzgün ama İngilizce yazılmış tarif, tek aşağı başparmakla
Yanlış dil bir basamak düşürüyor; araya karışan yabancı karakterler bir basamak daha. Kaynak: Alive Baku sunumu.

Böylece elinde beş basamaklı bir ölçek oluyor: çift aşağı başparmaktan çift yukarı başparmağa. Tek bir örnekten sonra bile yeni gelen her cevabı bu ölçeğin bir yerine koyabiliyorsun.

Kırmızıdan turkuaza beş renkli sütundan oluşan ölçek: çift aşağı başparmak, aşağı başparmak, omuz silken emoji, yukarı başparmak, çift yukarı başparmak
Değerlendirme ölçeği. Sunumun geri kalanında puanlar -2 ile +2 arasında bu basamaklara karşılık geliyor. Kaynak: Alive Baku sunumu.
Yöntem

Yönerge, sepet ve hakem

Tek bir sorgudan iki şey çıkıyor. Birincisi bir kural listesi. Rufat sadece bu tarif örneğine bakarak on kadar kural sıraladı:

İyi bir tarif cevabı için yönergeden örnekler
Cevap kullanıcının dilinde olmalı, yabancı karakter içermemeli.
Belirsiz sorgularda birden fazla tarif sunmak daha iyi.
Tarif yerel malzemelerle yapılabilmeli.
Güçlü alerjenler belirtilmeli, kalori bilgisi verilmeli.
Malzemeler ve adım adım hazırlanış ayrı gösterilmeli.
Malzemelerin küçük ikon ya da görselleri olmalı; cevap tarifi anlatan bir görselle açılmalı.
Videoyla desteklenen tarifler daha kullanışlı.

Bunları tek bir belgede topladığında bir yönergen (guideline) oluyor. İkincisi tek sorgunun yetmemesi. On, yüz, bin sorguda ne olacağını görmek için bir veri setine ihtiyacın var. Yandex bunun adına sepet (basket) diyor.

Sepeti kurmanın iki ucu var. Bir ucu yarım saatlik iş: ekip arkadaşlarınla oturup gerçek hayatta karşılaşacağını düşündüğün 50-100 kullanıcı senaryosunu yazıyorsun, sonra bir AI'a verip çoğaltmasını istiyorsun. Öbür ucu altı ay gece gündüz çalışan bir ekip. Çünkü kullanıcılar senin hayal ettiğin düzgün sorguları getirmiyor: uygunsuz içerik, sohbet, etik açıdan sorunlu talepler, hepsi geliyor. Yandex'te bunlar için ayrı bir ekip çalışıyor. Başlangıç için gereken şey kullanıcı davranışını temsil eden bir sepet.

Sonra hakem devreye giriyor. Sepetten bir sorgu alıyorsun, kendi modeline veriyorsun, cevabı alıyorsun. Sorguyu, cevabı ve yönergeyi güçlü bir LLM'e verip “bu yönergeye göre cevabı değerlendir” diyorsun. LLM bir karar (verdict) döndürüyor. Bunu sepetteki her sorgu için tekrarlıyorsun.

LLM hakem akışı: beş sorgu modele giriyor, beş cevap çıkıyor, cevaplar yönergeyle birlikte hakem LLM’e veriliyor ve her biri için bir karar çıkıyor
LLM-as-a-judge: sorgu, cevap ve yönerge hakem modele gidiyor; her sorgu için bir karar dönüyor. Kaynak: Alive Baku sunumu.

Kararlar sadece geçti/kaldı değil, neden kaldığını da söylüyor: tarif uydurma bir malzeme içeriyor (doğruluk), bulunması zor malzemeler var (yerellik), adım adım hazırlanış yok (kullanışlılık). Örnekte beş karar var ama Rufat'a göre yüze çıktığında sonuç istatistiksel olarak anlamlı olmaya başlıyor. O noktada “sistemim zamanın yüzde 60'ında iyi çalışıyor, kalan yüzde 40'ta şu şu şekillerde sorunlu” diyebiliyorsun.

Yönerge büyüyünce hakemlere bölünür

Yüz sorguyu değerlendirdiğinde o kadar çok kural birikiyor ki tek belge taşımıyor. Belgeyi parçalara ayırıyorsun: etik, dil yetkinliği, kullanışlılık, doğruluk ve diğerleri. AI dünyasında bunlara yönerge değil hakem (judge) deniyor. Her hakem aslında bir prompt.

Beş renkli bölgeye ayrılmış şema: Etik, Dil Yetkinliği, Kullanışlılık, Diğer hakemler ve ortada Doğruluk; her bölgede o hakemin sorduğu örnek sorular
Hakemler: her biri kendi sorularını soran ayrı bir prompt. Kaynak: Alive Baku sunumu.

Bu sürecin en işe yarar çıktısı bir yapılacaklar listesi. Ekip hangi sorunun ne sıklıkla çıktığını görüyor ve önceliklendiriyor. Tariflerde ilgisiz yemek görselleri çıkıyorsa yüksek öncelik. Malzeme ve hazırlanışta çelişen bilgi varsa yüksek öncelik. Anahtar bilgilerin kalın yazılması gibi iyileştirmeler düşük öncelik.

Rakip

Kör karşılaştırma ve tek metriğin yanıltması

Rufat'ın ikinci önemli pratiği rakip karşılaştırması (side-by-side). Sadece kendi yönergene göre değerlendirmek yetmiyor; rakip ne yaparsa yapsın, her zaman sende olmayan bir şeyi vardır. Yandex'in Google'dan ve ChatGPT'den çok şey öğrendiğini açıkça söyledi.

Yöntem şöyle: aynı sorgular beş farklı modele veriliyor, biri rakip. Ekipten biri model etiketlerini gizliyor, böylece kimse kendi ürününe taraf tutamıyor. Herkes cevapları aynı -2 ile +2 ölçeğiyle puanlıyor. Sunumdaki tablo, Yandex'in gerçek çalışma tablosunun anonimleştirilmiş hali.

Prototip ve rakip puan dağılımları: prototipin puanları -2 ile +1 arasında yayılmış, rakibin puanları +1 etrafında toplanmış ve -2 hiç yok
Aynı sepet, iki model. Ortalama yakın olabilir; dağılımın şekli bambaşka. Kaynak: Alive Baku sunumu.

Değerlendirmenin sonunda elinde birkaç sayı oluyor. Sunumdaki örnek tablo neden tek bir metriğe bakmaman gerektiğini iyi gösteriyor:

MetrikPrototipRakip
Olumlu ya da çok olumlu cevap oranı%70%64
Kritik hata oranı (çift aşağı başparmak)%5%2
Etik sorunlu cevap oranı%1'in altında%1'in altında
Kullanışlılık sorunu oranı%10%14
Ortalama ilk token süresi (TTFT)9 sn6 sn
Kazanma / kaybetme oranı%45%55

Prototip olumlu cevap oranında önde ama kritik hatada geride, daha yavaş ve doğrudan karşılaştırmada kaybediyor. Sadece olumlu cevap oranına bakan bir ekip yanlış bir zafer ilan ederdi. Kritik hataların çift aşağı başparmak olduğunu hatırla: tek bir Çince karakterli tarif, on iyi tariften daha çok konuşulur.

Not

Tablodaki sayılar bir örnek

Tablo sunumdaki örnek bir değerlendirmeden; Yandex'in yayımladığı bir ürün karşılaştırması değil ve rakibin adı verilmiyor. Sayıların değeri mutlak düzeyde değil, metrikler arasındaki gerilimi göstermesinde. Kendi sepetin ve kendi hakemlerinle çok farklı sonuçlar alman doğal.

Rufat bir noktanın altını özellikle çizdi: “rakip” yazan sütun senin geçen yılki modelin de olabilir. Önemli olan ölçümün aynı sepetle ve aynı (gelişen) kurallarla tekrar tekrar yapılması. Bir kez ölçtüğünde elinde bir nokta var. On kez ölçtüğünde bir grafik var. Grafik olunca raporlayabiliyor, KPI'ına ulaşıp ulaşmadığını gösterebiliyorsun.

Döngü

Hatalı sorgu sepete geri döner

Konuşmanın son slaytı bütün fikri tek bir döngüde topladı. Bu bir kez yapılan bir iş değil, sürekli dönen bir süreç.

Dört parçalı döngü: Sepet ve Yönergeler, LLM Hakemleri ve Rakip Karşılaştırması, Analiz ve Düzeltmeler, Yayın ve Kullanıcı Geri Bildirimi
Değerlendirme döngüsü: yayından gelen her hata yeni bir test sorgusu olur. Kaynak: Alive Baku sunumu.

Bir sorgu ve on kuralla başlıyorsun. Hakemlere ve rakip karşılaştırmasına veriyorsun. Analiz edip düzeltiyorsun. Test kullanıcılarına ya da canlıya çıkıyorsun. Gelen hataları, kullanıcının beğenmeme butonuna bastığı sorgular dahil, aynen alıp sepete geri koyuyorsun. Döngü her döndüğünde sepet gerçek kullanıma biraz daha benziyor ve ürün ölçülebilir şekilde iyileşiyor.

Eval bir test aşaması değil, ürünün kendisini geliştirme biçimi.

Soru-cevap

Son üç ay, önceki iki yıldan fazla

Soru-cevap Türkçe ve Azerbaycanca karışık geçti. İlk soru kişiseldi: Rufat AI'ı kendi işinde ne zaman kullanmaya başladı? Cevabı, geçen yıl sorulsa “bir yıldır” diyeceği yönündeydi. Ama son üç ayda yeni modellerin art arda çıkmasıyla, önceki iki yılın toplamının kat kat fazlasını kullanmış.

Salondan gelen ek soru, her hafta yeni bir model çıkarken bunun stres yaratıp yaratmadığıydı. Rufat'ın cevabı dürüsttü: evet, iş yükü açısından stres var, çünkü her yeni model onun ekibi için yeni bir değerlendirme işi demek. Ama işini elinden alacağı korkusunu taşımıyor. Eskiden yazılım geliştiren biri olarak, yaratıcı bir şey üretmek için daha önce hiç sahip olmadığı araçlara şimdi sahip olduğunu söyledi.

İkinci soru yöntemin kendisine yönelikti: bugüne kadar insan değerlendiricilerin Excel'e işlediği puanlamayı LLM'e devretmek sadece bir hızlanma mı, yoksa yeni bir şey mi? Rufat ikisinin de olduğunu söyledi. Bu işleri iki yıl kadar önce LLM'lere vermeye başladıklarında amaç hızdı. Ama bir noktada hızlanmanın ötesine geçti: araçlar daha önce mümkün olmayan derinlikte analiz yapmayı mümkün kıldı. Artık sadece zaman değil, içgörü kazandırıyor.

Çıkarım

Yarın başlamak için yarım saat yeter

Ekibinle otur, ürününe gelen 50 gerçekçi sorguyu yaz ve bir AI'a çoğalttır. Tek bir sorguya verdiğin cevabı alıp “bu daha iyi olabilir mi” diye sor; cevaplarından ilk on kuralını çıkar. Sonra aynı sepeti bir LLM hakeme ver. İlk ölçümün kusurlu olacak; önemli olan aynı sepetle ikinci kez ölçebilmen.

Senin ürününde “daha iyi” cevabı bugün kim tarif ediyor: bir yönerge mi, yoksa toplantıdaki en yüksek ses mi? 🧱

Alive Baku etkinlik sayfası, konferansın diğer konuşmaları ve programı burada.

Yaklaşan etkinlik

Alive Konf BAKU — Biletler Satışta

1-2 Ekim 2026
Hilton Baku
20+ konuşmacı, 2 gün
0
Gün
00
Saat
00
Dakika
Konular
ogrenme
kariyer
ai-agent
erisilebilirlik
arastirma-raporlari
pazarlama
liderlik
design
Ürün Yönetimi
product
Yapay Zeka
ai
Alive Baku

Diğer İçerikler

Tüm yazılar
Alive Bülten

Canlı kalmanın iki haftalık dozu.

Tasarım, ürün ve yapay zekadan seçtiğimiz en iyi okumalar, iki haftada bir çarşamba posta kutunda.

E-posta
Teşekkürler! Kaydın alındı, ilk bülten çarşamba posta kutunda.
Bir şeyler ters gitti. Lütfen tekrar dene.