Ana Sayfa
>
İçerikler
>
Jev nedir, LLM'den ne farkı var? Üç günde çıkan on örnek

Jev nedir, LLM'den ne farkı var? Üç günde çıkan on örnek

September 19, 2026
6
DK OKUMA
Mustafa Dalcı
Brick Institute
Co-Founder

Bir LLM'e açık uçlu soru sorarsın, Jev'e şıklı soru: şıkları sen yazarsın, o birini işaretler ve yanına yüzde kaç emin olduğunu koyar. Farkı rakamlarla koyduk, üç günde çıkan on örneğe baktık.

Bir modele soru sorup cevabını okumaya alıştık. Jev'e soru sorduğunda okuyacak bir şey yok: kararı doğrudan kodun içine düşüyor.

15 Eylül'de TypeSafe adında bir şirket Jev'i çıkardı. Kurucusu Diogo Almeida, ChatGPT'yi ortak icat eden ekipten. İki yıl sessiz kalmış, sonra bir sohbet modeli değil, konuşmayan bir model yayınlamış.

Üç gün sonra X'te tuhaf bir şey oldu. Birbirinden habersiz insanlar, birbirine hiç benzemeyen işlerde aynı şeyi keşfetti: bağlam sıkıştırma, uygulama başlatıcı, tablo, bilgisayar kullanımı, reklam analizi. Hadi önce farkı netleştirelim, örneklere sonra geleceğiz. Çünkü bu on örneğin hepsi tek bir ayrımdan besleniyor.

Temel ayrım

Açık uçlu soru ile şıklı soru

En basit haliyle: bir LLM'e açık uçlu soru soruyorsun, Jev'e şıklı soru.

LLM'den yapılandırılmış çıktı istediğinde aslında ondan bir kostüm giymesini istiyorsun. "Bana JSON ver" diyorsun, o da metin üretiyor, sen o metni ayrıştırıyorsun, sonra şemaya uyup uymadığını doğruluyorsun. Yapı modelin içinde değil, senin kurduğun katmanda. Bozulduğunda da orada bozuluyor.

Jev'e soruyu şıklarıyla birlikte soruyorsun. "Bu destek talebi acil mi, normal mi, düşük mü?" diyorsun ve üç şıkkı da sen yazıyorsun. Jev bir şıkkı işaretliyor, yanına da yüzde kaç emin olduğunu koyuyor. Ayrıştıracak metin yok, doğrulanacak şema yok. Uydurma da yapısal olarak mümkün değil: işaretleyeceği başka bir kutu yok çünkü.

LLM: açık uçlu soru
  • Cevap bir yazı, yapıyı sonradan sen giydirirsin
  • Kelime kelime, sırayla yazar
  • Ne kadar emin olduğunu cümlenin tonundan tahmin edersin
  • Kağıtta olmayan bir cevap uydurabilir
Jev: şıklı soru
  • Cevap işaretlenmiş bir şık, kod doğrudan dallanır
  • Bütün soruları tek seferde, aynı anda cevaplar
  • Her şıkkın yanında yüzde kaç emin olduğu yazar
  • Şıkların dışına çıkamaz

Adı da buradan geliyor. Kahneman'ın Sistem 1 ve Sistem 2 ayrımını hatırla: biri hızlı, sezgisel, anında yargı verir; öteki yavaş, adım adım düşünür. LLM'ler Sistem 2'yi taklit etmeye çalışıyor. Jev kendini açıkça Sistem 1'e yerleştiriyor ve yazma işini hiç üstlenmiyor.

Şık biçimleri de üç tane: Choice (verdiğin seçeneklerden birini işaretler), Score (verdiğin ölçeğe göre puan verir), Noul (0 ile 1 arasında bir değer döner, yani "ne kadar" sorusunun cevabı). Üçünü tek çağrıda birleştirebiliyorsun, hepsi aynı anda değerlendiriliyor.

Giren: uygulamanın durumu ve şıklarıyla bir soru. Çıkan: işaretlenmiş şık ve güven yüzdesi. Kaynak: OpenRouter.

Peki bu ayrım rakamlara nasıl yansıyor? TypeSafe'in kendi karşılaştırma tablosu şöyle:

BoyutLLMJev
ÇıktıÜretilmiş metinİşaretlenmiş şık ve güven yüzdesi
Üretim biçimiSıralı, kelime kelimeParalel, tek sorguda
Cevap süresi3 ila 329 saniye70 ila 500 milisaniye
Girdi fiyatıMilyon token başına 0,20 ila 10 dolarMilyon token başına 0,042 dolar
Çıktı fiyatıGirdinin yaklaşık 5 katıÜcretsiz
Uydurmaİyileşti ama sürüyorYapısal olarak mümkün değil

Asıl haber model değil, kararın fiyatı.

Peki bununla ne yapılıyor? On örnek

Buraya kadar teknik. Açıkçası bizi asıl durduran şey, bu ayrımın üç gün içinde kaç farklı yere sızdığı oldu. Seçkinin tamamı aşağıda:

Brick Radar W39, on örneğin tamamı dört dakikalık seçki halinde.
Ne yapılmışSorulan şıklı soruÖlçek
Anlık compactionBu tool çağrısı hala gerekli mi156 bin token, 62 bine
Niyet okuyan launcherBu tuş dizisiyle hangi dosyayı istiyorHer tuşta 100 ms
Anlamı hesaplayan tabloBu satır ne kadar acilSatır başına 100 ms
Ekran görüntüsüz computer useHangi butona basmalıyımKarar başına 90 ms
Reklam kütüphanesi analiziBu reklamın kancası, formatı, aşaması ne724 reklam, 40 saniye, 9 sent
Paralel kırma testiBu ekran doğru mu render olduOnlarca koşu, kuruşlar
Lead puanlamaBu mesaj bu kişiye uyuyor mu700 lead, 9 sent
Canlı yorum yönlendirmeBu yorum soru mu, istek miYayın akışında anlık
Konuşurken slayt seçimiŞu an hangi slayt açılmalıKonuşma hızında
Slop dedektörüBu paragraf yapay mı10 bin kelime, 2 saniye

Bir: daha önce sorulmayan sorular

Bu grubun ortak yanı, soruların yeni olmaması. "Bu tool çağrısı hala gerekli mi" sorusunu bir LLM'e de sorabilirdin. Her adımda saniyeler ve kuruşlar harcamaya razıysan tabi. O yüzden sormuyorduk: ya bir kurala bağlıyorduk ya da kullanıcıya soruyorduk.

Compaction örneği bunun en net hali. 2026'da bağlam sıkıştırma hala bir özetleme istemi, çünkü her tool çağrısını tek tek puanlamak pahalıydı. Jev puanlıyor, alakasızı atıyor, 156 bin token 62 bine iniyor. Özet yok, eleme var.

Her tool çağrısı puanlanıyor, alakasız olan düşüyor. Kaynak: tamarajtran.

İki: arayüzün kendisi karar vermeye başlıyor

Launcher'lar takma ada ve bulanık eşleşmeye göre sıralar. Bir tanesi artık niyete göre sıralıyor: "indirdiğim pdf" yazıyorsun, sen cümleyi bitirmeden doğru dosya başa geliyor. Aynı fikrin tablo hali de var: sütunun başına "Aciliyet" yazıyorsun, satırlar formülsüz puanlanıyor.

İşte tam burada ürün tarafındaki asıl soru çıkıyor. Bu iki örnekte de kullanıcı yeni bir şey öğrenmiyor, mevcut arayüz daha iyi tahmin ediyor. Yani kazanç bir özellikte değil, bir gecikmede.

Üç: gözü olmayan bilgisayar kullanımı

En sevdiğimiz örnek bu oldu (ufak bir araya gireyim: gizlilik tarafı yüzünden). Yerel bir CoreML modeli ekrandaki her butonu kutuluyor, cihazdaki OCR etiketleri okuyor, Jev'e giden tek şey o metin oluyor. Butonlar şık, Jev birini işaretliyor. Karar başına 90 milisaniye ve tek bir piksel bilgisayardan çıkmıyor. Ekran görüntüsü göndermeden bilgisayar kullanımı, sahici bir fark.

Karşı cephe

Seçkinin içinden çıkan itiraz

Bu kadar övgünün ortasında en sert itiraz da aynı haftadan geldi. Biri Qwen 4b üstüne küçük bir sınıflandırıcı eğitti ve benzerini yaptı. Bir başkası açık bir modelle Jev uyumlu bir API yayınladı. İkisi de Doom'u aynı şekilde oynatıyor.

Bu itiraz ciddiye alınmalı, çünkü ortada iki ayrı iddia var. Birincisi "yeni bir model kategorisi doğdu", ikincisi "var olan bir yetenek doğru fiyatlandı ve doğru paketlendi". Üç günlük demolar ikisini ayırmaya yetmiyor.

Qwen 4b üstüne eğitilmiş küçük bir sınıflandırıcı, aynı Doom demosunu oynatıyor. Kaynak: justALEXWORTEGA.
Kaynak sınırı

Bu bir seçki, örneklem değil. On örnek de yapımcılarının kendi paylaştığı demolardan geliyor; çalışmayan denemeler paylaşılmıyor, dolayısıyla burada görünmüyor. Yukarıdaki karşılaştırma tablosu da bağımsız bir ölçüm değil, TypeSafe'in kendi yayınladığı rakamlar. LLM tarafı için verilen 3 ila 329 saniye aralığı hangi modellerde, hangi görevlerde ölçüldü, açıklanmamış. Kalıbın var olduğu kesin. Kalıbın tuttuğuna dair kanıt henüz yok.

Bizim duruşumuz

"Jev gerçekten yeni mi" sorusu bize yanlış soru gibi geliyor. Çünkü cevabı ne olursa olsun senin yarın yapacağın şey değişmiyor.

Asıl soru şu: ürününde "bunu AI'a sormak pahalı" diye geçiştirdiğin kaç karar var? Bu satır acil mi, bu yorum şikayet mi, bu kullanıcı hangi butona basmak istiyor, bu ekran doğru mu render oldu. Her birini ya bir kurala bağladın ya kullanıcıya sordun ya da hiç sormadın. O kararların listesi, ekibinin kafasında değil kodun içinde duruyor ve kimse onu çıkarmamış.

Bana kalırsa bu haftanın asıl getirisi Jev değil, o listeyi çıkarmak için bir sebep. Fiyat düşerse liste açılır; düşmezse bile listeyi bilmek işine yarar.

İpucu

Bu hafta bir oturumda ekibinle şu egzersizi yap: ürününde kullanıcıya sorduğun ya da sabit bir kurala bağladığın kararları tek tek yaz. Sonra her birinin yanına iki şey ekle: bu karar saniyede kaç kez veriliyor ve yanlış olduğunda ne oluyor. Sık verilen ve yanlışı ucuz olan kararlar, bu tip modellerin ilk gireceği yer. Liste yirmi satırı geçiyorsa zaten cevabı bulmuşsun demektir.

Sen hangi kararı AI'a sormaktan vazgeçmiştin, sırf pahalı diye? Yorumlarda paylaşırsan sevinirim, cevabın muhtemelen bu yazıdaki on örnekten daha ilginç.

Bir sonraki radar sayısında görüşmek üzere. Sevgiyle kalın! 🧱

Yaklaşan etkinlik

Alive Konf BAKU — Biletler Satışta

1-2 Ekim 2026
Hilton Baku
20+ konuşmacı, 2 gün
0
Gün
00
Saat
00
Dakika
Konular
ogrenme
kariyer
AI Ajanları
ai-agent
erisilebilirlik
arastirma-raporlari
pazarlama
liderlik
design
product
Yapay Zeka
ai

Diğer İçerikler

Tüm yazılar
Alive Bülten

Canlı kalmanın iki haftalık dozu.

Tasarım, ürün ve yapay zekadan seçtiğimiz en iyi okumalar, iki haftada bir çarşamba posta kutunda.

E-posta
Teşekkürler! Kaydın alındı, ilk bülten çarşamba posta kutunda.
Bir şeyler ters gitti. Lütfen tekrar dene.