Bir modele soru sorup cevabını okumaya alıştık. Jev'e soru sorduğunda okuyacak bir şey yok: kararı doğrudan kodun içine düşüyor.
15 Eylül'de TypeSafe adında bir şirket Jev'i çıkardı. Kurucusu Diogo Almeida, ChatGPT'yi ortak icat eden ekipten. İki yıl sessiz kalmış, sonra bir sohbet modeli değil, konuşmayan bir model yayınlamış.
Üç gün sonra X'te tuhaf bir şey oldu. Birbirinden habersiz insanlar, birbirine hiç benzemeyen işlerde aynı şeyi keşfetti: bağlam sıkıştırma, uygulama başlatıcı, tablo, bilgisayar kullanımı, reklam analizi. Hadi önce farkı netleştirelim, örneklere sonra geleceğiz. Çünkü bu on örneğin hepsi tek bir ayrımdan besleniyor.
Temel ayrımAçık uçlu soru ile şıklı soru
En basit haliyle: bir LLM'e açık uçlu soru soruyorsun, Jev'e şıklı soru.
LLM'den yapılandırılmış çıktı istediğinde aslında ondan bir kostüm giymesini istiyorsun. "Bana JSON ver" diyorsun, o da metin üretiyor, sen o metni ayrıştırıyorsun, sonra şemaya uyup uymadığını doğruluyorsun. Yapı modelin içinde değil, senin kurduğun katmanda. Bozulduğunda da orada bozuluyor.
Jev'e soruyu şıklarıyla birlikte soruyorsun. "Bu destek talebi acil mi, normal mi, düşük mü?" diyorsun ve üç şıkkı da sen yazıyorsun. Jev bir şıkkı işaretliyor, yanına da yüzde kaç emin olduğunu koyuyor. Ayrıştıracak metin yok, doğrulanacak şema yok. Uydurma da yapısal olarak mümkün değil: işaretleyeceği başka bir kutu yok çünkü.
LLM: açık uçlu soru
- Cevap bir yazı, yapıyı sonradan sen giydirirsin
- Kelime kelime, sırayla yazar
- Ne kadar emin olduğunu cümlenin tonundan tahmin edersin
- Kağıtta olmayan bir cevap uydurabilir
Jev: şıklı soru
- Cevap işaretlenmiş bir şık, kod doğrudan dallanır
- Bütün soruları tek seferde, aynı anda cevaplar
- Her şıkkın yanında yüzde kaç emin olduğu yazar
- Şıkların dışına çıkamaz
Adı da buradan geliyor. Kahneman'ın Sistem 1 ve Sistem 2 ayrımını hatırla: biri hızlı, sezgisel, anında yargı verir; öteki yavaş, adım adım düşünür. LLM'ler Sistem 2'yi taklit etmeye çalışıyor. Jev kendini açıkça Sistem 1'e yerleştiriyor ve yazma işini hiç üstlenmiyor.
Şık biçimleri de üç tane: Choice (verdiğin seçeneklerden birini işaretler), Score (verdiğin ölçeğe göre puan verir), Noul (0 ile 1 arasında bir değer döner, yani "ne kadar" sorusunun cevabı). Üçünü tek çağrıda birleştirebiliyorsun, hepsi aynı anda değerlendiriliyor.
Peki bu ayrım rakamlara nasıl yansıyor? TypeSafe'in kendi karşılaştırma tablosu şöyle:
| Boyut | LLM | Jev |
|---|---|---|
| Çıktı | Üretilmiş metin | İşaretlenmiş şık ve güven yüzdesi |
| Üretim biçimi | Sıralı, kelime kelime | Paralel, tek sorguda |
| Cevap süresi | 3 ila 329 saniye | 70 ila 500 milisaniye |
| Girdi fiyatı | Milyon token başına 0,20 ila 10 dolar | Milyon token başına 0,042 dolar |
| Çıktı fiyatı | Girdinin yaklaşık 5 katı | Ücretsiz |
| Uydurma | İyileşti ama sürüyor | Yapısal olarak mümkün değil |
Asıl haber model değil, kararın fiyatı.
Peki bununla ne yapılıyor? On örnek
Buraya kadar teknik. Açıkçası bizi asıl durduran şey, bu ayrımın üç gün içinde kaç farklı yere sızdığı oldu. Seçkinin tamamı aşağıda:
| Ne yapılmış | Sorulan şıklı soru | Ölçek |
|---|---|---|
| Anlık compaction | Bu tool çağrısı hala gerekli mi | 156 bin token, 62 bine |
| Niyet okuyan launcher | Bu tuş dizisiyle hangi dosyayı istiyor | Her tuşta 100 ms |
| Anlamı hesaplayan tablo | Bu satır ne kadar acil | Satır başına 100 ms |
| Ekran görüntüsüz computer use | Hangi butona basmalıyım | Karar başına 90 ms |
| Reklam kütüphanesi analizi | Bu reklamın kancası, formatı, aşaması ne | 724 reklam, 40 saniye, 9 sent |
| Paralel kırma testi | Bu ekran doğru mu render oldu | Onlarca koşu, kuruşlar |
| Lead puanlama | Bu mesaj bu kişiye uyuyor mu | 700 lead, 9 sent |
| Canlı yorum yönlendirme | Bu yorum soru mu, istek mi | Yayın akışında anlık |
| Konuşurken slayt seçimi | Şu an hangi slayt açılmalı | Konuşma hızında |
| Slop dedektörü | Bu paragraf yapay mı | 10 bin kelime, 2 saniye |
Bir: daha önce sorulmayan sorular
Bu grubun ortak yanı, soruların yeni olmaması. "Bu tool çağrısı hala gerekli mi" sorusunu bir LLM'e de sorabilirdin. Her adımda saniyeler ve kuruşlar harcamaya razıysan tabi. O yüzden sormuyorduk: ya bir kurala bağlıyorduk ya da kullanıcıya soruyorduk.
Compaction örneği bunun en net hali. 2026'da bağlam sıkıştırma hala bir özetleme istemi, çünkü her tool çağrısını tek tek puanlamak pahalıydı. Jev puanlıyor, alakasızı atıyor, 156 bin token 62 bine iniyor. Özet yok, eleme var.
İki: arayüzün kendisi karar vermeye başlıyor
Launcher'lar takma ada ve bulanık eşleşmeye göre sıralar. Bir tanesi artık niyete göre sıralıyor: "indirdiğim pdf" yazıyorsun, sen cümleyi bitirmeden doğru dosya başa geliyor. Aynı fikrin tablo hali de var: sütunun başına "Aciliyet" yazıyorsun, satırlar formülsüz puanlanıyor.
İşte tam burada ürün tarafındaki asıl soru çıkıyor. Bu iki örnekte de kullanıcı yeni bir şey öğrenmiyor, mevcut arayüz daha iyi tahmin ediyor. Yani kazanç bir özellikte değil, bir gecikmede.
Üç: gözü olmayan bilgisayar kullanımı
En sevdiğimiz örnek bu oldu (ufak bir araya gireyim: gizlilik tarafı yüzünden). Yerel bir CoreML modeli ekrandaki her butonu kutuluyor, cihazdaki OCR etiketleri okuyor, Jev'e giden tek şey o metin oluyor. Butonlar şık, Jev birini işaretliyor. Karar başına 90 milisaniye ve tek bir piksel bilgisayardan çıkmıyor. Ekran görüntüsü göndermeden bilgisayar kullanımı, sahici bir fark.
Karşı cepheSeçkinin içinden çıkan itiraz
Bu kadar övgünün ortasında en sert itiraz da aynı haftadan geldi. Biri Qwen 4b üstüne küçük bir sınıflandırıcı eğitti ve benzerini yaptı. Bir başkası açık bir modelle Jev uyumlu bir API yayınladı. İkisi de Doom'u aynı şekilde oynatıyor.
Bu itiraz ciddiye alınmalı, çünkü ortada iki ayrı iddia var. Birincisi "yeni bir model kategorisi doğdu", ikincisi "var olan bir yetenek doğru fiyatlandı ve doğru paketlendi". Üç günlük demolar ikisini ayırmaya yetmiyor.
Bu bir seçki, örneklem değil. On örnek de yapımcılarının kendi paylaştığı demolardan geliyor; çalışmayan denemeler paylaşılmıyor, dolayısıyla burada görünmüyor. Yukarıdaki karşılaştırma tablosu da bağımsız bir ölçüm değil, TypeSafe'in kendi yayınladığı rakamlar. LLM tarafı için verilen 3 ila 329 saniye aralığı hangi modellerde, hangi görevlerde ölçüldü, açıklanmamış. Kalıbın var olduğu kesin. Kalıbın tuttuğuna dair kanıt henüz yok.
Bizim duruşumuz
"Jev gerçekten yeni mi" sorusu bize yanlış soru gibi geliyor. Çünkü cevabı ne olursa olsun senin yarın yapacağın şey değişmiyor.
Asıl soru şu: ürününde "bunu AI'a sormak pahalı" diye geçiştirdiğin kaç karar var? Bu satır acil mi, bu yorum şikayet mi, bu kullanıcı hangi butona basmak istiyor, bu ekran doğru mu render oldu. Her birini ya bir kurala bağladın ya kullanıcıya sordun ya da hiç sormadın. O kararların listesi, ekibinin kafasında değil kodun içinde duruyor ve kimse onu çıkarmamış.
Bana kalırsa bu haftanın asıl getirisi Jev değil, o listeyi çıkarmak için bir sebep. Fiyat düşerse liste açılır; düşmezse bile listeyi bilmek işine yarar.
Bu hafta bir oturumda ekibinle şu egzersizi yap: ürününde kullanıcıya sorduğun ya da sabit bir kurala bağladığın kararları tek tek yaz. Sonra her birinin yanına iki şey ekle: bu karar saniyede kaç kez veriliyor ve yanlış olduğunda ne oluyor. Sık verilen ve yanlışı ucuz olan kararlar, bu tip modellerin ilk gireceği yer. Liste yirmi satırı geçiyorsa zaten cevabı bulmuşsun demektir.
Sen hangi kararı AI'a sormaktan vazgeçmiştin, sırf pahalı diye? Yorumlarda paylaşırsan sevinirim, cevabın muhtemelen bu yazıdaki on örnekten daha ilginç.
Bir sonraki radar sayısında görüşmek üzere. Sevgiyle kalın! 🧱




