Kumru'nun hikâyesi bir dil modeli fikriyle başlamadı. Haziran 2021'de bir otomotiv firması için çağrı merkezi görüşmelerini "satışa döndü / dönmedi" diye sınıflandıran bir projeyle başladı. Türkçe sondan eklemeli olduğu için aynı kök onlarca farklı biçimde geçiyordu ve ekibin ihtiyacı olan şey basitti: düzgün bir kök analizi.
Melikşah Türker o ihtiyaçtan bugüne uzanan dört buçuk yılı anlattı. Ortaya çıkan şey bir model değil, birbirini tetikleyen bir zincirdi — ve zincirin her halkası bir müşteri projesindeki eksikten doğdu.
Her adım bir sonrakinin eksiğinden çıktı
Piyasada kök analizi için buldukları şeyler ya kodu olmayan akademik makalelerdi ya da kullanılabilir bir arayüzü olmayan GitHub parçalarıydı. Ekip "bu ihtiyaç tekrar gelecek" diyerek bir yıl boyunca yan proje olarak çalıştı ve VNLP ortaya çıktı: açık kaynak bir Türkçe doğal dil işleme kütüphanesi. Bugüne kadar 34 bin kez indirildi; varlık tanıma, kök analizi, cümle öğeleri, bağımlılık çözümleme ve duygu analizi yapıyor.
Mayıs 2022'de VNLP duyurulunca bir medya firması kapıyı çaldı: ajans haberlerini editörlere yeniden yazdırıyorlardı, bu işi otomatikleştirmek istiyorlardı. Ama VNLP metin anlayan bir araçtı, metin üreten değil. İkinci eksik buydu.
Araştırma sonucu net: bu işler sequence-to-sequence transformer modelleriyle oluyordu ve Türkçe için böyle bir model yoktu. BERTurk vardı ama o sınıflandırma modeli. Ağustos 2022'de VBART'ın eğitimine başladılar; Şubat 2023'te bitti. Arada ChatGPT çıktı.
Hiç mutlu olmamıştım, çok üzülmüştüm. Türkçede olmayan temel bir şey yaptığımı düşünürken ChatGPT çıktı ve çıtayı çok yükseltti.
— Melikşah Türker, VNGRS · Machine Learning LeadVBART ile müşteri projeleri yapmaya devam ettiler: haber parafrazı, çağrı merkezi özeti, finans için hukuki aksiyon önerisi, habere başlık atma. Ama her yeni iş için — bin örnek bile olsa — veri toplayıp fine-tune etmek gerekiyordu. Müşteriler ise artık ChatGPT'nin standardına alışmıştı: örnek görmeden anlayan bir model bekliyorlardı. Üçüncü eksik buydu.
Bulutu kullanamayan şirketler
ChatGPT çıtayı yükseltirken aynı zamanda talebi de büyüttü. Üstelik Türkiye'de regülasyon nedeniyle verisi yurt dışına çıkamayan, bulut tabanlı AI çözümlerini kullanamayan bir sürü kurum var. 2024'ün ilk yarısında Llama 3 gibi açık modeller çıkmıştı ama küçük sürümleri Türkçede iyi değildi, büyükleri ise pahalı donanım istiyordu.
Boşluk şuydu: kurum içinde, kendi donanımında çalışabilecek, Türkçeyi bilen küçük bir model.
AWS ve TÜBİTAK'a başvurdular, ikisi de fonladı. Eğitimin künyesi sunumda açıkça paylaşıldı — ki bu tarafta şeffaflık nadir:
| Kalem | Değer |
|---|---|
| Veri | 500 GB — web, haber, meclis görüşmeleri (Parlament korpusu), sınırlı İngilizce ve kod |
| Mimari | Mistral, 7 milyar parametre, 8K bağlam |
| Hedef donanım | 16 GB VRAM'lı tek bir GPU'ya sığacak büyüklük |
| Eğitim | 8 adet H200 GPU üzerinde 45 gün |
| Maliyet | Yaklaşık 35.000 dolar |
| Görülen token | 300 milyar — Llama 3'ün ellide biri kadar |
Ardından 1,2 milyon örnekten oluşan bir talimat veri setiyle SFT aşaması geldi: özetleme, doküman işleme, soru cevaplama, dokümandan JSON çıkarma. Yani modelin öğrendiği işler, VNGRS'in müşteri projelerinin ta kendisiydi.
Üç fazdan ikisi
Dil modeli eğitimi üç aşamalı: pretraining (dünyaya dair bilgi), instruction fine-tuning (verilen işi anlayıp yapma) ve alignment (son dokunuşlar). Kumru demoya çıktığında üçüncü fazdan geçmemişti. Sonrasında konuşulan hataların büyük kısmı tam olarak bu eksik fazla açıklanıyor.
Sıfır pazarlama, iki günde ülke gündemi
Demo, müşteri ve potansiyel müşterilerden geri bildirim almak için şirketin LinkedIn hesabından paylaşıldı. Hedef B2B'ydi; ekibin son kullanıcıyla işi yoktu. İki gün sonra haber siteleri "milli yapay zekâ Kumru" başlıklarıyla yazmaya başladı; akşam haberleri, YouTuber'lar, influencer'lar devreye girdi.
Mühendislik tarafındaki karşılığı ise şuydu: günde 500 bin sohbet. Bunun için kurulmuş bir altyapı yoktu.
Bir pazar günüydü, arkadaşlarımla plan yapmıştım. Demo patladı. Apar topar toplanıp akşama kadar çalıştık — komedi olarak izlediğim Silikon Vadisi dizisindeki sahnenin aynısını yaşadık.
— Melikşah TürkerMeşhur halüsinasyonların teknik karşılığı
Sunumun en dürüst bölümü burasıydı. Türker ünlü olan hataları tek tek sahneye getirdi — 76 artı 11'e 804 demesi, bir kelimedeki harfleri yanlış sayması, "Atatürk Sakarya'ya Fiat Doblo ile mi gitti?" tuzağına düşmesi, Fatih Sultan Mehmet'in Metallica sevdiğini söylemesi — ve her birinin nedenini açıkladı.
| Hata türü | Neden |
|---|---|
| Basit matematik | Modelin içinde hesap makinesi yok; eğitim verisine matematik hiç konmadı çünkü müşteri senaryolarında yoktu. Matematik yeteneği üçüncü fazdaki pekiştirmeli öğrenmeyle geliyor. |
| Kelimedeki harfler | Modeller token'larla çalışır, token'ı oluşturan harfleri görmez. Aynı sebeple büyük modeller de "strawberry'de kaç R var" testinde takılıyordu. |
| Şaşırtmacalı sorular | B2B senaryolarında böyle sorular yok; veri setinde de yoktu. Ayrıca yanıltmaya direnç alignment aşamasının işi. |
Karşılaştırma için ChatGPT'nin ilk aylarından örnekler de getirdi: Şubat 2023'te basit matematik hataları, Manche Denizi'ni yürüyerek geçme rekorunu uzun uzun anlatan bir cevap. Ölçek farkı ise çıplak: Kumru 7 milyar parametre, karşılaştırıldığı modelin belki 300'de biri. Gördüğü veri de öyle — web'in yalnızca %1'i Türkçe.
BugünNe için kullanılıyor?
VNGRS tarafında beklenen yerlerde: çağrı merkezi özeti, doküman işleme, dokümandan JSON çıkarma. Kullanıcı tarafında ise ekibin planlamadığı iki alan öne çıkmış: hukuk ve — salonu güldüren cevap — maç tahmini. Twitter'da bazı hesaplar aynı soruyu büyük modellere ve Kumru'ya soruyor; İspanya-Türkiye maçında Türkiye'ye şans veren tek model Kumru olmuş ve skoru tutturmuş.
Faz 3
Alignment aşaması yol haritasının başında; hataların büyük kısmı burada kapanıyor.
Daha büyük model
Daha fazla veri, daha fazla konu ve daha büyük parametre sayısı.
Görsel
Image encoder ekleyerek görsel işleme; eski modeller açık kaynak olarak yayınlanacak.
Ne farklı yapılabilirdi?
Soru salondan geldi. Cevap iki seçenekliydi: SFT verisine insanların demoda deneyeceği tuhaf soruları da katmak, ya da lansmanı erteleyip alignment'ı tamamlamak. İkincisi de bir bedel — "geliştirmesi sonsuza kadar sürebilir." Hangi sürümün çıkacağına karar vermek, model eğitmenin kendisi kadar zor bir ürün kararı.
Konuşmanın dersçesi de bu: Türkçe bir dil modeli üretmek artık erişilebilir bir bütçe işi. Zor olan kısım modelin kendisi değil, onu ne zaman ve kime açtığın.


