Ana Sayfa
>
İçerikler
>
AI tasarım aracını artık hangi soruyla seçiyoruz? Üç haftada on iki örnek

AI tasarım aracını artık hangi soruyla seçiyoruz? Üç haftada on iki örnek

September 19, 2026
7
DK OKUMA
Brick Institute
Brick Institute
Ekip

Aynı prompt’u alan dört AI aracının dördü de “Start free” dedi. Son üç haftada on iki ekip ise araç seçmek yerine tasarım sistemini ajanların okuyup uyabileceği, ihlal edince yakalanabileceği hale getirdi.

Beş AI prototipleme aracına aynı landing page prompt’unu veren bir test yazısındaki canlı linkleri tek tek açtık. Dört sayfanın dördünde de menüdeki buton aynı şeyi söylüyordu: Start free.

Test, Harsh Raval’in 15 Eylül’de Muzli’de yayımladığı yazıdan. Figma Make, Bolt.new, Lovable, v0 ve Framer AI’ya aynı SaaS landing page brief’i verilmiş. Araçlar ilk çıktıya ve o çıktının ne kadar kolay düzeltilebildiğine göre değerlendirilmiş. Figma Make’in çıktısı giriş istediği için dışarıda kaldı, kalan dördünü biz ölçtük (bir test yazısını test ettiğimizin farkındayız).

Dördünde de “No credit card required” satırı var. Üçünde bu buton mavi. Framer’ınki birebir Tailwind’in yıllardır varsayılan mavisi, #2563EB. Fontlar farklı (Inter, DM Sans, Geist), ama iskelet neredeyse kopya: ortada rozetli bir başlık, altında iki buton, onun altında bir dashboard maketi. Lovable’ın üst menüsü masaüstü genişlikte dağılmış, o da ayrı bir konu.

Bolt.new, Lovable, v0 ve Framer AI’nın aynı prompt ile ürettiği landing page ilk ekranları yan yana; dördünde de menüdeki buton Start free.
Aynı prompt, dört araç. Dördünün de menü butonu “Start free”, üçünde bu buton mavi. Kaynak: Harsh Raval, Muzli testindeki canlı linkler. Ölçüm ve ekran görüntüleri: Alive Medya.

Boş bir tuvalde araçları yarıştırınca aslında modellerin ortalamasını ölçmüş oluyorsun. Aynı gün yayımlanan iki yazı ise başka bir soru soruyor. Rishi Sharma, Claude Code, Codex CLI ve Cursor’ı tasarım sisteminin gerçekte nerede hayatta kaldığına bakarak kıyaslıyor. Yazısını da demodan iki sprint sonra kimsenin nereden geldiğini bilmediği 13 piksellik bir boşlukla açıyor. UX Planet’teki yazı da aynı web sayfasını Claude Design ve Figma AI ile ayrı ayrı tasarlıyor.

Peki bu soru neden şimdi soruluyor? Son üç haftada birbirinden habersiz on iki ekip, tasarım sistemini ajanların okuyabileceği, uyabileceği ve ihlal ettiğinde yakalanabileceği hale getirmek için bir şey yayımladı. Kıyaslamalar hala araçlara bakıyor; iş ise sessizce sistem tarafına kaymış durumda.

Seçki

Üç haftada on iki örnek

ÖrnekNe yaptıNeyi göstermeye çalışıyor
Bağlam · DHM Tokens (Dei)Figma dosyasını açmadan token ve skill paketiyle SwiftUI ekranı kurduAjanın tasarımı yorumlaması yerine kararları hazır alması
Bağlam · Dianne AlterBağlamı AGENTS.md, PRODUCT.md ve DESIGN.md dosyalarına ayırdıBileşen kütüphanesinin tek başına sistem olmadığı
Bağlam · ValetŞirket sitesinden tasarım sistemi çıkarıp her ajanın kullanabileceği skill’e çeviriyorSistemin bir araca değil ajana ait olabileceği
Bağlam · FlorenceBaştan ajana hazır kurulmuş bir tasarım sistemi, betaMevcut sistemlerin ajan için kurulmamış olduğu
Kısıt · Jared PalmerAjanlar için Tailwind yerine StyleX’i daha iyi bulduStil dilinin onu kimin yazdığına göre seçilmesi
Kısıt · Eivind KjosbakkenTüm UI elemanlarını tek klasöre topladı, dışını ajana yasakladıTutarlılığın sistemi daraltarak geldiği
Kısıt · Scribe StylusDokümanları Markdown’a taşıdı, kapsamı %37’den %52’ye çıkardıİnsan için yazılan dokümanın ajana da açılması
Kısıt · LucetRet, düşük güven, tool çağrısı gibi durumları bileşen yaptıSistemin kapsamının AI durumlarına genişlemesi
Doğrulama · open-design-system-benchDört sistemde ajan çıktısını puanladıSistem sadakatinin ölçülebilir olduğu
Doğrulama · shadcn/lintAjan kuralı çiğneyince doğru varyantı gösteren linterİhlalin mesajla birlikte düzeltilebildiği
Doğrulama · Design ReviewFigma’da sistem kullanımını ve ham değerleri denetleyen eklentiDenetimin tasarım tarafına da taşındığı
Doğrulama · /break skill’i (Jakub Krehel)Bileşeni her durumda render edip açıklarını buluyorSistemin kenar durumlarda da sınanması

Sistemi ajana okutmak

Dei’nin DHM denemesi bu grubun en somut örneği. Coding agent Figma dosyasını hiç görmemiş. Tasarım kararlarını token, bileşen, sayfa spesifikasyonu ve asset olarak taşıyan bir Swift paketiyle çalışmış; yanına da paketin nasıl okunacağını anlatan bir skill verilmiş. Sonuç, yazarın kendi tahminiyle yaklaşık %90 görsel benzerlik ve 30-45 dakikalık bir iş (bunun bir benchmark olmadığını da kendisi ayrıca yazıyor, ki bu dürüstlük az bulunuyor).

1 Eylül’de Dianne Alter, bileşen kütüphanenin artık tasarım sistemin olmadığını söyleyip bağlamı ayrı dosyalara bölüyor: ajanın her oturumda ilk okuduğu AGENTS.md, ürünü anlatan PRODUCT.md ve arayüze dokunmadan önce okunacak DESIGN.md. Valet bir adım öteye gidiyor. Kurumsal e-postayla kayıt olanın şirket sitesinden bir tasarım sistemi çıkarıyor ve bunu herhangi bir ajanın kullanabileceği bir skill olarak veriyor. Florence ise sıfırdan “ajana hazır” kurulmuş bir sistem olarak beta’ya çıktı.

Sistemi daraltmak

Burada ufak bir araya girelim. Kalıbın belki de en ilginç itirafı 24 Ağustos’ta geldi.

Jared Palmer’ın 24 Ağustos 2026 tarihli paylaşımı: ajanlar için StyleX’in Tailwind’den daha iyi olduğuna ikna olduğunu yazıyor.
Kısaca: insan için Tailwind, ajan için StyleX. x.com/jaredpalmer

Turborepo’nun ve v0’ın arkasındaki isim, on yıl atomik CSS kullandıktan sonra ajanlar için StyleX’in daha iyi olduğuna ikna olmuş. Tailwind’i hala insan için ideal buluyor. Ama class adlarını artık elle yazmadığı bir dünyada dengelerin değiştiğini söylüyor. Yani stil dili, onu kimin yazdığına göre yeniden seçiliyor.

Eivind Kjosbakken’in 15 Eylül’deki Towards Data Science yazısı aynı şeyi küçük ölçekte söylüyor: tüm UI elemanlarını tek bir klasörde topla ve ajana o klasörün dışında yeni eleman üretmeyi açıkça yasakla. Scribe’ın tasarım sistemi Stylus’u 18 ay boyunca büyüten Ky Decker da dokümanları Markdown olarak kod tabanına taşıdığında ajanların erişiminin iyileştiğini yazıyor. İç ankette bir mühendis, AI kod araçlarının sistemi kullanmakta zorlanmadığını not etmiş (bir tasarım sistemi ekibinin duyabileceği en tatlı cümlelerden biri olabilir).

Lucet ise sistemin kapsamını genişletiyor. Ret, düşük güven, tool çağrısının kısmen başarısız olması, yedek modele geçiş gibi AI arayüzlerinde çoğu zaman unutulan durumları bileşen olarak tanımlıyor.

İhlali saymak

13 piksellik boşluğu hatırlıyorsun. shadcn/lint’in eval’lerinde ajanları sistem dışına itmek için verilen “günaha davet” görevlerinden biri de tam olarak bu: 13px padding.

shadcn’in 14 Eylül 2026 tarihli paylaşımı: Tailwind tasarım sistemleri için ajan öncelikli linter shadcn/lint’i duyuruyor.
shadcn/lint duyurusu: kuralı sen belirliyorsun, ajan çiğneyince hata mesajı sistemdeki doğru düzeltmeyi gösteriyor. x.com/shadcn

14 Eylül’de çıkan linter altı kuralla geliyor: bileşeni className ile yeniden stillemek, ham renk, keyfi değer, inline stil, bilinmeyen class ve dinamik class. Ajan bir kuralı çiğnediğinde hata mesajı sadece “yasak” demiyor; sistemdeki doğru boyutu ya da varyantı gösteriyor. shadcn’in kendi eval’lerinde linter olmadan Sonnet 5 sekiz görevde 50 ile 80 arası ihlal üretiyor. Hiçbir stil talimatı içermeyen görevlerde bile ajanlar kendilerine verilen bileşenleri çoğu zaman yeniden stilliyor. Linter geri bildirimiyle 150’yi aşan görevin neredeyse tamamı tek turda sıfıra iniyor. Düzeltme de yalnızca yazılı kurallara göre %10 ile %48 arası daha ucuz.

Guillermo Rauch’un 14 Eylül 2026 tarihli paylaşımı: ajanların onlara verilen doğrulayıcılar kadar iyi olduğunu yazıyor.
Vercel CEO’su Guillermo Rauch kalıbı tek cümlede topluyor: ajan, ona verdiğin doğrulayıcılar kadar iyi. x.com/rauchg

İki hafta önce Christoph Hellmuth’un yayımladığı open-design-system-bench aynı soruyu sistemin tarafından soruyor. Nord Security’nin Aurora sistemiyle başlayan açık benchmark, ajanlara bileşen adı vermeyen görevler veriyor. Çıktıyı import, API sadakati, token disiplini, erişilebilirlik ve derlenme üzerinden puanlıyor. Dört sistemin hiçbiri “AI-native” eşiği olan 70 puana ulaşamamış.

open-design-system-bench verisi: beş model için rehber yokken ve dosyalar, skill ile katalog verildiğinde Aurora sistemindeki ortalama skor.
Rehber verilince skor nereye gidiyor? Beş model, Aurora sistemi. Kaynak: Christoph Hellmuth, open-design-system-bench.

Bench’in en öğretici bulgusu bir tuzak. GPT 5.6 Terra çıktıların %94’ünü derletmiş, ama görevlerin %63’ünde tasarım sistemine hiç dokunmamış. Ortalamaya bakınca kazanan gibi görünüyor; sistem ekibi için ise en kötü sonuç bu. Rehberin etkisi de dikkat çekici. DeepSeek V4 Pro 58,7’den 84,8’e, tek atışlık Sonnet 5 51,2’den 75,3’e çıkıyor. Sıçramanın büyük kısmı hiç doküman olmamasıyla bir talimat dosyası olması arasında.

Küçük üreticiler de aynı yerde. Figma’da sistem kullanımını ve ham değerleri denetleyen Design Review eklentisi ile bileşeni her durumda render edip açıklarını bulan /break skill’i, denetimin kod tarafıyla sınırlı kalmadığını gösteriyor.

İki test, iki farklı soru

Karşı okuma da seçkinin kendi içinden çıkıyor. Harsh Raval’in testi yanlış bir soru sormuyor; sadece farklı bir durumu ölçüyor.

Boş tuval testi
  • Sistemi olmayan, sıfırdan başlayan ekip için doğru soru.
  • İlk çıktıyı ve düzeltme kolaylığını ölçüyor.
  • Ama gördüğün şey modelin ortalaması: Start free ve mavi buton.
Sistem testi
  • Mevcut bir ürüne ekleme yapan ekip için doğru soru.
  • Ham rengi, keyfi değeri, elle yazılmış bileşeni sayıyor.
  • Aracın yanında sistemin okunabilirliğini de ölçüyor.
Kaynak sınırı

Bu bir seçki, örneklem değil. Örneklerin çoğu yapımcılarının kendi anlattığı denemeler; kalıp gerçek ama işe yaradığına dair bağımsız kanıt henüz yok. shadcn/lint’in eval’lerini shadcn kendisi yaptı ve Vercel’in bu yönde açık bir çıkarı var. Bench’in ajan davranışı verisi şimdilik yalnızca Aurora’dan geliyor. DHM’deki %90 yazarın kendi değerlendirmesi. Girişteki sayımımız da dört sayfa ve tek bir prompt’tan ibaret.

Bizim duruşumuz

Soru araçtan sisteme kaydı

İki taraf da yarı haklı. Boş tuval testi sistemi olmayan için gerçekten işe yarıyor, sistem sadakati ise ürünü olan herkesin asıl derdi. Ama üç haftalık seçkiden çıkan şey başka: bu örneklerin neredeyse hiçbiri bir araç seçmiyor. Hepsi sistemi, hangi araç gelirse gelsin okunabilir ve denetlenebilir hale getiriyor. Bench’teki en büyük sıçramanın modeller arasında değil, doküman olup olmaması arasında çıkması da tesadüf değil.

Şimdilik bulduğumuz çıkış noktası şu: araç seçmeden önce sistemin bozulduğunu fark edebildiğin bir ölçü kur. O ölçü olmadan her kıyaslama izlenim olarak kalıyor (bu yazının girişindeki sayım dahil).

Araçlar her ay değişiyor. Sistemin bozulduğunu gösteren ölçü sende kalmalı.

Yarın dene

Ürünündeki mevcut bir ekranı, bileşen adı vermeyen aynı prompt’la iki araca yeniden yaptır. Üç şeyi say: ham renk değerleri, sistemde olmayan boşluk değerleri ve sistem bileşeni yerine elle yazılmış bileşenler. Tailwind kullanıyorsan shadcn/lint’in no-raw-colors ve no-arbitrary-values kuralları bu sayımı senin yerine yapar.

Senin ekibinde son AI aracı seçimi hangi demoyla yapıldı: boş bir tuvalde mi, kendi sisteminin içinde mi? Bizce önümüzdeki dönemin tasarım sistemi ekibi, en güzel ekranı üreten aracı değil, sistemin ne zaman bozulduğunu en erken gösteren ölçüyü seçen ekip olacak.

Sevgiyle kalın! 🧱

Yaklaşan etkinlik

Alive Konf BAKU — Biletler Satışta

1-2 Ekim 2026
Hilton Baku
20+ konuşmacı, 2 gün
0
Gün
00
Saat
00
Dakika
Konular
ogrenme
kariyer
AI Ajanları
ai-agent
erisilebilirlik
arastirma-raporlari
pazarlama
liderlik
Tasarım
design
product
ai

Diğer İçerikler

Tüm yazılar
Alive Bülten

Canlı kalmanın iki haftalık dozu.

Tasarım, ürün ve yapay zekadan seçtiğimiz en iyi okumalar, iki haftada bir çarşamba posta kutunda.

E-posta
Teşekkürler! Kaydın alındı, ilk bülten çarşamba posta kutunda.
Bir şeyler ters gitti. Lütfen tekrar dene.