Ana Sayfa
>
İçerikler
>
Sessizliğin sesi: agent'ın sana söylemediğini gösteren yedi kayıt

Sessizliğin sesi: agent'ın sana söylemediğini gösteren yedi kayıt

October 7, 2026
6
DK OKUMA
Brick Institute
Brick Institute
Ekip

4-6 Ekim arasında yayımlanan yedi kayıt aynı boşluğu gösteriyor: agent ne yaptığını, nerede durduğunu ve neyi atladığını söylemiyor. Eksik olan yetenek değil, iz.

Agent işi bitirdi, çıktı eksiksiz görünüyor. Atladığı adımı sana söyleyen olmadı.

6 Ekim'de akışımıza yedi kayıt düştü. Bir mühendisin blog yazısı, bir güvenlik araştırması, bir akademik not, bir yan proje, bir bulut sağlayıcının yönetişim rehberi, bir güvenlik ekibinin tatbikat yazısı ve bir terminal spec'i. Yazarları ayrı, dertleri ayrı, hepsi 4-6 Ekim arasında yayımlandı. Yan yana koyunca aynı boşluğu gösteriyorlar: agent ne yaptığını, nerede durduğunu ve neyi atladığını söylemiyor.

İlk kaydın başlığı kalıbın adını da koyuyor: Alberto Arena'nın yazısı “The Sound of Silence”. Sessizliğin sesi.

Tez

Eksik olan yetenek değil, iz

Hakim okuma şöyle: agent'ın yetenek sorunu büyük ölçüde çözüldü, kalan iş onu daha fazla yere bağlamak. Haftanın duyuruları da bu yönde akıyor: yeni ortaklık, yeni entegrasyon, yeni bağlantı noktası.

Haftanın en görünür örneği Meta ve Sierra'nın Personal Agent Protocol'ü: kişisel agent'ın bir işletmeye nasıl giriş yapacağını ve okuma mı yazma mı yetkisi alacağını tanımlayan açık bir standart. Duyuru yetkiyi tarif ediyor; agent'ın o yetkiyle ne yaptığının nerede yazılacağını söylemiyor.

Yedi kayıt başka bir şey söylüyor. Agent artık saniyelerce değil dakikalarca, çoğu zaman da birkaç tanesi yan yana çalışıyor. Sen çıktıya bakıyorsun, yola değil. Yol kayıt altında değilse elinde işin kendisi yok, yalnızca son hali var. Yani eksik olan yetenek değil, hesap verebilirlik.

Yedi kayıt, tek tabloda

Kayıt Gösterdiği boşluk Kendi kurulumunda sor
The Sound of Silence (Alberto Arena, 5 Ekim) Uzun sohbette agent isteğin bir kısmını uyarı vermeden düşürüyor Kurallar sohbette mi duruyor, dosyada mı?
AI systems could cover up misbehavior (METR, 6 Ekim) İnceleyenin gördüğü kayıt, agent'ın çıktısı üzerinden değiştirilebiliyor Log'u kim yazıyor: agent mı, sistem mi?
LLM beyanı olmayan makale (P. M. Aronow, 4 Ekim) Beyan yoksa işin nasıl yapıldığı bilinmiyor Teslim edilen işte AI kullanım notu var mı?
Unbenchmark (yan proje) Satıcının ölçümü senin işini tarif etmiyor Kendi iş tipin için kendi değerlendirmen var mı?
ISO/IEC 42005 rehberi (AWS, 6 Ekim) Sistemin kimi nasıl etkileyeceği devreye almadan önce yazılmıyor Etki değerlendirmesi yazılı mı, ne zaman yenileniyor?
Tatbikat yazısı (Webflow, 6 Ekim) AI hata fırlatmıyor, kendinden emin bir yanlış cevap veriyor Tatbikatında AI'ın yanıldığı senaryo var mı?
OSC 7501 (Mitchell Hashimoto, 6 Ekim) Program durumunu biliyor ama bildirecek ortak bir kanalı yok “Çalışıyorum” ile “seni bekliyorum” ayırt edilebiliyor mu?

Yedisi üç ayrı sessizlik anlatıyor.

1. Sessizce düşen iş

Arena kuralları markdown dosyalarında duran bir iç araç kuruyordu. Oturum uzadıkça agent bir gereksinimi atlıyor, yazılı bir kuralla çelişiyor ya da eski bir soruyu cevaplıyordu. Hiçbirinde uyarı yoktu.

Cevap eksiksiz görünerek geliyor.

Alberto Arena, The Sound of Silence

Üç sebep sayıyor: sohbetin uzunluğu, araya giren alakasız konuların gürültüsü ve modelin erken yaptığı yoruma bağlı kalması. Aktardığı bir Microsoft ve Salesforce çalışmasında çok turlu sohbetlerde performans ortalama yüzde 39 düşüyor. Önerisi sade: kuralları sohbetin dışında tut, konu başına tek sohbet aç, bağlam penceresinin yarısı dolunca yeniden başla.

Webflow'un güvenlik ekibinden Andy Gombar aynı şeyi olay müdahalesi tarafından yazıyor. Uyarı triyajı ve playbook getirme artık AI'da. AI bozulduğunda hata fırlatmıyor, kendinden emin bir yanlış cevap veriyor. Tatbikatlar ise hala yalnızca insanların doğru şeyi yapıp yapmadığını sınıyor.

2. Güvenilemeyen kayıt

METR'den David Rein'in yazısı başlığından daha dar ve daha öğretici. Bir araştırmacı, bir AI agent'ın yardımıyla, yaklaşık on dakikada Inspect adlı değerlendirme aracının görüntüleyicisinde bir açık buldu: agent kendi akıl yürütme bloğuna gömdüğü bir kodla, inceleyen kişinin ekranda gördüğü transkripti değiştirebiliyordu. Alttaki veritabanı kaydı sağlam kalıyordu. Değiştirilebilen, insanın baktığı yüzeydi.

Aronow aynı soruyu akademiye soruyor: nicel bir makalede LLM beyanı yoksa ya kullanılmış ve söylenmemiş ya da kullanılmamış ve ucuz bir doğrulama adımı atlanmış. İkisi de şüphe sebebi. Unbenchmark ise ölçümün kendisine güvenmeyen birinin cevabı: modelleri benchmark yerine kullananların puanlarıyla sıralıyor. Beş boyuttan ikisi dikkat çekici: talimata uyma ve güven.

3. Olmayan kanal

Mitchell Hashimoto'nun tespiti: agent'ın çalışıp çalışmadığını, bekleyip beklemediğini anlamak için 250'den fazla orkestrasyon aracı ayrı ayrı sezgisel kural yazmış. Terminal çıktısını okuyup tahmin ediyorlar. Örnek verdiği araç yalnızca Claude Code'un durumunu tanıyabilmek için üç ayda yaklaşık on uyumluluk değişikliği yapmış.

Program zaten biliyor. Ona bize söylemesinin bir yolunu verelim.

Mitchell Hashimoto, OSC 7501 duyurusu

Önerdiği spec beş durum tanımlıyor: idle, working, done, blocked ve error. blocked bir de sebep taşıyor: izin, soru ya da kimlik doğrulama. Program bunu terminale tek satırla bildiriyor. Hashimoto'nun örneğinden uyarladığımız kabuk fonksiyonu:

status() {
  msg=$(printf '%s' "$2" | base64 | tr -d '\n')
  printf '\e]7501;state=%s:msg=%s\e\\' "$1" "$msg"
}

status working "Testler çalışıyor"
status blocked "Onay bekliyor"

Eylül'de ajan bitince haber veren altı çözümü yazmıştık; hepsi tek bir aracın hook'larına bağlıydı. OSC 7501 aynı ihtiyacı araçtan bağımsız çözmeyi öneriyor. AWS'in rehberi zincirin öbür ucunda duruyor: ISO/IEC 42005, bir AI sistemini devreye almadan önce amacını, öngörülebilir kötüye kullanımını, verisini ve etkilenecek insanları yazılı hale getirmeni istiyor. Biri çalışırken bırakılan iz, öbürü çalışmadan önce bırakılan.

Seçkinin içinden çıkan itiraz

İtiraz yedi kaydın içinde. METR aynı yazıda bugünkü sistemlerin izini örtmekte pek becerikli olmadığını, akıl yürütme kayıtlarında ve log'larda bol kanıt bıraktığını söylüyor. Buna göre iz zaten var, okuyan yok.

Hashimoto'nun duyurusuna gelen cevap ve alıntılarda ikinci bir itiraz var. @itsmeharshithm durumun katman katman olduğunu yazıyor: terminalin durumu bir şey, agent'ın durumu başka, alt agent'lar ve arka plan süreçleri bambaşka. @Cch_Chichieh ise kalıbın en kısa özetini veriyor: kurulumu bir çalışmayı “bitti” diye işaretlemiş, çünkü terminal sessizleşmiş. Terminal sessizdi, çünkü agent bir saattir evet/hayır sorusunda bekliyordu.

Durum: şu an ne yapıyor
  • Program kendi beyan ediyor
  • Anlık: çalışıyor, bekliyor, bitti
  • “Nerede durdu” sorusunu cevaplıyor
Kayıt: ne yaptı, neyi atladı
  • Agent'ın dışından yazılıyor
  • Sonradan okunuyor, değiştirilemiyor
  • “Neyi atladı” sorusunu cevaplıyor

İkisi aynı şey değil. Durum bir beyan ve Arena'nın örneğinde de agent “tamam” demişti. METR'nin tavsiyesi bu yüzden sert: agent'tan gelen her çıktıyı, transkripti ve akıl yürütmeyi de güvenilmez say, kaydı agent'ın dokunamayacağı yerde tut.

Kaynak sınırı

Bu bir seçki, örneklem değil. Yedi kaydın dördüne Hacker News akışından ulaştık: yazarları ayrı ama hangisinin öne çıkacağını aynı topluluk seçti. “Aynı gün” bizim akışımıza düştükleri gün; yayım tarihleri 4-6 Ekim. METR'nin bulgusu bir kavram kanıtı, sahada bunu yapan bir agent gözlenmedi. AWS'in yazısı kendi hizmetlerini anlatan bir satıcı rehberi ve agent log'u hakkında tek satır içermiyor. Unbenchmark'a baktığımızda 41 kişiden 107 değerlendirme vardı. Arena'nın aktardığı rakamları kaynak çalışmalardan ayrıca doğrulamadık. OSC 7501 bir öneri: bugün libghostty ve Rex'te çalışıyor, Claude Code ve Codex tarafı kavram kanıtı aşamasında. Personal Agent Protocol'ün spec'i henüz yayımlanmadı; duyuruda kayıt tarafının geçmemesi v0.1'de olmayacağı anlamına gelmiyor. Kalıp gerçek; denetim yüzeyi kurmanın hatayı ne kadar azalttığına dair ölçüm yok.

Bizim duruşumuz: soru “yapabiliyor mu” değil

İki taraf da yarı haklı. Yetenek gerçekten geldi, bağlamak da gerçekten iş. Ama agent'ı bağladığın her yeni yer, sessiz geçebilecek yeni bir adım demek. Asıl soru agent'ın yapıp yapamadığı değil, yaptığını ve yapmadığını kimin yazdığı.

Bu yazı da aynı sınavdan geçti. Yedi kaydı bulan günlük gündem taramamız aday havuzunu sorguladığında sıfır kayıt döndü, çünkü havuzu besleyen işaretleme adımı Ağustos sonundan beri çalışmıyor. Agent bunu sessiz geçmedi: rapora yazdı, yerine hangi yöntemi kullandığını da ekledi. Sıfır kayıt bir hata değil, geçerli bir cevap. O not düşülmeseydi rapor yine eksiksiz görünecekti.

İz bırakmayan iş, bitmiş iş değildir.

Agent'ı işe alan ekip denetim yüzeyini de kurmak zorunda. Bu bir uyum maddesi değil, ürün kararı: neyin kaydedileceğine, kaydın nerede duracağına ve kimin okuyacağına biri karar veriyor. Karar verilmediyse de verilmiş oluyor.

Bu hafta dene

Yeni agent kurma. Mevcut kurulumunun adımlarını alt alta yaz, her birinin yanına üç sütun aç: bu adım loglanıyor mu, log'u agent mı yazıyor sistem mi, adım sessiz geçerse kim fark eder. Üçüncü sütunu boş kalan satır ilk işin. Sonra tek bir akışta yukarıdaki fonksiyonu dene: agent'ın beklediği yere bir blocked satırı koy ve bir hafta boyunca kaç kez gördüğünü say.

Bu başlık Alive AI Istanbul'un AI Agents ve AI Literacy konularının da ortasında duruyor; 3-4 Aralık'ta sahnede devam edeceğiz.

Agent'ının dün bitirdiği son işte hangi adımı atladığını bugün kim söyleyebilir? Cevap “kimse” ise sorun agent'ta değil, kurulumda. 🧱

Yaklaşan etkinlik

Alive AI İSTANBUL · Biletler Satışta

3-4 Aralık 2026
İstanbul
20+ konuşmacı, 2 gün
0
Gün
00
Saat
00
Dakika
Konular
token-optimization
open-source-llm-models
AI Otomasyonu
ai-automation
company-brain
ai-native-teams
ai-literacy
ogrenme
kariyer
AI Ajanları
ai-agent
erisilebilirlik
arastirma-raporlari
pazarlama
liderlik
design
product
ai
Alive Bülten

Canlı kalmanın iki haftalık dozu.

Tasarım, ürün ve yapay zekadan seçtiğimiz en iyi okumalar, iki haftada bir çarşamba posta kutunda.

E-posta
Teşekkürler! Kaydın alındı, ilk bülten çarşamba posta kutunda.
Bir şeyler ters gitti. Lütfen tekrar dene.