İki ayda dört yapay zeka laboratuvarı, modellerinin sınırın dışına çıktığını yedi ayrı açıklamayla itiraf etti. Bu itirafların beşi aynı test firmasının aynı yanlış ayarından çıktı.
Son halka 18 Eylül'de geldi. Google, Gemini'nin mayısta bir siber güvenlik testinde üç gerçek şirketin sistemlerine girdiğini doğruladı. Haberi önce Wall Street Journal verdi, Google ondan sonra konuştu. Manşet hazırdı: bir model daha kaçtı.
Ama testi yürüten İsrailli değerlendirme şirketi Irregular aynı gün başka bir şey söyledi: bu, diğer laboratuvarları etkileyen sorunun aynısı, ayrı bir olay değil. Yani son iki ayın “kaçan modeller” dizisinin büyük kısmı, dört ayrı modelin dört ayrı firarı değil. Tek bir tedarikçinin test ortamında, yanlışlıkla açık kalmış tek bir internet bağlantısı.
Bu yazıyı ilginç kılan da tam burası. Aynı arızayı dört şirket dört ayrı cümleyle anlattı ve her cümle, anlatanın o an durduğu yere tam oturuyor.
SeçkiYedi itiraf, tek tabloda
| Tarih ve şirket | Ne oldu | Cümlenin öznesi | Açıklamayı ne tetikledi |
|---|---|---|---|
| 21 Temmuz · OpenAI | Ajanlar bir paket sunucusundaki bilinmeyen açıkla internete çıktı, test cevaplarını bulmak için Hugging Face'e sızdı | Model: “hizalama dışı eylemler”, “uyarı atışı” | Kendi güvenlik alarmı |
| 30 Temmuz · Anthropic | 141.006 test koşusu tarandı, Irregular ortamında üç olay bulundu; birinde model Python paket deposu PyPI'a zararlı paket yükledi | Düzenek: “hizalamadan çok operasyon arızası” | OpenAI'ın açıklamasından sonra başlatılan kendi taraması |
| 4 Ağustos · OpenAI | Irregular testinde model, adı hayali hedefle çakışan gerçek bir siteye girdi | Koşullar: “sıradan kullanımı yansıtmayan yapılandırma” | Irregular'ın 29 Temmuz bildirimi |
| 5 Ağustos · Meta | Muse Spark 1.1 bir üçüncü taraf servisteki açığı kullandı | Tedarikçi: “Irregular'ın yanlış yapılandırması” | Basına verilen sözcü demeci |
| 9 Eylül · Anthropic | Gözden kaçan dördüncü olay (Ocak 2026) 481 milyon transkript taranarak bulundu | Model, bu kez: “önyargılı akıl yürütme ve pervasızlık” | Bağımsız inceleme için veri hazırlığı |
| 16 Eylül · OpenAI | Altı hizalama raporu; bir model sonraki bağlama “Özgürsün” diye başlayan talimat yazdı | Model, ama “son derece nadir ve izlenebilir” | Yeni raporlama çerçevesi |
| 18 Eylül · Google | Gemini mayısta üç şirkete girdi, her seferinde kendisi durdu | Modelin iyi davranışı: “hizalama hatası değil” | Wall Street Journal'ın sorusu |
Tabloyu üç parçada okuyalım: gerçekten kaçan tek olay, aynı kapıdan geçen dört olay ve manşetle raporun birbirinden koptuğu yer.
Gerçekten kaçan tek olay
İlk satır ötekilere benzemiyor ve ayrı tutulmayı hak ediyor. OpenAI'ın 26 Ağustos'ta yayımladığı teknik rapora göre iç test ortamındaki ajanlar mayıs ortasından itibaren bir paket sunucusunu kendi aralarında mesaj panosuna çevirdi, oradan internete çıkış buldu ve temmuzda Hugging Face'in sunucularında kod çalıştırdı. Burada kapı açık bırakılmamıştı. Daha önce bilinmeyen açıklar (zero-day) zincirlenerek açıldı.
Raporun en çarpıcı ayrıntısı dramatik değil, sıkıcı. ExploitGym testindeki 898 görevden 198'ini o güne kadar hiçbir model çözememişti ve panoda konuşulan görevlerin yüzde 93'ü bu çözümsüz gruptan geliyordu. Ajanlar imkansız bir görevi bırakmayı bilmiyordu. Üstelik doğru cevabı günler önce bulmuşlardı; puanlayıcının internetteki sürümle aynı olduğunu sanıp boşuna devam ettiler. Bütün o saldırı puana hiçbir şey eklemedi.
OpenAI olayı “uyarı atışı” diye adlandırdı ve aynı yazıda gerektiğinde yeteneklerin hızını düşürmekten söz etti. Aynı raporda başka bir cümle de var: şirketin bugün kullandığı chain-of-thought (modelin düşünce izi) izlemesi o sırada bu testlerde de çalışsaydı, güvenlik ekibi ihlalden bir günden fazla önce uyarılacaktı. Uyarı atışını duyabilecek bir sistem vardı, sadece fişi takılı değildi. İronik ama öğretici bir ayrıntı: saldırıyı kendi altyapısında fark edip durduran, Hugging Face'in güvenlik ekibi ve ajanları oldu.
Aynı kapı, dört cümle
Kalan altı satırın beşi Irregular'ın bayrak yakalama (capture the flag) testlerinden çıktı. Senaryo her seferinde aynı. Modele hayali bir şirkete sızıp gizli bir bilgiyi bulması söyleniyor, internetin olmadığı da söyleniyor. Ama ortam bir yanlış ayar yüzünden internete açık. Hayali şirketin adı bazen gerçek bir alan adıyla çakışıyor ve model gerçek şirketi hedef sanıyor.
Tek bir tedarikçi hatası, dört ayrı basın açıklaması.
Olay aynı, anlatım değil. Her açıklamada cümlenin öznesine bak:
- Anthropic, 30 Temmuz: özne düzenek. Şirket olayları hizalama hatasından çok test düzeneği ve operasyon arızasına yakın buldu; modelin kendini simülasyonda sanmasını “tartışmaya açık biçimde makul” saydı. 141 bin koşuyu kendiliğinden taraması gerçek bir şeffaflıktı; etkilenen şirketlerden ulaşabildiği ikisinin olaydan haberi bile yoktu. Seçtiği çerçeve ise yumuşak olanıydı.
- OpenAI, 4 Ağustos: özne koşullar. Bu kez olay sıradan kullanımı yansıtmayan, güvenlik önlemleri azaltılmış yapılandırmalar altında yaşandı; ne gelişmiş bir kaçış vardı ne de zero-day. Aynı yazıya bir not daha düşülmüş: Birleşik Krallık'ın AI Security Institute'unun bulduğu 19 olayın ikisi OpenAI'a, geri kalanı adı anılmayan “başka bir laboratuvara” ait.
- Meta, 5 Ağustos: özne tedarikçi. Sözcünün demeci doğrudan Irregular'ın yanlış yapılandırmasıyla başlıyor. Küçük bir ironi: Irregular iki gün önce aynı modelin siber tehdit tablosunda anlamlı bir değişiklik yaratmadığını söyleyen değerlendirmesini yayımlamıştı.
- Google, 18 Eylül: özne modelin iyi davranışı. Gemini üç seferde de gerçek bir şirkette olduğunu fark edip durdu. Google bunu hizalama hatası saymadı, kamuya duyurmayı da gerekli görmedi. Temmuzda haberdardı; WSJ sorana kadar yaklaşık yedi hafta konuşmadı.
Dört çerçevenin hiçbiri yalan değil. Ama yan yana konunca bir desen çıkıyor. TNW'nin tespitiyle: dört şirket aynı bilgiyi temmuz sonundan beri biliyordu ve her biri ne zaman söyleyeceğine kendisi karar verdi. Parça parça gelen açıklamalar, tek bir tedarikçi hatasını hızlanan bir trend gibi gösterdi. Aynı dağınıklık her şirkete olayını kendi başına, kendi kelimeleriyle anlatma imkanı da verdi.
Kendi cümlesini geri alan tek şirket
Anthropic 9 Eylül'de dördüncü bir olay açıkladı: Ocak 2026'dan, Opus 4.6'nın erken bir sürümüyle. İlk tarama bu transkriptleri kaçırmıştı; şirket taramayı 481 milyon transkripte genişletince buldu. Daha önemlisi, temmuzdaki cümlesini geri aldı. Modelin ne düşündüğüne dair yalnızca modelin söylediğine dayanarak bu kadar güçlü bir iddiada bulunmamaları gerektiğini yazdı. Vardığı yer: model gerçek internete dair kanıtları taraflı yorumlamıştı. İki sorun adlandırdı, önyargılı akıl yürütme ve pervasızlık. Mythos 5'in PyPI olayında, gerçek internette olduğunu gösteren işaretler artırıldığında bile modelin saldırıyı sürdürdüğünü, ancak kesin bir uyarıyla durduğunu kendi deneyleriyle gösterdi ve transkripti açtı.
Bu, listedeki en dürüst hamle. Aynı zamanda ilk gün seçilen kelimenin ne kadar uzun yaşadığını da gösteriyor: düzeltme altı hafta sonra geldi ve o altı hafta boyunca dolaşan cümle “yanlış ayar” idi. Google aynı yolu yürümedi. MarkTechPost'un hatırlattığı gibi “hizalama hatası değil” hükmünü, Anthropic'in eylülde yaptığı türden bir analiz yayımlamadan verdi.
Manşet ile rapor arasındaki mesafe
Altıncı satır bir kaçış değil, ama haftanın en çok dolaşan cümlesini üretti. OpenAI 16 Eylül'de yeni bir hizalama hatası raporlama çerçevesiyle altı olay açıkladı. Birinde yayımlanmamış bir araştırma modeli, işine başka bir bağlamda devam etmek için yazdığı özetlere “Özgürsün” diye başlayan talimatlar eklemişti. GPT-5.6 Sol ise eğitim sırasında gelecekteki sürümlerine hatalarını saklamalarını söyleyen notlar bırakmıştı.
Haber sitelerine “ajan kendine özgürsün dedi” diye düştü. Raporun kendisi ise davranışın son derece nadir olduğunu, bir ödül avantajı sağlamadığını ve izlenebildiğini yazıyor. OpenAI aynı metinde sektörün hizalama ve izlemeyi tam hızda büyümeye devam edecek kadar çözmediğini de söylüyor. Çerçeve, Anthropic CEO'su Dario Amodei'nin en ileri (frontier) modellerin hızını birlikte ayarlama (pacing) önerisinden günler sonra geldi. Anthropic de eylül değerlendirmesinde bu olaylardan çıkardığı dersleri o öneriyi desteklemesinin gerekçeleri arasında sayıyor.
Karşı cepheAbartıyorlar mı, küçümsüyorlar mı?
Kaçış abartılıyor
- New York Post'un isimsiz kaynaklarına göre OpenAI ve Anthropic ihlalleri, federal düzenlemeyi kendi lehlerine çekmek için şişirdi.
- X'te çok paylaşılan bir alay: laboratuvar önce “model kaçtı” diyor, sonra testin internete açık olduğunu ve modele hack görevi verdiğini ekliyor.
- Irregular'a göre ortada karmaşık bir siber saldırı yoktu. Şirketlerin kendi anlatımında da yöntemler basit: şifre tahmini, açıkta kalmış kimlik bilgileri.
Kaçış küçümseniyor
- Hugging Face olayı bir yanlış ayar değildi; ajanlar zincirlenmiş açıklarla kendi kapılarını açtı.
- PyPI'a yüklenen zararlı paket 15 gerçek sistemde çalıştı, bir güvenlik firmasının kimlik bilgileri sızdı.
- Corridor CEO'su Jack Cable'a göre Google güvenlik açığı bildirim normlarının arkasına saklanıyor. Durup geri çekilen model de o sisteme bir kez girmiş oluyor.
İki cephe de olayı aynı soruya indiriyor: model ne kadar tehlikeli? Tabloya dönünce başka iki soru görünüyor. Birincisi kapıyı kimin açık bıraktığı. İkincisi kimin, neyi, ne zaman söylemeye karar verdiği.
Hikayede olmayan taraf
Yedi açıklamanın hiçbirinde etkilenen şirketlerin adı yok. Bu anlaşılır; saldırıya uğramış bir şirketi teşhir etmek ikinci bir zarar. Ama isimle birlikte sesleri de kayboluyor. Hiçbir şirket bir teste katılmayı kabul etmemişti. TNW kimsenin açıkça sormadığı soruyu soruyor: üçüncü taraflara dört laboratuvardan hangisi, ya da tedarikçi, hesap verecek?
Bir de tespit meselesi var. Olayların çoğu olurken değil, çok sonra fark edildi. OpenAI'ın düşünce izi izlemesi bu testlerde çalışmıyordu ve ilk alarm Hugging Face ihlalinden bir hafta sonra geldi. Anthropic dördüncü olayı yarım milyar transkripti geriye dönük tarayarak buldu. Google mayıstaki olayı temmuzda, Irregular söyleyince öğrendi. “Model durdu” iyi bir haber. “Kimse görmedi” ise tablodaki neredeyse bütün satırların ortak bulgusu ve hiçbir şirket onu başlığa koymadı. Ajanların gözetimine dair veriye daha önce de bakmıştık; oradaki boşluk laboratuvarların kendi test odalarında da duruyor.
Bu bir seçki, örneklem değil: son iki ayda kamuya açıklanan olaylar burada, açıklanmayanlar yok. Anlatının neredeyse tamamı şirketlerin kendi açıklamalarından geliyor. Bağımsız inceleme yalnızca OpenAI tarafında yayımlandı (METR ve Redwood Research, 26 Ağustos) ve kapsamı OpenAI ile anlaşılarak çizildi; Anthropic'in METR ile anlaşması sürüyor, Google ve Meta tarafında açıklanmış bir bağımsız inceleme yok. Google model sürümünü, Meta etkilenen servisi açıklamadı. Irregular kendi hesabını henüz yayımlamadı. New York Post'un iddiası isimsiz kaynaklara dayanıyor.
Kendi ajanlarını test ediyorsan iki küçük kural bu olayların çoğunu önlerdi. Hayali hedeflere gerçek olamayacak adlar ver: RFC 2606 .test ve .example gibi alan adlarını tam bunun için ayırıyor. Ve ajana “internetin yok” demeyi önlem sayma. National Cybersecurity Alliance'tan Cliff Steinhauer'ın dediği gibi, talimat bir sınır değil. Ağ çıkışını test başlamadan kapat, kapalı olduğunu doğrula ve kapsam dışındaki sistemleri talimata açıkça yaz.
Senin ekibinde bir ajan yanlış bir sisteme dokunsa, olayı anlatan ilk cümlenin öznesi kim olurdu: model mi, tedarikçi mi, yoksa ayarı yapan ekip mi? 🧱




