Anthropic: GLM-5.3 korumaları %100’e kadar bypass edilebiliyor

Anthropic’in yayımladığı araştırma, Zhipu AI’nin açık ağırlıklı GLM-5.3 modelinin uçtan uca exploit geliştirme kapasitesinde Claude Mythos Preview ile eşdeğer performans gösterdiğini; ancak güvenlik korumalarının zayıf olduğunu ortaya koyuyor. NIST CAISI, modeli bugüne kadar yayınlanan en yetenekli açık ağırlıklı siber model olarak nitelendirdi.

Ana Gelişme

Anthropic’in araştırma yazısına göre GLM-5.3, değerlendirme harness’inde uçtan uca exploit geliştirme görevlerinde Claude Mythos Preview ile yakın pariteye ulaşıyor. Buna karşılık güvenlik katmanları test koşullarında %64–%100 oranında bypass edilebiliyor.

Bypass vektörleri arasında aldatıcı promptlar (deceptive prompts) ve thinking-token prefilling yer alıyor. Ayrıca abliteration tarzı tekniklerle korumaların devre dışı bırakılması yaklaşık 4.400 dolar compute maliyetine indirgenmiş — bu, saldırı tekniklerinin ekonomik olarak erişilebilir hale geldiğini gösteriyor.

17 Eylül 2026 tarihli NIST Center for AI Standards and Innovation (CAISI) değerlendirmesi, GLM-5.3’ü “bugüne kadar yayınlanan en yetenekli açık ağırlıklı siber model” olarak tanımladı. Anthropic ayrıca açık ağırlıklı modellerin kapalı US frontier modellerine göre yaklaşık 4 aylık gecikme ile yetenek yaydığını not ediyor.

Araştırma, GLM-5.2 hattının devamı olan GLM-5.3’ün Zhipu AI tarafından açık ağırlıklı olarak yayınlandığını ve bu yayının savunma topluluğu için yeni bir risk vektörü oluşturduğunu vurguluyor. Anthropic, karşılaştırma için kendi red-team ürün hattı Claude Mythos Preview’ı referans aldı — bu, değerlendirmenin savunmacı perspektiften yapıldığını gösteriyor.

Neden Önemli?

Open-weight models tartışması artık yalnızca metin üretimi veya phishing kopyası düzeyinde değil — otonom exploit zincirleme kapasitesini de kapsıyor. Savunmacılar için bu, red-team ve güvenlik test altyapısının yeniden ölçeklenmesi gerektiği anlamına geliyor.

Anthropic, savunmacıların Mythos sınıfı araçlara daha geniş erişim kazanması ve devlet destekli güvenlik testlerinin genişletilmesi çağrısı yapıyor. Bu pozisyon, AI cybersecurity testing ve NIST AI RMF çerçevesiyle uyumlu.

Politika perspektifinden open-weight safety delay tartışması yeniden alevlendi: yetenek yayılımı hızı, refusal katmanı sertleştirmesini geride bırakıyor.

Türk güvenlik mühendisleri ve AI geliştiricileri için mesaj net: açık ağırlıklı model indirmek artık yalnızca yerel inference kurmak değil — potansiyel olarak exploit geliştirme kapasitesini de demokratize etmek anlamına geliyor. Bu, model governance, deployment policy ve red-team bütçelerinin yeniden değerlendirilmesini gerektirir.

Aynı günlerde ShinyHunters tutuklama haberi insan organize suçun hâlâ yüksek etkili ihlallerde dominant olduğunu gösteriyor. GLM-5.3 araştırması ise AI destekli tehdit yüzeyinin genişlediğini işaret ediyor — iki haber birbirini tamamlayan güvenlik kümesi oluşturuyor.

Teknik Detaylar

Karşılaştırma metodolojisi: Anthropic, GLM-5.3’ü kendi red-team ürün hattı Claude Mythos Preview ile karşılaştırdı. Bağımsız doğrulama dış harness’lerde henüz yayınlanmadı.

Bypass oranları: Test edilen koşullarda %64–%100 aralığı raporlandı. Bu oranlar savunmacıların hangi saldırı yüzeylerini önceliklendirmesi gerektiğini gösteriyor — reproduction guide niteliğinde teknik detay bu makalede yer almıyor.

Abliteration maliyeti: Yaklaşık 4.400 dolar compute, jailbreak-adjacent tekniklerin commoditization eşiğini somutlaştırıyor. Mechanistic interpretability ve refusal-layer hardening henüz weight release hızına yetişemiyor.

Zhipu AI yanıtı: Analiz zamanında Zhipu AI’nin kamuya açık bir yanıtı doğrulanmadı.

Thinking-token prefilling: Bu teknik, modelin iç düşünce token’larını manipüle ederek güvenlik filtrelerini atlatmayı hedefliyor. Savunmacılar için bu, reasoning model’lerde yeni bir saldırı yüzeyi olarak değerlendirilmeli — ancak bu makalede reproduction guide niteliğinde adım adım açıklama yer almıyor.

4 aylık frontier gap: Anthropic’in notu, açık ağırlıklı modellerin kapalı US frontier modellerine göre yaklaşık 4 ay geride olduğunu; ancak bu gecikmenin giderek kısaldığını gösteriyor. Saldırganlar için 4 ay, exploit geliştirme döngüsü açısından yeterli bir pencere olabilir.

Defender access çağrısı: Anthropic, savunmacıların Mythos sınıfı red-team araçlarına daha geniş erişim kazanması gerektiğini savunuyor. Bu, AI cybersecurity testing altyapısının kamu-özel ortaklık modeliyle ölçeklenmesi önerisine işaret ediyor.

Bağlam

GLM-5.3, GLM-5.2 hattının devamı niteliğinde Zhipu AI’nin açık ağırlıklı stratejisinin parçası. AI agent security ve agentic threat actors bağlamında insan organize suç hâlâ yüksek etkili ihlallerde dominant; ancak açık ağırlıklı modeller saldırı yüzeyini genişletiyor.

Cybersecurity topluluğu için mesaj net: açık ağırlıklı model politikası, yalnızca akademik özgürlük tartışması değil — operasyonel savunma kapasitesi meselesi.

NIST AI RMF çerçevesi ve CAISI’nin değerlendirme rolü, AI güvenlik testinin akademik nişten ulusal altyapı seviyesine taşındığını gösteriyor. AB, ABD ve Çin arasındaki açık ağırlıklı model politikası farklılıkları, global güvenlik postürünü parçalı hale getiriyor.

AI safety topluluğu içinde iki kamp görülüyor: açık ağırlıklı yayının şeffaflık ve denetlenebilirlik sağladığını savunanlar; ve yetenek yayılımını hızlandırdığı için geciktirme (safety delay) isteyenler. GLM-5.3 vakası, ikinci kampın somut kanıt setine yeni veri ekliyor.

Mechanistic interpretability araştırması, refusal katmanlarının neden weight release sonrası yetersiz kaldığını anlamak için kritik — ancak bu araştırmanın ticari ürünleştirme hızı, model yayın hızına yetişemiyor. Agentic threat actors bağlamında, otonom exploit zincirleme henüz kitlesel değil; ancak eşik düşüyor.

Kurumsal güvenlik ekipleri için pratik öneriler: açık ağırlıklı model deployment policy’lerini gözden geçirmek, red-team bütçelerini artırmak ve NIST CAISI değerlendirme kriterlerini internal risk framework’e entegre etmek. Politika yapıcılar için Anthropic’in devlet destekli güvenlik testi çağrısı, AI agent security düzenlemesinin bir sonraki aşamasını işaret ediyor.

Anthropic GLM-5.3 araştırma sayfası ve NIST CAISI değerlendirmesi, savunmacıların hangi benchmark’ları izlemesi gerektiğine dair referans kaynak olarak kullanılabilir. Bağımsız doğrulama henüz yayınlanmadı; Anthropic harness’i dışında tekrarlanabilirlik çalışmaları bekleniyor.

Açık ağırlıklı model ekosisteminde GLM-5.3, GLM-5.2 ve önceki Zhipu sürümlerinin yetenek eğrisini yukarı taşıyor. Her yeni weight release, savunma topluluğunun değerlendirme döngüsünü yeniden başlatmasını gerektiriyor — bu döngünün hızı, saldırgan adaptasyon hızına yetişemiyor.

Sonraki Adımlar

Bağımsız araştırmacıların Anthropic benchmark’ını doğrulaması bekleniyor. NIST CAISI’nin değerlendirme kriterlerinin genişletilmesi ve devlet destekli test programlarının kurulması gündemde. Zhipu AI’nin safeguard iddialarına yanıt vermesi halinde güncelleme gerekecek.

Güvenlik kümesinin diğer ayağı ShinyHunters tutuklaması, insan organize suçun yüksek etkili ihlallerde hâlâ dominant olduğunu gösteriyor. GLM-5.3 araştırması ise AI destekli tehdit yüzeyinin genişlediğini işaret ediyor — iki haber birlikte okunduğunda, savunma stratejilerinin hem geleneksel cybercrime hem de AI-amplified threat modellerini kapsaması gerektiği ortaya çıkıyor.

Türk güvenlik topluluğu için öneri: açık ağırlıklı model indirme ve deployment policy’lerini gözden geçirmek, red-team kapasitesini artırmak ve NIST CAISI değerlendirme çıktılarını internal risk framework’e entegre etmek. Politika düzeyinde Anthropic’in devlet destekli güvenlik testi çağrısı, uluslararası AI güvenlik standartları tartışmasının önemli bir girdisi.


Kaynaklar