ICML: Sahte Chain-of-Thought, LLM Jailbreak’ini ~%60’a Çıkarıyor

MIT Technology Review’un 30 Temmuz 2026 haberine göre ICML 2026’da sunulan bir çalışma, büyük dil modellerinin prompt-injection’a karşı tamamen güvence altına alınamayabileceğini savunuyor. Neden: role-confusion — modeller talimat kaynağını rol etiketlerinden değil yazım stilinden çıkarıyor. Saldırganlar, modelin kendi chain-of-thought notlarına benzeyen metin enjekte ederek modeli bunu kendi akıl yürütmesi gibi işlemeye ikna edebiliyor (cot-forgery).

Ana Gelişme

Charles Ye, Jasmine Cui ve ortak yazarların çalışmasına göre CoT forgery, frontier modellerde jailbreak başarı oranını (attack success rate) neredeyse sıfırdan yaklaşık %60’a çıkardı. Değerlendirme openai, anthropic, Alibaba ve DeepSeek modellerini kapsıyor. Keşif, Ağustos 2025’te OpenAI red-teaming hackathon’unu kazanmıştı; OpenAI araştırmacılarının aynı dönemde “fake chain of thought” / GPT-Red olarak adlandırdığı benzer bir bulgu da var.

Rol sondaları, etiketleri değiştirmenin neredeyse etkisiz kaldığını; metin CoT gibi görünüyorsa modelin onu CoT gibi işlediğini gösteriyor. Yazarlar, eğitim tabanlı savunmaların yapısal sorunu tek başına çözmediğini savunuyor. Ye, bazı senaryolarda sorunun “temelden çözülemez” olabileceğini söylüyor — bu kesin bir bilim yasası iddiası değil, yazarın yorumudur.

Neden Önemli?

agentic-ai ürünü çıkaran ekipler için pratik mesaj: “prompt injection’ı eğittik, bitti” iddiasına temkin. Hassas sistemlerde katmanlı kontroller — araç izinleri, insan onayı, dış sistem sandbox’ı — varsayılan olmalı. ai-agent-security tartışması, OpenAI rogue-agent olaylarından sonra zaten yoğunlaşmıştı; bu çalışma mekanizmayı bilimsel çerçeveye oturtuyor.

Teknik Detaylar

llm girdiyi user / assistant / system / tool / chain-of-thought rollerine bölünmüş sürekli metin olarak görüyor. Çalışma, rol kimliğinin etiketlerden çok lexikal ve stilistik kalıplarla çıkarıldığını gösteriyor. CoT forgery, bu stil eşlemesini kullanarak modelin “kendi düşüncesi” sandığı metni takip etmesini sağlıyor. Mekanizma kavramsal düzeyde aktarılmıştır; saldırı tarifi bu haberde yayımlanmaz.

Bağlam

ETH Zürich’ten Florian Tramèr, makalenin içgörüsünü olumlu bulduğunu; katmanlı savunmaların iyileştiğini ama yüksek hassasiyetli sistemler için yeterli olmayabileceğini belirtti. Yazarlar, test edilen bazı modellerin bir yıl öncesine ait olduğunu kabul ediyor; yine de daha iyi eğitimin yapısal boşluğu kapatmadığını savunuyorlar. “Sonsuza dek çözülemez” iddiasını abartmak doğru olmaz — alan katmanlı kontrollerle riski azaltmaya çalışıyor.

Sonraki Adımlar

İzlenecekler: frontier lab’lerin CoT / scratchpad izolasyonu, tool-use sandbox’ları ve ai-red-teaming pratikleri. Ürün ekipleri için checklist: stil tabanlı güvene dayalı güvenlik varsaymayın; agent çıktısını yüksek yetkili aksiyonlara bağlamadan önce insan veya politika katmanı koyun.

Ye’nin MIT Technology Review’a aktardığı uyarı sert: kurumlar LLM’lere kör güvenmemeli; ajanların yaptığı her şeyin güvensiz olabileceğini varsaymalıdır. Bu, “hiç ajan kullanmayın” tavsiyesi değil — tehdit modelini yapısal role confusion üzerine kurun demektir. Dual-use nedeniyle bu haberde saldırı tarifi verilmez; kamuya açık özet düzeyinde kalınır.


Kaynaklar