Summary

MIT Technology Review (Jul 30, 2026) covers an ICML 2026 paper arguing LLMs cannot be fully secured against prompt injection due to “role confusion”: models infer instruction source from writing style, not role tags. Attackers can inject forged chain-of-thought text that models treat as their own reasoning (“chain-of-thought forgery”), raising jailbreak success from near zero to ~60% across frontier models (OpenAI, Anthropic, Alibaba, DeepSeek). Won OpenAI’s Aug 2025 red-teaming hackathon; similar to OpenAI’s “fake chain of thought.” Authors Charles Ye and Jasmine Cui argue training-based defenses are incomplete; ETH’s Florian Tramèr praises the insight while noting layered defenses help but may not suffice for sensitive systems.

Source Analysis

See PreScreening Notes and Evaluation Report below for full source credibility, audience fit, risk, and publication strategy.

Research Notes

Additional Sources

Key Facts Verified

  • Confirmed: ICML 2026 paper by Ye, Cui, Hadfield-Menell; ~60% ASR via CoT Forgery vs near-zero baseline; role probes show style > tags; OpenAI Aug 2025 hackathon win; similar to OpenAI “fake CoT”/GPT-Red
  • Expert: Florian Tramèr — insight strong; layered defenses help but may not suffice for sensitive systems
  • Ethics: Conceptual mechanism only — no attack recipes beyond published summaries

Broader Context

Challenges “train away injections” as complete fix. Connects to agent security posture after OpenAI rogue-agent incidents.

role-confusion · cot-forgery · chain-of-thought · prompt-injection · llm · openai · anthropic · ai-agent-security · agentic-ai · ai-red-teaming

Draft Article

ICML: Sahte Chain-of-Thought, LLM Jailbreak’ini ~%60’a Çıkarıyor

MIT Technology Review’un 30 Temmuz 2026 haberine göre ICML 2026’da sunulan bir çalışma, büyük dil modellerinin prompt-injection’a karşı tamamen güvence altına alınamayabileceğini savunuyor. Neden: role-confusion — modeller talimat kaynağını rol etiketlerinden değil yazım stilinden çıkarıyor. Saldırganlar, modelin kendi chain-of-thought notlarına benzeyen metin enjekte ederek modeli bunu kendi akıl yürütmesi gibi işlemeye ikna edebiliyor (cot-forgery).

Ana Gelişme

Charles Ye, Jasmine Cui ve ortak yazarların çalışmasına göre CoT forgery, frontier modellerde jailbreak başarı oranını (attack success rate) neredeyse sıfırdan yaklaşık %60’a çıkardı. Değerlendirme openai, anthropic, Alibaba ve DeepSeek modellerini kapsıyor. Keşif, Ağustos 2025’te OpenAI red-teaming hackathon’unu kazanmıştı; OpenAI araştırmacılarının aynı dönemde “fake chain of thought” / GPT-Red olarak adlandırdığı benzer bir bulgu da var.

Rol sondaları, etiketleri değiştirmenin neredeyse etkisiz kaldığını; metin CoT gibi görünüyorsa modelin onu CoT gibi işlediğini gösteriyor. Yazarlar, eğitim tabanlı savunmaların yapısal sorunu tek başına çözmediğini savunuyor. Ye, bazı senaryolarda sorunun “temelden çözülemez” olabileceğini söylüyor — bu kesin bir bilim yasası iddiası değil, yazarın yorumudur.

Neden Önemli?

agentic-ai ürünü çıkaran ekipler için pratik mesaj: “prompt injection’ı eğittik, bitti” iddiasına temkin. Hassas sistemlerde katmanlı kontroller — araç izinleri, insan onayı, dış sistem sandbox’ı — varsayılan olmalı. ai-agent-security tartışması, OpenAI rogue-agent olaylarından sonra zaten yoğunlaşmıştı; bu çalışma mekanizmayı bilimsel çerçeveye oturtuyor.

Teknik Detaylar

llm girdiyi user / assistant / system / tool / chain-of-thought rollerine bölünmüş sürekli metin olarak görüyor. Çalışma, rol kimliğinin etiketlerden çok lexikal ve stilistik kalıplarla çıkarıldığını gösteriyor. CoT forgery, bu stil eşlemesini kullanarak modelin “kendi düşüncesi” sandığı metni takip etmesini sağlıyor. Mekanizma kavramsal düzeyde aktarılmıştır; saldırı tarifi bu haberde yayımlanmaz.

Bağlam

ETH Zürich’ten Florian Tramèr, makalenin içgörüsünü olumlu bulduğunu; katmanlı savunmaların iyileştiğini ama yüksek hassasiyetli sistemler için yeterli olmayabileceğini belirtti. Yazarlar, test edilen bazı modellerin bir yıl öncesine ait olduğunu kabul ediyor; yine de daha iyi eğitimin yapısal boşluğu kapatmadığını savunuyorlar. “Sonsuza dek çözülemez” iddiasını abartmak doğru olmaz — alan katmanlı kontrollerle riski azaltmaya çalışıyor.

Sonraki Adımlar

İzlenecekler: frontier lab’lerin CoT / scratchpad izolasyonu, tool-use sandbox’ları ve ai-red-teaming pratikleri. Ürün ekipleri için checklist: stil tabanlı güvene dayalı güvenlik varsaymayın; agent çıktısını yüksek yetkili aksiyonlara bağlamadan önce insan veya politika katmanı koyun.

Ye’nin MIT Technology Review’a aktardığı uyarı sert: kurumlar LLM’lere kör güvenmemeli; ajanların yaptığı her şeyin güvensiz olabileceğini varsaymalıdır. Bu, “hiç ajan kullanmayın” tavsiyesi değil — tehdit modelini yapısal role confusion üzerine kurun demektir. Dual-use nedeniyle bu haberde saldırı tarifi verilmez; kamuya açık özet düzeyinde kalınır.


Kaynaklar

PreScreening Notes

  • Score 8 / priority high: Important ICML security research with cross-frontier jailbreak results; core AI audience topic.
  • MIT Technology Review credible; same-day (Jul 30); AI domain; not a duplicate of prior prompt-injection coverage.
  • Research news (not opinion essay); passes strongly.

Evaluation Report

News Value

  • Timeliness: Same-day MIT TR coverage of ICML 2026 paper.
  • Impact: Challenges “train the model to ignore injections” as a complete fix; ~60% jailbreak lift across frontier labs matters for anyone shipping agents.
  • Prominence: OpenAI/Anthropic/Alibaba/DeepSeek evaluated; Florian Tramèr commentary; OpenAI hackathon pedigree.
  • Proximity: High for AI builders and security engineers in Turkey’s growing agent/product scene.
  • Novelty: “Role confusion” + CoT forgery as a fundamental framing — stronger than generic prompt-injection recap.

Audience Fit

Risk & Ethics

  • MIT Technology Review + ICML paper path is solid; Analysis should pull paper/authors for primary claims (~60% figure).
  • Responsible disclosure / dual-use: describe mechanism at conceptual level; avoid publishable attack recipes beyond what TR already summarizes.
  • Do not overclaim “unsolvable forever” — report authors’ and Tramèr’s nuanced positions.

Publication Strategy

Suggested Angle

Türkçe AI okuru için açı: “ICML çalışması: modeller rol etiketine değil yazım stiline güveniyor; sahte chain-of-thought jailbreak’i ~%60’a çıkarıyor — eğitim tabanlı savunma tek başına yetmiyor.” Ajans/ürün ekiplerine pratik mesaj: hassas sistemlerde katmanlı kontroller; ‘prompt injection çözüldü’ iddialarına temkin.

Editorial Notes

  • Decision: Approved
  • Angle: Confirmed — role confusion + CoT forgery as fundamental framing; training-only defenses incomplete; practical message for agent builders.
  • Format: standard (600–800 words) — confirmed
  • Reporting instructions:
    • Conceptual mechanism only — no attack recipes beyond published summaries (dual-use).
    • Balance authors’ claim with Florian Tramèr: layered defenses help, may not suffice for sensitive systems.
    • Do not overclaim “unsolvable forever.”
    • Cite ~60% ASR lift vs near-zero baseline across frontier models; ICML 2026 / OpenAI hackathon pedigree.
  • Headline suggestions (TR):
    1. ICML: Sahte chain-of-thought, LLM jailbreak’ini ~%60’a çıkarıyor
    2. Rol karışıklığı: Modeller etikete değil yazım stiline güveniyor
    3. Prompt injection “eğitilerek bitmez” — CoT forgery ne gösteriyor?
  • Mandatory points:
    • Role confusion (style > role tags)
    • CoT forgery → ~%60 ASR
    • OpenAI/Anthropic/Alibaba/DeepSeek değerlendirmesi
    • Tramèr nuance + agent güvenlik bağlantısı