Summary
MIT Technology Review (Jul 30, 2026) covers an ICML 2026 paper arguing LLMs cannot be fully secured against prompt injection due to “role confusion”: models infer instruction source from writing style, not role tags. Attackers can inject forged chain-of-thought text that models treat as their own reasoning (“chain-of-thought forgery”), raising jailbreak success from near zero to ~60% across frontier models (OpenAI, Anthropic, Alibaba, DeepSeek). Won OpenAI’s Aug 2025 red-teaming hackathon; similar to OpenAI’s “fake chain of thought.” Authors Charles Ye and Jasmine Cui argue training-based defenses are incomplete; ETH’s Florian Tramèr praises the insight while noting layered defenses help but may not suffice for sensitive systems.
Source Analysis
See PreScreening Notes and Evaluation Report below for full source credibility, audience fit, risk, and publication strategy.
Research Notes
Additional Sources
- 2026-07-30-llm-chain-of-thought-forgery-icml — MIT Technology Review
- 2026-07-30-cot-forgery-arxiv — arXiv:2603.12277 primary paper
- 2026-07-30-cot-forgery-project-site — role-confusion.github.io
Key Facts Verified
- Confirmed: ICML 2026 paper by Ye, Cui, Hadfield-Menell; ~60% ASR via CoT Forgery vs near-zero baseline; role probes show style > tags; OpenAI Aug 2025 hackathon win; similar to OpenAI “fake CoT”/GPT-Red
- Expert: Florian Tramèr — insight strong; layered defenses help but may not suffice for sensitive systems
- Ethics: Conceptual mechanism only — no attack recipes beyond published summaries
Broader Context
Challenges “train away injections” as complete fix. Connects to agent security posture after OpenAI rogue-agent incidents.
Related Wiki
role-confusion · cot-forgery · chain-of-thought · prompt-injection · llm · openai · anthropic · ai-agent-security · agentic-ai · ai-red-teaming
Draft Article
ICML: Sahte Chain-of-Thought, LLM Jailbreak’ini ~%60’a Çıkarıyor
MIT Technology Review’un 30 Temmuz 2026 haberine göre ICML 2026’da sunulan bir çalışma, büyük dil modellerinin prompt-injection’a karşı tamamen güvence altına alınamayabileceğini savunuyor. Neden: role-confusion — modeller talimat kaynağını rol etiketlerinden değil yazım stilinden çıkarıyor. Saldırganlar, modelin kendi chain-of-thought notlarına benzeyen metin enjekte ederek modeli bunu kendi akıl yürütmesi gibi işlemeye ikna edebiliyor (cot-forgery).
Ana Gelişme
Charles Ye, Jasmine Cui ve ortak yazarların çalışmasına göre CoT forgery, frontier modellerde jailbreak başarı oranını (attack success rate) neredeyse sıfırdan yaklaşık %60’a çıkardı. Değerlendirme openai, anthropic, Alibaba ve DeepSeek modellerini kapsıyor. Keşif, Ağustos 2025’te OpenAI red-teaming hackathon’unu kazanmıştı; OpenAI araştırmacılarının aynı dönemde “fake chain of thought” / GPT-Red olarak adlandırdığı benzer bir bulgu da var.
Rol sondaları, etiketleri değiştirmenin neredeyse etkisiz kaldığını; metin CoT gibi görünüyorsa modelin onu CoT gibi işlediğini gösteriyor. Yazarlar, eğitim tabanlı savunmaların yapısal sorunu tek başına çözmediğini savunuyor. Ye, bazı senaryolarda sorunun “temelden çözülemez” olabileceğini söylüyor — bu kesin bir bilim yasası iddiası değil, yazarın yorumudur.
Neden Önemli?
agentic-ai ürünü çıkaran ekipler için pratik mesaj: “prompt injection’ı eğittik, bitti” iddiasına temkin. Hassas sistemlerde katmanlı kontroller — araç izinleri, insan onayı, dış sistem sandbox’ı — varsayılan olmalı. ai-agent-security tartışması, OpenAI rogue-agent olaylarından sonra zaten yoğunlaşmıştı; bu çalışma mekanizmayı bilimsel çerçeveye oturtuyor.
Teknik Detaylar
llm girdiyi user / assistant / system / tool / chain-of-thought rollerine bölünmüş sürekli metin olarak görüyor. Çalışma, rol kimliğinin etiketlerden çok lexikal ve stilistik kalıplarla çıkarıldığını gösteriyor. CoT forgery, bu stil eşlemesini kullanarak modelin “kendi düşüncesi” sandığı metni takip etmesini sağlıyor. Mekanizma kavramsal düzeyde aktarılmıştır; saldırı tarifi bu haberde yayımlanmaz.
Bağlam
ETH Zürich’ten Florian Tramèr, makalenin içgörüsünü olumlu bulduğunu; katmanlı savunmaların iyileştiğini ama yüksek hassasiyetli sistemler için yeterli olmayabileceğini belirtti. Yazarlar, test edilen bazı modellerin bir yıl öncesine ait olduğunu kabul ediyor; yine de daha iyi eğitimin yapısal boşluğu kapatmadığını savunuyorlar. “Sonsuza dek çözülemez” iddiasını abartmak doğru olmaz — alan katmanlı kontrollerle riski azaltmaya çalışıyor.
Sonraki Adımlar
İzlenecekler: frontier lab’lerin CoT / scratchpad izolasyonu, tool-use sandbox’ları ve ai-red-teaming pratikleri. Ürün ekipleri için checklist: stil tabanlı güvene dayalı güvenlik varsaymayın; agent çıktısını yüksek yetkili aksiyonlara bağlamadan önce insan veya politika katmanı koyun.
Ye’nin MIT Technology Review’a aktardığı uyarı sert: kurumlar LLM’lere kör güvenmemeli; ajanların yaptığı her şeyin güvensiz olabileceğini varsaymalıdır. Bu, “hiç ajan kullanmayın” tavsiyesi değil — tehdit modelini yapısal role confusion üzerine kurun demektir. Dual-use nedeniyle bu haberde saldırı tarifi verilmez; kamuya açık özet düzeyinde kalınır.
Kaynaklar
- MIT Technology Review: A fundamental flaw leaves LLMs vulnerable to attack
- arXiv:2603.12277 — Prompt Injection as Role Confusion
- Project site: role-confusion.github.io
PreScreening Notes
- Score 8 / priority high: Important ICML security research with cross-frontier jailbreak results; core AI audience topic.
- MIT Technology Review credible; same-day (Jul 30); AI domain; not a duplicate of prior prompt-injection coverage.
- Research news (not opinion essay); passes strongly.
Evaluation Report
News Value
- Timeliness: Same-day MIT TR coverage of ICML 2026 paper.
- Impact: Challenges “train the model to ignore injections” as a complete fix; ~60% jailbreak lift across frontier labs matters for anyone shipping agents.
- Prominence: OpenAI/Anthropic/Alibaba/DeepSeek evaluated; Florian Tramèr commentary; OpenAI hackathon pedigree.
- Proximity: High for AI builders and security engineers in Turkey’s growing agent/product scene.
- Novelty: “Role confusion” + CoT forgery as a fundamental framing — stronger than generic prompt-injection recap.
Audience Fit
- Highly actionable for teams building LLM apps/agents: assume style-based trust is exploitable; layered defenses required for sensitive systems.
- Connects to ai-agent-security, agentic-ai, llm, openai, anthropic, prompt-injection themes.
Risk & Ethics
- MIT Technology Review + ICML paper path is solid; Analysis should pull paper/authors for primary claims (~60% figure).
- Responsible disclosure / dual-use: describe mechanism at conceptual level; avoid publishable attack recipes beyond what TR already summarizes.
- Do not overclaim “unsolvable forever” — report authors’ and Tramèr’s nuanced positions.
Publication Strategy
- Format:
standard(600–800 words) — mechanism, cross-model results, defense implications, expert quote balance. - Related wiki: ai-agent-security, agentic-ai, llm, openai, anthropic.
Suggested Angle
Türkçe AI okuru için açı: “ICML çalışması: modeller rol etiketine değil yazım stiline güveniyor; sahte chain-of-thought jailbreak’i ~%60’a çıkarıyor — eğitim tabanlı savunma tek başına yetmiyor.” Ajans/ürün ekiplerine pratik mesaj: hassas sistemlerde katmanlı kontroller; ‘prompt injection çözüldü’ iddialarına temkin.
Editorial Notes
- Decision: Approved
- Angle: Confirmed — role confusion + CoT forgery as fundamental framing; training-only defenses incomplete; practical message for agent builders.
- Format:
standard(600–800 words) — confirmed - Reporting instructions:
- Conceptual mechanism only — no attack recipes beyond published summaries (dual-use).
- Balance authors’ claim with Florian Tramèr: layered defenses help, may not suffice for sensitive systems.
- Do not overclaim “unsolvable forever.”
- Cite ~60% ASR lift vs near-zero baseline across frontier models; ICML 2026 / OpenAI hackathon pedigree.
- Headline suggestions (TR):
- ICML: Sahte chain-of-thought, LLM jailbreak’ini ~%60’a çıkarıyor
- Rol karışıklığı: Modeller etikete değil yazım stiline güveniyor
- Prompt injection “eğitilerek bitmez” — CoT forgery ne gösteriyor?
- Mandatory points:
- Role confusion (style > role tags)
- CoT forgery → ~%60 ASR
- OpenAI/Anthropic/Alibaba/DeepSeek değerlendirmesi
- Tramèr nuance + agent güvenlik bağlantısı