Summary
New unredacted filings in The New York Times’ copyright lawsuit against OpenAI and Microsoft reveal internal admissions that AI training on publisher content constituted “theft” and posed an “existential threat” to journalism. Microsoft data showed Copilot reduced NYT click-through rates up to 93%. Filings allege paywall circumvention, 91,692+ copied works in mid-training datasets, and deliberate copyright notice stripping.
Source Analysis
TechCrunch coverage of unsealed litigation material (September 17, 2026). Escalation in three-year-old fair-use dispute; Trump administration recently filed brief supporting OpenAI’s unlicensed training use.
Research Notes
Additional Sources Found
- 2026-09-17-microsoft-nyt-scraping-reuters — Reuters; Brockman/Nadella quotes; fair-use defense undermined
- 2026-09-17-microsoft-nyt-scraping-ars-technica — Project Mango details; Bing dataset repurposing
- Washington Post, Ars Technica — Brent Hecht “theft” quotes; CustomGPT “Bypass Paywall” projects
- CourtListener primary filing (SDNY) — plaintiff motion for summary judgment
Key Facts Verified (Court Filings)
- Confirmed: Brent Hecht (Microsoft Director of Applied Science) called scraping “largest theft of labor in human history” (Jan 2023 memo)
- Confirmed: OpenAI Head of ChatGPT wrote publishers face “existential threat” from “largely substitutive” AI products
- Confirmed: 91,692+ publisher works in mid-training datasets; 2.06M nytimes.com documents in Common Crawl
- Confirmed: Project Mango dataset: 160,903 unique publisher works
- Confirmed: Copilot CTR 87–93% below traditional Bing for NYT content
- Allegations: Paywall bypass, copyright notice stripping, Bing dataset sold as training data without consent
- Defense: OpenAI/Microsoft maintain fair-use defense; Trump admin brief supports unlicensed training
All quotes and statistics are from plaintiff court filings or plaintiff-cited discovery. Defendants dispute liability. Verify against primary filings before reporting.
Broader Context
- Landmark case for global AI training data licensing precedent
- Internal “theft” language directly contradicts fair-use substitution defense
- Developer implications: training data ethics, RAG vs fine-tuning risk, publisher partnership models
- Parallels emerging in Turkish and European publisher-AI disputes
Related Wiki Pages
- ai-copyright, nyt-openai-copyright-lawsuit, fair-use, ai-training-data
- project-mango, openai, microsoft, new-york-times, copilot
Draft Article
Published as: 2026-09-17-microsoft-ai-scraping-theft-testimony
PreScreening Notes
Score: 9/10 | Priority: critical
Suggested Angle
Türkçe başlık önerisi: “Microsoft’un gizli itirafları: AI eğitim verisi ‘tarihin en büyük emek hırsızlığı‘“
Editorial Notes
Onay: deep-dive formatı onaylandı. Önerilen açı korunacak — mahkeme dosyalarındaki iç itiraflar ve fair-use savunmasına etkisi.
Reporting talimatları:
- Tüm alıntı ve istatistikleri davacı iddiaları olarak çerçevele; Microsoft/OpenAI yanıtlarını dahil et
- Project Mango, Bing veri seti ve paywall bypass iddialarını ayrı alt başlıklarla yapılandır
- Copilot CTR (%87–93 düşüş) verisini NYT özelinde sun; genel sonuç çıkarma
- Trump yönetiminin fair-use destekleyici brifingini bağlam olarak belirt
- Türk/EU yayıncı-AI anlaşmazlıklarına kısa karşılaştırma paragrafı ekle
Başlık önerileri (TR):
- Microsoft’un gizli itirafları: AI eğitim verisi ‘tarihin en büyük emek hırsızlığı’
- NYT davasında açılan dosyalar: OpenAI ve Microsoft iç yazışmaları fair-use savunmasını zayıflatıyor
- 91.692+ kopyalanan haber: NYT–OpenAI telif davasında yeni belgeler ortaya çıktı
Makalede mutlaka yer almalı:
- Brent Hecht “largest theft of labor in human history” alıntısı (Ocak 2023 memo)
- 91.692+ yayıncı içeriği ve 2,06M nytimes.com belgesi istatistikleri
- Project Mango: 160.903 benzersiz yayıncı içeriği
- Copilot’un NYT içeriği için CTR düşüşü
- Fair-use savunması ve Trump yönetimi brifingi
- Geliştirici perspektifi: RAG vs fine-tuning, eğitim verisi etiği