Summary

New unredacted filings in The New York Times’ copyright lawsuit against OpenAI and Microsoft reveal internal admissions that AI training on publisher content constituted “theft” and posed an “existential threat” to journalism. Microsoft data showed Copilot reduced NYT click-through rates up to 93%. Filings allege paywall circumvention, 91,692+ copied works in mid-training datasets, and deliberate copyright notice stripping.

Source Analysis

TechCrunch coverage of unsealed litigation material (September 17, 2026). Escalation in three-year-old fair-use dispute; Trump administration recently filed brief supporting OpenAI’s unlicensed training use.

Research Notes

Additional Sources Found

Key Facts Verified (Court Filings)

  • Confirmed: Brent Hecht (Microsoft Director of Applied Science) called scraping “largest theft of labor in human history” (Jan 2023 memo)
  • Confirmed: OpenAI Head of ChatGPT wrote publishers face “existential threat” from “largely substitutive” AI products
  • Confirmed: 91,692+ publisher works in mid-training datasets; 2.06M nytimes.com documents in Common Crawl
  • Confirmed: Project Mango dataset: 160,903 unique publisher works
  • Confirmed: Copilot CTR 87–93% below traditional Bing for NYT content
  • Allegations: Paywall bypass, copyright notice stripping, Bing dataset sold as training data without consent
  • Defense: OpenAI/Microsoft maintain fair-use defense; Trump admin brief supports unlicensed training

All quotes and statistics are from plaintiff court filings or plaintiff-cited discovery. Defendants dispute liability. Verify against primary filings before reporting.

Broader Context

  • Landmark case for global AI training data licensing precedent
  • Internal “theft” language directly contradicts fair-use substitution defense
  • Developer implications: training data ethics, RAG vs fine-tuning risk, publisher partnership models
  • Parallels emerging in Turkish and European publisher-AI disputes

Draft Article

Published as: 2026-09-17-microsoft-ai-scraping-theft-testimony

PreScreening Notes

Score: 9/10 | Priority: critical

Suggested Angle

Türkçe başlık önerisi: “Microsoft’un gizli itirafları: AI eğitim verisi ‘tarihin en büyük emek hırsızlığı‘“

Editorial Notes

Onay: deep-dive formatı onaylandı. Önerilen açı korunacak — mahkeme dosyalarındaki iç itiraflar ve fair-use savunmasına etkisi.

Reporting talimatları:

  • Tüm alıntı ve istatistikleri davacı iddiaları olarak çerçevele; Microsoft/OpenAI yanıtlarını dahil et
  • Project Mango, Bing veri seti ve paywall bypass iddialarını ayrı alt başlıklarla yapılandır
  • Copilot CTR (%87–93 düşüş) verisini NYT özelinde sun; genel sonuç çıkarma
  • Trump yönetiminin fair-use destekleyici brifingini bağlam olarak belirt
  • Türk/EU yayıncı-AI anlaşmazlıklarına kısa karşılaştırma paragrafı ekle

Başlık önerileri (TR):

  • Microsoft’un gizli itirafları: AI eğitim verisi ‘tarihin en büyük emek hırsızlığı’
  • NYT davasında açılan dosyalar: OpenAI ve Microsoft iç yazışmaları fair-use savunmasını zayıflatıyor
  • 91.692+ kopyalanan haber: NYT–OpenAI telif davasında yeni belgeler ortaya çıktı

Makalede mutlaka yer almalı:

  • Brent Hecht “largest theft of labor in human history” alıntısı (Ocak 2023 memo)
  • 91.692+ yayıncı içeriği ve 2,06M nytimes.com belgesi istatistikleri
  • Project Mango: 160.903 benzersiz yayıncı içeriği
  • Copilot’un NYT içeriği için CTR düşüşü
  • Fair-use savunması ve Trump yönetimi brifingi
  • Geliştirici perspektifi: RAG vs fine-tuning, eğitim verisi etiği