Definition

AI copyright encompasses legal disputes over using copyrighted content to train large language models, the fair-use defense, publisher economic harm from AI products, and licensing frameworks for training data.

NYT v. OpenAI/Microsoft (September 2026 Escalation)

Unsealed summary judgment filings revealed internal admissions undermining defendants’ fair-use defense:

  • Microsoft Brent Hecht: Called AI scraping “the largest theft of labor in human history” and “an astonishing theft of unprecedented proportions”; said plan made “a complete mockery of ‘fair use’”
  • OpenAI leadership: Head of ChatGPT wrote publishers face “existential threat” from “largely substitutive” AI products
  • Scale: 91,692+ publisher works in mid-training datasets; 2.06M nytimes.com documents in Common Crawl; Project Mango dataset with 160,903 unique publisher works
  • Economic harm: Copilot reduced NYT click-through rates 87–93% below traditional Bing
  • Allegations: Paywall circumvention, copyright notice stripping, Bing dataset repurposing without consent

Allegations are from plaintiff court filings; defendants dispute liability and maintain fair-use defense. Trump administration filed brief supporting OpenAI's unlicensed training use.

Developer Implications

  • Training data licensing uncertainty affects all teams building on LLMs
  • RAG architectures and publisher partnership models as risk mitigation
  • Outcome will set precedent for global AI training practices

Sources