Definition
AI copyright encompasses legal disputes over using copyrighted content to train large language models, the fair-use defense, publisher economic harm from AI products, and licensing frameworks for training data.
NYT v. OpenAI/Microsoft (September 2026 Escalation)
Unsealed summary judgment filings revealed internal admissions undermining defendants’ fair-use defense:
- Microsoft Brent Hecht: Called AI scraping “the largest theft of labor in human history” and “an astonishing theft of unprecedented proportions”; said plan made “a complete mockery of ‘fair use’”
- OpenAI leadership: Head of ChatGPT wrote publishers face “existential threat” from “largely substitutive” AI products
- Scale: 91,692+ publisher works in mid-training datasets; 2.06M nytimes.com documents in Common Crawl; Project Mango dataset with 160,903 unique publisher works
- Economic harm: Copilot reduced NYT click-through rates 87–93% below traditional Bing
- Allegations: Paywall circumvention, copyright notice stripping, Bing dataset repurposing without consent
Allegations are from plaintiff court filings; defendants dispute liability and maintain fair-use defense. Trump administration filed brief supporting OpenAI's unlicensed training use.
Developer Implications
- Training data licensing uncertainty affects all teams building on LLMs
- RAG architectures and publisher partnership models as risk mitigation
- Outcome will set precedent for global AI training practices