Definition
AI training data governance covers how platforms collect, consent, and use user-generated content to train generative AI models — including opt-in vs opt-out defaults, scope of included content, and separation from operational AI features.
Key Points
- 2026-09-17: NYT v. OpenAI/Microsoft unsealed filings — 91,692+ publisher works in mid-training datasets; project-mango with 160,903 unique works; paywall bypass allegations (ai-copyright, nyt-openai-copyright-lawsuit)
- Default opt-out controversy: twitch defaults streamers into amazon GenAI training; buried toggle in Security and Privacy
- Scope separation: Opt-out from model training ≠ opt-out from AutoMod, captions, ad targeting
- Third-party chat data: Viewers on non-opted-out streams may contribute chat logs
- Historical use uncertainty: Twitch CPO could not confirm prior training use
- Industry pattern: platforms frame as “opt-out setting added” rather than “training begins”