Definition

AI training data governance covers how platforms collect, consent, and use user-generated content to train generative AI models — including opt-in vs opt-out defaults, scope of included content, and separation from operational AI features.

Key Points

  • 2026-09-17: NYT v. OpenAI/Microsoft unsealed filings — 91,692+ publisher works in mid-training datasets; project-mango with 160,903 unique works; paywall bypass allegations (ai-copyright, nyt-openai-copyright-lawsuit)
  • Default opt-out controversy: twitch defaults streamers into amazon GenAI training; buried toggle in Security and Privacy
  • Scope separation: Opt-out from model training ≠ opt-out from AutoMod, captions, ad targeting
  • Third-party chat data: Viewers on non-opted-out streams may contribute chat logs
  • Historical use uncertainty: Twitch CPO could not confirm prior training use
  • Industry pattern: platforms frame as “opt-out setting added” rather than “training begins”

Sources