Microsoft’un gizli itirafları: AI eğitim verisi ‘tarihin en büyük emek hırsızlığı’
The New York Times’ın OpenAI ve Microsoft’a karşı telif hakkı davasında açılan yeni dosyalar, şirket içi yazışmalarda AI eğitim verisinin “hırsızlık” olarak tanımlandığını ve gazeteciliğe “varoluşsal tehdit” oluşturduğunu ortaya koyuyor. Tüm alıntılar ve istatistikler davacı iddialarından kaynaklanıyor; Microsoft ve OpenAI sorumluluğu reddediyor.
Ana Gelişme
17 Eylül 2026’da TechCrunch’in raporladığı açılan dosyalar, üç yıllık fair-use tartışmasında yeni bir boyut açıyor. Trump yönetimi, OpenAI’nin lisansız eğitim kullanımını destekleyen bir brifing dosyaladı — ancak iç itiraflar savunmayı zayıflatıyor.
Microsoft Applied Science Direktörü Brent Hecht, Ocak 2023 tarihli bir notta scraping’i “tarihin en büyük emek hırsızlığı” (largest theft of labor in human history) olarak nitelendirdi. OpenAI Head of ChatGPT, yayıncıların “largely substitutive” AI ürünlerinden “varoluşsal tehdit” (existential threat) altında olduğunu yazdı.
Project Mango ve Bing Veri Seti
Dosyalar, Project Mango veri setinde 160.903 benzersiz yayıncı içeriği olduğunu iddia ediyor. Mid-training veri setlerinde 91.692’den fazla yayıncı çalışması ve Common Crawl’da 2,06 milyon nytimes.com belgesi bulunduğu öne sürülüyor.
Bing veri setinin, yayıncı onayı olmadan eğitim verisi olarak satıldığı iddiası da dosyalarda yer alıyor. Paywall bypass ve copyright notice stripping suçlamaları ayrı başlıklar altında detaylandırılıyor.
Copilot’un NYT İçeriğine Etkisi
Microsoft verilerine göre, Copilot NYT içeriği için geleneksel Bing’e kıyasla %87–93 daha düşük click-through rate (CTR) üretiyor. Bu veri yalnızca NYT özelinde; genel sonuç çıkarılamaz — ancak yayıncı gelir modeline doğrudan etkiyi somutlaştırıyor.
Fair-Use Savunması ve İç Çelişki
OpenAI ve Microsoft, eğitim verisi kullanımının fair-use kapsamında olduğunu savunuyor. Ancak iç “hırsızlık” dili, substitution (ikame) savunmasını doğrudan çelişkiye sokuyor: şirket içinde ürünlerin yayıncı içeriğini ikame ettiği kabul ediliyor.
CustomGPT “Bypass Paywall” projeleri ve kasıtlı copyright notice stripping iddiaları, savunmanın etik boyutunu daha da karmaşıklaştırıyor.
Neden Önemli?
Bu dava, küresel AI eğitim verisi lisanslama öncedeni için landmark niteliğinde. İç itiraflar, yayıncı-AI anlaşmazlıklarının hukuki ve etik boyutunu netleştiriyor.
Türk ve Avrupa yayıncı-AI anlaşmazlıklarında benzer dinamikler ortaya çıkıyor: eğitim verisi kullanımı, RAG vs fine-tuning risk profili ve yayıncı ortaklık modelleri tartışılıyor.
Teknik Detaylar — Geliştirici Perspektifi
RAG vs fine-tuning: Retrieval-Augmented Generation, eğitim verisi yerine runtime’da kaynak erişimi kullanır — telif riski profili farklıdır. Fine-tuning ve mid-training veri setleri, lisanslama gereksinimlerini artırır.
Eğitim verisi etiği: 91.692+ yayıncı içeriği iddiası, veri provenance ve consent mekanizmalarının önemini vurguluyor. Geliştiriciler, training data pipeline’larında kaynak doğrulama ve lisans uyumluluğu kontrolleri uygulamalıdır.
Publisher partnership modelleri: NYT davası, lisanslı içerik anlaşmalarının (Reuters, AP modeli) AI eğitiminde alternatif yol olduğunu gösteriyor.
Bağlam
Dava, SDNY’de (Southern District of New York) devam ediyor. Davacı summary judgment motion’ı, birincil mahkeme dosyasında (CourtListener) erişilebilir. Ars Technica ve Washington Post, Project Mango detaylarını ve Brockman/Nadella alıntılarını doğruladı.
Trump yönetiminin fair-use destekleyici brifingi, federal politika boyutunu ekliyor. Ancak iç keşif materyalleri, mahkeme kararını etkileyebilecek güçlü kanıtlar sunuyor.
Türk ve EU Karşılaştırması
Türkiye’de yayıncı kuruluşlar, AI şirketlerinin içerik kullanımına karşı benzer endişeleri dile getiriyor. AB’de AI Act ve telif direktifleri, eğitim verisi kullanımını daha sıkı çerçeveliyor. NYT davasının sonucu, bu bölgelerdeki düzenleyici ve ticari anlaşmalar için referans oluşturacak.
Sonraki Adımlar
Summary judgment kararı ve keşif sürecinin devamı izlenecek. Yayıncı-AI lisanslama anlaşmaları ve alternatif eğitim verisi kaynakları (synthetic data, licensed corpora) tartışması yoğunlaşacak.
Geliştiriciler için: training data audit, consent tracking ve RAG-first mimari, telif riskini azaltmanın pratik adımları olarak öne çıkıyor.