AI Agent’lar Freelance İşlerin %16’sını Profesyonel Kalitede Tamamlayabiliyor
center-for-ai-safety ve Scale Labs’ın Remote Labor Index (RLI) güncellemesi, claude-fable-5’in 240 gerçek freelance projede %16,1 otomasyon oranına ulaştığını gösteriyor. Sekiz ay önceki %2,5’ten bu rakam dört katın üzerinde arttı. Ancak CAIS, AI hakemlerin insan değerlendiricilere kıyasla 2,5–3 kat fazla puan verdiğini uyarıyor.
Ana Gelişme
RLI, AI agent’ların gerçek freelance projeleri profesyonel kalitede tamamlama oranını insan değerlendiricilerle ölçüyor. 2 Temmuz 2026 güncellemesindeki sonuçlar:
| Model | Otomasyon Oranı |
|---|---|
| claude-fable-5 | %16,1 |
| claude-opus-4-8 | %8,3 |
| gpt-56 (GPT-5.5) | %6,3 |
Benchmark, toplam $144.000 değerinde 240 projeyi kapsıyor. Projeler 358 doğrulanmış freelancer’dan alındı; 3D/CAD, mimari, grafik tasarım, video, ses, veri analizi ve web uygulamaları gibi kategorileri içeriyor.
Önceki lider Opus 4.6 (Claude Cowork scaffold ile) %4,17’deydi. RLI’nin lansmanından bu yana geçen sekiz ayda en iyi oran %2,5’ten %16,1’e sıçradı.
claude-fable-5’in 240 projeden 218’i, ABD hükümetinin erişimi kısıtlamasından önce değerlendirildi. Kalan 22 projede tamamen başarısız olsa bile oran %14,6 olurdu — yine de en yüksek skor.
Neden Önemli?
%16 otomasyon oranı, %16 iş kaybı anlamına gelmez. RLI, belirli freelance projelerin profesyonel standartta tamamlanma oranını ölçer; genel istihdam etkisini doğrudan tahmin etmez.
RLI, AI işgücü otomasyonu tartışmasına ampirik zemin sağlıyor. Spekülasyon yerine gerçek freelance işler üzerinde ölçüm yapılması, benchmark’ın güvenilirliğini artırıyor.
CAIS’in AI hakem uyarısı kritik: otomatik değerlendirme sistemleri çıktıları 2,5–3 kat fazla puanlıyor. Hands-on software görevlerinde insan değerlendirmesi hâlâ şart. Bu, ai-benchmarks alanında yaygın bir metodolojik tuzak.
Türk geliştirici topluluğu için mesaj net: agent yetenekleri hızla artıyor, ancak çoğu projede profesyonel kaliteye ulaşamıyor. %16 bile “çoğunlukla başarısız” demek.
Teknik Detaylar
RLI metodolojisi, Upwork benzeri platformlardan gerçek freelance projeleri topluyor ve AI agent’lara veriyor. İnsan değerlendiriciler, çıktıları profesyonel standartta olup olmadığına göre puanlıyor. Otomasyon oranı, profesyonel kalitede tamamlanan projelerin toplam içindeki payı.
AI hakemlerin aşırı puanlama eğilimi, özellikle kodlama ve tasarım gibi subjektif değerlendirme gerektiren alanlarda belirgin. CAIS, gelecek güncellemelerde insan değerlendirmesini merkeze almaya devam edeceğini belirtiyor.
Bağlam
claude-fable-5’in ABD hükümeti tarafından kısıtlanması ve aynı hafta kısmen geri açılması, RLI sonuçlarını openai-trump-five-percent-stake haberindeki AI governance tartışmasıyla birleştiriyor. Devlet, frontier modellerin yeteneklerini hem ölçüyor hem de erişimini kontrol ediyor.
agentic-ai deployment’ında yetenek ile güvenilirlik arasındaki gerilim devam ediyor. RLI yetenek tarafını ölçerken, enterprise ortamlarda hallucination ve güvenilirlik hâlâ asıl darboğaz.
Sonraki Adımlar
CAIS ve Scale Labs, RLI’yi düzenli güncellemeye devam edecek. Fable 5’in kısıtlama sonrası performansı ve yeni modellerin katılımı izlenecek. İnsan değerlendirmesi maliyeti benchmark ölçeğini sınırlıyor — otomatik değerlendirme iyileştirmeleri metodolojik tartışmayı sürdürecek.
Kaynaklar
- A Significant Increase in Digital Labor Automation (Center for AI Safety)
- AI agents can now complete 16 percent of freelance jobs at pro quality (THE DECODER)