Summary

The Center for AI Safety and Scale Labs’ Remote Labor Index (RLI) updated July 2, 2026 shows Fable 5 achieving a record 16.1% automation rate on 240 real freelance projects ($144K total value) — up from 2.5% eight months ago. Opus 4.8 scored 8.3%, GPT-5.5 6.3%. Human evaluators remain essential; AI judges over-scored outputs by 2.5–3x. Even top models fail most projects at professional quality.

Source Analysis

Primary: THE DECODER covering CAIS/Scale Labs RLI benchmark. Related to recently restored Fable 5 access.

PreScreening assessment: THE DECODER is credible for AI news; CAIS/Scale Labs RLI is an established benchmark. Same-day story (July 2, 2026). Fits AI domain strongly. 6.4x improvement in automation rate (2.5% → 16.1%) over eight months is a significant milestone with broad implications for labor markets and agent capabilities. No duplicate found. High developer/AI enthusiast audience interest.

Research Notes

Additional Sources

  • 2026-07-02-remote-labor-index-cais-official — CAIS primary blog post with leaderboard data
  • The Rundown AI — Fable 5 access restoration context same week
  • Scale Labs RLI paper — original benchmark methodology (Oct 2025 baseline 2.5%)

Key Facts Verified

  • Confirmed: Fable 5 16.1%, Opus 4.8 8.3%, GPT-5.5 6.3% on 240 projects ($144K total)
  • Confirmed: Automation rate rose from 2.5% at launch to 16.1% in <8 months (>4×)
  • Confirmed: 218/240 Fable 5 projects evaluated before U.S. government access restriction; worst-case 14.6%
  • Confirmed: AI judges over-score 2.5–3× vs human evaluators — hands-on software tasks require human grading

Broader Context

Empirical grounding for AI labor automation debate — not speculation. Ties to government scrutiny of claude-fable-5 and openai-trump-five-percent-stake governance narrative. 16% ≠ 16% job loss — measures task completion at professional standard.

PreScreening Notes

Score: 8/10 | Priority: high

Important benchmark milestone showing rapid agent capability growth on real freelance work. The human-evaluator vs AI-judge discrepancy adds analytical depth. Strong story for AI agents and automation coverage.

Evaluation Report

News Value Assessment

  • Timeliness: Excellent — RLI updated July 2, 2026; ties to Fable 5 access restoration same week.
  • Impact: High — 6.4x automation rate improvement (2.5% → 16.1%) in 8 months on real freelance work.
  • Prominence: CAIS, Scale Labs, Fable 5, Opus 4.8, GPT-5.5 — established benchmark with frontier models.
  • Proximity: High — freelance/remote work automation resonates with Turkish developer community.
  • Novelty: New benchmark record with methodological insight (AI judges over-score 2.5–3x).

Audience Fit

  • Primary audience: AI enthusiasts and software developers — agent capability benchmarking.
  • Actionability: Moderate — helps calibrate expectations for AI agent deployment in real work.
  • Topic connection: Links to OpenAI governance story (Fable 5 government scrutiny); agentic AI wiki topics.

Risk & Ethics Assessment

  • Established benchmark (RLI) with real freelance projects — credible methodology.
  • Human evaluator vs AI judge discrepancy is important caveat — must be highlighted.
  • Labor market implications require balanced framing — “16% automation” ≠ “16% job loss.”

Publication Strategy

Suggested Angle

Türkçe başlık önerisi: “AI agent’lar freelance işlerin %16’sını profesyonel kalitede tamamlayabiliyor”

Remote Labor Index’in 8 ayda 2.5%‘ten 16.1%‘e sıçramasını merkeze al. 240 gerçek freelance projesi ($144K değer) üzerindeki metodolojiyi açıkla. AI hakemlerin 2.5–3x fazla puan vermesi uyarısını vurgula — insan değerlendirmesinin hâlâ kritik olduğunu belirt. Fable 5, Opus 4.8 ve GPT-5.5 karşılaştırmasını somut verilerle sun.

Editorial Notes

Onay durumu: Onaylandı — standard formatı (600–800 kelime)

Onaylanan açı: RLI benchmark rekoru; AI agent yetenek artışı ve metodolojik uyarılar.

Reporting talimatları:

  • “%16 otomasyon ≠ %16 iş kaybı” uyarısını belirgin şekilde vurgula
  • AI hakemlerin 2.5–3x fazla puan vermesi metodolojik uyarısı kritik
  • OpenAI governance hikayesine (Fable 5 devlet denetimi) kısa cross-link
  • CAIS resmi blog’u birincil kaynak

Başlık önerileri:

  • “AI agent’lar freelance işlerin %16’sını profesyonel kalitede tamamlayabiliyor”
  • “Remote Labor Index rekoru: 8 ayda 2.5%‘ten %16.1’e sıçrama”
  • “Fable 5 liderliğinde AI otomasyon oranı 6 kat arttı — ama insan değerlendirmesi hâlâ şart”

Makalede mutlaka yer almalı:

  • 240 gerçek freelance projesi ($144K toplam değer) metodolojisi
  • Fable 5 %16.1, Opus 4.8 %8.3, GPT-5.5 %6.3 karşılaştırması
  • 8 ayda 2.5% → 16.1% artış
  • AI hakem vs insan değerlendirici farkı (2.5–3x)
  • Otoman oranı ≠ iş kaybı oranı uyarısı

Draft Article

AI Agent’lar Freelance İşlerin %16’sını Profesyonel Kalitede Tamamlayabiliyor

center-for-ai-safety ve Scale Labs’ın Remote Labor Index (RLI) güncellemesi, claude-fable-5’in 240 gerçek freelance projede %16,1 otomasyon oranına ulaştığını gösteriyor. Sekiz ay önceki %2,5’ten bu rakam dört katın üzerinde arttı. Ancak CAIS, AI hakemlerin insan değerlendiricilere kıyasla 2,5–3 kat fazla puan verdiğini uyarıyor.

Ana Gelişme

RLI, AI agent’ların gerçek freelance projeleri profesyonel kalitede tamamlama oranını insan değerlendiricilerle ölçüyor. 2 Temmuz 2026 güncellemesindeki sonuçlar:

ModelOtomasyon Oranı
claude-fable-5%16,1
claude-opus-4-8%8,3
gpt-56 (GPT-5.5)%6,3

Benchmark, toplam $144.000 değerinde 240 projeyi kapsıyor. Projeler 358 doğrulanmış freelancer’dan alındı; 3D/CAD, mimari, grafik tasarım, video, ses, veri analizi ve web uygulamaları gibi kategorileri içeriyor.

Önceki lider Opus 4.6 (Claude Cowork scaffold ile) %4,17’deydi. RLI’nin lansmanından bu yana geçen sekiz ayda en iyi oran %2,5’ten %16,1’e sıçradı.

claude-fable-5’in 240 projeden 218’i, ABD hükümetinin erişimi kısıtlamasından önce değerlendirildi. Kalan 22 projede tamamen başarısız olsa bile oran %14,6 olurdu — yine de en yüksek skor.

Neden Önemli?

%16 otomasyon oranı, %16 iş kaybı anlamına gelmez. RLI, belirli freelance projelerin profesyonel standartta tamamlanma oranını ölçer; genel istihdam etkisini doğrudan tahmin etmez.

RLI, AI işgücü otomasyonu tartışmasına ampirik zemin sağlıyor. Spekülasyon yerine gerçek freelance işler üzerinde ölçüm yapılması, benchmark’ın güvenilirliğini artırıyor.

CAIS’in AI hakem uyarısı kritik: otomatik değerlendirme sistemleri çıktıları 2,5–3 kat fazla puanlıyor. Hands-on software görevlerinde insan değerlendirmesi hâlâ şart. Bu, ai-benchmarks alanında yaygın bir metodolojik tuzak.

Türk geliştirici topluluğu için mesaj net: agent yetenekleri hızla artıyor, ancak çoğu projede profesyonel kaliteye ulaşamıyor. %16 bile “çoğunlukla başarısız” demek.

Teknik Detaylar

RLI metodolojisi, Upwork benzeri platformlardan gerçek freelance projeleri topluyor ve AI agent’lara veriyor. İnsan değerlendiriciler, çıktıları profesyonel standartta olup olmadığına göre puanlıyor. Otomasyon oranı, profesyonel kalitede tamamlanan projelerin toplam içindeki payı.

AI hakemlerin aşırı puanlama eğilimi, özellikle kodlama ve tasarım gibi subjektif değerlendirme gerektiren alanlarda belirgin. CAIS, gelecek güncellemelerde insan değerlendirmesini merkeze almaya devam edeceğini belirtiyor.

Bağlam

claude-fable-5’in ABD hükümeti tarafından kısıtlanması ve aynı hafta kısmen geri açılması, RLI sonuçlarını openai-trump-five-percent-stake haberindeki AI governance tartışmasıyla birleştiriyor. Devlet, frontier modellerin yeteneklerini hem ölçüyor hem de erişimini kontrol ediyor.

agentic-ai deployment’ında yetenek ile güvenilirlik arasındaki gerilim devam ediyor. RLI yetenek tarafını ölçerken, enterprise ortamlarda hallucination ve güvenilirlik hâlâ asıl darboğaz.

Sonraki Adımlar

CAIS ve Scale Labs, RLI’yi düzenli güncellemeye devam edecek. Fable 5’in kısıtlama sonrası performansı ve yeni modellerin katılımı izlenecek. İnsan değerlendirmesi maliyeti benchmark ölçeğini sınırlıyor — otomatik değerlendirme iyileştirmeleri metodolojik tartışmayı sürdürecek.


Kaynaklar