Summary

On July 31, 2026, Supabase open-sourced supabase/evals (Apache-2.0), a benchmark and harness that runs coding agents (Claude Code, Codex, OpenCode) against real Supabase tasks—schema design, Edge Function debugging, RLS fixes—on containerized stacks with actual MCP/CLI. It powers a public leaderboard at supabase.com/evals and a daily internal regression suite. Early results show top models often pass unaided; skills help smaller models; agents underuse declarative schemas and docs inconsistently.

Source Analysis

Primary ingest plus 3 corroborating raw feeds saved under raw/feeds/. Cross-checked key claims; warnings retained for vendor benches / scope disputes / company-stated traction.

Research Notes

Additional Sources

Key Facts Verified

  • Confirmed: Apache-2.0 supabase/evals Jul 31; Claude Code / Codex / OpenCode; real containers + MCP/CLI; public leaderboard + daily regression
  • Vendor snapshot: Top models often pass unaided; skills help smaller models; declarative schema underuse — attribute to Supabase writing-time snapshot

Broader Context

Real-task agent evals vs synthetic SWE benches (agent-eval-harnesses-2026). Complements YC QM (ops harness) without overlap.

supabase, supabase-evals, ai-benchmarks, mcp, row-level-security, edge-functions, agent-eval-harnesses-2026, ai-coding-assistants

Draft Article

Supabase Evals: Gerçek görevlerle coding agent benchmark’ı açıldı

Supabase, 31 Temmuz 2026’da Apache-2.0 lisanslı supabase/evals paketini açtı. Harness, Claude Code, Codex ve OpenCode gibi coding agent’ları gerçek Supabase görevlerinde ölçüyor: şema tasarımı, Edge Function hata ayıklama, bozuk RLS politikası düzeltme. Senaryolar containerize edilmiş stack üzerinde gerçek MCP sunucusu ve CLI ile koşuyor.

Paket hem supabase.com/evals üzerindeki public leaderboard’u hem de günlük iç regression suite’i besliyor. Amaç, sentetik SWE bench’lerinden ziyade BaaS yüzeylerinde (AI coding assistants) agent performansını görmek. Her senaryo gerçek benzeri ortamda koşar; skorlama deterministic kontroller ile LLM-as-a-judge karışımı kullanır ve agent’a notlandırmadan önce bir retry hakkı verir.

Erken bulgular (vendor snapshot)

Supabase’in yayımlanma anı anlık görüntüsüne göre üst modeller çoğu senaryoyu skill yüklemeden geçiyor; Build aşamasında Opus 5 ve Kimi K3 skills’siz yüzde 100 skor aldı. Skills küçük/orta modellerdeki boşlukları kapatıyor (ör. Sonnet 5 78%→100%). Zayıf nokta: agent’lar declarative schema yerine elle migration yazma eğiliminde; dokümantasyon kullanımı tutarsız.

Bu gözlemler vendor-run leaderboard anlığıdır; bağımsız uzun dönem sıralama değildir. Harness Apache-2.0 olduğu için ekipler senaryo ekleyebilir, daily regression fikrini kendi CI’larına taşıyabilir ve MCP/CLI yüzeylerindeki gerilemeleri erken yakalayabilir.

Neden Önemli?

Geliştiriciler harness’i klonlayıp kendi agent / skill kombinasyonlarını ölçebilir. Senaryolar Database, Auth ve benzeri ürün alanlarını; build ile issue-resolve aşamalarını kapsıyor. YC QM (ops harness) veya model sürüm haberleriyle birleştirilmez — tamamlayıcı ama ayrı bir eval aracıdır. Public leaderboard, “hangi agent Supabase işinde daha az takılıyor?” sorusuna ilk bakış sunar; uzun dönem sıralama değildir. Repo: github.com/supabase/evals — clone, koş, kendi skill set’inizle karşılaştırın.

Kısa brifing olarak bu paket, agent eval’lerini gerçek BaaS görevlerine indirger; derin pazar analizi gerektirmez. Leaderboard’u ve GitHub reposunu takip etmek yeterlidir.


Kaynaklar

PreScreening Notes

  • Score 6 / priority medium: Useful open-source agent eval harness from a widely used BaaS vendor; relevant to AI coding tooling audience but not a platform-shifting launch.
  • Real product news; Jul 31 (within 48h); AI + software domains; first-party Supabase blog is credible.
  • No duplicate in pipeline.

Evaluation Report

News Value

  • Timeliness: High — Jul 31 first-party launch.
  • Impact: Moderate — valuable for agent-eval builders and Supabase ecosystem; not industry-structure changing.
  • Prominence: Supabase brand + public leaderboard; Apache-2.0.
  • Proximity: Good for Turkish developers using Supabase / coding agents; narrower than frontier-model news.
  • Novelty: Useful real-task (schema/RLS/Edge Functions) eval vs synthetic coding benches.

Audience Fit

  • Primary: software developers + AI coding-tool users.
  • Actionable: clone harness, read leaderboard patterns (skills help smaller models; declarative schema underuse).
  • Complements YC QM (harness infra) and DeepSeek Flash (model) without overlap — keep as light package piece.

Risk & Ethics

  • First-party Supabase blog is credible; early leaderboard observations are vendor-run — attribute.
  • No misinformation or ethics concerns.
  • Batch note: do not over-invest Analysis bandwidth vs critical/high items.

Publication Strategy

  • Format: brief (~300 words) — what shipped, who it tests, one insight from early results, link to leaderboard.
  • Priority kept medium.
  • Suggested wiki: Supabase, AI coding agents, agent evaluation / benchmarks, MCP.

Suggested Angle

Türkçe kısa brifing: “Supabase, gerçek BaaS görevleriyle agent eval açtı” — schema / Edge Functions / RLS senaryoları; Claude Code / Codex / OpenCode; public leaderboard. Erken bulgu: güçlü modeller çoğu kez skills’siz geçiyor, küçük modeller skills’ten yararlanıyor. Derin pazar analizine girmeden araç duyurusu olarak yayınla.

Editorial Notes

Decision: APPROVED
Format: brief (~300 words) — confirmed
Angle: Gerçek BaaS görevleriyle agent eval; schema/RLS/Edge Functions; kısa araç duyurusu — derin pazar analizi yok.

Reporting instructions:

  • Erken leaderboard bulgularını vendor snapshot olarak etiketle
  • YC QM / DeepSeek haberleriyle birleştirme; tamamlayıcı ama ayrı paket
  • Leaderboard + GitHub linklerini ver
  • Kısa tut; critical/high paketini gölgelemesin

Headline suggestions (TR):

  1. Supabase Evals: Gerçek görevlerle coding agent benchmark’ı açıldı
  2. Claude Code, Codex ve OpenCode’u RLS ve Edge Function’larda ölçen açık eval
  3. Supabase, agent’lar için Apache-2.0 eval harness yayımladı

Mandatory points:

  • Apache-2.0 supabase/evals; Jul 31
  • Real containers + MCP/CLI; public leaderboard
  • Claude Code / Codex / OpenCode
  • Early insight: top models often pass unaided; skills help smaller models
  • Declarative schema underuse (vendor snapshot)