Summary
On July 31, 2026, Supabase open-sourced supabase/evals (Apache-2.0), a benchmark and harness that runs coding agents (Claude Code, Codex, OpenCode) against real Supabase tasks—schema design, Edge Function debugging, RLS fixes—on containerized stacks with actual MCP/CLI. It powers a public leaderboard at supabase.com/evals and a daily internal regression suite. Early results show top models often pass unaided; skills help smaller models; agents underuse declarative schemas and docs inconsistently.
Source Analysis
Primary ingest plus 3 corroborating raw feeds saved under raw/feeds/. Cross-checked key claims; warnings retained for vendor benches / scope disputes / company-stated traction.
Research Notes
Additional Sources
- 2026-08-01-marktechpost-supabase-evals — early leaderboard patterns
- 2026-08-01-runtimewire-supabase-evals — product/strategy framing
- 2026-08-01-supabase-evals-github — repo structure
- Pipeline primary: 2026-08-01-supabase-evals-open-source-benchmark (Supabase blog)
Key Facts Verified
- Confirmed: Apache-2.0 supabase/evals Jul 31; Claude Code / Codex / OpenCode; real containers + MCP/CLI; public leaderboard + daily regression
- Vendor snapshot: Top models often pass unaided; skills help smaller models; declarative schema underuse — attribute to Supabase writing-time snapshot
Broader Context
Real-task agent evals vs synthetic SWE benches (agent-eval-harnesses-2026). Complements YC QM (ops harness) without overlap.
Related Wiki
supabase, supabase-evals, ai-benchmarks, mcp, row-level-security, edge-functions, agent-eval-harnesses-2026, ai-coding-assistants
Draft Article
Supabase Evals: Gerçek görevlerle coding agent benchmark’ı açıldı
Supabase, 31 Temmuz 2026’da Apache-2.0 lisanslı supabase/evals paketini açtı. Harness, Claude Code, Codex ve OpenCode gibi coding agent’ları gerçek Supabase görevlerinde ölçüyor: şema tasarımı, Edge Function hata ayıklama, bozuk RLS politikası düzeltme. Senaryolar containerize edilmiş stack üzerinde gerçek MCP sunucusu ve CLI ile koşuyor.
Paket hem supabase.com/evals üzerindeki public leaderboard’u hem de günlük iç regression suite’i besliyor. Amaç, sentetik SWE bench’lerinden ziyade BaaS yüzeylerinde (AI coding assistants) agent performansını görmek. Her senaryo gerçek benzeri ortamda koşar; skorlama deterministic kontroller ile LLM-as-a-judge karışımı kullanır ve agent’a notlandırmadan önce bir retry hakkı verir.
Erken bulgular (vendor snapshot)
Supabase’in yayımlanma anı anlık görüntüsüne göre üst modeller çoğu senaryoyu skill yüklemeden geçiyor; Build aşamasında Opus 5 ve Kimi K3 skills’siz yüzde 100 skor aldı. Skills küçük/orta modellerdeki boşlukları kapatıyor (ör. Sonnet 5 78%→100%). Zayıf nokta: agent’lar declarative schema yerine elle migration yazma eğiliminde; dokümantasyon kullanımı tutarsız.
Bu gözlemler vendor-run leaderboard anlığıdır; bağımsız uzun dönem sıralama değildir. Harness Apache-2.0 olduğu için ekipler senaryo ekleyebilir, daily regression fikrini kendi CI’larına taşıyabilir ve MCP/CLI yüzeylerindeki gerilemeleri erken yakalayabilir.
Neden Önemli?
Geliştiriciler harness’i klonlayıp kendi agent / skill kombinasyonlarını ölçebilir. Senaryolar Database, Auth ve benzeri ürün alanlarını; build ile issue-resolve aşamalarını kapsıyor. YC QM (ops harness) veya model sürüm haberleriyle birleştirilmez — tamamlayıcı ama ayrı bir eval aracıdır. Public leaderboard, “hangi agent Supabase işinde daha az takılıyor?” sorusuna ilk bakış sunar; uzun dönem sıralama değildir. Repo: github.com/supabase/evals — clone, koş, kendi skill set’inizle karşılaştırın.
Kısa brifing olarak bu paket, agent eval’lerini gerçek BaaS görevlerine indirger; derin pazar analizi gerektirmez. Leaderboard’u ve GitHub reposunu takip etmek yeterlidir.
Kaynaklar
PreScreening Notes
- Score 6 / priority medium: Useful open-source agent eval harness from a widely used BaaS vendor; relevant to AI coding tooling audience but not a platform-shifting launch.
- Real product news; Jul 31 (within 48h); AI + software domains; first-party Supabase blog is credible.
- No duplicate in pipeline.
Evaluation Report
News Value
- Timeliness: High — Jul 31 first-party launch.
- Impact: Moderate — valuable for agent-eval builders and Supabase ecosystem; not industry-structure changing.
- Prominence: Supabase brand + public leaderboard; Apache-2.0.
- Proximity: Good for Turkish developers using Supabase / coding agents; narrower than frontier-model news.
- Novelty: Useful real-task (schema/RLS/Edge Functions) eval vs synthetic coding benches.
Audience Fit
- Primary: software developers + AI coding-tool users.
- Actionable: clone harness, read leaderboard patterns (skills help smaller models; declarative schema underuse).
- Complements YC QM (harness infra) and DeepSeek Flash (model) without overlap — keep as light package piece.
Risk & Ethics
- First-party Supabase blog is credible; early leaderboard observations are vendor-run — attribute.
- No misinformation or ethics concerns.
- Batch note: do not over-invest Analysis bandwidth vs critical/high items.
Publication Strategy
- Format:
brief(~300 words) — what shipped, who it tests, one insight from early results, link to leaderboard. - Priority kept
medium. - Suggested wiki: Supabase, AI coding agents, agent evaluation / benchmarks, MCP.
Suggested Angle
Türkçe kısa brifing: “Supabase, gerçek BaaS görevleriyle agent eval açtı” — schema / Edge Functions / RLS senaryoları; Claude Code / Codex / OpenCode; public leaderboard. Erken bulgu: güçlü modeller çoğu kez skills’siz geçiyor, küçük modeller skills’ten yararlanıyor. Derin pazar analizine girmeden araç duyurusu olarak yayınla.
Editorial Notes
Decision: APPROVED
Format: brief (~300 words) — confirmed
Angle: Gerçek BaaS görevleriyle agent eval; schema/RLS/Edge Functions; kısa araç duyurusu — derin pazar analizi yok.
Reporting instructions:
- Erken leaderboard bulgularını vendor snapshot olarak etiketle
- YC QM / DeepSeek haberleriyle birleştirme; tamamlayıcı ama ayrı paket
- Leaderboard + GitHub linklerini ver
- Kısa tut; critical/high paketini gölgelemesin
Headline suggestions (TR):
- Supabase Evals: Gerçek görevlerle coding agent benchmark’ı açıldı
- Claude Code, Codex ve OpenCode’u RLS ve Edge Function’larda ölçen açık eval
- Supabase, agent’lar için Apache-2.0 eval harness yayımladı
Mandatory points:
- Apache-2.0 supabase/evals; Jul 31
- Real containers + MCP/CLI; public leaderboard
- Claude Code / Codex / OpenCode
- Early insight: top models often pass unaided; skills help smaller models
- Declarative schema underuse (vendor snapshot)