Secondary on supabase/evals Apache-2.0. Real containerized stacks; MCP + CLI. Early results: Opus 5 and Kimi K3 100% Build unaided; skills help smaller models. Agents underuse declarative schemas; docs usage inconsistent (Codex ~8 pages vs Claude Code ~2). LLM-as-judge + deterministic scoring; one retry.