codeKK project summary for Niko1221/Strata — one-click install inference engine for Qwen3.8-Flash-Next on Windows/Linux.

Requirements: NVIDIA RTX 20/30/40/50 or select AMD Radeon cards; 12GB+ VRAM; 32GB+ RAM (64GB runs all quant sizes); ~80GB disk; current GPU drivers.

Quantization recommendations by RAM:

  • 32GB: Coder variant
  • 48GB: IQ2_XS or Q2_0
  • 64GB: IQ2_XS (recommended) or IQ3_XXS/IQ3_S
  • 96GB+: IQ3_S or UD-IQ4_XS

API: OpenAI-compatible provider at http://127.0.0.1:8080/v1 — any API key and model name accepted.

Stack credits: Qwen team model; compression by ISTA-DASLab, UkisAI (Swift 1.5), Unsloth; engine uses llama.cpp/ggml parts. MIT License for Strata; model and component licenses vary.