codeKK project summary for Niko1221/Strata — one-click install inference engine for Qwen3.8-Flash-Next on Windows/Linux.
Requirements: NVIDIA RTX 20/30/40/50 or select AMD Radeon cards; 12GB+ VRAM; 32GB+ RAM (64GB runs all quant sizes); ~80GB disk; current GPU drivers.
Quantization recommendations by RAM:
- 32GB: Coder variant
- 48GB: IQ2_XS or Q2_0
- 64GB: IQ2_XS (recommended) or IQ3_XXS/IQ3_S
- 96GB+: IQ3_S or UD-IQ4_XS
API: OpenAI-compatible provider at http://127.0.0.1:8080/v1 — any API key and model name accepted.
Stack credits: Qwen team model; compression by ISTA-DASLab, UkisAI (Swift 1.5), Unsloth; engine uses llama.cpp/ggml parts. MIT License for Strata; model and component licenses vary.