125B parametreli Qwen modeli RTX 4090’da çalıştırılabilir: Strata inference engine
Strata, Alibaba’nın Qwen3.8-Flash-Next modelini (512-expert MoE, toplam 125B parametre) consumer GPU’larda çalıştırmayı hedefleyen açık kaynak bir yerel inference motoru. “125B model, 12 GB VRAM” iddiası agresif quantization ve expert RAM offload gerektiriyor — tam hassasiyetli inference değil.
Ana Gelişme
Strata, llama-cpp/ggml tabanlı, MIT lisanslı bir engine. llama.cpp ekosistemine alternatif olarak konumlanıyor; ollama’dan farklı olarak frontier MoE modellerine odaklanıyor. OpenAI/Anthropic uyumlu REST API (localhost:8080) ve MCP agent entegrasyonu sunuyor.
Donanım gereksinimleri:
| Bileşen | Minimum |
|---|---|
| VRAM | 12 GB+ |
| Sistem RAM | 32 GB+ |
| Disk | ~80 GB |
Quantization katmanları (IQ2_XS, IQ3_S) sistem RAM’ine göre seçiliyor; kullanılmayan expert’ler RAM’de tutulurken sık kullanılanlar GPU’da cache’leniyor.
Performans İddiaları
Benchmark rakamları dikkatle etiketlenmeli:
- Proje sahibi iddiası: RTX 5070’de ~94 tok/s decode
- Topluluk raporu (ferstar, RTX 4090 24GB): IQ3_S quantization ile ~100–110 tok/s decode; 20–30K token prefill’te 2500–2800 tok/s; 262K context desteği
Bu rakamlar tek kullanıcı veya proje README kaynaklı; bağımsız replikasyon bekliyor. Agresif quantization kaliteyi etkileyebilir.
Neden Önemli?
consumer-gpu-ai trendi Türkiye’deki AI meraklıları için pratik: RTX 4090/5070 sahibi geliştiriciler kendi donanımlarında frontier model deneyebilir. open-weight-models ekosisteminde qwen ailesi güçlü bir seçenek.
Ollama/llama.cpp Karşılaştırması
ollama kullanım kolaylığı sunarken Strata, büyük MoE modellerinde expert offload ile VRAM sınırlarını aşmayı hedefliyor. ferstar blog yazarı, kod tarama workload’larında Strata decode’unun daha hızlı olduğunu raporluyor — ancak model ve quantization farklılıkları karşılaştırmayı zorlaştırıyor.
Bağlam
ai-inference alanında yerel çalıştırma talebi artıyor. Ticari kullanım için Alibaba model lisans şartları kontrol edilmeli.
Sonraki Adımlar
Topluluk benchmark’ları ve kalite değerlendirmeleri netleşecek. Kendi donanımınızda test etmek en güvenilir yol.