DeepSeek-V4.1 Flash: agent workload’ları için KV cache’te 4x/8x kazanım

DeepSeek, uzun bağlamlı agent workload’ları için optimize edilmiş DeepSeek-V4.1 Flash modelini yayınladı. 552 milyar parametreli multimodal MoE model, agresif KV cache sıkıştırmasıyla DeepSeek-V4-Flash’a kıyasla yaklaşık 4x runtime ve 8x kalıcı KV depolama azaltımı sağlıyor. 1 milyon token context destekleniyor.

Ana Gelişme

Model, Causal Encoder-Decoder (CED) mimarisi kullanıyor: 20 katmanlı encoder + 20 katmanlı decoder. Prefill aşamasında 8B, decode aşamasında 16B aktif parametre devreye giriyor.

CSA2 (Compressed Sparse Attention 2): Full/Reindex/Reuse modları, KV ve sparse-attention indekslerini katmanlar arasında paylaşıyor. FP4 KV caching (E2M1, E4M3 scale per 16 channels) global KV’yi token başına 890 byte’a düşürüyor — V4-Flash’ın yaklaşık 1/4’ü.

SWA Bounded Replay: Son n_win token’ı replay ederek SSD’deki kalıcı KV’yi V4-Flash’ın yaklaşık 1/8’ine indiriyor.

Model, 45 trilyon multimodal token üzerinde pretrain edildi. DeepSeek API’sinde V4-Pro, 14 Eylül’den itibaren V4.1-Flash’a yönlendiriliyor.

CED mimarisinin prefill/decode aktivasyon farkı (8B vs 16B), inference maliyetini workload tipine göre optimize ediyor: uzun context ingestion (prefill) daha az parametre aktive ederken, token generation (decode) daha fazla compute kullanıyor. Bu asimetri, agent workload’larında tipik olan “uzun input + kısa output” pattern’ine uygun.

CSA2’nin Full/Reindex/Reuse modları, katmanlar arası KV paylaşımını sağlıyor — her katmanın bağımsız KV cache tutması yerine, cross-layer compression ile bellek footprint’i dramatik olarak düşürülüyor.

Neden Önemli?

Uzun bağlamlı agent deployment’larında LLM inference maliyeti, KV cache boyutu ve runtime’ın doğrudan belirleyicisi. Input-heavy workload’larda (uzun context, çoklu tool call) sıkıştırma kazanımları özellikle belirgin.

Türk AI mühendisleri ve self-hosted inference kullanıcıları için: 890 byte/token global KV, HBM ve SSD maliyetlerini düşürerek uzun horizon agent’ların ekonomik olarak uygulanabilirliğini artırıyor. Bir agent’ın 500K token context ile çalışması, sıkıştırılmamış KV’de gigabyte’larca bellek gerektirirken, FP4 compression ile bu ~445 MB’a düşüyor.

SWA Bounded Replay mekanizması, SSD’deki kalıcı KV’yi son n_win token replay ile sınırlıyor — bu, disk I/O ve storage maliyetini ayrı bir boyutta optimize ediyor. Runtime’daki 4x kazanım ve storage’daki 8x kazanım, farklı bottleneck’lere hitap ediyor.

DeepSeek API docs, V4-Pro migration’ın pricing ve endpoint değişikliklerini detaylandırıyor. Self-hosted deployment için Hugging Face model card, inference framework entegrasyonu için teknik spesifikasyonları sunuyor.

Agent benchmark skorları (Terminal-Bench 2.1: 90.6, DeepSWE v1.1: 74.2, CyberGym: 88.1) harness-bağımlıdır ve resmi model card uyarısına göre doğrudan karşılaştırma için dikkatli yorumlanmalıdır.

Teknik Detaylar

  • Mimari: Causal Encoder-Decoder, CSA2
  • Aktivasyon: 8B prefill / 16B decode
  • Context: 1M token
  • KV: FP4 format, cross-layer compression
  • İlgili wiki: coding-agents, llm-inference
  • Multimodal: 45T token pretrain, text ve görsel input desteği
  • MoE routing: 552B total, sparse activation ile compute efficiency
  • Zartbot blog analizi: CSA2 cross-layer compression detayları ve benchmark metodolojisi

Agent workload’larında tipik pattern: uzun system prompt + tool call history + code context = yüzbinlerce token input. KV cache compression, bu pattern’de en büyük maliyet kalemini (memory bandwidth ve storage) doğrudan etkiliyor. Coding agent’lar, terminal benchmark’ları ve multi-step reasoning task’ları bu modelin hedef use case’leri.

Bağlam

MoE ve inference optimization tartışması, agent scaling’in maliyet engelini aşmak için mimari yeniliklere yöneliyor. DeepSeek’in açık weight stratejisi, self-hosted deployment ekonomisini doğrudan etkiliyor.

Sonraki Adımlar

API pricing ve V4-Pro migration detayları DeepSeek API docs’ta güncelleniyor. Topluluk benchmark’ları ve production deployment raporları önümüzdeki haftalarda netleşecek.

DeepSeek’in açık weight stratejisi, Türk AI topluluğunda self-hosted inference ilgisini artırıyor. V4.1 Flash’ın KV compression kazanımları, özellikle uzun context agent deployment’larında GPU memory ve SSD maliyetlerini doğrudan etkiliyor. FP4 formatının E2M1 ve E4M3 scale per 16 channels yapısı, precision-loss ile compression ratio arasında dengeli bir trade-off sunuyor — production deployment’larda quality regression testleri önerilir — bu, frontier model erişimini demokratize eden bir faktör.


Kaynaklar