Baidu Unlimited OCR: Onlarca Sayfayı Tek Geçişte İşleyen Açık Kaynak Model
baidu araştırmacıları, unlimited-ocr adlı uçtan uca bir belge işleme modelini yayınladı. Model, reference-sliding-window-attention (R-SWA) mekanizması sayesinde onlarca sayfayı tek geçişte sabit bellek ve throughput ile işleyebiliyor. OmniDocBench v1.5’te %93,23, v1.6’da %93,92 skor elde etti. Ağırlıklar Hugging Face’te açık olarak erişilebilir.
Ana Gelişme
Unlimited OCR, 3 milyar parametreli MoE mimarisi kullanıyor; aktif parametre sayısı 500 milyon. DeepSeek OCR baseline üzerine continue-training yapıldı. Temel yenilik R-SWA: model, KV cache’i sabit tutmak için yalnızca son 128 output token’a dikkat ederken, tüm görsel referans token’larını koruyor.
Performans rakamları:
- OmniDocBench v1.5: %93,23 (baseline’a göre +6,22 puan)
- OmniDocBench v1.6: %93,92
- Throughput: Base modda 5.580 token/saniye
- Kapasite: 40+ sayfa tek geçişte
Ağırlıklar Hugging Face ve GitHub (github.com/baidu/Unlimited-OCR) üzerinden MIT lisansıyla yayınlandı. vLLM ve SGLang desteği mevcut.
Neden Önemli?
Uzun belge OCR’da KV cache’in doğrusal büyümesi temel bir darboğaz. R-SWA, “insan unutması gibi” bellek yönetimiyle bu sorunu çözüyor — eski output token’ları atılırken görsel referanslar korunuyor. Bu yaklaşım ASR ve çeviri gibi diğer uzun-sequence görevlere de genelleştirilebilir.
mistral-ocr-4-enterprise kurumsal OCR çözümüne kıyasla, Baidu’nun açık ağırlıklı modeli geliştirici topluluğu için doğrudan erişim sunuyor. document-processing ve kv-cache optimizasyonu alanında pratik bir alternatif oluşturuyor.
Bağlam
llm-optimization alanında bellek verimliliği kritik bir rekabet ekseni. R-SWA, sliding window attention’ın referans token’ları koruyan bir varyantı olarak, uzun belge işlemede yeni bir standart oluşturma potansiyeli taşıyor.
Kaynaklar
- Unlimited OCR — arXiv 2606.23050 (arXiv)
- Baidu Unlimited OCR — Hugging Face Model Card (Hugging Face)
- Baidu Unlimited OCR — GitHub Repository (GitHub)