Baidu Unlimited OCR: Onlarca Sayfayı Tek Geçişte İşleyen Açık Kaynak Model

baidu araştırmacıları, unlimited-ocr adlı uçtan uca bir belge işleme modelini yayınladı. Model, reference-sliding-window-attention (R-SWA) mekanizması sayesinde onlarca sayfayı tek geçişte sabit bellek ve throughput ile işleyebiliyor. OmniDocBench v1.5’te %93,23, v1.6’da %93,92 skor elde etti. Ağırlıklar Hugging Face’te açık olarak erişilebilir.

Ana Gelişme

Unlimited OCR, 3 milyar parametreli MoE mimarisi kullanıyor; aktif parametre sayısı 500 milyon. DeepSeek OCR baseline üzerine continue-training yapıldı. Temel yenilik R-SWA: model, KV cache’i sabit tutmak için yalnızca son 128 output token’a dikkat ederken, tüm görsel referans token’larını koruyor.

Performans rakamları:

  • OmniDocBench v1.5: %93,23 (baseline’a göre +6,22 puan)
  • OmniDocBench v1.6: %93,92
  • Throughput: Base modda 5.580 token/saniye
  • Kapasite: 40+ sayfa tek geçişte

Ağırlıklar Hugging Face ve GitHub (github.com/baidu/Unlimited-OCR) üzerinden MIT lisansıyla yayınlandı. vLLM ve SGLang desteği mevcut.

Neden Önemli?

Uzun belge OCR’da KV cache’in doğrusal büyümesi temel bir darboğaz. R-SWA, “insan unutması gibi” bellek yönetimiyle bu sorunu çözüyor — eski output token’ları atılırken görsel referanslar korunuyor. Bu yaklaşım ASR ve çeviri gibi diğer uzun-sequence görevlere de genelleştirilebilir.

mistral-ocr-4-enterprise kurumsal OCR çözümüne kıyasla, Baidu’nun açık ağırlıklı modeli geliştirici topluluğu için doğrudan erişim sunuyor. document-processing ve kv-cache optimizasyonu alanında pratik bir alternatif oluşturuyor.

Bağlam

llm-optimization alanında bellek verimliliği kritik bir rekabet ekseni. R-SWA, sliding window attention’ın referans token’ları koruyan bir varyantı olarak, uzun belge işlemede yeni bir standart oluşturma potansiyeli taşıyor.


Kaynaklar