Unlimited-OCR

Summary

Baidu가 2026-06에 공개한 다페이지 문서 파싱/OCR 모델. 핵심 메시지는 R-SWA(Reference Sliding Window Attention) 를 통해 긴 문서 출력에서도 KV cache 병목을 줄이고, 수십 페이지 문서를 한 번에 파싱하는 워크플로를 지향한다는 점이다.

주요 특징

  • GitHub/Hugging Face/arXiv 공개
  • 라이선스: MIT
  • 다페이지/PDF 파싱을 infer_multi 흐름으로 지원
  • sglang 기반 OpenAI 호환 API 배포 예시 제공
  • 포스트 및 README 문맥상 DeepSeek-OCR을 한 단계 더 밀어보는 포지셔닝

알려진 포인트

  • LinkedIn 공유 포스트에서는 OmniDocBench v1.5 93.23%, 활성 파라미터 500M, 40페이지 이상 속도 저하 완화 등을 강조했다.
  • 공개 README에서는 “One-shot Long-horizon Parsing”을 전면 메시지로 내세운다.
  • 실제 한국어 장문 정확도는 댓글 기준 상반된 사용자 피드백이 있어 별도 검증이 필요하다.

실무 의미

  • 페이지별 OCR 후 외부 스케줄러로 병합하던 문서 파이프라인을 단순화할 가능성이 있다.
  • 계약서, 보고서, 발표자료처럼 문서 구조를 함께 보존해야 하는 업무에 특히 적합성 검토 가치가 있다.
  • 다만 한국어 문서, 표, 스캔 품질, 긴 PDF에서의 일관성은 실샘플 벤치가 필요하다.

관련 노트

외부 참조