Unlimited-OCR
Summary
Baidu가 2026-06에 공개한 다페이지 문서 파싱/OCR 모델. 핵심 메시지는 R-SWA(Reference Sliding Window Attention) 를 통해 긴 문서 출력에서도 KV cache 병목을 줄이고, 수십 페이지 문서를 한 번에 파싱하는 워크플로를 지향한다는 점이다.
주요 특징
- GitHub/Hugging Face/arXiv 공개
- 라이선스: MIT
- 다페이지/PDF 파싱을
infer_multi흐름으로 지원 - sglang 기반 OpenAI 호환 API 배포 예시 제공
- 포스트 및 README 문맥상 DeepSeek-OCR을 한 단계 더 밀어보는 포지셔닝
알려진 포인트
- LinkedIn 공유 포스트에서는 OmniDocBench v1.5 93.23%, 활성 파라미터 500M, 40페이지 이상 속도 저하 완화 등을 강조했다.
- 공개 README에서는 “One-shot Long-horizon Parsing”을 전면 메시지로 내세운다.
- 실제 한국어 장문 정확도는 댓글 기준 상반된 사용자 피드백이 있어 별도 검증이 필요하다.
실무 의미
- 페이지별 OCR 후 외부 스케줄러로 병합하던 문서 파이프라인을 단순화할 가능성이 있다.
- 계약서, 보고서, 발표자료처럼 문서 구조를 함께 보존해야 하는 업무에 특히 적합성 검토 가치가 있다.
- 다만 한국어 문서, 표, 스캔 품질, 긴 PDF에서의 일관성은 실샘플 벤치가 필요하다.
관련 노트
- Reference-Sliding-Window-Attention
- KV-캐시
- linkedin-jeongmin-lee-unlimited-ocr-r-swa-long-document-ocr-2026-06-23.md
- Unlimited-OCR은-장문-문서-OCR-병목을-어떻게-줄이려는가.md
외부 참조
- GitHub: https://github.com/baidu/Unlimited-OCR
- Hugging Face: https://huggingface.co/baidu/Unlimited-OCR
- Paper: https://arxiv.org/abs/2606.23050