Unlimited-OCR: R-SWA로 장문 문서 OCR 병목을 줄이는 방식 — Jeongmin Lee

Key Insight

장문 문서 OCR의 핵심 병목은 모델 크기보다도 다페이지 디코딩 중 커지는 KV cache와 페이지 단절 문제이며, Unlimited-OCR은 R-SWA로 이를 구조적으로 줄이려는 접근이다.

출처: LinkedIn / Jeongmin Lee
타입: SNS 포스트
공유 맥락: 정영필 대표님 ingest 요청
유효일: 2026-06-23
Raw: 2026-06-23-linkedin-jeongmin-lee-7475044787692130305.md

핵심 Takeaway

  • Unlimited-OCR은 다페이지 OCR에서 페이지별 분할→결과 병합으로 생기던 문맥 단절과 포맷 붕괴를, 문서 전체를 한 번에 보는 방식으로 줄이려는 모델이다.
  • 포스트의 핵심 주장은 R-SWA(Reference Sliding Window Attention)로 KV cache를 고정 크기처럼 운영해 장문 출력에서도 메모리 사용량과 속도 저하를 완화한다는 점이다.
  • 공개 언급 기준으로 OmniDocBench v1.5 93.23%를 제시하며 Qwen3-VL, Gemini-2.5 Pro보다 높다고 주장한다. 수치 자체는 원 저장소/논문 재확인 가치가 있다.
  • 작성자 본인 댓글에서는 A100 1대로 페이지당 4초 이내, 페이지 간 유지 양호라고 보완했지만, 다른 댓글에서는 한국어 장수 증가 시 정확도 저하가 크다는 반론도 있어 한글 실무 적용은 별도 검증이 필요하다.

원문 요지

  • Jeongmin Lee는 OCR이 한국 실무 현장에서 활발하지만, 여러 페이지 문서를 처리할 때 상하문 단절과 포맷 왜곡이 반복된다고 문제를 제기했다.
  • 바이두 Unlimited-OCR의 차별점으로 활성 파라미터 500M 수준, OmniDocBench v1.5 93.23%, R-SWA 기반 고정형 KV cache 운용, 40페이지 이상에서도 속도 저하 완화, infer_multi 기반 PDF 일괄 추론, sglang/OpenAI 호환 배포 가능성을 정리했다.
  • 포스트 말미에서는 OCR이 단순 글자 인식에서 여러 페이지를 통째로 이해하는 엔진으로 이동하고 있다고 해석했다.

검증 메모

공개 확인된 내용

  • LinkedIn guest page meta description과 JSON-LD에서 본문, 게시일(2026-06-23T04:39:16.983Z), 작성자, 댓글 일부를 확인했다.
  • 웹 검색으로 baidu/Unlimited-OCR GitHub 저장소와 Hugging Face 모델 페이지가 노출되는 것은 확인했다.

확인 필요

  • 포스트는 “핵심 포인트 6가지”라고 했지만 공개 description에는 5번까지만 명시되어 있어 나머지 항목은 페이지 제한 또는 본문 생략 가능성이 있다.
  • OmniDocBench 점수, 활성 파라미터 수치, 40페이지 이상 성능은 GitHub README/논문/벤치마크 표를 직접 대조해 재확인 필요하다.
  • 한글 OCR 품질은 댓글 상반 신호가 있어 한국어 장문 PDF 샘플로 별도 벤치가 필요하다.

JYP Labs 운영체계 시사점

자동화

  • 계약서·제안서·리포트처럼 다페이지 PDF를 다루는 파이프라인에서는 “페이지별 OCR 후 병합” 구조가 병목인지 먼저 점검할 가치가 있다.
  • OCR 엔진 선정 기준을 단순 문자 정확도에서 다페이지 일관성 / 레이아웃 보존 / 추론 속도 / 한국어 품질 / API 배포 난이도로 넓혀야 한다.
  • sglang 기반 OpenAI 호환 배포 가능성은 기존 에이전트 워크플로에 붙이기 쉽다는 장점이 있다.

강의/컨설팅

  • 메시지 포인트: “문서 AI의 경쟁력은 OCR 정확도만이 아니라 긴 문서 문맥을 유지하는 아키텍처에 달려 있다.”
  • 사례화 포인트: 문서 처리 자동화에서 파서 선택 기준, 한국어 품질 검증 프레임, 다페이지 병합 비용을 함께 설명할 수 있다.

인프라 실험 후보

  • 사내 테스트 후보: 한국어 계약서/제안서/회의자료 10~50페이지 샘플에 대해 기존 OCR vs Unlimited-OCR 비교.
  • 평가지표: 페이지 간 제목/표/문단 연속성, 표 인식, 토큰 비용, 처리시간, 후처리 병합 복잡도.

연결되는 노트

외부 참조

주의점

  • 본 ingest는 LinkedIn 공개 페이지 메타데이터와 JSON-LD, 일반 웹 검색에 기반한다. 로그인 시 보이는 전체 본문/첨부/댓글 전체와 다를 수 있다.
  • 댓글 기반 한글 품질 평가는 실사용 경험 공유 수준이며, 정식 벤치마크를 대체하지 않는다.