• 프로젝트 정의

    한국어 PDF OCR 시스템 개발

  • 개발 단계

    1) PDF detection layout model 실험 및 최종 모델 선정

    2) 이미지 / pdf 내 text extraction 모델 및 라이브러리 실험 및 선정

    3) 선정된 detection layout model, text extraction model 병합

    4) 한국어 PDF Parser demo 페이지 개발

  • 사용 기술

    1) PP-YOLOE (PDF layer detection model)

    2) PyMuPDF (text extraction)

    3) gradio (demo page)

  • 개발 언어

    python

  • 개발 과정 요약
    • PP-YOLOE, microsoft/Florence-2-large, Detectron2, PDF to XML 등 PDF layer detection 모델 실험 + 최종 모델 선정
    • microsoft/Phi-3, PdfReader, ocrmypdf, PyMuPDF 등PDF text extraction 모델 실험 + 최종 모델 선정 (한국어 추출 성능이 선정 기준)
    • 선정된 모델을 병합하여 최종 개발물 완성
    • PDF OCR 시각 데모 페이지 구축
  • 개발 로그

    https://finddme.github.io/dev log/2024/02/02/pdf/

  • Git Repository

    https://github.com/finddme/OCR_RAG

    • 각 section 및 head에 할당된 chunk를 기반으로 문단 생성(각 참조 문서별로)
    • 각 section 및 head에 생성된 문단들 종합 (전체 참조 문서 종합)