-
프로젝트 정의
한국어 PDF OCR 시스템 개발
-
개발 단계
1) PDF detection layout model 실험 및 최종 모델 선정
2) 이미지 / pdf 내 text extraction 모델 및 라이브러리 실험 및 선정
3) 선정된 detection layout model, text extraction model 병합
4) 한국어 PDF Parser demo 페이지 개발
-
사용 기술
1) PP-YOLOE (PDF layer detection model)
2) PyMuPDF (text extraction)
3) gradio (demo page)
-
개발 언어
python
- 개발 과정 요약
- PP-YOLOE, microsoft/Florence-2-large, Detectron2, PDF to XML 등 PDF layer detection 모델 실험 + 최종 모델 선정
- microsoft/Phi-3, PdfReader, ocrmypdf, PyMuPDF 등PDF text extraction 모델 실험 + 최종 모델 선정 (한국어 추출 성능이 선정 기준)
- 선정된 모델을 병합하여 최종 개발물 완성
- PDF OCR 시각 데모 페이지 구축
-
개발 로그
https://finddme.github.io/dev log/2024/02/02/pdf/
-
Git Repository
https://github.com/finddme/OCR_RAG
- 각 section 및 head에 할당된 chunk를 기반으로 문단 생성(각 참조 문서별로)
- 각 section 및 head에 생성된 문단들 종합 (전체 참조 문서 종합)