데이터 전처리) OCR — 이미지 PDF를 Searchable PDF로 만들기
스캔·이미지로 된 PDF를 OCR로 텍스트가 살아있는 Searchable PDF로 바꿔, GPT·RAG가 정확히 읽을 수 있는 자료로 만드는 전처리 과정.
개인정보·대외비가 담긴 문서는 온라인 변환 사이트(online2pdf 등)에 업로드하지 마세요. 외부 서버로 원문이 전송됩니다. 이런 자료는 로컬에서 동작하는 도구로만 처리하세요. 또한 OCR 결과에는 오탈자·누락이 생길 수 있으므로, 법령·수치·인명 등은 원문과 대조해 사람이 최종 검증해야 합니다. AI·OCR은 초안·보조이며 최종 책임은 사람에게 있습니다.
PDF에는 두 종류가 있다
같은 PDF라도 컴퓨터가 글자를 읽을 수 있는지에 따라 두 유형으로 나뉩니다. AI 자료로 쓰려면 이 구분이 첫 단계입니다.
- 읽기 가능한 PDF(Searchable PDF): 텍스트 레이어가 있어 선택·복사·문서 내 검색이 가능. 디지털로 직접 작성한 PDF가 보통 여기에 해당.
- 읽기 불가능한 PDF(Image-only PDF): 스캔 문서나 이미지로만 이루어져 텍스트 레이어가 없음. 선택·검색이 안 되며 OCR 처리가 필요.
1분 자가진단: 내 PDF는 어느 쪽?
PDF를 열고 본문 텍스트를 마우스로 드래그해 봅니다. 글자가 파랗게 선택되면 읽기 가능한 PDF, 선택이 전혀 안 되면 이미지 기반 PDF입니다. 이미지 기반이면 아래 OCR 과정을 진행합니다.
OCR이란, 그리고 왜 하는가
OCR(Optical Character Recognition, 광학 문자 인식)은 이미지나 스캔 문서 속 글자를 인식해 편집 가능한 디지털 텍스트로 바꾸는 기술입니다. 이미지 PDF에 텍스트 레이어를 입혀 Searchable PDF로 만들어 줍니다.
- 검색 가능: 문서 안에서 특정 단어·문구를 바로 찾을 수 있음
- 편집 가능: 인식된 텍스트를 수정·재활용할 수 있음
- 용량 절약: 텍스트 기반 PDF는 이미지 PDF보다 파일 크기가 작음
- 접근성 향상: 시각장애인용 화면 판독기(스크린 리더)가 읽을 수 있음
실습: 알PDF로 OCR 처리하기
알PDF에서 [메뉴 > 도구 > 문자인식(OCR)]을 실행한 뒤, 결과를 새로운 이름으로 저장해 GPT·RAG 자료로 사용합니다. 완료 판정 기준이 중요합니다: 본문을 드래그했을 때 글자가 문단 단위로 끊기지 않고 이어서 하이라이트되면 성공입니다.
- 도구 > 문자인식(OCR) 실행
- 처리 결과를 '원본명_OCR' 등 새 파일로 저장(원본은 보존)
- 드래그로 텍스트가 끊김 없이 선택되는지 확인해 검수
OCR이 안 될 때: 원인과 대체 방법
알PDF의 문자인식이 동작하지 않는 경우가 있습니다. 아래 원인을 점검하고, 그래도 안 되면 온라인 변환 도구로 이미지를 다시 PDF로 만든 뒤 재시도하거나 다른 OCR 도구를 씁니다.
- 라이선스 제한: 무료 버전에서 OCR 기능이 막혀 있을 수 있음(버전·정책 확인 필요)
- 보안 설정: 문서가 잠겨 있거나 편집이 제한된 경우
- 이미지 품질: 원본 해상도가 너무 낮거나 흐릿한 경우
- 순수 그림형: 글자가 그림 안에 녹아 있어 인식이 어려운 경우
- 대체책: online2pdf 등 이미지→PDF 변환 후 재OCR, 또는 아래 대안 도구 사용
왜 Searchable PDF가 RAG에 중요한가
RAG(Retrieval Augmented Generation)는 외부 문서에서 관련 정보를 검색해 LLM의 답변을 보강하는 방식입니다. 이때 벡터화의 재료가 되는 것이 PDF의 '텍스트'입니다. OCR이 부실해 텍스트가 문단 단위로 이어지지 않으면, 검색·인용 품질이 떨어져 RAG 성능 전체가 저하됩니다.
- 정확한 텍스트 추출이 있어야 AI가 분석 가능한 형태로 활용됨
- 표·그래프 등 구조가 살아 있어야 검색·참조가 효과적
- 문서 원래 구조·맥락을 유지해야 의미가 정확히 전달됨
- 대량 문서를 자동 처리해 지식베이스를 넓힐 수 있음
마무리 체크포인트
Searchable PDF를 만들 때 최종적으로 확인할 항목입니다. 여기까지 통과하면 GPT·RAG에 넣을 수 있는 깨끗한 전처리 자료가 완성됩니다.
- 문단 인식: 텍스트가 문단 단위로 올바르게 선택·복사되는지 확인
- OCR 처리: 이미지 기반 PDF는 반드시 텍스트 레이어를 생성
- 포맷 활용: 필요 시 TXT·XML·Markdown 등으로 변환해 활용
- 데이터 클리닝: 불필요한 잡음(garbage) 텍스트를 제거해 품질 향상
완료 판정은 '드래그했을 때 글자가 문단 단위로 끊김 없이 이어 선택되는가'로 합니다. 한 글자씩 뚝뚝 끊기거나 선택이 안 되면 OCR이 부실한 것이니 다시 처리하세요. 원본 파일은 지우지 말고 'OCR본'을 별도 이름으로 저장하는 것이 안전합니다.
사용 도구
- 알PDF — OCR/문자인식 기능(무료·유료 버전 구분, OCR 지원 범위는 버전·정책에 따라 변동 확인 필요)
- online2pdf.com (image2pdf) — 이미지→PDF 온라인 변환(무료, 업로드 파일 수·용량 제한 확인 필요)
- Adobe Acrobat Pro — OCR/Searchable PDF 변환(유료)
- ABBYY FineReader — 고정확도 OCR·다국어·표 레이아웃 유지·배치 처리(유료). 한글 인식률이 우수하다고 알려짐(성능은 문서 품질에 따라 다름, 확인 필요)