PDF Limitations
스캔 PDF와 복잡한 문서가 잘 안 읽히는 이유
“PDF인데 왜 아무 글도 안 잡히지?”라는 문제는 파일 확장자가 아니라 PDF 내부 구조에서 시작합니다. DocListen은 현재 OCR을 제공하지 않기 때문에 이미지형 스캔 문서와 복잡한 편집 문서에는 분명한 한계가 있습니다.
텍스트형·스캔형·혼합형 PDF를 구분합니다
| 유형 | 확인 방법 | 예상 결과 |
|---|---|---|
| 텍스트형 | 문장을 드래그해 복사 가능 | 문단 추출에 가장 적합 |
| 스캔 이미지형 | 페이지 전체가 사진처럼 선택됨 | OCR 없이는 본문 추출 어려움 |
| 혼합형 | 일부 페이지만 복사 가능 | 페이지마다 결과가 달라질 수 있음 |
스캔 파일이라면 먼저 신뢰할 수 있는 OCR 도구로 텍스트를 인식하고 결과를 검수해야 합니다. 주민등록번호·의료정보·회사 비밀이 있는 문서를 외부 OCR 서비스에 올리는 것은 피하세요.
2단 편집은 읽는 순서가 바뀔 수 있습니다
논문과 보고서의 좌우 두 열은 사람에게는 분명하지만 PDF에는 글자 좌표만 저장될 수 있습니다. 이 경우 왼쪽 첫 줄 다음에 오른쪽 첫 줄이 이어지거나, 페이지 아래 각주가 본문 중간에 섞일 수 있습니다. 첫 페이지에서 문장 순서를 확인하고 이상하면 문단을 직접 눌러 구간별로 듣습니다.
표·수식·페이지 번호는 음성에 맞지 않습니다
표는 행과 열의 관계가 중요한데 텍스트 추출 과정에서는 셀 내용이 한 줄로 이어질 수 있습니다. 수식은 기호와 위첨자·아래첨자가 분리되고, 머리말과 페이지 번호는 본문 사이에 반복될 수 있습니다. 금액, 날짜, 단위, 통계값은 반드시 화면에서 직접 확인해야 합니다.

문제가 생겼을 때 순서대로 점검합니다
- 파일 크기가 30MB 이하인지 확인합니다.
- 원본 PDF에서 글자를 복사할 수 있는지 확인합니다.
- 표지가 아니라 본문 페이지를 열어봅니다.
- 첫 문단 대신 화면의 다른 문단을 직접 선택합니다.
- 다른 브라우저나 네트워크에서 한 번만 재현합니다.
- 그래도 실패하면 PDF 전체 대신 파일 유형·페이지·기기 정보를 문의합니다.
PDF 읽기 서비스를 비교할 때 볼 기준
- OCR이 필요한 스캔 PDF를 지원하는가
- 문단을 직접 선택하고 현재 위치를 확인할 수 있는가
- 페이지와 음성을 함께 볼 수 있는가
- 파일 보관·삭제·제3자 전송 방침이 공개되어 있는가
- 오류가 난 숫자와 문장을 원문에서 대조하기 쉬운가
- 계정과 파일 삭제 요청 경로가 있는가
음성의 자연스러움만으로 고르지 말고, 자신의 문서 유형에서 텍스트 순서가 맞는지와 파일 처리 기준을 함께 봐야 합니다.
DocListen이 현재 하지 않는 것
스캔 이미지 OCR, 표 구조 해석, 수식 낭독 최적화, 법률·의료·투자 문서의 정확성 보증을 제공하지 않습니다. 현재 비공개 테스트에서는 텍스트 선택이 가능한 단일 열 PDF를 중심으로 검증하고 있습니다. 확인된 실제 범위는 비공개 테스트 기록에 공개합니다.