문서 파싱과 OCR 출력의 품질을 재는 방법은 하나가 아니다. 비용과 깊이가 다른 여러 층이 있고, 각 층이 무엇을 보고 무엇을 못 보는지 알아야 조합할 수 있다. 이 글은 회귀 테스트부터 LLM 판정까지를 한 줄로 늘어놓고 선택 기준을 정리한다. 실제 서비스에서 이 층을 어떻게 쌓았는지는 업무 기록 문서 파싱 서비스의 코드 구조 정리와 파싱 품질 운영 루...
문서 파싱과 OCR 출력의 품질을 재는 방법은 하나가 아니다. 비용과 깊이가 다른 여러 층이 있고, 각 층이 무엇을 보고 무엇을 못 보는지 알아야 조합할 수 있다.
이 글은 회귀 테스트부터 LLM 판정까지를 한 줄로 늘어놓고 선택 기준을 정리한다. 실제 서비스에서 이 층을 어떻게 쌓았는지는 업무 기록 문서 파싱 서비스의 코드 구조 정리와 파싱 품질 운영 루프와 Document Parser 운영과 개선에 있다. 파싱 도구 자체는 Docling에서 다룬다.
가볍고 얕은 쪽에서 무겁고 깊은 쪽 순서다.
| 방법 | 보는 것 | 못 보는 것 |
|---|---|---|
| 회귀 테스트 | 이전 출력과 같은지 | 절대 품질 |
| 정답 테스트(golden) | 사람이 만든 정답지와의 정확도 | 정답지가 없는 문서, 정답지 자체의 오류 |
| NED | 텍스트의 편집 거리 | 표 구조와 레이아웃 |
| docling-eval | 텍스트, 레이아웃, 읽기 순서, 표 구조 | 도구와 벤치마크 밖의 품질, 정성 품질 |
| LLM as Judge | 의미 품질 | 비용과 비결정성을 방어 장치 없이는 통제하지 못함 |
이전 출력과 같은지만 본다. 가장 가벼워서 CI에 상시로 둘 수 있다.
한계는 절대 품질을 못 본다는 점이다. 이전 출력과 현재 출력이 둘 다 틀려도 "동일"이면 통과한다. 예를 들어 한글 음절 누락이 이전부터 같았다면 회귀 테스트는 그 결함을 영영 잡지 못한다.
사람이 만든 정답지와 비교해 정확도를 측정한다. 회귀 테스트가 못 보는 절대 품질 저하를 잡는다.
대신 정답지를 만들고 유지하는 비용이 든다. 정답지가 틀리면 점수도 틀리므로 정답지도 검수 대상이다.
NED(Normalized Edit Distance)는 예측과 정답의 편집 거리를 0에서 1 사이 점수로 바꾼 값이다.
NED = 1 − (삽입 + 삭제 + 치환) / max(len(예측), len(정답))높을수록 좋고, 1이면 완전히 같다. 순수 텍스트, 수식, 읽기 순서처럼 선형으로 읽히는 내용에 적합하다.
텍스트 거리만 보므로 표 구조나 레이아웃은 못 본다. 표의 셀이 한 칸 밀려도 글자 수준에서는 차이가 작아 점수에 묻힐 수 있다.
docling-eval은 IBM의 docling 진영이 만든 문서 처리 평가 프레임워크다. 텍스트, 레이아웃, 읽기 순서, 표 구조를 벤치마크로 정량 평가한다. 다루는 벤치마크로 DocLayNet, FinTabNet, PubTabNet, OmniDocBench가 있다.
표 구조는 OTSL 포맷으로 표현하고 TEDS(Tree Edit Distance based Similarity)로 측정한다. 표를 트리로 보고 편집 거리를 계산하는 지표여서, NED가 못 보는 표 구조 차이를 점수로 드러낸다. 데이터셋 생성, 정답 준비, 평가, 시각화를 CLI로 제공한다.
한계는 도구와 벤치마크에 종속된다는 점이다. 읽기 자연스러움이나 서사 흐름 같은 정성 품질도 못 본다.
모델 출력을 다른 모델로 채점한다. 정량 지표가 못 보는 의미 품질을 유연하게 본다. 구조가 보존됐는지, 노이즈가 섞였는지, 읽기 자연스러운지가 대상이다.
약점은 비용과 비결정성이다. 같은 입력에도 점수가 흔들릴 수 있다. 이를 줄이는 흔한 장치가 둘 있다.
이 두 장치는 직접 만든 평가 체계에서 쓴 방식이며 공개 출처로 검증한 내용은 아니다.
한 방법으로 끝내지 않고 층으로 쌓는다.
정량 지표(NED, TEDS)는 결정적이고 재현할 수 있다. 정성 판정은 유연하지만 방어 장치가 필요하다. 둘의 역할이 다르므로 서로 대체하지 않는다.
| 질문 | 쓸 방법 |
|---|---|
| 바꾼 뒤 출력이 달라졌나 | 회귀 테스트 |
| 정답에 얼마나 가까운가 | 정답 테스트와 NED |
| 표 구조가 맞는가 | TEDS 기반 평가 |
| 읽기에 자연스럽고 노이즈가 없는가 | LLM 판정 |