fos-blog/study
01 / 홈02 / 카테고리03 / 시리즈
01 / 홈02 / 카테고리03 / 시리즈

카테고리

  • AI 페이지로 이동
    • RAG 페이지로 이동
    • agent 페이지로 이동
    • claude-code 페이지로 이동
    • harness 페이지로 이동
    • llm 페이지로 이동
    • ops 페이지로 이동
    • practice 페이지로 이동
  • algorithm 페이지로 이동
    • Alias Method: 가중치 랜덤 선택을 전처리 O(n), 추출 O(1)로 바꾸기
    • Welford's Online Algorithm: 값을 저장하지 않고 평균과 분산 계산하기
  • architecture 페이지로 이동
    • distributed-systems 페이지로 이동
    • domain 페이지로 이동
    • evolution 페이지로 이동
    • patterns 페이지로 이동
  • database 페이지로 이동
    • milvus 페이지로 이동
    • mysql 페이지로 이동
    • opensearch 페이지로 이동
    • qdrant 페이지로 이동
    • redis 페이지로 이동
    • vespa 페이지로 이동
    • DB Connection Pool Saturation과 Thread Pool 격리
    • 커넥션 풀 크기는 얼마나 조정해야 할까?
    • MyBatis 기본기 — XML Mapper, resultMap, 동적 SQL, 운영 패턴 정리
    • MyBatis와 JPA/Hibernate 트레이드오프 — 레거시 백엔드를 다루는 시니어 관점
    • 한국어 형태소 분석기 Nori vs Lindera — OpenSearch에서 Milvus로 갈 때 어휘 검색은 유지되나
    • 정규화와 역정규화: 무결성과 조회 비용 사이의 선택
    • 벡터 DB 5종, 아키텍처는 어떻게 다른가
    • 벡터 DB 5종을 실제로 벤치마크했다 — 같은 recall에서 QPS는 얼마나 갈리나
    • 벡터 DB 어떻게 고를까 — OpenSearch · Milvus · Qdrant · Vespa · pgvector 비교
    • 벡터 DB를 실제로 도입한 사례 — 빅테크 프로덕션
  • devops 페이지로 이동
    • docker 페이지로 이동
    • k8s 페이지로 이동
    • Envoy Proxy
    • Graceful Shutdown
    • 종료 신호는 어디서 멈추는가
  • http 페이지로 이동
    • HTTP Connection Pool
    • HTTPS와 TLS: 핸드셰이크, 인증서, 종료 지점
  • java 페이지로 이동
    • concurrency 페이지로 이동
    • jdbc 페이지로 이동
    • spring 페이지로 이동
    • spring-batch 페이지로 이동
    • testing 페이지로 이동
    • Java 동시성 락 정리 — 커머스 메뉴/프로모션 정책 캐시 갱신 관점
    • JVM 튜닝 실전: 메모리 구조부터 Virtual Threads, GC 튜닝, 프로파일링까지
    • 로그에 traceId 남기기 — MDC 부터 OpenTelemetry 까지
    • Java StampedLock — 읽기 폭주에도 쓰기가 밀리지 않는 락
    • Virtual Thread와 Project Loom
  • javascript 페이지로 이동
    • typescript 페이지로 이동
    • AbortController
    • Async Iterator와 제너레이터
    • CommonJS와 ECMAScript Modules
    • 제너레이터(Generator)
    • Http Client
    • Node 백엔드 운영 패턴 — Streams 백프레셔, pipe/pipeline, 멱등성 vs 분산 락
    • Node.js
    • `setImmediate()`
  • kafka 페이지로 이동
    • Kafka 클러스터 아키텍처: Broker, KRaft Controller와 복제
    • Kafka 기본 개념: Topic, Partition, Offset과 Segment
    • Kafka 실전 설계: 파티션 전략, 컨슈머 그룹, 전달 보장, 재시도, 순서 보장 트레이드오프
    • Kafka 파티션·리밸런스·컨슈머 지연 운영
    • Kafka를 로그로 이해하기: 복제, 재처리, 상태와 데이터 통합
    • Spring Kafka 컨슈머 오프셋 커밋과 트랜잭션 정렬: AckMode, manual ack, 멱등 처리
  • linux 페이지로 이동
    • fsync — 리눅스 파일 동기화 시스템 콜
    • SSH forced command 로 배포 키가 실행할 수 있는 명령 제한하기
  • mlops 페이지로 이동
    • llm-serving 페이지로 이동
    • model-router 페이지로 이동
    • Python CUDA 버전 생태계 — nvidia-smi, nvcc, pip, conda가 다 다른 버전을 말하는 이유
    • GPU 컨테이너의 CUDA 버전 호환성 — nvidia-smi부터 이미지 다이어트까지
    • Kubernetes GPU 노드에서 /run tmpfs가 꽉 차서 Pod가 안 뜰 때
    • GPU·CUDA·MPS 기초 — 자바 백엔드 개발자가 처음 만나는 그림
    • Multi-process GPU 워크로드 — 자바 ThreadPool 사용자가 만나는 모델 차이
    • ML 서비스 성능 분석 워크플로 — 자바 백엔드 트러블슈팅과 다른 점
    • 한 GPU 를 여러 프로세스가 나눠 쓰기 — Time-Slicing 과 MPS
  • network 페이지로 이동
    • Connection reset by peer는 누가 보낸 걸까 — 리버스 프록시 홉마다 TCP 연결은 따로 논다
    • L2(스위치)와 L3(라우터)의 역할 차이
    • L4와 VIP(Virtual IP Address)
    • IP Subnet
  • observability 페이지로 이동
    • Observability 입문: 시니어 백엔드가 장애를 탐지하고 대응하는 방식
    • K8s 위 Spring Boot 앱의 메트릭 수집
  • python 페이지로 이동
    • Python async/await — CompletableFuture·Reactor 와 다른 점, 그리고 blocking I/O 함정
    • Python 의존성 관리 — Java Maven/Gradle 사용자가 만나는 첫 충격
    • FastAPI 기초 — Spring Boot 사용자가 빠르게 익히는 법
    • Java 개발자를 위한 Python 심화 — OOP·데코레이터·컨텍스트 매니저
    • PyTorch 기초 — 텐서, 디바이스, 그리고 모델 로딩이 무거운 이유
    • Java 개발자를 위한 Python 문법 핵심
    • ThreadLocal 에서 contextvars 로 — Python 의 요청 컨텍스트 전파
    • OCR 동작 원리 — Layout · Text · Post-process 3단계
    • Python 서버의 RSS가 줄지 않는 이유: CPython, gc.collect(), malloc_trim
  • rabbitmq 페이지로 이동
    • RabbitMQ Basics — 실전 백엔드 관점에서 정리하는 메시지 브로커 기본기
    • RabbitMQ vs Kafka — 백엔드 메시징 선택 기준과 실전 운영 관점
  • resume 페이지로 이동
    • 경험 및 경력기술서
    • 김병태 경력기술서
    • 김병태 포트폴리오
  • task 페이지로 이동
    • ai-service-team 페이지로 이동
    • nsc-slot 페이지로 이동
    • sb-dev-team 페이지로 이동
    • the-future-company 페이지로 이동
  • thinking 페이지로 이동
    • 자기주도 학습: 질문에서 시작해 글로 검증하기
    • 좋은 일을 넘어 중요한 일을 하는 법
FOS-BLOG · FOOTERall systems normal·v0.1 · 2026.04.27·seoul, kr
Ffos-blog/study

개발 학습 기록을 정리하는 블로그입니다. 공부하면서 기록하고, 기록하면서 다시 배웁니다.

visitors
01site
  • Home↗
  • Posts↗
  • Categories↗
  • Glossary↗
  • About↗
02policy
  • 소개/about
  • 개인정보처리방침/privacy
  • 연락처/contact
03categories
  • AI↗
  • Algorithm↗
  • DB↗
  • DevOps↗
  • Java/Spring↗
  • JS/TS↗
  • React↗
  • Next.js↗
  • System↗
04connect
  • GitHub@jon890↗
  • Source repositoryjon890/fos-study↗
  • RSS feed/rss.xml↗
  • Newsletter매주 1 회 · 한 편의 글→
© 2026 FOS Study. All posts MIT-licensed.
built with·Next.js·Tailwind v4·Geist·Pretendard·oklch
fos-blog/AI/문서 파싱 품질을 재는 방법의 스펙트럼
ai

문서 파싱 품질을 재는 방법의 스펙트럼

문서 파싱과 OCR 출력의 품질을 재는 방법은 하나가 아니다. 비용과 깊이가 다른 여러 층이 있고, 각 층이 무엇을 보고 무엇을 못 보는지 알아야 조합할 수 있다. 이 글은 회귀 테스트부터 LLM 판정까지를 한 줄로 늘어놓고 선택 기준을 정리한다. 실제 서비스에서 이 층을 어떻게 쌓았는지는 업무 기록 문서 파싱 서비스의 코드 구조 정리와 파싱 품질 운영 루...

2026.10.02·3 min read·5 views

문서 파싱과 OCR 출력의 품질을 재는 방법은 하나가 아니다. 비용과 깊이가 다른 여러 층이 있고, 각 층이 무엇을 보고 무엇을 못 보는지 알아야 조합할 수 있다.

이 글은 회귀 테스트부터 LLM 판정까지를 한 줄로 늘어놓고 선택 기준을 정리한다. 실제 서비스에서 이 층을 어떻게 쌓았는지는 업무 기록 문서 파싱 서비스의 코드 구조 정리와 파싱 품질 운영 루프와 Document Parser 운영과 개선에 있다. 파싱 도구 자체는 Docling에서 다룬다.

스펙트럼

가볍고 얕은 쪽에서 무겁고 깊은 쪽 순서다.

방법보는 것못 보는 것
회귀 테스트이전 출력과 같은지절대 품질
정답 테스트(golden)사람이 만든 정답지와의 정확도정답지가 없는 문서, 정답지 자체의 오류
NED텍스트의 편집 거리표 구조와 레이아웃
docling-eval텍스트, 레이아웃, 읽기 순서, 표 구조도구와 벤치마크 밖의 품질, 정성 품질
LLM as Judge의미 품질비용과 비결정성을 방어 장치 없이는 통제하지 못함

회귀 테스트

이전 출력과 같은지만 본다. 가장 가벼워서 CI에 상시로 둘 수 있다.

한계는 절대 품질을 못 본다는 점이다. 이전 출력과 현재 출력이 둘 다 틀려도 "동일"이면 통과한다. 예를 들어 한글 음절 누락이 이전부터 같았다면 회귀 테스트는 그 결함을 영영 잡지 못한다.

정답 테스트

사람이 만든 정답지와 비교해 정확도를 측정한다. 회귀 테스트가 못 보는 절대 품질 저하를 잡는다.

대신 정답지를 만들고 유지하는 비용이 든다. 정답지가 틀리면 점수도 틀리므로 정답지도 검수 대상이다.

NED

NED(Normalized Edit Distance)는 예측과 정답의 편집 거리를 0에서 1 사이 점수로 바꾼 값이다.

text
NED = 1 − (삽입 + 삭제 + 치환) / max(len(예측), len(정답))

높을수록 좋고, 1이면 완전히 같다. 순수 텍스트, 수식, 읽기 순서처럼 선형으로 읽히는 내용에 적합하다.

텍스트 거리만 보므로 표 구조나 레이아웃은 못 본다. 표의 셀이 한 칸 밀려도 글자 수준에서는 차이가 작아 점수에 묻힐 수 있다.

docling-eval

docling-eval은 IBM의 docling 진영이 만든 문서 처리 평가 프레임워크다. 텍스트, 레이아웃, 읽기 순서, 표 구조를 벤치마크로 정량 평가한다. 다루는 벤치마크로 DocLayNet, FinTabNet, PubTabNet, OmniDocBench가 있다.

표 구조는 OTSL 포맷으로 표현하고 TEDS(Tree Edit Distance based Similarity)로 측정한다. 표를 트리로 보고 편집 거리를 계산하는 지표여서, NED가 못 보는 표 구조 차이를 점수로 드러낸다. 데이터셋 생성, 정답 준비, 평가, 시각화를 CLI로 제공한다.

한계는 도구와 벤치마크에 종속된다는 점이다. 읽기 자연스러움이나 서사 흐름 같은 정성 품질도 못 본다.

LLM as Judge

모델 출력을 다른 모델로 채점한다. 정량 지표가 못 보는 의미 품질을 유연하게 본다. 구조가 보존됐는지, 노이즈가 섞였는지, 읽기 자연스러운지가 대상이다.

약점은 비용과 비결정성이다. 같은 입력에도 점수가 흔들릴 수 있다. 이를 줄이는 흔한 장치가 둘 있다.

  • 같은 항목을 여러 번 채점해 중앙값을 쓴다.
  • 채점 전에 결함부터 찾게 해서 후한 점수를 막는다.

이 두 장치는 직접 만든 평가 체계에서 쓴 방식이며 공개 출처로 검증한 내용은 아니다.

조합 원칙

한 방법으로 끝내지 않고 층으로 쌓는다.

  • 회귀 테스트는 CI에서 상시로 가볍게 돌린다.
  • 정답 테스트와 LLM 판정은 주기적으로, 또는 릴리스 전에 깊게 돌린다.
  • 회귀 테스트가 못 보는 절대 저하는 정답 테스트가 메운다.
  • 정량 지표가 못 보는 정성 품질은 LLM 판정이 메운다.

정량 지표(NED, TEDS)는 결정적이고 재현할 수 있다. 정성 판정은 유연하지만 방어 장치가 필요하다. 둘의 역할이 다르므로 서로 대체하지 않는다.

정리

질문쓸 방법
바꾼 뒤 출력이 달라졌나회귀 테스트
정답에 얼마나 가까운가정답 테스트와 NED
표 구조가 맞는가TEDS 기반 평가
읽기에 자연스럽고 노이즈가 없는가LLM 판정

참고 링크

  • docling-eval: https://github.com/docling-project/docling-eval
  • OmniDocBench: https://github.com/opendatalab/OmniDocBench
on this page
  • 01스펙트럼
  • 회귀 테스트
  • 정답 테스트
  • NED
  • docling-eval
  • LLM as Judge
  • 02조합 원칙
  • 03정리
  • 04참고 링크
tags
#study

이런 글도

  • ai

    하네스 회고는 새 문서로 쌓지 않고 종류에 맞는 기존 단일 소스에 환원한다

    2026.10.02
  • ai

    에이전트가 배운 회피 패턴은 조건을 통과한 것만 파일로 쌓고 주기적으로 지운다

    2026.10.02
  • ai

    ADR 은 되돌리기 어려운 결정의 이유만 남기고, 대안 기각은 옵션마다 줄을 나눈다

    2026.10.02
  • ai

    스킬 문서는 반복 실행을 스크립트로 내리고 같은 지시를 한 곳에서만 소유하게 쓴다

    2026.10.02

댓글 (0)