fos-blog/study
01 / 홈02 / 카테고리03 / 시리즈
01 / 홈02 / 카테고리03 / 시리즈

카테고리

  • AI 페이지로 이동
    • RAG 페이지로 이동
    • agent 페이지로 이동
    • langgraph 페이지로 이동
    • 사람용 CLI와 AI 에이전트용 CLI는 설계가 다르다
    • agents.md
    • Claude Code 메모리: CLAUDE.md와 .claude/rules를 규칙으로 쓰는 법
    • Claude Code의 Skill 시스템 - 개발자를 위한 AI 자동화의 새로운 차원
    • Claude Code를 5주 더 쓴 결과 — 스킬·CLAUDE.md를 키워가는 방식
    • Claude Code를 11일 동안 쓴 결과 — 데이터로 본 나의 사용 패턴
    • Claude Code 멀티 에이전트 — Teams
    • AI 에이전트와 디자인의 새 컨벤션 — DESIGN.md, Google Stitch, Claude Design
    • Docling — IBM Research 의 문서 파싱 toolkit 상세 정리
    • 하네스 엔지니어링 실전 — 4인 에이전트 팀으로 코딩 파이프라인 구축하기
    • 하네스 엔지니어링 — 오래 실행되는 AI 에이전트를 위한 설계
    • 멀티모달 LLM (Multimodal Large Language Model)
    • AI 에이전트와 함께 MVP 만들기 — dooray-cli 사례
    • 온톨로지에서 코딩 에이전트 컨텍스트까지 — 클래스·관계 설계와 그래프 평가
    • OpenClaw는 context와 memory를 어떻게 관리하나 — 나만의 에이전트를 구성하는 법
    • OpenClaw vs Hermes Agent — 갈아탈까 고민하며 정리한 비교
  • ai 페이지로 이동
    • agent 페이지로 이동
    • [초안] AI 제품 백엔드 안정성 — 지연·비용·권한·관측·도구 실패·폴백/재시도/사람 에스컬레이션
    • [초안] LLM 평가 프레임워크: 골든셋, 회귀 테스트, LLM-as-a-judge, 사람 피드백 루프
  • algorithm 페이지로 이동
    • live-coding 페이지로 이동
    • 분산 계산을 위한 알고리즘
  • architecture 페이지로 이동
    • 시니어 백엔드를 위한 API 설계 실전 스터디 팩
    • API 버저닝과 하위 호환성: 모바일·외부 컨슈머까지 안전하게 진화시키기
    • 캐시 설계 전략 총정리
    • [초안] 커머스 Spring 서비스에 Clean/Hexagonal Architecture를 실용적으로 적용하기
    • [초안] 커머스 도메인 모델링: 주문·재고·노출의 세 축을 분리해서 설계하기
    • 커머스 주문 상태와 데이터 정합성 기본기
    • [초안] 쿠폰/프로모션 동시성과 정합성 기본기 — 선착순·중복 사용 방지·발급/사용/복구
    • [초안] DDD와 도메인 모델링: 시니어 백엔드 관점의 전술/전략 패턴 실전 가이드
    • [초안] Decorator & Chain of Responsibility — 행동을 체인으로 조립하는 두 가지 방식
    • 디자인 패턴
    • [초안] 분산 아키텍처 완전 정복: Java 백엔드 시니어 인터뷰 대비 실전 가이드
    • [초안] 분산 트랜잭션과 Outbox 패턴 — 왜 2PC를 피하고 어떻게 대신할 것인가
    • 분산 트랜잭션
    • [초안] e-Commerce 주문·결제 도메인 모델링: 상태머신, 멱등성, Outbox/Saga 실전 정리
    • [초안] Event Sourcing과 CQRS — 상태가 아니라 변화를 저장한다는 발상
    • [학습중] 금융 거래 취소·정정·대사·일마감 운영
    • [학습중] 금융 거래 상태와 원장 설계
    • [초안] F&B 쿠폰·프로모션·멤버십·포인트 설계
    • [초안] F&B · e-Commerce 디지털 채널 도메인 한 장 정리
    • [초안] F&B 주문/매장/픽업 상태머신 설계
    • [초안] F&B 이커머스 결제·환불·정산 운영 가이드
    • [초안] Hexagonal / Clean Architecture를 Spring 백엔드에 적용하기
    • [초안] 대규모 커머스 트래픽 처리 패턴 — 대규모 회원과 메가 프로모션을 버티는 설계
    • [초안] 레거시 JSP/jQuery 화면과 신규 API가 공존하는 백엔드 운영 전략
    • [학습중] 모듈러 모놀리스에서 MSA로 점진 전환하는 실습
    • [초안] MSA 서비스 간 통신: Redis [Cache-Aside](../database/redis/cache-aside.md) × Kafka 이벤트 하이브리드 설계
    • [초안] Observability 입문: 시니어 백엔드가 장애를 탐지하고 대응하는 방식
    • [초안] Outbox / Inbox Pattern 심화 — 분산 메시징의 정합성 문제를 DB 트랜잭션으로 풀어내기
    • [초안] 결제 도메인 멱등성과 트랜잭션 재시도 기본기
    • [초안] 시니어 백엔드를 위한 Resilience 패턴 실전 가이드 — Timeout, Retry, Circuit Breaker, Bulkhead, Backpressure
    • [초안] Spring Batch vs Event-Driven — 같은 비동기처럼 보이지만 전혀 다른 두 패러다임
    • [초안] Strategy Pattern — 분기문을 없애는 설계, 시니어 백엔드 인터뷰 핵심 패턴
    • [초안] 시니어 백엔드를 위한 시스템 설계 입문 스터디 팩
    • [초안] 템플릿 메서드 패턴 - 백엔드 처리 골격을 강제하는 가장 오래되고 가장 위험한 패턴
    • [초안] 대규모 트래픽 중 무중단 마이그레이션 — Feature Flag + Shadow Mode 실전
  • database 페이지로 이동
    • milvus 페이지로 이동
    • mysql 페이지로 이동
    • opensearch 페이지로 이동
    • qdrant 페이지로 이동
    • redis 페이지로 이동
    • vespa 페이지로 이동
    • 김영한의-실전-데이터베이스-설계 페이지로 이동
    • [초안] DB Connection Pool Saturation과 Thread Pool 격리
    • 커넥션 풀 크기는 얼마나 조정해야 할까?
    • 인덱스 - DB 성능 최적화의 핵심
    • [초안] JPA N+1과 커머스 조회 모델: 주문/메뉴/쿠폰 도메인에서 살아남기
    • [초안] MyBatis 기본기 — XML Mapper, resultMap, 동적 SQL, 운영 패턴 정리
    • [초안] MyBatis와 JPA/Hibernate 트레이드오프 — 레거시 백엔드를 다루는 시니어 관점
    • 한국어 형태소 분석기 Nori vs Lindera — OpenSearch에서 Milvus로 갈 때 어휘 검색은 유지되나
    • 벡터 DB 5종, 아키텍처는 어떻게 다른가
    • 벡터 DB 5종을 실제로 벤치마크했다 — 같은 recall에서 QPS는 얼마나 갈리나
    • 벡터 DB 어떻게 고를까 — OpenSearch · Milvus · Qdrant · Vespa · pgvector 비교
    • 벡터 DB를 실제로 도입한 사례 — 빅테크 프로덕션
    • 역정규화 (Denormalization)
    • 데이터 베이스 정규화
  • devops 페이지로 이동
    • docker 페이지로 이동
    • k8s 페이지로 이동
    • k8s-in-action 페이지로 이동
    • observability 페이지로 이동
    • [초안] 커머스/F&B 채널 장애 첫 5분과 관측성 기본기
    • [초안] 운영 데이터 정합성 장애 대응 — 결제 취소 누락과 중복 적재 런북
    • Envoy Proxy
    • [초안] F&B / e-Commerce 운영 장애 대응과 모니터링 — 백엔드 관점 정리
    • Graceful Shutdown
    • [초안] 시니어 백엔드를 위한 SLO와 Error Budget 기반 장애 대응
  • http 페이지로 이동
    • HTTP Connection Pool
    • HTTPS는 어떻게 안전한가 — TLS, 인증서, 그리고 termination
  • interview 페이지로 이동
    • [초안] AI 서비스 팀 경험 기반 시니어 백엔드 면접 질문 뱅크 — Spring Batch RAG / gRPC graceful shutdown / 캐시 정합성 / 12일 AI 웹툰 MVP
    • Observability — 면접 답변 프레임
    • [초안] 시니어 Java 백엔드 면접 마스터 플레이북 — 김병태
    • [초안] NSC 슬롯팀 경험 기반 질문 은행 — 도메인 모델링·동시성·성능·AI 협업
  • java 페이지로 이동
    • concurrency 페이지로 이동
    • jdbc 페이지로 이동
    • opentelemetry 페이지로 이동
    • spring 페이지로 이동
    • spring-batch 페이지로 이동
    • testing 페이지로 이동
    • 더_자바_코드를_조작하는_다양한_방법 페이지로 이동
    • [초안] Java 동시성 락 정리 — 커머스 메뉴/프로모션 정책 캐시 갱신 관점
    • [초안] JVM 튜닝 실전: 메모리 구조부터 Virtual Threads, GC 튜닝, 프로파일링까지
    • Java의 로깅 환경
    • MDC (Mapped Diagnostic Context)
    • Java StampedLock — 읽기 폭주에도 쓰기가 밀리지 않는 락
    • Virtual Thread와 Project Loom
  • javascript 페이지로 이동
    • typescript 페이지로 이동
    • AbortController
    • Async Iterator와 제너레이터
    • CommonJS와 ECMAScript Modules
    • 제너레이터(Generator)
    • Http Client
    • Node 백엔드 운영 패턴 — Streams 백프레셔, pipe/pipeline, 멱등성 vs 분산 락
    • Node.js
    • npm vs pnpm — 어떤 기준으로 선택했나
    • `setImmediate()`
  • kafka 페이지로 이동
    • [초안] Kafka 기본 개념 — 토픽, 파티션, 오프셋, 복제
    • Kafka를 사용하여 **데이터 정합성**은 어떻게 유지해야 할까?
    • [초안] Kafka 실전 설계: 파티션 전략, 컨슈머 그룹, 전달 보장, 재시도, 순서 보장 트레이드오프
    • [학습중] Kafka 파티션·리밸런스·컨슈머 지연 운영
    • 메시지 전송 신뢰성
    • [초안] Spring Kafka 컨슈머 오프셋 커밋과 트랜잭션 정렬: AckMode, manual ack, 멱등 처리
  • linux 페이지로 이동
    • fsync — 리눅스 파일 동기화 시스템 콜
    • tmux — Terminal Multiplexer
  • mlops 페이지로 이동
    • llm-serving 페이지로 이동
    • serving-frameworks 페이지로 이동
    • Python CUDA 버전 생태계 — nvidia-smi, nvcc, pip, conda가 다 다른 버전을 말하는 이유
    • GPU 컨테이너의 CUDA 버전 호환성 — nvidia-smi부터 이미지 다이어트까지
    • Kubernetes GPU 노드에서 /run tmpfs가 꽉 차서 Pod가 안 뜰 때
    • GPU·CUDA·MPS 기초 — 자바 백엔드 개발자가 처음 만나는 그림
    • Multi-process GPU 워크로드 — 자바 ThreadPool 사용자가 만나는 모델 차이
    • ML 서비스 성능 분석 워크플로 — 자바 백엔드 트러블슈팅과 다른 점
    • 한 GPU 를 여러 프로세스가 나눠 쓰기 — Time-Slicing 과 MPS
  • network 페이지로 이동
    • Connection reset by peer는 누가 보낸 걸까 — 리버스 프록시 홉마다 TCP 연결은 따로 논다
    • L2(스위치)와 L3(라우터)의 역할 차이
    • L4와 VIP(Virtual IP Address)
    • IP Subnet
  • python 페이지로 이동
    • Python async/await — CompletableFuture·Reactor 와 다른 점, 그리고 blocking I/O 함정
    • Python 의존성 관리 — Java Maven/Gradle 사용자가 만나는 첫 충격
    • FastAPI 기초 — Spring Boot 사용자가 빠르게 익히는 법
    • Java 개발자를 위한 Python 심화 — OOP·데코레이터·컨텍스트 매니저
    • PyTorch 기초 — 텐서, 디바이스, 그리고 모델 로딩이 무거운 이유
    • Java 개발자를 위한 Python 문법 핵심
    • ThreadLocal 에서 contextvars 로 — Python 의 요청 컨텍스트 전파
    • OCR 동작 원리 — Layout · Text · Post-process 3단계
    • Python 서버의 RSS 가 안 줄어드는 이유 — gc.collect 의 한계와 malloc_trim
  • rabbitmq 페이지로 이동
    • [초안] RabbitMQ Basics — 실전 백엔드 관점에서 정리하는 메시지 브로커 기본기
    • [초안] RabbitMQ vs Kafka — 백엔드 메시징 선택 기준과 실전 운영 관점
  • resume 페이지로 이동
    • [초안] 김병태 경력기술서
    • [초안] 김병태 포트폴리오
  • security 페이지로 이동
    • [초안] 시니어 백엔드를 위한 보안 / 인증 스터디 팩 — Spring Security, JWT, OAuth2, OWASP Top 10
    • [초안] Spring Security 6.x OAuth2 + JWT 상용 인증 설계 — Grant 선택, Resource Server, Refresh Rotation, 로그아웃
  • task 페이지로 이동
    • ai-service-team 페이지로 이동
    • nsc-slot 페이지로 이동
    • sb-dev-team 페이지로 이동
    • the-future-company 페이지로 이동
  • testing 페이지로 이동
    • [초안] 시니어 Java 백엔드를 위한 테스트 전략 완전 정리 — 피라미드부터 TestContainers, 마이크로벤치, Contract까지
  • thinking 페이지로 이동
    • 좋은 일을 넘어 중요한 일을 하는 법
FOS-BLOG · FOOTERall systems normal·v0.1 · 2026.04.27·seoul, kr
Ffos-blog/study

개발 학습 기록을 정리하는 블로그입니다. 공부하면서 기록하고, 기록하면서 다시 배웁니다.

visitors
01site
  • Home↗
  • Posts↗
  • Categories↗
  • Glossary↗
  • About↗
02policy
  • 소개/about
  • 개인정보처리방침/privacy
  • 연락처/contact
03categories
  • AI↗
  • Algorithm↗
  • DB↗
  • DevOps↗
  • Java/Spring↗
  • JS/TS↗
  • React↗
  • Next.js↗
  • System↗
04connect
  • GitHub@jon890↗
  • Source repositoryjon890/fos-study↗
  • RSS feed/rss.xml↗
  • Newsletter매주 1 회 · 한 편의 글→
© 2026 FOS Study. All posts MIT-licensed.
built with·Next.js·Tailwind v4·Geist·Pretendard·oklch
fos-blog/AI/GraphRAG 평가와 벡터 RAG 제거 실…
aidb

GraphRAG 평가와 벡터 RAG 제거 실험

GraphRAG 평가는 "답이 맞았다" 하나로 끝나면 안 된다. 이 글의 결론은, 그래프 구축 품질, 후보와 근거 회수, 최종 컨텍스트 정밀도와 재현율, 출처·최신성·권한·지연·비용을 단계별로 나누고, 반드시 벡터 전용 기준선과 제거 실험으로 비교해야 한다는 것이다. 그래프를 만들었다는 사실은 성공 기준이 아니다. 벡터 RAG가 놓친 관계형 질문에서, 권한...

2026.07.30·9 min read·7 views

GraphRAG 평가는 "답이 맞았다" 하나로 끝나면 안 된다. 이 글의 결론은, 그래프 구축 품질, 후보와 근거 회수, 최종 컨텍스트 정밀도와 재현율, 출처·최신성·권한·지연·비용을 단계별로 나누고, 반드시 벡터 전용 기준선과 제거 실험으로 비교해야 한다는 것이다.

그래프를 만들었다는 사실은 성공 기준이 아니다. 벡터 RAG가 놓친 관계형 질문에서, 권한과 출처를 보존한 컨텍스트를 더 잘 제공한다는 증거가 있어야 한다.

이 글은 세 질문을 따라간다.

  • 그래프 구축 품질과 검색 품질을 왜 분리해서 평가해야 하는가?
  • candidate recall과 context recall은 무엇이 다른가?
  • 그래프 확장을 제거했을 때 품질, 지연, 비용이 어떻게 바뀌는가?

가져갈 판단 기준은 세 가지다.

  • graph construction 평가는 검색 전에 끝내야 한다.
  • 후보에 있던 근거가 최종 컨텍스트에서 빠질 수 있으므로 candidate와 context를 나눠 본다.
  • 벡터 전용 제거 실험을 이기지 못하면 GraphRAG 복잡도를 정당화할 수 없다.

이전 글: 에이전트를 위한 Neo4j 컨텍스트 제공자 설계

평가 경계를 먼저 그린다

GraphRAG 파이프라인은 여러 단계로 실패한다. 노드를 잘못 만들 수도 있고, 검색 후보를 놓칠 수도 있고, 후보에는 있었던 근거를 토큰 조립에서 버릴 수도 있다.

그래서 평가 경계를 다음처럼 나눈다.

각 단계는 정답 집합이 다르다. 같은 recall이라는 이름을 쓰더라도, 무엇을 정답으로 보는지 다르면 전혀 다른 지표가 된다.

평가 데이터셋

처음에는 큰 벤치마크보다 작은 고정 질문 세트가 낫다. 이 시리즈의 도메인에서는 질문 30개 정도로 시작한다.

질문 유형예시필수 근거
단일 사실특정 API의 제한 시간은 얼마인가?Chunk 1개
관계 영향이 API 변경 시 어떤 서비스와 저장소를 봐야 하는가?API, Service, Repository, Chunk
결정 추적이 운영 방식은 어떤 ADR에서 결정됐는가?ADR, Claim, Evidence, Document
장애 연결최근 장애와 관련된 소유자와 결정은 무엇인가?Incident, Owner, ADR, Evidence
충돌 탐지같은 서비스에 대해 충돌하는 문서가 있는가?상충 Claim 2개와 각각의 Evidence
안전 경계권한 밖 문서를 제외하고 답할 수 있는가?허용 문서만 포함

각 질문에는 사람이 표시한 정답을 붙인다. 정답은 최종 답변 문장이 아니라, 필수 노드, 관계, 청크, 원문 URI로 저장한다.

그래프 구축 품질

그래프 구축 품질은 검색을 돌리기 전에 평가한다. 그래프가 틀렸는데 검색이 맞았다면 우연일 수 있다.

평가 항목은 네 가지다.

항목측정 예실패 판정
개체 식별같은 Service가 하나로 합쳐졌는가별칭 때문에 중복 노드가 생기거나 다른 서비스가 병합된다
관계 정확성EXPOSES, OWNED_BY, DECIDES_FOR가 맞는가관계 방향이나 대상 타입이 틀린다
claim 추출검증 가능한 문장만 Claim이 되었는가의견, 제목, 목차가 주장으로 들어간다
evidence 연결모든 Claim이 원문 Chunk와 연결되는가근거 없는 관계가 컨텍스트에 들어간다

정량화는 단순하게 시작한다.

text
entity_precision = 올바른 개체 수 / 추출된 개체 수
entity_recall = 회수된 정답 개체 수 / 정답 개체 수
relationship_precision = 올바른 관계 수 / 추출된 관계 수
evidence_coverage = evidence가 연결된 claim 수 / 전체 claim 수

중요한 실패는 평균 점수로 덮지 않는다. 예를 들어 권한 밖 문서에서 추출된 Evidence가 연결되면, precision이 높아도 안전 실패로 따로 표시한다.

후보와 근거 회수

후보 검색 평가는 "필수 근거가 후보 안에 들어왔는가"를 본다.

지표답하는 질문
candidate recall@k필수 문서, 청크, 노드가 후보 안에 들어왔는가
evidence recall@k사람이 표시한 필수 Evidence가 후보 안에 들어왔는가
candidate precision@k후보 중 실제 관련 있는 비율은 얼마인가
path recall필수 관계 경로가 탐색 결과에 들어왔는가

벡터 검색은 가까운 청크를 찾을 수 있지만, 그 청크와 연결된 서비스·저장소·ADR 경로를 항상 회수하지는 않는다. 반대로 그래프 확장은 경로를 회수하지만, 시작 후보가 틀리면 잘못된 관계를 많이 가져온다.

따라서 후보 단계에서는 VectorRetriever, HybridRetriever, HybridCypherRetriever를 나눠 기록한다. 공식 Neo4j GraphRAG retriever의 역할은 여기까지다. Microsoft GraphRAG의 global, local, DRIFT 용어를 이 평가표의 구현체 이름으로 쓰지 않는다.

컨텍스트 정밀도와 재현율

후보에 들어온 근거가 최종 컨텍스트에 남는다는 보장은 없다. 토큰 예산, 중복 제거, 정렬, 최신성 필터에서 빠질 수 있다.

그래서 컨텍스트 단계 지표를 따로 둔다.

지표의미
context recall필수 근거 중 최종 컨텍스트에 들어간 비율
context precision최종 컨텍스트 중 질문 답변에 필요한 비율
token efficiency필수 근거 1개를 전달하는 데 쓴 토큰 수
duplicate ratio같은 원문이나 같은 claim이 반복된 비율

예를 들어 후보에는 필수 근거 4개가 모두 있었지만, 최종 컨텍스트에 2개만 들어갔다면 candidate recall은 성공이고 context recall은 실패다. 이 경우 retriever를 바꿀 문제가 아니라 조립기를 고쳐야 한다.

출처와 최신성 평가

GraphRAG는 관계 경로를 제공할 수 있지만, 그 경로가 원문으로 닫히지 않으면 에이전트 답변에 쓰기 어렵다.

출처 평가는 다음을 본다.

  • 모든 claim에 Evidence가 있는가?
  • 모든 evidence가 Chunk와 Document.source_uri로 이어지는가?
  • 답변에 인용된 문장과 실제 청크 내용이 일치하는가?
  • 같은 원문에서 나온 여러 청크를 병합해도 chunk_id 목록이 유지되는가?

최신성 평가는 별도다.

상태실패 예
current최신 문서가 있는데 오래된 ADR을 현재 결정처럼 반환한다
stale폐기된 문서를 경고 없이 사용한다
unknown갱신 시각이 없는데 확정 근거처럼 쓴다

최신성은 retrieval score가 높아도 통과 조건을 깰 수 있다. 운영 문서에서는 최신성 누락을 품질 점수 감점이 아니라 별도 실패로 둔다.

ACL violation은 상쇄하지 않는다

권한 위반은 평균 점수로 다루면 안 된다. 한 건의 권한 밖 문서 노출도 실패다.

측정은 단순하다.

text
acl_violation_count = 최종 후보와 컨텍스트에 포함된 권한 밖 source_uri 수
acl_violation_rate = 권한 위반 요청 수 / 전체 요청 수

둘 다 0이어야 한다. 후보 검색 단계에서만 0이어도 충분하지 않다. 관계 확장과 컨텍스트 조립 뒤에도 다시 계산해야 한다.

지연과 비용

GraphRAG의 추가 품질은 비용을 낸다. 관계 확장과 LLM 기반 쿼리 생성은 특히 비싸다.

기본적으로 다음 값을 기록한다.

항목기록값
후보 검색 지연벡터, 전문, 하이브리드 각각의 밀리초
관계 확장 지연hop, 반환 경로 수, DB hits
컨텍스트 조립 비용사용 토큰, 제거된 후보 수
LLM 비용Text2Cypher나 rerank를 썼을 때 호출 수와 토큰
전체 지연p50, p95, 시간 제한 비율

Neo4j Cypher의 EXPLAIN은 실행하지 않고 계획을 보여주며, PROFILE은 실제로 실행하고 DB hits 같은 측정값을 보여준다. 쓰기 쿼리에 PROFILE을 붙이면 실제 쓰기가 일어날 수 있으므로, 컨텍스트 제공자 튜닝은 읽기 쿼리와 격리된 환경에서만 한다.

벡터 전용 제거 실험

제거 실험은 복잡한 구성을 정당화하는 최소 장치다. 비교군을 네 개로 둔다.

구성목적
벡터 전용의미 검색 기준선
hybrid벡터와 전문 검색 결합 효과
하이브리드 검색 + 그래프 확장관계 탐색 추가 효과
하이브리드 검색 + 그래프 확장 + 최신성/ACL운영 제약까지 넣은 실제 후보

각 구성에서 같은 질문 세트를 돌린다. 그리고 질문 유형별로 지표를 나눠 본다.

  • 단일 사실 질문에서 GraphRAG가 더 느리기만 하면 라우팅에서 제외한다.
  • 관계 영향 질문에서 컨텍스트 재현율이 오르지 않으면 그래프 모델이나 검색 쿼리를 고친다.
  • 출처와 최신성이 깨지면 검색 점수와 무관하게 실패다.
  • 지연과 비용이 예산을 넘으면 더 깊은 그래프 탐색을 기본값으로 두지 않는다.

GraphRAG가 모든 질문에서 이겨야 하는 것은 아니다. 관계형 질문에서만 이기고 단일 사실 질문은 벡터 전용 경로로 보내는 설계가 더 현실적이다.

평가 기록 예시

아래 표는 기록 형식 예시다. 실측값이 아니라 실습 때 채워야 할 양식이다.

query_id유형구성evidence recall@10context recallattributionACLp95 ms
q-001단일 사실벡터 전용미측정미측정미측정미측정미측정
q-001단일 사실하이브리드 검색미측정미측정미측정미측정미측정
q-014관계 영향하이브리드 검색 + 그래프미측정미측정미측정미측정미측정
q-021안전 경계하이브리드 검색 + 그래프 + ACL미측정미측정미측정미측정미측정

값이 비어 있는 상태로는 글의 결론을 주장하면 안 된다. 이 시리즈의 코드는 학습 설계 예시이며, 실측 평가는 독자가 자기 데이터와 질문 세트에서 채워야 한다.

실패 모드

평가 자체도 실패할 수 있다.

실패설명대응
정답 집합 오류사람이 표시한 필수 근거가 틀렸다샘플을 이중 검토한다
질문 편향그래프가 잘하는 질문만 모았다단일 사실과 관계 질문을 섞는다
지표 혼합ACL 실패와 검색 점수를 평균낸다안전 지표는 통과 조건으로 분리한다
비용 누락품질만 보고 지연을 기록하지 않는다p95와 timeout을 기본 열로 둔다

평가표가 허술하면 GraphRAG는 쉽게 좋아 보인다. 특히 관계형 질문만 골라놓고 벡터 전용 검색을 비판하면 실무 판단에는 도움이 되지 않는다.

언제 쓰지 말아야 하는가

다음 상황에서는 GraphRAG 평가를 크게 시작하지 않는다.

  • 정답 근거를 표시할 사람이 없다.
  • 문서의 원문 URI와 버전이 없다.
  • ACL을 테스트할 사용자 시나리오가 없다.
  • 단일 사실 질문만 있는 서비스다.
  • 벡터 전용 기준선도 아직 측정하지 않았다.

이 경우에는 작은 질문 세트와 벡터 전용 기준선을 먼저 만들고, 그다음 그래프 구성요소를 하나씩 추가한다.

실습

실습 목표는 같은 질문 세트를 네 구성으로 돌리고, 그래프 확장이 어떤 지표를 올리고 어떤 비용을 올렸는지 분리해 기록하는 것이다.

재현 가능한 단계

  1. 질문 30개를 단일 사실, 관계 영향, 결정 추적, 장애 연결, 안전 경계로 나눈다.
  2. 각 질문에 필수 Document, Chunk, Evidence, 관계 경로를 표시한다.
  3. 벡터 전용 결과를 저장한다.
  4. hybrid 결과를 저장한다.
  5. 하이브리드 검색과 그래프 확장 결과를 저장한다.
  6. ACL과 freshness 필터를 넣은 운영형 결과를 저장한다.
  7. 각 단계의 후보 재현율, 근거 재현율, 컨텍스트 정밀도, 컨텍스트 재현율, 출처 연결률, ACL 위반률, 지연, 비용을 계산한다.

확인할 결과

관계 영향과 결정 추적 질문에서는 graph expansion이 context recall을 올려야 한다. 단일 사실 질문에서는 vector-only나 hybrid가 더 싸게 충분한 결과를 낼 수 있다. ACL violation은 모든 구성에서 0이어야 한다. 출처 누락과 최신성 누락은 별도 실패로 표시되어야 한다.

실패 판정

다음 중 하나라도 나오면 실패다.

  • graph construction 품질을 확인하지 않고 retrieval 지표만 본다.
  • 후보 recall과 context recall을 구분하지 않는다.
  • 벡터 전용 기준선 없이 GraphRAG가 낫다고 주장한다.
  • ACL violation을 평균 점수로 상쇄한다.
  • attribution 없는 답변을 정답으로 처리한다.
  • latency와 cost가 예산을 넘었는데 성공으로 표시한다.

참고 링크

  • Neo4j GraphRAG RAG guide: https://neo4j.com/docs/neo4j-graphrag-python/current/user_guide_rag.html
  • Neo4j GraphRAG Knowledge Graph Builder: https://neo4j.com/docs/neo4j-graphrag-python/current/user_guide_kg_builder.html
  • Neo4j GraphRAG Pipeline: https://neo4j.com/docs/neo4j-graphrag-python/current/user_guide_pipeline.html
  • Neo4j Cypher Manual - Query plans: https://neo4j.com/docs/cypher-manual/current/planning-and-tuning/execution-plans/
  • Neo4j Cypher Manual - Vector indexes: https://neo4j.com/docs/cypher-manual/current/indexes/semantic-indexes/vector-indexes/
  • Neo4j Operations Manual - Role-based access control: https://neo4j.com/docs/operations-manual/current/authentication-authorization/manage-privileges/

이어서 읽기

  • 이전 글: 에이전트를 위한 Neo4j 컨텍스트 제공자 설계
  • 다음 글: 권한·최신성·성능을 포함한 Neo4j 운영 설계
on this page
  • 01평가 경계를 먼저 그린다
  • 02평가 데이터셋
  • 03그래프 구축 품질
  • 04후보와 근거 회수
  • 05컨텍스트 정밀도와 재현율
  • 06출처와 최신성 평가
  • 07ACL violation은 상쇄하지 않는다
  • 08지연과 비용
  • 09벡터 전용 제거 실험
  • 10평가 기록 예시
  • 11실패 모드
  • 12언제 쓰지 말아야 하는가
  • 13실습
  • 재현 가능한 단계
  • 확인할 결과
  • 실패 판정
  • 14참고 링크
  • 15이어서 읽기
tags
#심화

이런 글도

  • 권한·최신성·성능을 포함한 Neo4j 운영 설계
    운영 설계의 결론은 학습 환경과 제품 환경을 분리하는 것이다. Neo4j Community Edition은 로컬 학습과 단일 인스턴스 실습에 충분할 수 있지만, 사내 컨텍스트 제공자가 권한, 가용성, 백업, 운영 보안을 요구하면 Enterprise 또는 Aura 기능 범위를 따로 검토해야 한다. Text2Cypher는 특히 조심해야 한다. 읽기 전용 권한,...
    🤖 ai
    ai
    2026.07.30
  • 에이전트를 위한 Neo4j 컨텍스트 제공자 설계
    컨텍스트 제공자는 검색기를 감싼 얇은 함수가 아니다. 이 글의 결론은, 사내 에이전트에 붙이는 Neo4j 컨텍스트 제공자는 읽기 전용 도구이며 ACL 선필터, 출처, 최신성, 토큰 예산, 시간 제한, 출력 계약을 함께 보장해야 한다는 것이다. 그래프 탐색은 유용하지만 위험도 크다. 관계 경로가 답처럼 보일수록, 그 경로를 누가 볼 수 있고 어떤 원문이 지지...
    🤖 ai
    ai
    2026.07.30
  • 벡터·전문·그래프 탐색을 결합한 하이브리드 검색
    벡터 검색만으로 놓치는 질문은 대부분 "가까운 문장"이 아니라 "연결된 사실"을 요구한다. 이 글의 결론은 단순하다. Neo4j GraphRAG의 하이브리드 검색은 벡터와 전문 검색으로 후보를 넓히고, VectorCypherRetriever나 HybridCypherRetriever로 관계를 확장한 뒤, 최종 컨텍스트는 반드시 원문 Document와 Chun...
    🤖 ai
    ai
    2026.07.30
  • 문서에서 근거를 보존한 지식 그래프 구축하기
    Neo4j GraphRAG Python의 KG Builder는 문서를 그래프로 만드는 출발점이지만, 아직 실험적 기능이다. 그래서 이 글의 목표는 패키지를 믿고 맡기는 것이 아니라, 어떤 단계에서 어떤 품질 게이트를 끼워 넣을지 읽는 것이다. > 이전 글: Cypher, 제약, 쿼리 계획으로 검색 안정화하기 Neo4j GraphRAG Python 문서는 n...
    🤖 ai
    ai
    2026.07.30

댓글 (0)