fos-blog/study
01 / 홈02 / 카테고리03 / 시리즈
01 / 홈02 / 카테고리03 / 시리즈

카테고리

  • AI 페이지로 이동
    • RAG 페이지로 이동
    • agent 페이지로 이동
    • langgraph 페이지로 이동
    • 사람용 CLI와 AI 에이전트용 CLI는 설계가 다르다
    • agents.md
    • Claude Code 메모리: CLAUDE.md와 .claude/rules를 규칙으로 쓰는 법
    • Claude Code의 Skill 시스템 - 개발자를 위한 AI 자동화의 새로운 차원
    • Claude Code를 5주 더 쓴 결과 — 스킬·CLAUDE.md를 키워가는 방식
    • Claude Code를 11일 동안 쓴 결과 — 데이터로 본 나의 사용 패턴
    • Claude Code 멀티 에이전트 — Teams
    • AI 에이전트와 디자인의 새 컨벤션 — DESIGN.md, Google Stitch, Claude Design
    • Docling — IBM Research 의 문서 파싱 toolkit 상세 정리
    • 하네스 엔지니어링 실전 — 4인 에이전트 팀으로 코딩 파이프라인 구축하기
    • 하네스 엔지니어링 — 오래 실행되는 AI 에이전트를 위한 설계
    • 멀티모달 LLM (Multimodal Large Language Model)
    • AI 에이전트와 함께 MVP 만들기 — dooray-cli 사례
    • 온톨로지에서 코딩 에이전트 컨텍스트까지 — 클래스·관계 설계와 그래프 평가
    • OpenClaw는 context와 memory를 어떻게 관리하나 — 나만의 에이전트를 구성하는 법
    • OpenClaw vs Hermes Agent — 갈아탈까 고민하며 정리한 비교
  • ai 페이지로 이동
    • agent 페이지로 이동
    • [초안] AI 제품 백엔드 안정성 — 지연·비용·권한·관측·도구 실패·폴백/재시도/사람 에스컬레이션
    • [초안] LLM 평가 프레임워크: 골든셋, 회귀 테스트, LLM-as-a-judge, 사람 피드백 루프
  • algorithm 페이지로 이동
    • live-coding 페이지로 이동
    • 분산 계산을 위한 알고리즘
  • architecture 페이지로 이동
    • 시니어 백엔드를 위한 API 설계 실전 스터디 팩
    • API 버저닝과 하위 호환성: 모바일·외부 컨슈머까지 안전하게 진화시키기
    • 캐시 설계 전략 총정리
    • [초안] 커머스 Spring 서비스에 Clean/Hexagonal Architecture를 실용적으로 적용하기
    • [초안] 커머스 도메인 모델링: 주문·재고·노출의 세 축을 분리해서 설계하기
    • 커머스 주문 상태와 데이터 정합성 기본기
    • [초안] 쿠폰/프로모션 동시성과 정합성 기본기 — 선착순·중복 사용 방지·발급/사용/복구
    • [초안] DDD와 도메인 모델링: 시니어 백엔드 관점의 전술/전략 패턴 실전 가이드
    • [초안] Decorator & Chain of Responsibility — 행동을 체인으로 조립하는 두 가지 방식
    • 디자인 패턴
    • [초안] 분산 아키텍처 완전 정복: Java 백엔드 시니어 인터뷰 대비 실전 가이드
    • [초안] 분산 트랜잭션과 Outbox 패턴 — 왜 2PC를 피하고 어떻게 대신할 것인가
    • 분산 트랜잭션
    • [초안] e-Commerce 주문·결제 도메인 모델링: 상태머신, 멱등성, Outbox/Saga 실전 정리
    • [초안] Event Sourcing과 CQRS — 상태가 아니라 변화를 저장한다는 발상
    • [학습중] 금융 거래 취소·정정·대사·일마감 운영
    • [학습중] 금융 거래 상태와 원장 설계
    • [초안] F&B 쿠폰·프로모션·멤버십·포인트 설계
    • [초안] F&B · e-Commerce 디지털 채널 도메인 한 장 정리
    • [초안] F&B 주문/매장/픽업 상태머신 설계
    • [초안] F&B 이커머스 결제·환불·정산 운영 가이드
    • [초안] Hexagonal / Clean Architecture를 Spring 백엔드에 적용하기
    • [초안] 대규모 커머스 트래픽 처리 패턴 — 대규모 회원과 메가 프로모션을 버티는 설계
    • [초안] 레거시 JSP/jQuery 화면과 신규 API가 공존하는 백엔드 운영 전략
    • [학습중] 모듈러 모놀리스에서 MSA로 점진 전환하는 실습
    • [초안] MSA 서비스 간 통신: Redis [Cache-Aside](../database/redis/cache-aside.md) × Kafka 이벤트 하이브리드 설계
    • [초안] Observability 입문: 시니어 백엔드가 장애를 탐지하고 대응하는 방식
    • [초안] Outbox / Inbox Pattern 심화 — 분산 메시징의 정합성 문제를 DB 트랜잭션으로 풀어내기
    • [초안] 결제 도메인 멱등성과 트랜잭션 재시도 기본기
    • [초안] 시니어 백엔드를 위한 Resilience 패턴 실전 가이드 — Timeout, Retry, Circuit Breaker, Bulkhead, Backpressure
    • [초안] Spring Batch vs Event-Driven — 같은 비동기처럼 보이지만 전혀 다른 두 패러다임
    • [초안] Strategy Pattern — 분기문을 없애는 설계, 시니어 백엔드 인터뷰 핵심 패턴
    • [초안] 시니어 백엔드를 위한 시스템 설계 입문 스터디 팩
    • [초안] 템플릿 메서드 패턴 - 백엔드 처리 골격을 강제하는 가장 오래되고 가장 위험한 패턴
    • [초안] 대규모 트래픽 중 무중단 마이그레이션 — Feature Flag + Shadow Mode 실전
  • database 페이지로 이동
    • milvus 페이지로 이동
    • mysql 페이지로 이동
    • opensearch 페이지로 이동
    • qdrant 페이지로 이동
    • redis 페이지로 이동
    • vespa 페이지로 이동
    • 김영한의-실전-데이터베이스-설계 페이지로 이동
    • [초안] DB Connection Pool Saturation과 Thread Pool 격리
    • 커넥션 풀 크기는 얼마나 조정해야 할까?
    • 인덱스 - DB 성능 최적화의 핵심
    • [초안] JPA N+1과 커머스 조회 모델: 주문/메뉴/쿠폰 도메인에서 살아남기
    • [초안] MyBatis 기본기 — XML Mapper, resultMap, 동적 SQL, 운영 패턴 정리
    • [초안] MyBatis와 JPA/Hibernate 트레이드오프 — 레거시 백엔드를 다루는 시니어 관점
    • 한국어 형태소 분석기 Nori vs Lindera — OpenSearch에서 Milvus로 갈 때 어휘 검색은 유지되나
    • 벡터 DB 5종, 아키텍처는 어떻게 다른가
    • 벡터 DB 5종을 실제로 벤치마크했다 — 같은 recall에서 QPS는 얼마나 갈리나
    • 벡터 DB 어떻게 고를까 — OpenSearch · Milvus · Qdrant · Vespa · pgvector 비교
    • 벡터 DB를 실제로 도입한 사례 — 빅테크 프로덕션
    • 역정규화 (Denormalization)
    • 데이터 베이스 정규화
  • devops 페이지로 이동
    • docker 페이지로 이동
    • k8s 페이지로 이동
    • k8s-in-action 페이지로 이동
    • observability 페이지로 이동
    • [초안] 커머스/F&B 채널 장애 첫 5분과 관측성 기본기
    • [초안] 운영 데이터 정합성 장애 대응 — 결제 취소 누락과 중복 적재 런북
    • Envoy Proxy
    • [초안] F&B / e-Commerce 운영 장애 대응과 모니터링 — 백엔드 관점 정리
    • Graceful Shutdown
    • [초안] 시니어 백엔드를 위한 SLO와 Error Budget 기반 장애 대응
  • http 페이지로 이동
    • HTTP Connection Pool
    • HTTPS는 어떻게 안전한가 — TLS, 인증서, 그리고 termination
  • interview 페이지로 이동
    • [초안] AI 서비스 팀 경험 기반 시니어 백엔드 면접 질문 뱅크 — Spring Batch RAG / gRPC graceful shutdown / 캐시 정합성 / 12일 AI 웹툰 MVP
    • Observability — 면접 답변 프레임
    • [초안] 시니어 Java 백엔드 면접 마스터 플레이북 — 김병태
    • [초안] NSC 슬롯팀 경험 기반 질문 은행 — 도메인 모델링·동시성·성능·AI 협업
  • java 페이지로 이동
    • concurrency 페이지로 이동
    • jdbc 페이지로 이동
    • opentelemetry 페이지로 이동
    • spring 페이지로 이동
    • spring-batch 페이지로 이동
    • testing 페이지로 이동
    • 더_자바_코드를_조작하는_다양한_방법 페이지로 이동
    • [초안] Java 동시성 락 정리 — 커머스 메뉴/프로모션 정책 캐시 갱신 관점
    • [초안] JVM 튜닝 실전: 메모리 구조부터 Virtual Threads, GC 튜닝, 프로파일링까지
    • Java의 로깅 환경
    • MDC (Mapped Diagnostic Context)
    • Java StampedLock — 읽기 폭주에도 쓰기가 밀리지 않는 락
    • Virtual Thread와 Project Loom
  • javascript 페이지로 이동
    • typescript 페이지로 이동
    • AbortController
    • Async Iterator와 제너레이터
    • CommonJS와 ECMAScript Modules
    • 제너레이터(Generator)
    • Http Client
    • Node 백엔드 운영 패턴 — Streams 백프레셔, pipe/pipeline, 멱등성 vs 분산 락
    • Node.js
    • npm vs pnpm — 어떤 기준으로 선택했나
    • `setImmediate()`
  • kafka 페이지로 이동
    • [초안] Kafka 기본 개념 — 토픽, 파티션, 오프셋, 복제
    • Kafka를 사용하여 **데이터 정합성**은 어떻게 유지해야 할까?
    • [초안] Kafka 실전 설계: 파티션 전략, 컨슈머 그룹, 전달 보장, 재시도, 순서 보장 트레이드오프
    • [학습중] Kafka 파티션·리밸런스·컨슈머 지연 운영
    • 메시지 전송 신뢰성
    • [초안] Spring Kafka 컨슈머 오프셋 커밋과 트랜잭션 정렬: AckMode, manual ack, 멱등 처리
  • linux 페이지로 이동
    • fsync — 리눅스 파일 동기화 시스템 콜
    • tmux — Terminal Multiplexer
  • mlops 페이지로 이동
    • llm-serving 페이지로 이동
    • serving-frameworks 페이지로 이동
    • Python CUDA 버전 생태계 — nvidia-smi, nvcc, pip, conda가 다 다른 버전을 말하는 이유
    • GPU 컨테이너의 CUDA 버전 호환성 — nvidia-smi부터 이미지 다이어트까지
    • Kubernetes GPU 노드에서 /run tmpfs가 꽉 차서 Pod가 안 뜰 때
    • GPU·CUDA·MPS 기초 — 자바 백엔드 개발자가 처음 만나는 그림
    • Multi-process GPU 워크로드 — 자바 ThreadPool 사용자가 만나는 모델 차이
    • ML 서비스 성능 분석 워크플로 — 자바 백엔드 트러블슈팅과 다른 점
    • 한 GPU 를 여러 프로세스가 나눠 쓰기 — Time-Slicing 과 MPS
  • network 페이지로 이동
    • Connection reset by peer는 누가 보낸 걸까 — 리버스 프록시 홉마다 TCP 연결은 따로 논다
    • L2(스위치)와 L3(라우터)의 역할 차이
    • L4와 VIP(Virtual IP Address)
    • IP Subnet
  • python 페이지로 이동
    • Python async/await — CompletableFuture·Reactor 와 다른 점, 그리고 blocking I/O 함정
    • Python 의존성 관리 — Java Maven/Gradle 사용자가 만나는 첫 충격
    • FastAPI 기초 — Spring Boot 사용자가 빠르게 익히는 법
    • Java 개발자를 위한 Python 심화 — OOP·데코레이터·컨텍스트 매니저
    • PyTorch 기초 — 텐서, 디바이스, 그리고 모델 로딩이 무거운 이유
    • Java 개발자를 위한 Python 문법 핵심
    • ThreadLocal 에서 contextvars 로 — Python 의 요청 컨텍스트 전파
    • OCR 동작 원리 — Layout · Text · Post-process 3단계
    • Python 서버의 RSS 가 안 줄어드는 이유 — gc.collect 의 한계와 malloc_trim
  • rabbitmq 페이지로 이동
    • [초안] RabbitMQ Basics — 실전 백엔드 관점에서 정리하는 메시지 브로커 기본기
    • [초안] RabbitMQ vs Kafka — 백엔드 메시징 선택 기준과 실전 운영 관점
  • resume 페이지로 이동
    • [초안] 김병태 경력기술서
    • [초안] 김병태 포트폴리오
  • security 페이지로 이동
    • [초안] 시니어 백엔드를 위한 보안 / 인증 스터디 팩 — Spring Security, JWT, OAuth2, OWASP Top 10
    • [초안] Spring Security 6.x OAuth2 + JWT 상용 인증 설계 — Grant 선택, Resource Server, Refresh Rotation, 로그아웃
  • task 페이지로 이동
    • ai-service-team 페이지로 이동
    • nsc-slot 페이지로 이동
    • sb-dev-team 페이지로 이동
    • the-future-company 페이지로 이동
  • testing 페이지로 이동
    • [초안] 시니어 Java 백엔드를 위한 테스트 전략 완전 정리 — 피라미드부터 TestContainers, 마이크로벤치, Contract까지
  • thinking 페이지로 이동
    • 좋은 일을 넘어 중요한 일을 하는 법
FOS-BLOG · FOOTERall systems normal·v0.1 · 2026.04.27·seoul, kr
Ffos-blog/study

개발 학습 기록을 정리하는 블로그입니다. 공부하면서 기록하고, 기록하면서 다시 배웁니다.

visitors
01site
  • Home↗
  • Posts↗
  • Categories↗
  • Glossary↗
  • About↗
02policy
  • 소개/about
  • 개인정보처리방침/privacy
  • 연락처/contact
03categories
  • AI↗
  • Algorithm↗
  • DB↗
  • DevOps↗
  • Java/Spring↗
  • JS/TS↗
  • React↗
  • Next.js↗
  • System↗
04connect
  • GitHub@jon890↗
  • Source repositoryjon890/fos-study↗
  • RSS feed/rss.xml↗
  • Newsletter매주 1 회 · 한 편의 글→
© 2026 FOS Study. All posts MIT-licensed.
built with·Next.js·Tailwind v4·Geist·Pretendard·oklch
fos-blog/AI/문서에서 근거를 보존한 지식 그래프 구축하기
aidb

문서에서 근거를 보존한 지식 그래프 구축하기

Neo4j GraphRAG Python의 KG Builder는 문서를 그래프로 만드는 출발점이지만, 아직 실험적 기능이다. 그래서 이 글의 목표는 패키지를 믿고 맡기는 것이 아니라, 어떤 단계에서 어떤 품질 게이트를 끼워 넣을지 읽는 것이다. > 이전 글: Cypher, 제약, 쿼리 계획으로 검색 안정화하기 Neo4j GraphRAG Python 문서는 n...

2026.07.30·7 min read·0 views

Neo4j GraphRAG Python의 KG Builder는 문서를 그래프로 만드는 출발점이지만, 아직 실험적 기능이다. 그래서 이 글의 목표는 패키지를 믿고 맡기는 것이 아니라, 어떤 단계에서 어떤 품질 게이트를 끼워 넣을지 읽는 것이다.

이전 글: Cypher, 제약, 쿼리 계획으로 검색 안정화하기

Neo4j GraphRAG Python 문서는 neo4j-graphrag 패키지를 공식 패키지로 설명하고, 예전 neo4j-genai는 deprecated라고 안내한다. Neo4j 지원 버전은 Neo4j 5.18.1 이상과 Neo4j 2026.01 이상을 포함한다. 이 글은 현재 문서 기준으로 쓰지만, KG Builder API는 바뀔 수 있다는 전제를 둔다.

이 글은 세 질문에 답한다.

  • KG Builder 파이프라인은 문서를 어떤 단계로 그래프에 넣는가.
  • Document, Chunk, Claim, Evidence 출처 모델을 어느 단계에서 보강해야 하는가.
  • 실험적 기능을 학습 프로젝트에서 어디까지 믿어도 되는가.

가져갈 판단 기준은 세 가지다.

  • SimpleKGPipeline은 빠른 시작용이고, 운영 계약은 컴포넌트 경계에서 검증한다.
  • schema guidance는 LLM 출력을 돕지만 데이터베이스 제약을 대체하지 않는다.
  • KG Builder가 만든 그래프도 최종 컨텍스트 전에 권한과 출처 게이트를 통과해야 한다.

파이프라인을 단계로 읽는다

공식 KG Builder 문서는 비정형 데이터에서 Knowledge Graph를 만들기 위해 여러 컴포넌트를 둔다. 문서 로더, 텍스트 분할기, 청크 임베더, 스키마 빌더가 앞단을 담당한다. 어휘 그래프 빌더, 엔티티·관계 추출기, 그래프 정리기, 저장기, 엔티티 식별기가 뒤를 잇는다.

이 구성은 컨텍스트 제공자 관점에서 다음처럼 읽힌다.

여기서 내가 가장 먼저 확인할 단계는 Document와 Chunk 그래프다. 공식 문서는 어휘 그래프가 Document 노드, Chunk 노드, NEXT_CHUNK, FROM_DOCUMENT 관계를 만든다고 설명한다. 이 구조는 RAG에서 앞뒤 청크를 붙이는 데도 쓸 수 있다.

다만 이 시리즈의 모델은 Evidence -> Chunk -> Document 경로가 필요하다. 따라서 KG Builder의 기본 관계와 속성을 그대로 쓰지 않고 공통 계약에 맞춘다.

SimpleKGPipeline은 빠른 시작점이다

공식 문서는 SimpleKGPipeline으로 시작하는 예시를 제공한다. 아래 코드는 공식 예시의 형태를 이 시리즈 맥락에 맞게 줄인 일반화 예시다. 아직 실행하지 않았으므로 실측 결과로 읽으면 안 된다.

python
from neo4j_graphrag.experimental.components.types import LexicalGraphConfig
from neo4j_graphrag.experimental.pipeline.kg_builder import SimpleKGPipeline
 
schema = {
    "node_types": [
        {
            "label": "Service",
            "properties": [
                {"name": "service_id", "type": "STRING"},
                {"name": "name", "type": "STRING"},
            ],
        },
        {
            "label": "API",
            "properties": [
                {"name": "api_id", "type": "STRING"},
                {"name": "path", "type": "STRING"},
            ],
        },
        {
            "label": "Repository",
            "properties": [
                {"name": "repository_id", "type": "STRING"},
                {"name": "name", "type": "STRING"},
            ],
        },
        {
            "label": "ADR",
            "properties": [
                {"name": "adr_id", "type": "STRING"},
                {"name": "title", "type": "STRING"},
            ],
        },
        {"label": "Incident", "properties": [{"name": "incident_id", "type": "STRING"}]},
        {
            "label": "Claim",
            "properties": [
                {"name": "claim_id", "type": "STRING"},
                {"name": "text", "type": "STRING"},
            ],
        },
    ],
    "relationship_types": [
        "EXPOSES",
        "IMPLEMENTED_BY",
        "DECIDES_FOR",
        "AFFECTED_BY",
        "ABOUT",
    ],
    "patterns": [
        ("Service", "EXPOSES", "API"),
        ("Service", "IMPLEMENTED_BY", "Repository"),
        ("ADR", "DECIDES_FOR", "Service"),
        ("Service", "AFFECTED_BY", "Incident"),
        ("Claim", "ABOUT", "ADR"),
    ],
    "additional_node_types": False,
}
 
lexical_graph_config = LexicalGraphConfig(
    chunk_to_document_relationship_type="PART_OF",
    node_to_chunk_relationship_type="MENTIONED_IN",
    chunk_id_property="chunk_id",
    chunk_index_property="chunk_index",
    chunk_text_property="text",
    chunk_embedding_property="embedding",
)
 
kg_builder = SimpleKGPipeline(
    llm=llm,
    driver=neo4j_driver,
    embedder=embedder,
    from_file=False,
    schema=schema,
    lexical_graph_config=lexical_graph_config,
)
 
await kg_builder.run_async(
    text=document_text,
    document_metadata={
        "document_id": "doc:adr-42",
        "source_uri": "internal://docs/adr-42",
        "allowed_groups": ["platform-oncall"],
    },
)

공식 문서에 따르면 document_metadata는 Document 노드 속성으로 저장될 수 있다. 이 프로젝트에서는 여기에 source_uri, source_hash, allowed_groups, updated_at 같은 출처와 권한 속성을 넣는 것이 중요하다.

이 설정은 추출된 개체와 Claim에 MENTIONED_IN 관계를 붙인다. 아직 Evidence 노드를 자동으로 만들지는 않는다. 커스텀 추출·검증 단계가 원문 인용 구간이나 문자 위치를 확보했을 때만 Claim-[:SUPPORTED_BY]->Evidence-[:LOCATED_IN]->Chunk를 만들고, 원문 구간과 일치하지 않는 Claim은 컨텍스트 후보에서 제외한다. 정확한 구간을 확보하지 못한 MENTIONED_IN 관계는 탐색 보조 정보일 뿐, 답변의 직접 근거로 승격하지 않는다.

schema guidance는 제약이 아니다

KG Builder 문서는 schema를 제공해 LLM이 추출할 노드와 관계 타입을 안내할 수 있다고 설명한다. 또한 schema가 모델 출력을 엄격하게 강제하는 것은 아니며, 정의하지 않은 라벨이나 관계가 나올 수 있다고 경고한다.

이 차이가 중요하다.

장치막는 것못 막는 것
schema guidanceLLM이 봐야 할 타입을 좁힌다데이터베이스에 잘못된 노드가 저장되는 것
graph prunerschema 위반 일부를 제거한다근거 없는 관계를 모두 증명하는 것
Neo4j 제약중복, 결측, 타입 일부를 막는다문장이 사실인지 판단하는 것
평가 질문최종 컨텍스트 품질을 측정한다모든 운영 입력을 자동 보장하는 것

따라서 schema를 넣었다고 끝내면 안 된다. Claim과 Evidence는 별도 검증 경로가 필요하다. LLM이 Claim을 만들었다면, 그 주장이 어느 Chunk의 어느 구간에서 나왔는지 남겨야 한다.

이것이 없으면 KG Builder는 "그럴듯한 그래프"를 만들 수는 있어도 "근거 있는 컨텍스트"를 만들지는 못한다.

entity resolver는 편하지만 위험하다

공식 문서는 기본적으로 각 실행 뒤 entity resolution이 수행되어 같은 라벨과 name 속성을 공유하는 노드를 병합한다고 설명한다. 필요하면 perform_entity_resolution=False로 끌 수 있다.

이 기능은 중복 Service 노드를 줄이는 데 유용하다. 하지만 사내 기술 문서에서는 같은 이름이 항상 같은 실체를 뜻하지 않는다.

예를 들어 gateway라는 이름은 다음을 모두 뜻할 수 있다.

  • 실제 API Gateway 서비스
  • 저장소 안의 모듈 이름
  • 네트워크 경계 역할
  • 과거 문서의 옛 서비스명

라벨과 name만으로 병합하면 잘못된 경로가 생긴다. 초기 실습에서는 자동 병합을 켠 결과와 끈 결과를 둘 다 저장해 비교하는 편이 좋다.

정량적으로는 병합 전후를 이렇게 본다.

  • 고유 Service 노드 수
  • 사람이 맞다고 본 병합 수
  • 사람이 틀렸다고 본 병합 수
  • 관계형 질문의 필수 근거 재현율 변화

노드 수가 줄어도 필수 근거 재현율이 떨어지거나 잘못된 경로가 늘면 실패다.

실험적 기능을 다루는 경계

KG Builder 문서 첫 부분에는 이 기능이 아직 experimental이며 API 변경과 버그 수정이 예상된다는 경고가 있다. 따라서 학습 글에서도 다음을 명확히 해야 한다.

  • 패키지 내부 API 이름을 장기 계약처럼 쓰지 않는다.
  • 실습 코드는 공식 문서 예시의 현재 형태로만 다룬다.
  • 운영 설계는 Document, Chunk, 권한, 출처, 평가 데이터셋 같은 자체 계약을 중심에 둔다.
  • 패키지 교체가 가능하도록 파이프라인 입출력 스키마를 따로 적는다.

이 경계가 있으면 KG Builder가 바뀌어도 학습 프로젝트의 중심은 남는다. 도구는 그래프 생성기를 바꿀 수 있지만, 컨텍스트 제공자 계약은 바뀌면 안 된다.

실패 모드

실패 모드증상방지선
자동 schema 과신라벨이 늘고 관계 의미가 흐려진다수동 schema와 additional_node_types 정책을 둔다
청크 출처 누락답변은 나오지만 인용할 원문이 없다document_metadata와 lexical graph를 필수로 본다
병합 오탐다른 서비스가 하나로 합쳐진다병합 전후 평가 질문을 비교한다
실험 API 고착패키지 변경 때 전체 코드가 깨진다파이프라인 입출력 계약을 별도 wrapper로 둔다

실패를 줄이려면 한 번에 모든 문서를 넣지 않는다. 문서 10개에서 시작해 사람이 그래프를 읽을 수 있는 크기로 반복한다.

언제 쓰지 말아야 하는가

KG Builder가 항상 좋은 시작점은 아니다.

  • 문서가 이미 구조화되어 있어 직접 Cypher 적재가 더 정확한 경우
  • 서비스 카탈로그와 저장소 메타데이터가 이미 별도 시스템에 있는 경우
  • LLM 추출 결과를 검토할 사람이 없는 경우
  • 권한 메타데이터를 Document에 붙일 수 없는 경우
  • 패키지의 experimental API 변경을 감당하기 어려운 운영 코드인 경우

이때는 KG Builder를 운영 파이프라인으로 넣기보다, 작은 샘플의 모델 검증 도구로만 쓰는 편이 낫다.

작은 실습

실습 목표는 KG Builder로 문서에서 그래프를 만들고, 컨텍스트 제공자 계약에 부족한 속성을 찾는 것이다. 아래 단계는 공식 문서 기반의 재현 계획이며, 이 글에서 실제 실행하지는 않았다.

재현 단계다.

  • Neo4j 테스트 데이터베이스를 준비한다.
  • 공개 가능한 문서 10개를 텍스트로 준비한다.
  • Service, API, Repository, ADR, Incident, Claim 중심의 schema를 작성한다.
  • document_metadata에 document_id, source_uri, source_hash, allowed_groups를 넣는다.
  • SimpleKGPipeline을 perform_entity_resolution=True로 한 번 실행한다.
  • 같은 입력을 perform_entity_resolution=False로 한 번 더 실행한다.
  • 두 그래프에서 관계형 질문 10개를 실행해 필수 근거 재현율과 병합 오탐을 비교한다.

확인할 결과다.

  • 모든 Chunk는 Document로 돌아가는 관계를 가져야 한다.
  • 최종 근거 후보는 Document.allowed_groups를 통과해야 한다.
  • Claim이 있다면 어떤 Chunk에서 나온 주장인지 추적할 수 있어야 한다.
  • 병합 전후에 필수 근거 재현율이 나빠지지 않아야 한다.

실패 판정이다.

  • Document 메타데이터가 저장되지 않으면 출처와 권한 계약이 깨진다.
  • schema에 없는 라벨이 대량 생성되면 추출 경계가 느슨하다.
  • entity resolver가 다른 서비스를 병합하면 자동 병합을 끄고 별도 해소 규칙을 만들어야 한다.
  • 질문 10개 중 관계형 질문의 필수 근거 재현율이 벡터 기준선보다 낮으면 GraphRAG 도입 근거가 부족하다.

다음 글

다음 글에서는 KG Builder로 만든 그래프를 그대로 믿지 않고, 검색기와 컨텍스트 제공자의 경계에서 권한과 출처를 보존하는 흐름을 설계한다.

  • 벡터·전문·그래프 탐색을 결합한 하이브리드 검색

참고 링크

  • Neo4j GraphRAG for Python: https://neo4j.com/docs/neo4j-graphrag-python/current/index.html
  • Neo4j GraphRAG Knowledge Graph Builder: https://neo4j.com/docs/neo4j-graphrag-python/current/user_guide_kg_builder.html
  • Neo4j GraphRAG Pipeline: https://neo4j.com/docs/neo4j-graphrag-python/current/user_guide_pipeline.html
  • Neo4j GraphRAG RAG guide: https://neo4j.com/docs/neo4j-graphrag-python/current/user_guide_rag.html
  • Neo4j Cypher constraints: https://neo4j.com/docs/cypher-manual/current/schema/constraints/
  • Neo4j Cypher 25 SEARCH: https://neo4j.com/docs/cypher-manual/25/clauses/search/
on this page
  • 01파이프라인을 단계로 읽는다
  • 02`SimpleKGPipeline`은 빠른 시작점이다
  • 03schema guidance는 제약이 아니다
  • 04entity resolver는 편하지만 위험하다
  • 05실험적 기능을 다루는 경계
  • 06실패 모드
  • 07언제 쓰지 말아야 하는가
  • 08작은 실습
  • 09다음 글
  • 10참고 링크
tags
#심화

이런 글도

  • 권한·최신성·성능을 포함한 Neo4j 운영 설계
    운영 설계의 결론은 학습 환경과 제품 환경을 분리하는 것이다. Neo4j Community Edition은 로컬 학습과 단일 인스턴스 실습에 충분할 수 있지만, 사내 컨텍스트 제공자가 권한, 가용성, 백업, 운영 보안을 요구하면 Enterprise 또는 Aura 기능 범위를 따로 검토해야 한다. Text2Cypher는 특히 조심해야 한다. 읽기 전용 권한,...
    🤖 ai
    ai
    2026.07.30
  • GraphRAG 평가와 벡터 RAG 제거 실험
    GraphRAG 평가는 "답이 맞았다" 하나로 끝나면 안 된다. 이 글의 결론은, 그래프 구축 품질, 후보와 근거 회수, 최종 컨텍스트 정밀도와 재현율, 출처·최신성·권한·지연·비용을 단계별로 나누고, 반드시 벡터 전용 기준선과 제거 실험으로 비교해야 한다는 것이다. 그래프를 만들었다는 사실은 성공 기준이 아니다. 벡터 RAG가 놓친 관계형 질문에서, 권한...
    🤖 ai
    ai
    2026.07.30
  • 에이전트를 위한 Neo4j 컨텍스트 제공자 설계
    컨텍스트 제공자는 검색기를 감싼 얇은 함수가 아니다. 이 글의 결론은, 사내 에이전트에 붙이는 Neo4j 컨텍스트 제공자는 읽기 전용 도구이며 ACL 선필터, 출처, 최신성, 토큰 예산, 시간 제한, 출력 계약을 함께 보장해야 한다는 것이다. 그래프 탐색은 유용하지만 위험도 크다. 관계 경로가 답처럼 보일수록, 그 경로를 누가 볼 수 있고 어떤 원문이 지지...
    🤖 ai
    ai
    2026.07.30
  • 벡터·전문·그래프 탐색을 결합한 하이브리드 검색
    벡터 검색만으로 놓치는 질문은 대부분 "가까운 문장"이 아니라 "연결된 사실"을 요구한다. 이 글의 결론은 단순하다. Neo4j GraphRAG의 하이브리드 검색은 벡터와 전문 검색으로 후보를 넓히고, VectorCypherRetriever나 HybridCypherRetriever로 관계를 확장한 뒤, 최종 컨텍스트는 반드시 원문 Document와 Chun...
    🤖 ai
    ai
    2026.07.30

댓글 (0)