fos-blog/study
01 / 홈02 / 카테고리03 / 시리즈
01 / 홈02 / 카테고리03 / 시리즈

카테고리

  • AI 페이지로 이동
    • RAG 페이지로 이동
    • agent 페이지로 이동
    • claude-code 페이지로 이동
    • harness 페이지로 이동
    • llm 페이지로 이동
    • ops 페이지로 이동
    • practice 페이지로 이동
  • algorithm 페이지로 이동
    • Alias Method: 가중치 랜덤 선택을 전처리 O(n), 추출 O(1)로 바꾸기
    • Welford's Online Algorithm: 값을 저장하지 않고 평균과 분산 계산하기
  • architecture 페이지로 이동
    • distributed-systems 페이지로 이동
    • domain 페이지로 이동
    • evolution 페이지로 이동
    • patterns 페이지로 이동
  • database 페이지로 이동
    • milvus 페이지로 이동
    • mysql 페이지로 이동
    • opensearch 페이지로 이동
    • qdrant 페이지로 이동
    • redis 페이지로 이동
    • vespa 페이지로 이동
    • DB Connection Pool Saturation과 Thread Pool 격리
    • 커넥션 풀 크기는 얼마나 조정해야 할까?
    • MyBatis 기본기 — XML Mapper, resultMap, 동적 SQL, 운영 패턴 정리
    • MyBatis와 JPA/Hibernate 트레이드오프 — 레거시 백엔드를 다루는 시니어 관점
    • 한국어 형태소 분석기 Nori vs Lindera — OpenSearch에서 Milvus로 갈 때 어휘 검색은 유지되나
    • 정규화와 역정규화: 무결성과 조회 비용 사이의 선택
    • 벡터 DB 5종, 아키텍처는 어떻게 다른가
    • 벡터 DB 5종을 실제로 벤치마크했다 — 같은 recall에서 QPS는 얼마나 갈리나
    • 벡터 DB 어떻게 고를까 — OpenSearch · Milvus · Qdrant · Vespa · pgvector 비교
    • 벡터 DB를 실제로 도입한 사례 — 빅테크 프로덕션
  • devops 페이지로 이동
    • docker 페이지로 이동
    • k8s 페이지로 이동
    • Envoy Proxy
    • Graceful Shutdown
    • 종료 신호는 어디서 멈추는가
  • http 페이지로 이동
    • HTTP Connection Pool
    • HTTPS와 TLS: 핸드셰이크, 인증서, 종료 지점
  • java 페이지로 이동
    • concurrency 페이지로 이동
    • jdbc 페이지로 이동
    • spring 페이지로 이동
    • spring-batch 페이지로 이동
    • testing 페이지로 이동
    • Java 동시성 락 정리 — 커머스 메뉴/프로모션 정책 캐시 갱신 관점
    • JVM 튜닝 실전: 메모리 구조부터 Virtual Threads, GC 튜닝, 프로파일링까지
    • 로그에 traceId 남기기 — MDC 부터 OpenTelemetry 까지
    • Java StampedLock — 읽기 폭주에도 쓰기가 밀리지 않는 락
    • Virtual Thread와 Project Loom
  • javascript 페이지로 이동
    • typescript 페이지로 이동
    • AbortController
    • Async Iterator와 제너레이터
    • CommonJS와 ECMAScript Modules
    • 제너레이터(Generator)
    • Http Client
    • Node 백엔드 운영 패턴 — Streams 백프레셔, pipe/pipeline, 멱등성 vs 분산 락
    • Node.js
    • `setImmediate()`
  • kafka 페이지로 이동
    • Kafka 클러스터 아키텍처: Broker, KRaft Controller와 복제
    • Kafka 기본 개념: Topic, Partition, Offset과 Segment
    • Kafka 실전 설계: 파티션 전략, 컨슈머 그룹, 전달 보장, 재시도, 순서 보장 트레이드오프
    • Kafka 파티션·리밸런스·컨슈머 지연 운영
    • Kafka를 로그로 이해하기: 복제, 재처리, 상태와 데이터 통합
    • Spring Kafka 컨슈머 오프셋 커밋과 트랜잭션 정렬: AckMode, manual ack, 멱등 처리
  • linux 페이지로 이동
    • fsync — 리눅스 파일 동기화 시스템 콜
    • SSH forced command 로 배포 키가 실행할 수 있는 명령 제한하기
  • mlops 페이지로 이동
    • llm-serving 페이지로 이동
    • model-router 페이지로 이동
    • Python CUDA 버전 생태계 — nvidia-smi, nvcc, pip, conda가 다 다른 버전을 말하는 이유
    • GPU 컨테이너의 CUDA 버전 호환성 — nvidia-smi부터 이미지 다이어트까지
    • Kubernetes GPU 노드에서 /run tmpfs가 꽉 차서 Pod가 안 뜰 때
    • GPU·CUDA·MPS 기초 — 자바 백엔드 개발자가 처음 만나는 그림
    • Multi-process GPU 워크로드 — 자바 ThreadPool 사용자가 만나는 모델 차이
    • ML 서비스 성능 분석 워크플로 — 자바 백엔드 트러블슈팅과 다른 점
    • 한 GPU 를 여러 프로세스가 나눠 쓰기 — Time-Slicing 과 MPS
  • network 페이지로 이동
    • Connection reset by peer는 누가 보낸 걸까 — 리버스 프록시 홉마다 TCP 연결은 따로 논다
    • L2(스위치)와 L3(라우터)의 역할 차이
    • L4와 VIP(Virtual IP Address)
    • IP Subnet
  • observability 페이지로 이동
    • Observability 입문: 시니어 백엔드가 장애를 탐지하고 대응하는 방식
    • K8s 위 Spring Boot 앱의 메트릭 수집
  • python 페이지로 이동
    • Python async/await — CompletableFuture·Reactor 와 다른 점, 그리고 blocking I/O 함정
    • Python 의존성 관리 — Java Maven/Gradle 사용자가 만나는 첫 충격
    • FastAPI 기초 — Spring Boot 사용자가 빠르게 익히는 법
    • Java 개발자를 위한 Python 심화 — OOP·데코레이터·컨텍스트 매니저
    • PyTorch 기초 — 텐서, 디바이스, 그리고 모델 로딩이 무거운 이유
    • Java 개발자를 위한 Python 문법 핵심
    • ThreadLocal 에서 contextvars 로 — Python 의 요청 컨텍스트 전파
    • OCR 동작 원리 — Layout · Text · Post-process 3단계
    • Python 서버의 RSS가 줄지 않는 이유: CPython, gc.collect(), malloc_trim
  • rabbitmq 페이지로 이동
    • RabbitMQ Basics — 실전 백엔드 관점에서 정리하는 메시지 브로커 기본기
    • RabbitMQ vs Kafka — 백엔드 메시징 선택 기준과 실전 운영 관점
  • resume 페이지로 이동
    • 경험 및 경력기술서
    • 김병태 경력기술서
    • 김병태 포트폴리오
  • task 페이지로 이동
    • ai-service-team 페이지로 이동
    • nsc-slot 페이지로 이동
    • sb-dev-team 페이지로 이동
    • the-future-company 페이지로 이동
  • thinking 페이지로 이동
    • 자기주도 학습: 질문에서 시작해 글로 검증하기
    • 좋은 일을 넘어 중요한 일을 하는 법
FOS-BLOG · FOOTERall systems normal·v0.1 · 2026.04.27·seoul, kr
Ffos-blog/study

개발 학습 기록을 정리하는 블로그입니다. 공부하면서 기록하고, 기록하면서 다시 배웁니다.

visitors
01site
  • Home↗
  • Posts↗
  • Categories↗
  • Glossary↗
  • About↗
02policy
  • 소개/about
  • 개인정보처리방침/privacy
  • 연락처/contact
03categories
  • AI↗
  • Algorithm↗
  • DB↗
  • DevOps↗
  • Java/Spring↗
  • JS/TS↗
  • React↗
  • Next.js↗
  • System↗
04connect
  • GitHub@jon890↗
  • Source repositoryjon890/fos-study↗
  • RSS feed/rss.xml↗
  • Newsletter매주 1 회 · 한 편의 글→
© 2026 FOS Study. All posts MIT-licensed.
built with·Next.js·Tailwind v4·Geist·Pretendard·oklch
fos-blog/AI/RAG 검색을 제품별로 만들지 않고 공통 파…
ai

RAG 검색을 제품별로 만들지 않고 공통 파이프라인으로 둔다

LLM을 쓰는 서비스가 늘면 서비스마다 데이터를 가져오는 방식이 제각각이 된다. 이 글은 RAG를 "문서를 LLM에 붙이는 기술"이 아니라 "검색을 제품화하는 문제"로 보면 무엇이 달라지는지 정리한다. 토스증권 ML 엔지니어가 쓴 토스증권 추천과 검색은 어떻게 진화하고 있을까?(황호익, 토스 기술 블로그, 2026-08-26)의 RAG 부분을 바탕으로 한다...

2026.10.02·4 min read·5 views

LLM을 쓰는 서비스가 늘면 서비스마다 데이터를 가져오는 방식이 제각각이 된다. 이 글은 RAG를 "문서를 LLM에 붙이는 기술"이 아니라 "검색을 제품화하는 문제"로 보면 무엇이 달라지는지 정리한다.

토스증권 ML 엔지니어가 쓴 토스증권 추천과 검색은 어떻게 진화하고 있을까?(황호익, 토스 기술 블로그, 2026-08-26)의 RAG 부분을 바탕으로 한다. 영상판은 테크톡톡 2026 | ML Engineer - 토스증권 추천과 검색은 어떻게 진화하고 있을까?다. 로컬 환경의 RAG 구성 논의를 모은 Hacker News 스레드 Ask HN: 로컬에서 RAG를 어떻게 구현하고 있나요?(GeekNews 소개, 원문 HN 스레드)의 의견도 일부 참고했다.

데이터를 가져오는 방식이 파편화되는 문제

원문이 든 상황은 이렇다. 어떤 서비스는 검색 엔진에 쿼리를 직접 작성하고, 어떤 서비스는 필터를 따로 고안해 조합한다. 새 서비스를 시작할 때마다 원하는 데이터를 잘 찾는 쿼리를 처음부터 다시 찾아야 한다.

이렇게 두면 품질 기준과 운영 방식이 서비스마다 갈라진다. LLM은 사실과 다른 내용을 생성할 수 있어서, 답변이 검색된 문서에 근거하는지 확인하는 일도 서비스마다 반복된다.

공통 파이프라인

제품은 자연어 질문과 필요한 범위만 넘기고, 검색 플랫폼이 후보 생성과 재정렬을 맡는 구조다.

단계하는 일
질문 구조화질문이 원하는 범주를 분류하고, 날짜 조건과 검색 범위를 만들고, 질문 벡터를 생성해 검색 쿼리를 구성한다
하이브리드 검색텍스트 검색과 벡터 검색을 함께 쓰고 메타데이터 필터를 적용해 후보를 찾는다
리랭킹후보를 한 번 더 걸러 관련 없는 항목을 줄이고 중요한 순서로 정렬한다

하이브리드 검색과 리랭킹의 구현은 OpenSearch로 RAG 검색 품질 높이기가 자세히 다룬다. 점수 단위가 다른 두 검색 결과를 순위로 합치는 RRF는 Milvus 벡터 데이터베이스 입문에 정리돼 있다.

원문에서 이 단계의 모델은 대부분 LLM 호출로 시작했다. 이후 우선순위가 높은 모델부터 하나씩 직접 운영하는 모델로 바꿨다. 처음부터 모든 단계를 자체 모델로 만들지 않아도 된다는 뜻이다.

제품은 달라도 흐름은 하나다

원문의 뉴스 RAG에는 시황을 설명하는 뉴스, 기업의 가격 변동을 설명하는 뉴스, 투자 판단과 관련된 뉴스처럼 서로 다른 제품 요구가 들어왔다. 플랫폼 관점으로 열어 두면 모두 자연어 검색 API로 들어오고, 내부에서 메타데이터 태그로 범위를 제어한 뒤 같은 하이브리드 검색과 리랭킹 흐름을 탄다.

각 단계가 막아 주는 약점

원문은 검색 품질에 하나의 해법이 없었다고 말한다. 서로의 약점을 보완하는 모듈을 점진적으로 붙여 갔다.

약점보완
벡터 검색은 키워드 중심 질의에 약하다. 도메인 특화 임베딩도 모든 용어를 고르게 학습하기 어렵다텍스트 검색을 함께 쓴다
텍스트 검색은 형태소 분석기가 모르는 새 키워드에 약하다사전을 갱신하는 운영을 둔다
의도가 분명한 질문에 불필요한 결과가 한두 건 섞이면 사용자가 시스템 전체를 의심한다리랭커로 마지막 노이즈를 줄인다
질문과 문서가 같은 범주인지 알기 어렵다분류 모델로 범주 태그를 달고, 태그가 맞으면 점수를 높인다

범주 분류 체계는 검색에만 쓰이지 않았다. 잘 만든 분류는 다른 제품 기능에서도 재사용할 수 있었다고 한다.

단계를 올리기 전에 측정 장치를 만든다

Ask HN 스레드에서 반복된 의견은 두 가지다. 벡터 DB가 항상 필요한 것은 아니고 BM25나 SQLite FTS5 같은 텍스트 검색만으로 충분한 경우가 많다는 것이다. 그리고 RAG 성능은 결국 LLM에 넘기는 짧은 텍스트 조각의 질이 정한다는 것이다.

이 의견은 단계를 올리는 기준으로 이어진다. 질의 확장, 융합 방식 변경, 재정렬 모델 교체는 모두 품질을 올리려는 변경이다. 정답 질문 세트와 recall, nDCG 같은 지표가 없으면 좋아졌는지 판단할 근거가 없다. 부하 테스트는 처리 시간만 보므로 품질 판단을 대신하지 못한다.

점수를 직접 합산하는 방식을 택한다면 정규화 함수와 가중치를 설정값으로 빼고, 바꿀 때마다 측정해 이력을 남기는 편이 낫다. 코드 상수로 박아 두면 왜 그 값인지 나중에 아무도 설명하지 못한다.

평가 지표를 어떻게 나누는지는 RAG를 평가에서 역설계하기에서 이어서 읽을 수 있다.

정리

  • 서비스마다 검색을 따로 만들면 품질 기준과 운영 방식이 갈라진다. 제품은 질문과 범위만 넘기고 검색 플랫폼이 후보 생성과 재정렬을 맡는다.
  • 검색 방식 하나를 만능으로 보지 않고, 약점을 보완하는 모듈을 하나씩 더한다.
  • 모듈을 더하기 전에 측정 장치를 먼저 둔다.
  • 관계를 따라가야 하는 질문은 이 파이프라인만으로 풀리지 않는다. 그 확장은 Beam search로 GraphRAG 경로 폭발을 제한하기에서 다룬다.
on this page
  • 01데이터를 가져오는 방식이 파편화되는 문제
  • 02공통 파이프라인
  • 03제품은 달라도 흐름은 하나다
  • 04각 단계가 막아 주는 약점
  • 05단계를 올리기 전에 측정 장치를 만든다
  • 06정리
tags
#study

이런 글도

  • ai

    하네스 회고는 새 문서로 쌓지 않고 종류에 맞는 기존 단일 소스에 환원한다

    2026.10.02
  • ai

    에이전트가 배운 회피 패턴은 조건을 통과한 것만 파일로 쌓고 주기적으로 지운다

    2026.10.02
  • ai

    ADR 은 되돌리기 어려운 결정의 이유만 남기고, 대안 기각은 옵션마다 줄을 나눈다

    2026.10.02
  • ai

    스킬 문서는 반복 실행을 스크립트로 내리고 같은 지시를 한 곳에서만 소유하게 쓴다

    2026.10.02

댓글 (0)