fos-blog/study
01 / 홈02 / 카테고리03 / 시리즈
01 / 홈02 / 카테고리03 / 시리즈

카테고리

  • AI 페이지로 이동
    • RAG 페이지로 이동
    • agent 페이지로 이동
    • langgraph 페이지로 이동
    • 사람용 CLI와 AI 에이전트용 CLI는 설계가 다르다
    • agents.md
    • Claude Code 메모리: CLAUDE.md와 .claude/rules를 규칙으로 쓰는 법
    • Claude Code의 Skill 시스템 - 개발자를 위한 AI 자동화의 새로운 차원
    • Claude Code를 5주 더 쓴 결과 — 스킬·CLAUDE.md를 키워가는 방식
    • Claude Code를 11일 동안 쓴 결과 — 데이터로 본 나의 사용 패턴
    • Claude Code 멀티 에이전트 — Teams
    • AI 에이전트와 디자인의 새 컨벤션 — DESIGN.md, Google Stitch, Claude Design
    • Docling — IBM Research 의 문서 파싱 toolkit 상세 정리
    • 하네스 엔지니어링 실전 — 4인 에이전트 팀으로 코딩 파이프라인 구축하기
    • 하네스 엔지니어링 — 오래 실행되는 AI 에이전트를 위한 설계
    • 멀티모달 LLM (Multimodal Large Language Model)
    • AI 에이전트와 함께 MVP 만들기 — dooray-cli 사례
    • 온톨로지에서 코딩 에이전트 컨텍스트까지 — 클래스·관계 설계와 그래프 평가
    • OpenClaw는 context와 memory를 어떻게 관리하나 — 나만의 에이전트를 구성하는 법
    • OpenClaw vs Hermes Agent — 갈아탈까 고민하며 정리한 비교
  • ai 페이지로 이동
    • agent 페이지로 이동
    • [초안] AI 제품 백엔드 안정성 — 지연·비용·권한·관측·도구 실패·폴백/재시도/사람 에스컬레이션
    • [초안] LLM 평가 프레임워크: 골든셋, 회귀 테스트, LLM-as-a-judge, 사람 피드백 루프
  • algorithm 페이지로 이동
    • live-coding 페이지로 이동
    • 분산 계산을 위한 알고리즘
  • architecture 페이지로 이동
    • 시니어 백엔드를 위한 API 설계 실전 스터디 팩
    • API 버저닝과 하위 호환성: 모바일·외부 컨슈머까지 안전하게 진화시키기
    • 캐시 설계 전략 총정리
    • [초안] 커머스 Spring 서비스에 Clean/Hexagonal Architecture를 실용적으로 적용하기
    • [초안] 커머스 도메인 모델링: 주문·재고·노출의 세 축을 분리해서 설계하기
    • 커머스 주문 상태와 데이터 정합성 기본기
    • [초안] 쿠폰/프로모션 동시성과 정합성 기본기 — 선착순·중복 사용 방지·발급/사용/복구
    • [초안] DDD와 도메인 모델링: 시니어 백엔드 관점의 전술/전략 패턴 실전 가이드
    • [초안] Decorator & Chain of Responsibility — 행동을 체인으로 조립하는 두 가지 방식
    • 디자인 패턴
    • [초안] 분산 아키텍처 완전 정복: Java 백엔드 시니어 인터뷰 대비 실전 가이드
    • [초안] 분산 트랜잭션과 Outbox 패턴 — 왜 2PC를 피하고 어떻게 대신할 것인가
    • 분산 트랜잭션
    • [초안] e-Commerce 주문·결제 도메인 모델링: 상태머신, 멱등성, Outbox/Saga 실전 정리
    • [초안] Event Sourcing과 CQRS — 상태가 아니라 변화를 저장한다는 발상
    • [학습중] 금융 거래 취소·정정·대사·일마감 운영
    • [학습중] 금융 거래 상태와 원장 설계
    • [초안] F&B 쿠폰·프로모션·멤버십·포인트 설계
    • [초안] F&B · e-Commerce 디지털 채널 도메인 한 장 정리
    • [초안] F&B 주문/매장/픽업 상태머신 설계
    • [초안] F&B 이커머스 결제·환불·정산 운영 가이드
    • [초안] Hexagonal / Clean Architecture를 Spring 백엔드에 적용하기
    • [초안] 대규모 커머스 트래픽 처리 패턴 — 대규모 회원과 메가 프로모션을 버티는 설계
    • [초안] 레거시 JSP/jQuery 화면과 신규 API가 공존하는 백엔드 운영 전략
    • [학습중] 모듈러 모놀리스에서 MSA로 점진 전환하는 실습
    • [초안] MSA 서비스 간 통신: Redis [Cache-Aside](../database/redis/cache-aside.md) × Kafka 이벤트 하이브리드 설계
    • [초안] Observability 입문: 시니어 백엔드가 장애를 탐지하고 대응하는 방식
    • [초안] Outbox / Inbox Pattern 심화 — 분산 메시징의 정합성 문제를 DB 트랜잭션으로 풀어내기
    • [초안] 결제 도메인 멱등성과 트랜잭션 재시도 기본기
    • [초안] 시니어 백엔드를 위한 Resilience 패턴 실전 가이드 — Timeout, Retry, Circuit Breaker, Bulkhead, Backpressure
    • [초안] Spring Batch vs Event-Driven — 같은 비동기처럼 보이지만 전혀 다른 두 패러다임
    • [초안] Strategy Pattern — 분기문을 없애는 설계, 시니어 백엔드 인터뷰 핵심 패턴
    • [초안] 시니어 백엔드를 위한 시스템 설계 입문 스터디 팩
    • [초안] 템플릿 메서드 패턴 - 백엔드 처리 골격을 강제하는 가장 오래되고 가장 위험한 패턴
    • [초안] 대규모 트래픽 중 무중단 마이그레이션 — Feature Flag + Shadow Mode 실전
  • database 페이지로 이동
    • milvus 페이지로 이동
    • mysql 페이지로 이동
    • opensearch 페이지로 이동
    • qdrant 페이지로 이동
    • redis 페이지로 이동
    • vespa 페이지로 이동
    • 김영한의-실전-데이터베이스-설계 페이지로 이동
    • [초안] DB Connection Pool Saturation과 Thread Pool 격리
    • 커넥션 풀 크기는 얼마나 조정해야 할까?
    • 인덱스 - DB 성능 최적화의 핵심
    • [초안] JPA N+1과 커머스 조회 모델: 주문/메뉴/쿠폰 도메인에서 살아남기
    • [초안] MyBatis 기본기 — XML Mapper, resultMap, 동적 SQL, 운영 패턴 정리
    • [초안] MyBatis와 JPA/Hibernate 트레이드오프 — 레거시 백엔드를 다루는 시니어 관점
    • 한국어 형태소 분석기 Nori vs Lindera — OpenSearch에서 Milvus로 갈 때 어휘 검색은 유지되나
    • 벡터 DB 5종, 아키텍처는 어떻게 다른가
    • 벡터 DB 5종을 실제로 벤치마크했다 — 같은 recall에서 QPS는 얼마나 갈리나
    • 벡터 DB 어떻게 고를까 — OpenSearch · Milvus · Qdrant · Vespa · pgvector 비교
    • 벡터 DB를 실제로 도입한 사례 — 빅테크 프로덕션
    • 역정규화 (Denormalization)
    • 데이터 베이스 정규화
  • devops 페이지로 이동
    • docker 페이지로 이동
    • k8s 페이지로 이동
    • k8s-in-action 페이지로 이동
    • observability 페이지로 이동
    • [초안] 커머스/F&B 채널 장애 첫 5분과 관측성 기본기
    • [초안] 운영 데이터 정합성 장애 대응 — 결제 취소 누락과 중복 적재 런북
    • Envoy Proxy
    • [초안] F&B / e-Commerce 운영 장애 대응과 모니터링 — 백엔드 관점 정리
    • Graceful Shutdown
    • [초안] 시니어 백엔드를 위한 SLO와 Error Budget 기반 장애 대응
  • http 페이지로 이동
    • HTTP Connection Pool
    • HTTPS는 어떻게 안전한가 — TLS, 인증서, 그리고 termination
  • interview 페이지로 이동
    • [초안] AI 서비스 팀 경험 기반 시니어 백엔드 면접 질문 뱅크 — Spring Batch RAG / gRPC graceful shutdown / 캐시 정합성 / 12일 AI 웹툰 MVP
    • Observability — 면접 답변 프레임
    • [초안] 시니어 Java 백엔드 면접 마스터 플레이북 — 김병태
    • [초안] NSC 슬롯팀 경험 기반 질문 은행 — 도메인 모델링·동시성·성능·AI 협업
  • java 페이지로 이동
    • concurrency 페이지로 이동
    • jdbc 페이지로 이동
    • opentelemetry 페이지로 이동
    • spring 페이지로 이동
    • spring-batch 페이지로 이동
    • testing 페이지로 이동
    • 더_자바_코드를_조작하는_다양한_방법 페이지로 이동
    • [초안] Java 동시성 락 정리 — 커머스 메뉴/프로모션 정책 캐시 갱신 관점
    • [초안] JVM 튜닝 실전: 메모리 구조부터 Virtual Threads, GC 튜닝, 프로파일링까지
    • Java의 로깅 환경
    • MDC (Mapped Diagnostic Context)
    • Java StampedLock — 읽기 폭주에도 쓰기가 밀리지 않는 락
    • Virtual Thread와 Project Loom
  • javascript 페이지로 이동
    • typescript 페이지로 이동
    • AbortController
    • Async Iterator와 제너레이터
    • CommonJS와 ECMAScript Modules
    • 제너레이터(Generator)
    • Http Client
    • Node 백엔드 운영 패턴 — Streams 백프레셔, pipe/pipeline, 멱등성 vs 분산 락
    • Node.js
    • npm vs pnpm — 어떤 기준으로 선택했나
    • `setImmediate()`
  • kafka 페이지로 이동
    • [초안] Kafka 기본 개념 — 토픽, 파티션, 오프셋, 복제
    • Kafka를 사용하여 **데이터 정합성**은 어떻게 유지해야 할까?
    • [초안] Kafka 실전 설계: 파티션 전략, 컨슈머 그룹, 전달 보장, 재시도, 순서 보장 트레이드오프
    • [학습중] Kafka 파티션·리밸런스·컨슈머 지연 운영
    • 메시지 전송 신뢰성
    • [초안] Spring Kafka 컨슈머 오프셋 커밋과 트랜잭션 정렬: AckMode, manual ack, 멱등 처리
  • linux 페이지로 이동
    • fsync — 리눅스 파일 동기화 시스템 콜
    • tmux — Terminal Multiplexer
  • mlops 페이지로 이동
    • llm-serving 페이지로 이동
    • serving-frameworks 페이지로 이동
    • Python CUDA 버전 생태계 — nvidia-smi, nvcc, pip, conda가 다 다른 버전을 말하는 이유
    • GPU 컨테이너의 CUDA 버전 호환성 — nvidia-smi부터 이미지 다이어트까지
    • Kubernetes GPU 노드에서 /run tmpfs가 꽉 차서 Pod가 안 뜰 때
    • GPU·CUDA·MPS 기초 — 자바 백엔드 개발자가 처음 만나는 그림
    • Multi-process GPU 워크로드 — 자바 ThreadPool 사용자가 만나는 모델 차이
    • ML 서비스 성능 분석 워크플로 — 자바 백엔드 트러블슈팅과 다른 점
    • 한 GPU 를 여러 프로세스가 나눠 쓰기 — Time-Slicing 과 MPS
  • network 페이지로 이동
    • Connection reset by peer는 누가 보낸 걸까 — 리버스 프록시 홉마다 TCP 연결은 따로 논다
    • L2(스위치)와 L3(라우터)의 역할 차이
    • L4와 VIP(Virtual IP Address)
    • IP Subnet
  • python 페이지로 이동
    • Python async/await — CompletableFuture·Reactor 와 다른 점, 그리고 blocking I/O 함정
    • Python 의존성 관리 — Java Maven/Gradle 사용자가 만나는 첫 충격
    • FastAPI 기초 — Spring Boot 사용자가 빠르게 익히는 법
    • Java 개발자를 위한 Python 심화 — OOP·데코레이터·컨텍스트 매니저
    • PyTorch 기초 — 텐서, 디바이스, 그리고 모델 로딩이 무거운 이유
    • Java 개발자를 위한 Python 문법 핵심
    • ThreadLocal 에서 contextvars 로 — Python 의 요청 컨텍스트 전파
    • OCR 동작 원리 — Layout · Text · Post-process 3단계
    • Python 서버의 RSS 가 안 줄어드는 이유 — gc.collect 의 한계와 malloc_trim
  • rabbitmq 페이지로 이동
    • [초안] RabbitMQ Basics — 실전 백엔드 관점에서 정리하는 메시지 브로커 기본기
    • [초안] RabbitMQ vs Kafka — 백엔드 메시징 선택 기준과 실전 운영 관점
  • resume 페이지로 이동
    • [초안] 김병태 경력기술서
    • [초안] 김병태 포트폴리오
  • security 페이지로 이동
    • [초안] 시니어 백엔드를 위한 보안 / 인증 스터디 팩 — Spring Security, JWT, OAuth2, OWASP Top 10
    • [초안] Spring Security 6.x OAuth2 + JWT 상용 인증 설계 — Grant 선택, Resource Server, Refresh Rotation, 로그아웃
  • task 페이지로 이동
    • ai-service-team 페이지로 이동
    • nsc-slot 페이지로 이동
    • sb-dev-team 페이지로 이동
    • the-future-company 페이지로 이동
  • testing 페이지로 이동
    • [초안] 시니어 Java 백엔드를 위한 테스트 전략 완전 정리 — 피라미드부터 TestContainers, 마이크로벤치, Contract까지
  • thinking 페이지로 이동
    • 좋은 일을 넘어 중요한 일을 하는 법
FOS-BLOG · FOOTERall systems normal·v0.1 · 2026.04.27·seoul, kr
Ffos-blog/study

개발 학습 기록을 정리하는 블로그입니다. 공부하면서 기록하고, 기록하면서 다시 배웁니다.

visitors
01site
  • Home↗
  • Posts↗
  • Categories↗
  • Glossary↗
  • About↗
02policy
  • 소개/about
  • 개인정보처리방침/privacy
  • 연락처/contact
03categories
  • AI↗
  • Algorithm↗
  • DB↗
  • DevOps↗
  • Java/Spring↗
  • JS/TS↗
  • React↗
  • Next.js↗
  • System↗
04connect
  • GitHub@jon890↗
  • Source repositoryjon890/fos-study↗
  • RSS feed/rss.xml↗
  • Newsletter매주 1 회 · 한 편의 글→
© 2026 FOS Study. All posts MIT-licensed.
built with·Next.js·Tailwind v4·Geist·Pretendard·oklch
fos-blog/devops/IP whitelist가 조용히 뚫려 있었다…
devops

IP whitelist가 조용히 뚫려 있었다 — 클라이언트 IP는 어디서 사라지는가

> 외부 트래픽은 어떻게 Pod까지 닿는가와 ingress-nginx 운영에서 부딪힌 디테일들을 먼저 읽으면 좋다. 이 글은 그 다음 단계로, 그때 걸어둔 whitelist가 실제로는 아무도 막지 못하고 있었다는 이야기다. 사내 전용으로 열어둔 검증 환경에 whitelist-source-range를 걸어놨다. kubectl get ingress로 보면 허용...

2026.07.27·8 min read·11 views·SERIES · API Gateway를 걷어내고 쿠버네티스로 직접 노출하기 · 6/6

외부 트래픽은 어떻게 Pod까지 닿는가와 ingress-nginx 운영에서 부딪힌 디테일들을 먼저 읽으면 좋다. 이 글은 그 다음 단계로, 그때 걸어둔 whitelist가 실제로는 아무도 막지 못하고 있었다는 이야기다.

사내 전용으로 열어둔 검증 환경에 whitelist-source-range를 걸어놨다. kubectl get ingress로 보면 허용 IP 목록이 멀쩡히 들어 있다. 그런데 목록에 없는 IP에서 호출했더니 200이 돌아왔다.

설정은 정상이었다. 문제는 nginx가 보는 "클라이언트 IP"가 진짜 클라이언트의 IP가 아니었다는 것이다. 이 글은 그 IP가 어느 구간에서 어떻게 바뀌는지, 그리고 그게 왜 접근 제어를 통째로 무력화하는지 정리한 기록이다.

가져갈 결론부터 적으면 이렇다. IP 기반 접근 제어를 걸었다면, 반드시 허용 목록에 없는 곳에서 차단되는지 확인해야 한다. 설정 존재 확인(kubectl get)은 검증이 아니다.

증상 — 같은 요청인데 포트에 따라 결과가 갈렸다

처음엔 whitelist가 통째로 안 먹는 줄 알았다. 그런데 포트를 바꿔보니 결과가 달랐다.

bash
# 443 (HTTPS) — 통과해버린다
curl -sk -o /dev/null -w "%{http_code}\n" \
  https://api.example.com/v1.0/ping
# 200
 
# 80 (HTTP) — 정상적으로 막힌다
curl -s -o /dev/null -w "%{http_code}\n" \
  http://api.example.com/v1.0/ping
# 403

같은 클라이언트, 같은 경로, 같은 Ingress 리소스인데 포트만 다르다. whitelist가 "동작은 하는데 443에서만 안 먹는" 상태였다.

진단 — nginx 액세스 로그에 찍힌 source IP를 본다

원인을 찾는 가장 빠른 방법은 nginx가 실제로 무슨 IP를 봤는지 확인하는 것이다. ingress controller의 로그에 그대로 남는다.

bash
# controller 파드 전부에서 특정 경로 요청만 뽑는다.
# replica가 여러 개면 요청이 어디로 갔는지 모르니 전부 훑어야 한다.
for P in $(kubectl -n <ingress-ns> get pods -o name); do
  kubectl -n <ingress-ns> logs "$P" --tail=500 | grep "ping"
done

나온 로그가 결정적이었다.

plaintext
# 443 요청 — source가 노드 IP로 찍혔다
10.150.202.87 - - [27/Jul/2026:09:52:05] "POST /v1.0/ping HTTP/2.0" 200
 
# 80 요청 — source가 진짜 내 공인 IP다
203.0.113.79 - - [27/Jul/2026:11:49:48] "POST /v1.0/ping HTTP/1.1" 403
[error] access forbidden by rule, client: 203.0.113.79

443으로 들어온 요청은 클러스터 노드 IP(10.150.202.87)로 둔갑해 있었다. 그리고 그 노드 IP가 속한 대역이 whitelist에 들어 있었다.

yaml
nginx.ingress.kubernetes.io/whitelist-source-range: 10.150.202.0/24,10.100.0.0/16,203.0.113.5
#                                                   ^^^^^^^^^^^^^^^ 노드 대역
#                                                                   ^^^^^^^^^^^^^ Pod CIDR

내부 통신을 허용하려고 넣어둔 사설 대역이, 외부 트래픽의 위장 주소가 되어버린 것이다. 외부에서 오든 내부에서 오든 전부 노드 IP로 바뀌니 whitelist는 항상 통과다.

왜 IP가 바뀌었나 — 두 계층이 겹쳤다

원인은 하나가 아니라 두 개가 겹친 거였다. 하나만 있었으면 문제가 안 됐을 수도 있다.

원인 1 — L4 리스너는 헤더를 붙일 수 없다

TLS를 nginx에서 직접 끝내기로 하면서 LB의 443 리스너를 HTTP에서 TCP 패스스루로 바꿨다. 인증서를 LB가 아니라 nginx에서 관리하려는 결정이었다.

여기서 계층 차이가 결정적이다.

L7 (HTTP 리스너)L4 (TCP 패스스루)
하는 일봉투를 뜯어 내용을 읽고 고쳐 씀봉투를 안 뜯고 그대로 전달
X-Forwarded-For붙일 수 있음불가능
TLSLB에서 종료백엔드까지 그대로 통과

X-Forwarded-For는 프록시를 거치면서 사라지는 원래 발신자 주소를 헤더에 적어 전달하는 관례다. 택배로 치면 중간 물류센터가 "이거 원래 어디서 왔음"이라고 송장에 적어주는 것과 같다. 그런데 이건 봉투를 뜯을 수 있는 L7만 할 수 있다. TCP 패스스루는 암호화된 바이트를 그대로 흘려보내니 헤더를 끼워 넣을 자리가 없다.

80이 정상 차단됐던 이유가 여기 있다. 80은 여전히 HTTP 리스너라 LB가 XFF를 붙여줬고, nginx의 이 설정이 그걸 읽어 실제 IP를 복원했다.

yaml
use-forwarded-headers: "true"
real-ip-header: "X-Forwarded-For"

이 설정은 XFF 헤더가 있을 때만 의미가 있다. 443에는 그 헤더 자체가 없었으니 설정이 켜져 있어도 할 일이 없었다.

원인 2 — externalTrafficPolicy 기본값이 IP를 덮어쓴다

XFF가 없으면 TCP 연결의 출발지 IP라도 남아 있어야 하는데, 그것마저 사라졌다. Service의 externalTrafficPolicy 때문이다.

bash
kubectl -n <ns> get svc -o custom-columns=\
'NAME:.metadata.name,POLICY:.spec.externalTrafficPolicy,EXT-IP:.status.loadBalancer.ingress[0].ip'
# NAME                 POLICY    EXT-IP
# ingress-controller   Cluster   203.0.113.100

Cluster가 기본값이다. 두 값의 차이는 이렇다.

Cluster (기본)Local
파드가 없는 노드로 오면파드 있는 노드로 넘긴다버린다
클라이언트 IPSNAT로 사라짐보존됨
부하 분산고르게 퍼짐노드별 파드 수에 쏠림
홉노드 간 추가 홉없음

Cluster에서 노드 A로 들어온 요청의 파드가 노드 B에 있으면, 노드 A가 B로 넘겨준다. 이때 응답이 돌아올 길을 만들려고 출발지 주소를 자기 IP로 바꾼다. 이게 SNAT(Source NAT)다.

집으로 온 택배를 옆집에 대신 전달하면서 송장의 발신자란에 자기 집 주소를 적는 셈이다. 옆집은 답장을 보낼 때 나에게 보내고, 내가 원래 발신자에게 다시 넘겨줄 수 있다. 경로는 완성되지만 옆집은 원래 누가 보냈는지 영영 알 수 없다.

Java 백엔드로 치면 프록시 클래스가 호출자 정보를 지우고 자기 이름으로 다시 호출하는 것과 비슷하다. 호출은 성공하는데 스택 추적에서 원래 호출자가 안 보인다.

왜 위험한가 — 내부 대역 허용이 백도어가 된다

이 사건에서 가장 위험했던 건 IP가 바뀐 것 자체가 아니다. 바뀐 그 주소가 마침 허용 목록에 있었다는 것이다.

whitelist에 10.150.202.0/24(노드 대역)와 10.100.0.0/16(Pod CIDR)을 넣은 건 자연스러운 판단이었다. 클러스터 내부 통신은 막으면 안 되니까. 그런데 SNAT가 모든 외부 트래픽을 그 대역으로 바꿔놓는 순간, 그 허용 규칙이 모두를 통과시키는 백도어로 바뀐다.

그래서 이 조합은 특히 조심해야 한다.

  • 클라이언트 IP가 보존되지 않는 경로 (L4 패스스루, Cluster 정책, 프록시 다단 경유)
  • 그 경로에서 나타나는 주소 대역이 허용 목록에 포함

둘 다 성립하면 접근 제어는 설정만 남고 기능은 사라진다. 로그에도 정상처럼 200이 찍혀서 눈치채기 어렵다.

어떻게 고치나 — 선택지 세 개

externalTrafficPolicy를 Local로

가장 간단하다. kube-proxy SNAT 홉이 사라지니 LB가 전달한 주소가 그대로 보인다.

yaml
service:
  externalTrafficPolicy: Local

함정이 있다. 파드가 없는 노드로 온 트래픽은 그냥 버려진다. 정상 동작하려면 LB가 healthCheckNodePort로 "이 노드에 파드가 있나"를 확인해서 없는 노드에는 안 보내야 한다. 클라우드 provider가 이걸 제대로 연동하는지 확인이 필요하다.

파드 배치도 미리 봐야 한다. 나는 이걸 적용하려다 문제를 하나 발견했다.

bash
kubectl -n <ingress-ns> get pods \
  -o custom-columns='NAME:.metadata.name,NODE:.spec.nodeName'
# 파드 2개가 전부 같은 노드에 있었다

replica 2개인데 둘 다 한 노드에 몰려 있었다. 처음엔 soft anti-affinity가 제 역할을 못 한 줄 알고 required로 올리려 했는데, 확인해보니 nodeSelector가 특정 노드그룹으로 제한하고 있었고 그 노드그룹에 노드가 1대뿐이었다. required로 바꿨으면 두 번째 파드가 영원히 Pending에 빠질 뻔했다.

Local은 이렇게 파드 배치와 LB health check에 의존한다. 설정 한 줄이지만 전제가 여럿이다.

PROXY protocol

L4에서도 클라이언트 IP를 전달하는 방법이다. TCP 연결을 열자마자 맨 앞에 발신자 정보를 담은 짧은 텍스트 한 줄을 먼저 보낸다.

plaintext
PROXY TCP4 203.0.113.79 10.150.202.87 54321 443\r\n
...이후부터 실제 TLS 바이트...

봉투를 안 뜯어도 되니 TLS 패스스루와 공존한다. 대신 LB와 백엔드가 동시에 켜져야 한다. 한쪽만 켜면 통신이 깨진다. 백엔드가 PROXY 헤더를 기대하는데 LB가 안 보내면 TLS handshake로 오해해서 실패하고, 반대면 그 한 줄이 요청 본문으로 섞여 들어간다.

전환 순간에 짧은 장애가 불가피해서, 이건 점검 시간대에 해야 한다.

LB에서 TLS를 종료

443도 HTTP(S) 리스너로 되돌리면 LB가 XFF를 붙여준다. 가장 확실하지만, 인증서를 LB에서 관리해야 해서 애초에 패스스루로 바꾼 이유와 정면 충돌한다.

무엇을 배웠나

설정했다와 동작한다는 다르다. 애노테이션은 정상 적용돼 있었고 kubectl get ingress로 확인해도 IP 목록이 멀쩡했다. 그런데 실제로는 아무도 막지 못했다. 보안 설정은 존재 확인이 아니라 차단되는지를 봐야 한다.

자기 IP로 테스트하면 안 된다. 이게 내가 가장 크게 헛짚은 부분이다. 처음에 검증 환경에 접속이 되길래 "외부에 열려 있구나" 판단했는데, 알고 보니 내 IP가 그 환경 whitelist에 들어 있었다. 허용 목록에 내 IP가 없는 다른 환경과 비교하고 나서야 진짜 문제가 드러났다. 접근 제어를 검증할 때 통과했다는 사실만으로는 아무것도 증명하지 못한다. 차단돼야 할 곳에서 차단되는지가 유일한 증거다.

한 계층의 변경이 다른 계층의 전제를 깬다. 인증서 관리를 편하게 하려고 TLS 종료 위치를 LB에서 nginx로 옮긴 결정이, IP 기반 접근 제어를 무너뜨렸다. 두 결정은 서로 다른 사람이 다른 시점에 내려도 이상하지 않다. 그래서 이 변경이 어떤 전제에 기대고 있었나를 짚어보는 습관이 필요하다. TLS 종료 위치를 옮길 때 XFF에 의존하던 게 있었는지 물었다면 바로 잡혔을 문제다.

기본값은 선택이 아니라 상속이다. externalTrafficPolicy: Cluster는 아무도 고르지 않았다. 그냥 기본값이었다. 부하 분산 관점에서는 합리적인 기본값이지만 클라이언트 IP를 포기한다는 대가가 딸려 있고, 그 대가는 IP 기반 정책을 쓰기 전까지 드러나지 않는다.

점검 체크리스트

IP 기반 접근 제어를 쓰는 환경이라면 이 순서로 확인하면 된다.

  1. 허용 목록에 없는 곳에서 호출해본다. 테더링이든 다른 환경이든, 내 IP가 목록에 없는 경로를 확보한다.
  2. 포트별로 각각 확인한다. 80과 443이 다른 리스너 타입이면 결과가 갈릴 수 있다.
  3. nginx 액세스 로그의 source IP를 본다. 진짜 클라이언트 IP인지, 노드나 LB 주소인지.
  4. externalTrafficPolicy를 확인한다. Cluster면 SNAT를 의심한다.
  5. 허용 목록에 내부 대역이 있는지 본다. 있다면 그게 SNAT 후 주소와 겹치는지 확인한다.

관련 글

  • 외부 트래픽은 어떻게 Pod까지 닿는가 — LoadBalancer부터 Pod까지의 경로. 이 글의 SNAT가 어느 구간에서 일어나는지 이해하는 배경
  • ingress-nginx 운영에서 부딪힌 디테일들 — whitelist를 처음 걸었던 맥락
  • API Gateway를 걷어낸 자리 채우기 — TLS 종료 위치를 옮긴 작업
  • L4와 VIP — L4 로드밸런싱의 기본

참고 링크

  • Kubernetes — Preserving the client source IP
  • Kubernetes — Service externalTrafficPolicy
  • ingress-nginx — whitelist-source-range
  • ingress-nginx — use-forwarded-headers
  • HAProxy — The PROXY protocol 사양
on this page
  • 01증상 — 같은 요청인데 포트에 따라 결과가 갈렸다
  • 02진단 — nginx 액세스 로그에 찍힌 source IP를 본다
  • 03왜 IP가 바뀌었나 — 두 계층이 겹쳤다
  • 원인 1 — L4 리스너는 헤더를 붙일 수 없다
  • 원인 2 — externalTrafficPolicy 기본값이 IP를 덮어쓴다
  • 04왜 위험한가 — 내부 대역 허용이 백도어가 된다
  • 05어떻게 고치나 — 선택지 세 개
  • externalTrafficPolicy를 Local로
  • PROXY protocol
  • LB에서 TLS를 종료
  • 06무엇을 배웠나
  • 07점검 체크리스트
  • 08관련 글
  • 09참고 링크
tags
#심화📚 API Gateway를 걷어내고 쿠버네티스로 직접 노출하기
← PREVIOUSingress-nginx 운영에서 부딪힌 디테일들 — webhook, whitelist, affinity, 리소스 사양

이런 글도

  • 컨테이너와 쿠버네티스가 필요한 이유 — jar 를 서버에 올리던 사람의 관점에서
    나는 오랫동안 Spring Boot 를 jar 로 말아서 서버에 올리는 방식으로 일했다. 배포는 "서버에 접속해서 기존 프로세스를 죽이고 새 jar 를 띄운다"였고, 그걸로 충분했다. 그러다 쿠버네티스 위에서 도는 서비스를 맡게 됐는데, ArgoCD 화면은 매일 보면서도 그 안에서 무슨 일이 벌어지는지는 몰랐다. Pod 가 왜 이름이 매번 바뀌는지, 왜 서...
    🚀 devops
    devops
    2026.07.27
  • 선언형 API 와 reconcile loop — 쿠버네티스를 관통하는 단 하나의 원리
    > 컨테이너와 쿠버네티스가 필요한 이유에서 "원하는 상태를 선언하면 시스템이 맞춘다"까지 말하고 넘어갔다. 이 글은 그 문장의 내부를 연다. 쿠버네티스를 배우면서 가장 오래 헤맨 건 객체 이름이 아니었다. kubectl apply 를 하면 리소스가 "생긴다"는데, 누가 언제 그걸 만드는지가 안 잡혔다. 명령을 보냈으니 그 명령이 실행되는 거라고 막연히 생각...
    🚀 devops
    devops
    2026.07.27
  • 쿠버네티스 Admission 단계 — 리소스가 etcd에 저장되기 직전에 무슨 일이 일어나는가
    kubectl apply를 하면 리소스가 클러스터에 "생긴다". 그런데 그 사이에 뭐가 있는지는 오래 몰랐다. 공인 LoadBalancer를 붙이면서 ingress controller를 내부용·외부용으로 나눴는데, "새 Ingress를 만들면 admission webhook이 검증한다"는 문장이 계속 나왔다. admission이 정확히 어느 단계고, 왜 하...
    🚀 devops
    devops
    2026.07.16
  • API Gateway를 걷어낸 자리 채우기 — path rewrite, 요청 크기 병목 4개, 그리고 HTTPS
    > 관리형 클러스터는 누구의 권한으로 클라우드를 만지는가의 후속 편이다. 그 글에서 클러스터 신원 문제를 해결하고 나서야, 원래 하려던 일 — API Gateway를 걷어내고 공인 LoadBalancer를 그 자리에 앉히는 작업 — 을 이어갈 수 있었다. 이 글은 LB가 뜬 다음부터의 이야기다. API Gateway를 걷어내기로 한 이유는 단순했다. 5MB...
    🚀 devops
    devops
    2026.07.10

댓글 (0)