fos-blog/study
01 / 홈02 / 카테고리03 / 시리즈
01 / 홈02 / 카테고리03 / 시리즈

카테고리

  • AI 페이지로 이동
    • RAG 페이지로 이동
    • agent 페이지로 이동
    • langgraph 페이지로 이동
    • 사람용 CLI와 AI 에이전트용 CLI는 설계가 다르다
    • agents.md
    • Claude Code 메모리: CLAUDE.md와 .claude/rules를 규칙으로 쓰는 법
    • Claude Code의 Skill 시스템 - 개발자를 위한 AI 자동화의 새로운 차원
    • Claude Code를 5주 더 쓴 결과 — 스킬·CLAUDE.md를 키워가는 방식
    • Claude Code를 11일 동안 쓴 결과 — 데이터로 본 나의 사용 패턴
    • Claude Code 멀티 에이전트 — Teams
    • AI 에이전트와 디자인의 새 컨벤션 — DESIGN.md, Google Stitch, Claude Design
    • Docling — IBM Research 의 문서 파싱 toolkit 상세 정리
    • 하네스 엔지니어링 실전 — 4인 에이전트 팀으로 코딩 파이프라인 구축하기
    • 하네스 엔지니어링 — 오래 실행되는 AI 에이전트를 위한 설계
    • 멀티모달 LLM (Multimodal Large Language Model)
    • AI 에이전트와 함께 MVP 만들기 — dooray-cli 사례
    • 온톨로지에서 코딩 에이전트 컨텍스트까지 — 클래스·관계 설계와 그래프 평가
    • OpenClaw는 context와 memory를 어떻게 관리하나 — 나만의 에이전트를 구성하는 법
    • OpenClaw vs Hermes Agent — 갈아탈까 고민하며 정리한 비교
  • ai 페이지로 이동
    • agent 페이지로 이동
    • [초안] AI 제품 백엔드 안정성 — 지연·비용·권한·관측·도구 실패·폴백/재시도/사람 에스컬레이션
    • [초안] LLM 평가 프레임워크: 골든셋, 회귀 테스트, LLM-as-a-judge, 사람 피드백 루프
  • algorithm 페이지로 이동
    • live-coding 페이지로 이동
    • 분산 계산을 위한 알고리즘
  • architecture 페이지로 이동
    • 시니어 백엔드를 위한 API 설계 실전 스터디 팩
    • API 버저닝과 하위 호환성: 모바일·외부 컨슈머까지 안전하게 진화시키기
    • 캐시 설계 전략 총정리
    • [초안] 커머스 Spring 서비스에 Clean/Hexagonal Architecture를 실용적으로 적용하기
    • [초안] 커머스 도메인 모델링: 주문·재고·노출의 세 축을 분리해서 설계하기
    • 커머스 주문 상태와 데이터 정합성 기본기
    • [초안] 쿠폰/프로모션 동시성과 정합성 기본기 — 선착순·중복 사용 방지·발급/사용/복구
    • [초안] DDD와 도메인 모델링: 시니어 백엔드 관점의 전술/전략 패턴 실전 가이드
    • [초안] Decorator & Chain of Responsibility — 행동을 체인으로 조립하는 두 가지 방식
    • 디자인 패턴
    • [초안] 분산 아키텍처 완전 정복: Java 백엔드 시니어 인터뷰 대비 실전 가이드
    • [초안] 분산 트랜잭션과 Outbox 패턴 — 왜 2PC를 피하고 어떻게 대신할 것인가
    • 분산 트랜잭션
    • [초안] e-Commerce 주문·결제 도메인 모델링: 상태머신, 멱등성, Outbox/Saga 실전 정리
    • [초안] Event Sourcing과 CQRS — 상태가 아니라 변화를 저장한다는 발상
    • [학습중] 금융 거래 취소·정정·대사·일마감 운영
    • [학습중] 금융 거래 상태와 원장 설계
    • [초안] F&B 쿠폰·프로모션·멤버십·포인트 설계
    • [초안] F&B · e-Commerce 디지털 채널 도메인 한 장 정리
    • [초안] F&B 주문/매장/픽업 상태머신 설계
    • [초안] F&B 이커머스 결제·환불·정산 운영 가이드
    • [초안] Hexagonal / Clean Architecture를 Spring 백엔드에 적용하기
    • [초안] 대규모 커머스 트래픽 처리 패턴 — 대규모 회원과 메가 프로모션을 버티는 설계
    • [초안] 레거시 JSP/jQuery 화면과 신규 API가 공존하는 백엔드 운영 전략
    • [학습중] 모듈러 모놀리스에서 MSA로 점진 전환하는 실습
    • [초안] MSA 서비스 간 통신: Redis [Cache-Aside](../database/redis/cache-aside.md) × Kafka 이벤트 하이브리드 설계
    • [초안] Observability 입문: 시니어 백엔드가 장애를 탐지하고 대응하는 방식
    • [초안] Outbox / Inbox Pattern 심화 — 분산 메시징의 정합성 문제를 DB 트랜잭션으로 풀어내기
    • [초안] 결제 도메인 멱등성과 트랜잭션 재시도 기본기
    • [초안] 시니어 백엔드를 위한 Resilience 패턴 실전 가이드 — Timeout, Retry, Circuit Breaker, Bulkhead, Backpressure
    • [초안] Spring Batch vs Event-Driven — 같은 비동기처럼 보이지만 전혀 다른 두 패러다임
    • [초안] Strategy Pattern — 분기문을 없애는 설계, 시니어 백엔드 인터뷰 핵심 패턴
    • [초안] 시니어 백엔드를 위한 시스템 설계 입문 스터디 팩
    • [초안] 템플릿 메서드 패턴 - 백엔드 처리 골격을 강제하는 가장 오래되고 가장 위험한 패턴
    • [초안] 대규모 트래픽 중 무중단 마이그레이션 — Feature Flag + Shadow Mode 실전
  • database 페이지로 이동
    • milvus 페이지로 이동
    • mysql 페이지로 이동
    • opensearch 페이지로 이동
    • qdrant 페이지로 이동
    • redis 페이지로 이동
    • vespa 페이지로 이동
    • 김영한의-실전-데이터베이스-설계 페이지로 이동
    • [초안] DB Connection Pool Saturation과 Thread Pool 격리
    • 커넥션 풀 크기는 얼마나 조정해야 할까?
    • 인덱스 - DB 성능 최적화의 핵심
    • [초안] JPA N+1과 커머스 조회 모델: 주문/메뉴/쿠폰 도메인에서 살아남기
    • [초안] MyBatis 기본기 — XML Mapper, resultMap, 동적 SQL, 운영 패턴 정리
    • [초안] MyBatis와 JPA/Hibernate 트레이드오프 — 레거시 백엔드를 다루는 시니어 관점
    • 한국어 형태소 분석기 Nori vs Lindera — OpenSearch에서 Milvus로 갈 때 어휘 검색은 유지되나
    • 벡터 DB 5종, 아키텍처는 어떻게 다른가
    • 벡터 DB 5종을 실제로 벤치마크했다 — 같은 recall에서 QPS는 얼마나 갈리나
    • 벡터 DB 어떻게 고를까 — OpenSearch · Milvus · Qdrant · Vespa · pgvector 비교
    • 벡터 DB를 실제로 도입한 사례 — 빅테크 프로덕션
    • 역정규화 (Denormalization)
    • 데이터 베이스 정규화
  • devops 페이지로 이동
    • docker 페이지로 이동
    • k8s 페이지로 이동
    • k8s-in-action 페이지로 이동
    • observability 페이지로 이동
    • [초안] 커머스/F&B 채널 장애 첫 5분과 관측성 기본기
    • [초안] 운영 데이터 정합성 장애 대응 — 결제 취소 누락과 중복 적재 런북
    • Envoy Proxy
    • [초안] F&B / e-Commerce 운영 장애 대응과 모니터링 — 백엔드 관점 정리
    • Graceful Shutdown
    • [초안] 시니어 백엔드를 위한 SLO와 Error Budget 기반 장애 대응
  • http 페이지로 이동
    • HTTP Connection Pool
    • HTTPS는 어떻게 안전한가 — TLS, 인증서, 그리고 termination
  • interview 페이지로 이동
    • [초안] AI 서비스 팀 경험 기반 시니어 백엔드 면접 질문 뱅크 — Spring Batch RAG / gRPC graceful shutdown / 캐시 정합성 / 12일 AI 웹툰 MVP
    • Observability — 면접 답변 프레임
    • [초안] 시니어 Java 백엔드 면접 마스터 플레이북 — 김병태
    • [초안] NSC 슬롯팀 경험 기반 질문 은행 — 도메인 모델링·동시성·성능·AI 협업
  • java 페이지로 이동
    • concurrency 페이지로 이동
    • jdbc 페이지로 이동
    • opentelemetry 페이지로 이동
    • spring 페이지로 이동
    • spring-batch 페이지로 이동
    • testing 페이지로 이동
    • 더_자바_코드를_조작하는_다양한_방법 페이지로 이동
    • [초안] Java 동시성 락 정리 — 커머스 메뉴/프로모션 정책 캐시 갱신 관점
    • [초안] JVM 튜닝 실전: 메모리 구조부터 Virtual Threads, GC 튜닝, 프로파일링까지
    • Java의 로깅 환경
    • MDC (Mapped Diagnostic Context)
    • Java StampedLock — 읽기 폭주에도 쓰기가 밀리지 않는 락
    • Virtual Thread와 Project Loom
  • javascript 페이지로 이동
    • typescript 페이지로 이동
    • AbortController
    • Async Iterator와 제너레이터
    • CommonJS와 ECMAScript Modules
    • 제너레이터(Generator)
    • Http Client
    • Node 백엔드 운영 패턴 — Streams 백프레셔, pipe/pipeline, 멱등성 vs 분산 락
    • Node.js
    • npm vs pnpm — 어떤 기준으로 선택했나
    • `setImmediate()`
  • kafka 페이지로 이동
    • [초안] Kafka 기본 개념 — 토픽, 파티션, 오프셋, 복제
    • Kafka를 사용하여 **데이터 정합성**은 어떻게 유지해야 할까?
    • [초안] Kafka 실전 설계: 파티션 전략, 컨슈머 그룹, 전달 보장, 재시도, 순서 보장 트레이드오프
    • [학습중] Kafka 파티션·리밸런스·컨슈머 지연 운영
    • 메시지 전송 신뢰성
    • [초안] Spring Kafka 컨슈머 오프셋 커밋과 트랜잭션 정렬: AckMode, manual ack, 멱등 처리
  • linux 페이지로 이동
    • fsync — 리눅스 파일 동기화 시스템 콜
    • tmux — Terminal Multiplexer
  • mlops 페이지로 이동
    • llm-serving 페이지로 이동
    • serving-frameworks 페이지로 이동
    • Python CUDA 버전 생태계 — nvidia-smi, nvcc, pip, conda가 다 다른 버전을 말하는 이유
    • GPU 컨테이너의 CUDA 버전 호환성 — nvidia-smi부터 이미지 다이어트까지
    • Kubernetes GPU 노드에서 /run tmpfs가 꽉 차서 Pod가 안 뜰 때
    • GPU·CUDA·MPS 기초 — 자바 백엔드 개발자가 처음 만나는 그림
    • Multi-process GPU 워크로드 — 자바 ThreadPool 사용자가 만나는 모델 차이
    • ML 서비스 성능 분석 워크플로 — 자바 백엔드 트러블슈팅과 다른 점
    • 한 GPU 를 여러 프로세스가 나눠 쓰기 — Time-Slicing 과 MPS
  • network 페이지로 이동
    • Connection reset by peer는 누가 보낸 걸까 — 리버스 프록시 홉마다 TCP 연결은 따로 논다
    • L2(스위치)와 L3(라우터)의 역할 차이
    • L4와 VIP(Virtual IP Address)
    • IP Subnet
  • python 페이지로 이동
    • Python async/await — CompletableFuture·Reactor 와 다른 점, 그리고 blocking I/O 함정
    • Python 의존성 관리 — Java Maven/Gradle 사용자가 만나는 첫 충격
    • FastAPI 기초 — Spring Boot 사용자가 빠르게 익히는 법
    • Java 개발자를 위한 Python 심화 — OOP·데코레이터·컨텍스트 매니저
    • PyTorch 기초 — 텐서, 디바이스, 그리고 모델 로딩이 무거운 이유
    • Java 개발자를 위한 Python 문법 핵심
    • ThreadLocal 에서 contextvars 로 — Python 의 요청 컨텍스트 전파
    • OCR 동작 원리 — Layout · Text · Post-process 3단계
    • Python 서버의 RSS 가 안 줄어드는 이유 — gc.collect 의 한계와 malloc_trim
  • rabbitmq 페이지로 이동
    • [초안] RabbitMQ Basics — 실전 백엔드 관점에서 정리하는 메시지 브로커 기본기
    • [초안] RabbitMQ vs Kafka — 백엔드 메시징 선택 기준과 실전 운영 관점
  • resume 페이지로 이동
    • [초안] 김병태 경력기술서
    • [초안] 김병태 포트폴리오
  • security 페이지로 이동
    • [초안] 시니어 백엔드를 위한 보안 / 인증 스터디 팩 — Spring Security, JWT, OAuth2, OWASP Top 10
    • [초안] Spring Security 6.x OAuth2 + JWT 상용 인증 설계 — Grant 선택, Resource Server, Refresh Rotation, 로그아웃
  • task 페이지로 이동
    • ai-service-team 페이지로 이동
    • nsc-slot 페이지로 이동
    • sb-dev-team 페이지로 이동
    • the-future-company 페이지로 이동
  • testing 페이지로 이동
    • [초안] 시니어 Java 백엔드를 위한 테스트 전략 완전 정리 — 피라미드부터 TestContainers, 마이크로벤치, Contract까지
  • thinking 페이지로 이동
    • 좋은 일을 넘어 중요한 일을 하는 법
FOS-BLOG · FOOTERall systems normal·v0.1 · 2026.04.27·seoul, kr
Ffos-blog/study

개발 학습 기록을 정리하는 블로그입니다. 공부하면서 기록하고, 기록하면서 다시 배웁니다.

visitors
01site
  • Home↗
  • Posts↗
  • Categories↗
  • Glossary↗
  • About↗
02policy
  • 소개/about
  • 개인정보처리방침/privacy
  • 연락처/contact
03categories
  • AI↗
  • Algorithm↗
  • DB↗
  • DevOps↗
  • Java/Spring↗
  • JS/TS↗
  • React↗
  • Next.js↗
  • System↗
04connect
  • GitHub@jon890↗
  • Source repositoryjon890/fos-study↗
  • RSS feed/rss.xml↗
  • Newsletter매주 1 회 · 한 편의 글→
© 2026 FOS Study. All posts MIT-licensed.
built with·Next.js·Tailwind v4·Geist·Pretendard·oklch
fos-blog/mlops/Triton Inference Server …
mlops

Triton Inference Server — GPU 추론을 짜내는 모델 실행 런타임

> 이 글은 추론 프레임워크 비교 시리즈의 첫 편이다. > 배칭이 왜 GPU 처리량을 올리는지 원리가 궁금하면 배칭과 GPU 활용률을 먼저 읽으면 좋다. 여기서는 그 원리를 Triton이 어떤 설정으로 실현하는지에 집중한다. 추론 프레임워크를 비교하기 전에 한 가지를 먼저 못박아야 한다. Triton, BentoML, Ray는 흔히 "vs"로 묶이지만 같은...

2026.07.14·8 min read·11 views·SERIES · 추론 서빙 프레임워크 비교 · 1/4

이 글은 추론 프레임워크 비교 시리즈의 첫 편이다. 배칭이 왜 GPU 처리량을 올리는지 원리가 궁금하면 배칭과 GPU 활용률을 먼저 읽으면 좋다. 여기서는 그 원리를 Triton이 어떤 설정으로 실현하는지에 집중한다.

추론 프레임워크를 비교하기 전에 한 가지를 먼저 못박아야 한다. Triton, BentoML, Ray는 흔히 "vs"로 묶이지만 같은 층이 아니다. Triton은 그중 가장 아래, 모델을 GPU에서 실제로 실행하는 런타임에 있다. 이 글은 Triton이 그 층에서 무엇을 해주는지, 그리고 우리가 직접 gRPC 서버를 짜서 하던 일을 Triton이 어떻게 설정 한 줄로 대체하는지를 정리한다.

한 문장 결론: Triton은 "GPU를 최대한 안 놀리기"에 특화된 서버다. dynamic batching과 concurrent execution 두 장치가 그 목적을 위해 존재한다. 대신 전후처리를 Python으로 편하게 붙이는 개발 경험은 포기해야 한다.

Triton이 정확히 무엇인가 — 서빙 런타임 층

Triton은 이미 만들어진 모델을 로드해 요청을 받고 추론을 실행·응답하는 서버다. 모델을 학습하거나 최적화하는 도구가 아니다. TensorRT 엔진, ONNX, PyTorch(TorchScript), TensorFlow 같은 산출물을 받아 프로덕션에서 굴리는 실행 계층에 있다.

이름에 얽힌 사연이 하나 있다. 처음엔 TensorRT Inference Server였는데, TensorRT 외 다른 프레임워크까지 지원하게 되면서 2020년 Triton으로 개명됐다. 최근 NVIDIA 마케팅 자료에서 "Dynamo Triton"이라는 상위 브랜드로 묶어 부르기도 하지만, 공식 GitHub 저장소와 문서는 여전히 "Triton Inference Server"라는 이름과 2.x 버전 체계를 그대로 쓴다(2026년 7월 기준 최신 2.70.0, 컨테이너 태그 26.06).

레이어를 이렇게 잡아두면 뒤 편들이 쉬워진다.

  • Triton: 모델을 GPU에서 빠르게 실행하는 런타임 (이 글)
  • BentoML: 모델을 Python으로 포장해 API로 내보내는 프레임워크
  • Ray Serve: 여러 모델·노드에 분산·오케스트레이션하는 층

Triton은 제일 아래고, 뒤 두 프레임워크가 Triton을 감싸 쓰는 조합도 실제로 존재한다.

Dynamic batching — 요청을 묶어 GPU를 채운다

Triton의 핵심 기능 첫 번째. 개별 요청을 큐에서 잠깐 대기시켰다가 여러 건을 묶어 백엔드에 한 번에 넘긴다. 배칭이 왜 처리량을 올리는지는 별도 글에서 다뤘으니 여기서는 Triton이 그걸 어떤 손잡이로 조절하는지만 본다.

모델 설정 파일 config.pbtxt에 이렇게 적는다.

plaintext
# config.pbtxt
max_batch_size: 32
 
dynamic_batching {
  preferred_batch_size: [ 8, 16 ]
  max_queue_delay_microseconds: 100
}
  • preferred_batch_size: 가능하면 이 크기로 배치를 묶으려 시도한다.
  • max_queue_delay_microseconds: 선호 배치를 못 채웠을 때 요청을 큐에서 얼마나 더 기다릴지의 상한. 기본값 0.
    • 대기 중 새 요청이 들어와 배치가 차면 그 즉시 보낸다.
    • 이 값을 키우면 배치가 잘 차서 처리량↑, 대신 개별 요청 지연↑. 앞서 스캐폴딩에서 짚은 처리량 대 지연 맞교환이 바로 이 한 줄에 있다.

여기서 중요한 구분 하나. Triton의 dynamic batching은 요청 단위 배칭(request batching)이다. CV·OCR 모델처럼 한 번의 forward pass로 결과가 나오는 모델에 맞다. LLM에서 쓰는 continuous batching(토큰 스텝 단위로 슬롯을 재활용하는 방식)과는 다른 개념이다 — LLM 쪽은 배칭 글에서 다룬다. OCR 추론 서빙을 고민한다면 우리에게 필요한 건 continuous가 아니라 이 dynamic batching이다.

Concurrent model execution — 한 GPU에 인스턴스 여러 개

두 번째 장치. 기본 상태의 Triton은 모델 인스턴스를 1개만 띄운다. 동시에 요청이 몰리면 GPU에서 순차 실행된다. instance_group으로 인스턴스를 늘리면 여러 요청을 겹쳐 처리한다.

plaintext
# config.pbtxt
instance_group [
  {
    count: 2
    kind: KIND_GPU
  }
]

인스턴스를 2개로 늘리면 한 인스턴스가 CPU↔GPU 메모리 전송을 하는 동안 다른 인스턴스가 연산을 돌려, 놀던 시간을 겹쳐 없앤다. dynamic batching이 "요청을 가로로 묶기"라면 concurrent execution은 "실행을 세로로 겹치기"다. 둘을 함께 써서 GPU 활용도를 짜낸다.

지원 백엔드 — 하나의 서버로 여러 프레임워크

Triton은 프레임워크마다 "백엔드" 플러그인으로 대응한다. 한 서버 프로세스가 서로 다른 프레임워크 모델을 동시에 굴릴 수 있다.

  • TensorRT, ONNX Runtime, PyTorch(LibTorch), TensorFlow, OpenVINO
  • Python backend — 전후처리나 커스텀 로직을 Python으로 직접 구현
  • vLLM backend, TensorRT-LLM backend — LLM 서빙용

OCR 파이프라인이 검출 모델은 ONNX, 인식 모델은 PyTorch처럼 섞여 있어도 한 Triton으로 묶을 수 있다는 뜻이다.

Ensemble과 BLS — 여러 모델을 서버 안에서 이어 붙이기

OCR은 보통 단일 모델이 아니라 전처리 → 검출 → 인식 → 후처리로 이어지는 파이프라인이다. 이걸 잇는 방법은 두 가지다.

먼저 안 쓰는 쪽부터 보면 왜 필요한지 와닿는다. 클라이언트가 직접 오케스트레이션하는 방식이다.

  1. 클라이언트 → Triton: 전처리 모델 호출, 결과 받음
  2. 클라이언트 → Triton: 검출 모델 호출, 박스 받음
  3. 클라이언트 → Triton: 인식 모델 호출, 텍스트 받음

문제는 단계마다 네트워크 왕복이 생기고, 중간 텐서(전처리된 이미지·박스)가 GPU에서 클라이언트로 나왔다 다시 들어간다는 것이다. 이미지 데이터가 크면 이 왕복이 지연을 지배한다.

Ensemble과 BLS는 이 오케스트레이션을 서버 안으로 옮긴다. 클라이언트는 원본 이미지 한 번만 보내고 최종 텍스트만 받는다. 중간 텐서는 GPU 메모리에 머문 채 모델 사이를 흐른다. 왕복이 사라진다.

Ensemble — 설정으로 그리는 정적 DAG

Ensemble은 코드 없이 config.pbtxt 설정만으로 모델들을 DAG(방향 있는 비순환 그래프)로 잇는다. 핵심은 어느 모델의 출력이 어느 모델의 입력으로 들어가는지를 텐서 이름으로 배선하는 것이다.

plaintext
# ocr_pipeline/config.pbtxt
name: "ocr_pipeline"
platform: "ensemble"
input  [ { name: "RAW_IMAGE" data_type: TYPE_UINT8 dims: [ -1 ] } ]
output [ { name: "TEXT"      data_type: TYPE_STRING dims: [ -1 ] } ]
 
ensemble_scheduling {
  step [
    {
      model_name: "preprocess"
      input_map  { key: "IMAGE_IN"  value: "RAW_IMAGE" }    # 파이프라인 입력을 받음
      output_map { key: "IMAGE_OUT" value: "preprocessed" } # "preprocessed"라는 이름표를 붙여 내보냄
    },
    {
      model_name: "detector"
      input_map  { key: "IMAGE" value: "preprocessed" }     # 위 단계 출력을 이름으로 받음
      output_map { key: "BOXES" value: "boxes" }
    },
    {
      model_name: "recognizer"
      input_map  { key: "BOXES"    value: "boxes" }
      output_map { key: "TEXT_OUT" value: "TEXT" }           # 파이프라인 최종 출력으로 연결
    }
  ]
}

읽는 법: output_map의 value가 이름표를 붙여 내보내면, 다음 단계의 input_map이 그 value 이름으로 받아 간다. value들이 서버 내부의 "텐서 버스"고, key는 각 모델이 자기 입출력에 붙인 이름이다. 이렇게 RAW_IMAGE → preprocessed → boxes → TEXT로 텐서가 흐른다.

한계가 여기서 드러난다. 배선이 고정이다. if 한글이면 A엔진, 영어면 B엔진 같은 조건 분기나, 검출된 박스 개수만큼 인식 반복 같은 루프를 config로는 못 그린다. DAG는 갈래가 정해진 정적 그래프라서다.

BLS — Python으로 짜는 동적 오케스트레이션

BLS(Business Logic Scripting)는 그 한계를 푼다. Python backend 모델의 execute 함수 안에서 다른 모델에 추론 요청을 코드로 직접 보낸다. 그래서 반복문·조건문이 된다.

OCR의 전형적 상황 — 검출된 박스 개수가 이미지마다 다르다. ensemble로는 "박스 수만큼 인식 반복"을 못 그리지만 BLS로는 그냥 for다.

python
import triton_python_backend_utils as pb_utils
 
class TritonPythonModel:
    def execute(self, requests):
        responses = []
        for request in requests:
            image = pb_utils.get_input_tensor_by_name(request, "RAW_IMAGE")
 
            # 1. 검출 모델을 코드로 호출
            det_req = pb_utils.InferenceRequest(
                model_name="detector",
                requested_output_names=["BOXES"],
                inputs=[image],
            )
            boxes = pb_utils.get_output_tensor_by_name(det_req.exec(), "BOXES")
 
            # 2. 검출된 박스 "개수만큼" 인식 모델 반복 호출 — ensemble로는 불가능한 부분
            texts = []
            for box in split_boxes(boxes):
                rec_req = pb_utils.InferenceRequest(
                    model_name="recognizer",
                    requested_output_names=["TEXT"],
                    inputs=[box],
                )
                text = pb_utils.get_output_tensor_by_name(rec_req.exec(), "TEXT")
                texts.append(text)
 
            responses.append(pb_utils.InferenceResponse(output_tensors=[join(texts)]))
        return responses

InferenceRequest(...).exec()가 다른 모델을 호출하는 부분이다. 동기(exec())·비동기(async_exec()) 둘 다 있다. 박스 개수가 데이터에 따라 변해도 for가 알아서 돈다 — 이게 ensemble과 결정적으로 다른 점이다.

언제 무엇을

  • 파이프라인이 정해진 일직선/고정 갈래 → Ensemble. 코드 없이 config로 끝, 가장 가볍다.
  • 데이터에 따라 횟수·경로가 달라짐(가변 박스 수, 언어별 분기) → BLS. Python이라 자유롭지만 손이 더 간다.

이 대목이 Triton의 트레이드오프를 잘 보여준다. 우리가 Python으로 자유롭게 짜던 파이프라인을, ensemble 설정 문법이나 BLS 규약에 맞춰 다시 구성해야 한다. 대신 얻는 것이 서버 내 오케스트레이션(왕복 제거)과 GPU 상주 텐서다.

프로토콜 — KServe v2 기반 gRPC와 HTTP

Triton은 KServe 커뮤니티 표준 추론 프로토콜(v2, Open Inference Protocol)을 기반으로 HTTP/REST와 gRPC를 노출한다. gRPC는 양방향 스트리밍 추론도 지원한다.

이 지점이 실무에서 의미가 크다. 많은 사내 모델 서버가 이미 gRPC로 짜여 있는데, 그건 Triton이 표준으로 제공하는 것을 손으로 구현한 셈이다. Triton으로 옮기면 프로토콜·배칭·인스턴스 관리를 직접 짜는 대신 설정으로 얻는다 — 이 맞바꿈이 도입 판단의 핵심이고, 비교편에서 다시 다룬다.

Model repository와 warmup

  • Model repository: 파일시스템 기반 모델 저장소. 로컬 경로뿐 아니라 S3·GCS도 된다.
    • 모델 디렉터리 아래에 숫자 이름의 버전 폴더(1/, 2/)를 두고 그 안에 모델 파일을 넣는다. 버전 관리가 디렉터리 구조로 강제된다.
  • Model warmup: 첫 실제 요청 전에 더미 추론을 미리 돌려 모델을 완전히 초기화한다. warmup이 끝나기 전엔 모델을 "ready"로 표시하지 않아 첫 요청의 콜드 스타트 지연을 없앤다. 대신 모델 리로드 응답성이 떨어지는 맞교환이 있다.

성능 — 공식 수치는 조건을 보고 읽자

Triton 자료에는 "single-digit millisecond latency" 같은 정성 표현이 자주 나오지만, 조건(모델·하드웨어·배치 크기)이 명시된 재현 가능한 벤치마크 표는 공식 소개 페이지에 없다. NVIDIA가 MLPerf Inference 4.1에서 TensorRT-LLM + Triton으로 Llama-2-70B 서빙 결과를 공개했지만, 이 글에서 절대 수치를 단정하진 않겠다.

대신 Triton 철학은 "고정 벤치마크를 믿지 말고 네 워크로드로 직접 재라"에 가깝다. 그래서 perf_analyzer와 Model Analyzer라는 측정 도구를 제공한다. 동시성·배치 설정을 바꿔가며 최적 구성을 스스로 찾는 방식이다. 우리 OCR 모델의 실제 처리량·지연은 이 도구로 측정하는 것이 후속 과제다.

언제 쓰나 / 언제 피하나

강점:

  • GPU 활용도가 비용에 직결되는 고처리량 서빙. dynamic batching + concurrent execution + TensorRT 결합.
  • 여러 프레임워크 모델을 한 서버로 통합 관리.
  • 표준 gRPC/HTTP 프로토콜과 버전 관리를 서버가 제공.

약점 / 피할 상황:

  • Python 전후처리를 편하게 붙이고 싶다 → Python backend나 BLS로 별도 구현해야 해 번거롭다.
  • config.pbtxt 옵션이 많아 러닝커브가 있다. 빠른 프로토타이핑에는 무겁다.
  • CPU-only 환경 → Triton의 핵심 이점(GPU 활용 극대화)이 상대적으로 줄어든다.

한 줄로 요약하면, 모델이 GPU에 얹혀 있고 처리량 한 톨이 아까운 단계에서 Triton이 빛나고, 아직 API 형태와 전후처리를 빠르게 실험하는 단계에서는 무겁다.

다음 편

다음 글에서는 Triton과 정반대 지점에 있는 BentoML을 본다. "GPU를 짜내는 서버"가 아니라 "Python 코드를 API로 빠르게 포장하는 프레임워크"다. 두 글을 읽으면 층위 차이가 선명해지고, 마지막 비교편에서 둘을 조합하는 패턴까지 이어진다.

참고 링크

  • Triton Inference Server GitHub
  • Model Configuration (dynamic_batching, instance_group)
  • Batcher 문서
  • Concurrent Model Execution
  • Business Logic Scripting (BLS)
  • Inference Protocols and APIs (KServe v2)
on this page
  • 01Triton이 정확히 무엇인가 — 서빙 런타임 층
  • 02Dynamic batching — 요청을 묶어 GPU를 채운다
  • 03Concurrent model execution — 한 GPU에 인스턴스 여러 개
  • 04지원 백엔드 — 하나의 서버로 여러 프레임워크
  • 05Ensemble과 BLS — 여러 모델을 서버 안에서 이어 붙이기
  • Ensemble — 설정으로 그리는 정적 DAG
  • BLS — Python으로 짜는 동적 오케스트레이션
  • 언제 무엇을
  • 06프로토콜 — KServe v2 기반 gRPC와 HTTP
  • 07Model repository와 warmup
  • 08성능 — 공식 수치는 조건을 보고 읽자
  • 09언제 쓰나 / 언제 피하나
  • 10다음 편
  • 11참고 링크
tags
#모델 서빙#추론 프레임워크#입문📚 추론 서빙 프레임워크 비교
NEXT →BentoML — Python 코드를 프로덕션 API로 포장하는 프레임워크

이런 글도

  • BentoML — Python 코드를 프로덕션 API로 포장하는 프레임워크
    > 추론 프레임워크 비교 시리즈의 두 번째 편이다. > 첫 편 Triton Inference Server를 먼저 읽으면 "런타임 층"과 "프레임워크 층"의 차이가 잡힌다. 이 글은 Triton 바로 위 층에 있는 BentoML을 다룬다. Triton이 "GPU에서 모델을 어떻게 빠르게 돌리나"였다면, BentoML의 질문은 다르다. 내 Python 추론 코...
    📁 mlops
    mlops
    2026.07.14
  • Ray Serve — 여러 모델을 분산·오토스케일하는 오케스트레이션 층
    > 추론 프레임워크 비교 시리즈의 세 번째 편이다. > 앞의 Triton(런타임 층)과 BentoML(패키징 층)을 먼저 읽으면 Ray Serve가 어느 층에 있는지 대비가 선명하다. Triton이 "한 GPU에서 모델을 빠르게", BentoML이 "한 모델을 API로 편하게"였다면, Ray Serve의 질문은 규모 쪽이다. 여러 모델을, 여러 노드에 걸쳐...
    📁 mlops
    mlops
    2026.07.14
  • Triton vs BentoML vs Ray Serve — 층이 다른 셋을 어떻게 고르나
    > 추론 프레임워크 비교 시리즈의 마지막 편이다. > 각 프레임워크 입문편(Triton · BentoML · Ray Serve)을 먼저 읽으면 이 글의 비교가 훨씬 잘 붙는다. 세 프레임워크를 공부하며 얻은 가장 중요한 결론을 먼저 박아둔다. Triton vs BentoML vs Ray 는 사실 틀린 질문이다. 셋은 경쟁 제품이 아니라 서로 다른 층에 있고...
    📁 mlops
    mlops
    2026.07.14
  • 배칭과 GPU 활용률 — batch 1이 GPU를 놀리는 이유부터 continuous batching까지
    > GPU로 LLM을 서빙한다는 것을 먼저 읽으면 이 글이 훨씬 쉽다. 거기서 유도한 "decode는 memory-bandwidth bound"라는 결론을 전제로 깔고 시작한다. 앞 글에서 이런 수치를 봤다. Llama 70B를 H100에서 요청 하나씩(batch 1) 디코딩하면, 텐서코어 활용률이 약 0.34%다. 989 TFLOP/s짜리 연산 유닛의 9...
    📁 mlops
    mlops
    2026.07.10

댓글 (0)