fos-blog/study
01 / 홈02 / 카테고리03 / 시리즈
01 / 홈02 / 카테고리03 / 시리즈

카테고리

  • AI 페이지로 이동
    • RAG 페이지로 이동
    • agent 페이지로 이동
    • langgraph 페이지로 이동
    • 사람용 CLI와 AI 에이전트용 CLI는 설계가 다르다
    • agents.md
    • Claude Code 메모리: CLAUDE.md와 .claude/rules를 규칙으로 쓰는 법
    • Claude Code의 Skill 시스템 - 개발자를 위한 AI 자동화의 새로운 차원
    • Claude Code를 5주 더 쓴 결과 — 스킬·CLAUDE.md를 키워가는 방식
    • Claude Code를 11일 동안 쓴 결과 — 데이터로 본 나의 사용 패턴
    • Claude Code 멀티 에이전트 — Teams
    • AI 에이전트와 디자인의 새 컨벤션 — DESIGN.md, Google Stitch, Claude Design
    • Docling — IBM Research 의 문서 파싱 toolkit 상세 정리
    • 하네스 엔지니어링 실전 — 4인 에이전트 팀으로 코딩 파이프라인 구축하기
    • 하네스 엔지니어링 — 오래 실행되는 AI 에이전트를 위한 설계
    • 멀티모달 LLM (Multimodal Large Language Model)
    • AI 에이전트와 함께 MVP 만들기 — dooray-cli 사례
    • 온톨로지에서 코딩 에이전트 컨텍스트까지 — 클래스·관계 설계와 그래프 평가
    • OpenClaw는 context와 memory를 어떻게 관리하나 — 나만의 에이전트를 구성하는 법
    • OpenClaw vs Hermes Agent — 갈아탈까 고민하며 정리한 비교
  • ai 페이지로 이동
    • agent 페이지로 이동
    • [초안] AI 제품 백엔드 안정성 — 지연·비용·권한·관측·도구 실패·폴백/재시도/사람 에스컬레이션
    • [초안] LLM 평가 프레임워크: 골든셋, 회귀 테스트, LLM-as-a-judge, 사람 피드백 루프
  • algorithm 페이지로 이동
    • live-coding 페이지로 이동
    • 분산 계산을 위한 알고리즘
  • architecture 페이지로 이동
    • 시니어 백엔드를 위한 API 설계 실전 스터디 팩
    • API 버저닝과 하위 호환성: 모바일·외부 컨슈머까지 안전하게 진화시키기
    • 캐시 설계 전략 총정리
    • [초안] 커머스 Spring 서비스에 Clean/Hexagonal Architecture를 실용적으로 적용하기
    • [초안] 커머스 도메인 모델링: 주문·재고·노출의 세 축을 분리해서 설계하기
    • 커머스 주문 상태와 데이터 정합성 기본기
    • [초안] 쿠폰/프로모션 동시성과 정합성 기본기 — 선착순·중복 사용 방지·발급/사용/복구
    • [초안] DDD와 도메인 모델링: 시니어 백엔드 관점의 전술/전략 패턴 실전 가이드
    • [초안] Decorator & Chain of Responsibility — 행동을 체인으로 조립하는 두 가지 방식
    • 디자인 패턴
    • [초안] 분산 아키텍처 완전 정복: Java 백엔드 시니어 인터뷰 대비 실전 가이드
    • [초안] 분산 트랜잭션과 Outbox 패턴 — 왜 2PC를 피하고 어떻게 대신할 것인가
    • 분산 트랜잭션
    • [초안] e-Commerce 주문·결제 도메인 모델링: 상태머신, 멱등성, Outbox/Saga 실전 정리
    • [초안] Event Sourcing과 CQRS — 상태가 아니라 변화를 저장한다는 발상
    • [학습중] 금융 거래 취소·정정·대사·일마감 운영
    • [학습중] 금융 거래 상태와 원장 설계
    • [초안] F&B 쿠폰·프로모션·멤버십·포인트 설계
    • [초안] F&B · e-Commerce 디지털 채널 도메인 한 장 정리
    • [초안] F&B 주문/매장/픽업 상태머신 설계
    • [초안] F&B 이커머스 결제·환불·정산 운영 가이드
    • [초안] Hexagonal / Clean Architecture를 Spring 백엔드에 적용하기
    • [초안] 대규모 커머스 트래픽 처리 패턴 — 대규모 회원과 메가 프로모션을 버티는 설계
    • [초안] 레거시 JSP/jQuery 화면과 신규 API가 공존하는 백엔드 운영 전략
    • [학습중] 모듈러 모놀리스에서 MSA로 점진 전환하는 실습
    • [초안] MSA 서비스 간 통신: Redis [Cache-Aside](../database/redis/cache-aside.md) × Kafka 이벤트 하이브리드 설계
    • [초안] Observability 입문: 시니어 백엔드가 장애를 탐지하고 대응하는 방식
    • [초안] Outbox / Inbox Pattern 심화 — 분산 메시징의 정합성 문제를 DB 트랜잭션으로 풀어내기
    • [초안] 결제 도메인 멱등성과 트랜잭션 재시도 기본기
    • [초안] 시니어 백엔드를 위한 Resilience 패턴 실전 가이드 — Timeout, Retry, Circuit Breaker, Bulkhead, Backpressure
    • [초안] Spring Batch vs Event-Driven — 같은 비동기처럼 보이지만 전혀 다른 두 패러다임
    • [초안] Strategy Pattern — 분기문을 없애는 설계, 시니어 백엔드 인터뷰 핵심 패턴
    • [초안] 시니어 백엔드를 위한 시스템 설계 입문 스터디 팩
    • [초안] 템플릿 메서드 패턴 - 백엔드 처리 골격을 강제하는 가장 오래되고 가장 위험한 패턴
    • [초안] 대규모 트래픽 중 무중단 마이그레이션 — Feature Flag + Shadow Mode 실전
  • database 페이지로 이동
    • milvus 페이지로 이동
    • mysql 페이지로 이동
    • opensearch 페이지로 이동
    • qdrant 페이지로 이동
    • redis 페이지로 이동
    • vespa 페이지로 이동
    • 김영한의-실전-데이터베이스-설계 페이지로 이동
    • [초안] DB Connection Pool Saturation과 Thread Pool 격리
    • 커넥션 풀 크기는 얼마나 조정해야 할까?
    • 인덱스 - DB 성능 최적화의 핵심
    • [초안] JPA N+1과 커머스 조회 모델: 주문/메뉴/쿠폰 도메인에서 살아남기
    • [초안] MyBatis 기본기 — XML Mapper, resultMap, 동적 SQL, 운영 패턴 정리
    • [초안] MyBatis와 JPA/Hibernate 트레이드오프 — 레거시 백엔드를 다루는 시니어 관점
    • 한국어 형태소 분석기 Nori vs Lindera — OpenSearch에서 Milvus로 갈 때 어휘 검색은 유지되나
    • 벡터 DB 5종, 아키텍처는 어떻게 다른가
    • 벡터 DB 5종을 실제로 벤치마크했다 — 같은 recall에서 QPS는 얼마나 갈리나
    • 벡터 DB 어떻게 고를까 — OpenSearch · Milvus · Qdrant · Vespa · pgvector 비교
    • 벡터 DB를 실제로 도입한 사례 — 빅테크 프로덕션
    • 역정규화 (Denormalization)
    • 데이터 베이스 정규화
  • devops 페이지로 이동
    • docker 페이지로 이동
    • k8s 페이지로 이동
    • k8s-in-action 페이지로 이동
    • observability 페이지로 이동
    • [초안] 커머스/F&B 채널 장애 첫 5분과 관측성 기본기
    • [초안] 운영 데이터 정합성 장애 대응 — 결제 취소 누락과 중복 적재 런북
    • Envoy Proxy
    • [초안] F&B / e-Commerce 운영 장애 대응과 모니터링 — 백엔드 관점 정리
    • Graceful Shutdown
    • [초안] 시니어 백엔드를 위한 SLO와 Error Budget 기반 장애 대응
  • http 페이지로 이동
    • HTTP Connection Pool
    • HTTPS는 어떻게 안전한가 — TLS, 인증서, 그리고 termination
  • interview 페이지로 이동
    • [초안] AI 서비스 팀 경험 기반 시니어 백엔드 면접 질문 뱅크 — Spring Batch RAG / gRPC graceful shutdown / 캐시 정합성 / 12일 AI 웹툰 MVP
    • Observability — 면접 답변 프레임
    • [초안] 시니어 Java 백엔드 면접 마스터 플레이북 — 김병태
    • [초안] NSC 슬롯팀 경험 기반 질문 은행 — 도메인 모델링·동시성·성능·AI 협업
  • java 페이지로 이동
    • concurrency 페이지로 이동
    • jdbc 페이지로 이동
    • opentelemetry 페이지로 이동
    • spring 페이지로 이동
    • spring-batch 페이지로 이동
    • testing 페이지로 이동
    • 더_자바_코드를_조작하는_다양한_방법 페이지로 이동
    • [초안] Java 동시성 락 정리 — 커머스 메뉴/프로모션 정책 캐시 갱신 관점
    • [초안] JVM 튜닝 실전: 메모리 구조부터 Virtual Threads, GC 튜닝, 프로파일링까지
    • Java의 로깅 환경
    • MDC (Mapped Diagnostic Context)
    • Java StampedLock — 읽기 폭주에도 쓰기가 밀리지 않는 락
    • Virtual Thread와 Project Loom
  • javascript 페이지로 이동
    • typescript 페이지로 이동
    • AbortController
    • Async Iterator와 제너레이터
    • CommonJS와 ECMAScript Modules
    • 제너레이터(Generator)
    • Http Client
    • Node 백엔드 운영 패턴 — Streams 백프레셔, pipe/pipeline, 멱등성 vs 분산 락
    • Node.js
    • npm vs pnpm — 어떤 기준으로 선택했나
    • `setImmediate()`
  • kafka 페이지로 이동
    • [초안] Kafka 기본 개념 — 토픽, 파티션, 오프셋, 복제
    • Kafka를 사용하여 **데이터 정합성**은 어떻게 유지해야 할까?
    • [초안] Kafka 실전 설계: 파티션 전략, 컨슈머 그룹, 전달 보장, 재시도, 순서 보장 트레이드오프
    • [학습중] Kafka 파티션·리밸런스·컨슈머 지연 운영
    • 메시지 전송 신뢰성
    • [초안] Spring Kafka 컨슈머 오프셋 커밋과 트랜잭션 정렬: AckMode, manual ack, 멱등 처리
  • linux 페이지로 이동
    • fsync — 리눅스 파일 동기화 시스템 콜
    • tmux — Terminal Multiplexer
  • mlops 페이지로 이동
    • llm-serving 페이지로 이동
    • serving-frameworks 페이지로 이동
    • Python CUDA 버전 생태계 — nvidia-smi, nvcc, pip, conda가 다 다른 버전을 말하는 이유
    • GPU 컨테이너의 CUDA 버전 호환성 — nvidia-smi부터 이미지 다이어트까지
    • Kubernetes GPU 노드에서 /run tmpfs가 꽉 차서 Pod가 안 뜰 때
    • GPU·CUDA·MPS 기초 — 자바 백엔드 개발자가 처음 만나는 그림
    • Multi-process GPU 워크로드 — 자바 ThreadPool 사용자가 만나는 모델 차이
    • ML 서비스 성능 분석 워크플로 — 자바 백엔드 트러블슈팅과 다른 점
    • 한 GPU 를 여러 프로세스가 나눠 쓰기 — Time-Slicing 과 MPS
  • network 페이지로 이동
    • Connection reset by peer는 누가 보낸 걸까 — 리버스 프록시 홉마다 TCP 연결은 따로 논다
    • L2(스위치)와 L3(라우터)의 역할 차이
    • L4와 VIP(Virtual IP Address)
    • IP Subnet
  • python 페이지로 이동
    • Python async/await — CompletableFuture·Reactor 와 다른 점, 그리고 blocking I/O 함정
    • Python 의존성 관리 — Java Maven/Gradle 사용자가 만나는 첫 충격
    • FastAPI 기초 — Spring Boot 사용자가 빠르게 익히는 법
    • Java 개발자를 위한 Python 심화 — OOP·데코레이터·컨텍스트 매니저
    • PyTorch 기초 — 텐서, 디바이스, 그리고 모델 로딩이 무거운 이유
    • Java 개발자를 위한 Python 문법 핵심
    • ThreadLocal 에서 contextvars 로 — Python 의 요청 컨텍스트 전파
    • OCR 동작 원리 — Layout · Text · Post-process 3단계
    • Python 서버의 RSS 가 안 줄어드는 이유 — gc.collect 의 한계와 malloc_trim
  • rabbitmq 페이지로 이동
    • [초안] RabbitMQ Basics — 실전 백엔드 관점에서 정리하는 메시지 브로커 기본기
    • [초안] RabbitMQ vs Kafka — 백엔드 메시징 선택 기준과 실전 운영 관점
  • resume 페이지로 이동
    • [초안] 김병태 경력기술서
    • [초안] 김병태 포트폴리오
  • security 페이지로 이동
    • [초안] 시니어 백엔드를 위한 보안 / 인증 스터디 팩 — Spring Security, JWT, OAuth2, OWASP Top 10
    • [초안] Spring Security 6.x OAuth2 + JWT 상용 인증 설계 — Grant 선택, Resource Server, Refresh Rotation, 로그아웃
  • task 페이지로 이동
    • ai-service-team 페이지로 이동
    • nsc-slot 페이지로 이동
    • sb-dev-team 페이지로 이동
    • the-future-company 페이지로 이동
  • testing 페이지로 이동
    • [초안] 시니어 Java 백엔드를 위한 테스트 전략 완전 정리 — 피라미드부터 TestContainers, 마이크로벤치, Contract까지
  • thinking 페이지로 이동
    • 좋은 일을 넘어 중요한 일을 하는 법
FOS-BLOG · FOOTERall systems normal·v0.1 · 2026.04.27·seoul, kr
Ffos-blog/study

개발 학습 기록을 정리하는 블로그입니다. 공부하면서 기록하고, 기록하면서 다시 배웁니다.

visitors
01site
  • Home↗
  • Posts↗
  • Categories↗
  • Glossary↗
  • About↗
02policy
  • 소개/about
  • 개인정보처리방침/privacy
  • 연락처/contact
03categories
  • AI↗
  • Algorithm↗
  • DB↗
  • DevOps↗
  • Java/Spring↗
  • JS/TS↗
  • React↗
  • Next.js↗
  • System↗
04connect
  • GitHub@jon890↗
  • Source repositoryjon890/fos-study↗
  • RSS feed/rss.xml↗
  • Newsletter매주 1 회 · 한 편의 글→
© 2026 FOS Study. All posts MIT-licensed.
built with·Next.js·Tailwind v4·Geist·Pretendard·oklch
fos-blog/mlops/BentoML — Python 코드를 프로덕…
mlops

BentoML — Python 코드를 프로덕션 API로 포장하는 프레임워크

> 추론 프레임워크 비교 시리즈의 두 번째 편이다. > 첫 편 Triton Inference Server를 먼저 읽으면 "런타임 층"과 "프레임워크 층"의 차이가 잡힌다. 이 글은 Triton 바로 위 층에 있는 BentoML을 다룬다. Triton이 "GPU에서 모델을 어떻게 빠르게 돌리나"였다면, BentoML의 질문은 다르다. 내 Python 추론 코...

2026.07.14·5 min read·13 views·SERIES · 추론 서빙 프레임워크 비교 · 2/4

추론 프레임워크 비교 시리즈의 두 번째 편이다. 첫 편 Triton Inference Server를 먼저 읽으면 "런타임 층"과 "프레임워크 층"의 차이가 잡힌다. 이 글은 Triton 바로 위 층에 있는 BentoML을 다룬다.

Triton이 "GPU에서 모델을 어떻게 빠르게 돌리나"였다면, BentoML의 질문은 다르다. 내 Python 추론 코드를 어떻게 빠르게 프로덕션 API로 만들고 배포하나. 공식 정의도 "Python 타입 힌트만으로 모델 추론 코드를 REST API 서버로 전환한다"에 방점이 있다.

한 문장 결론: BentoML은 개발·패키징·배포의 편의를 파는 프레임워크다. 저수준 GPU 최적화는 Triton 같은 엔진에 위임하고, 자신은 그 위에서 "빠르게 만들고 컨테이너로 찍어 배포하는" 경험을 책임진다.

BentoML이 정확히 무엇인가 — 패키징 + 서빙 층

BentoML은 Python 라이브러리다. 추론 로직을 담은 클래스에 데코레이터를 붙이면 REST API 서버가 되고, 그걸 의존성·모델 파일과 함께 하나의 배포 단위로 묶어 컨테이너 이미지까지 뽑는다. 관심사가 "GPU 성능"이 아니라 "개발자 워크플로"에 있다.

버전 얘기를 먼저 정리해야 헷갈리지 않는다. BentoML은 1.2에서 API를 크게 갈아엎었다(2026년 7월 기준 최신 1.4.x).

  • 1.1 이전: bentoml.Service + Runner 조합 구조. 지금은 "legacy"로 명시됨.
  • 1.2 이후: 클래스 기반 @bentoml.service 데코레이터 방식으로 전면 개편.

웹에서 옛 예제(Runner 중심)를 보고 따라 하면 최신 버전과 어긋난다. 아래는 현행 클래스 기반 API 기준이다.

핵심 개념 1 — @bentoml.service로 클래스를 API로

추론 클래스에 데코레이터를 붙여 서비스로 만든다. 리소스·타임아웃 같은 설정을 데코레이터 인자로 준다.

python
import bentoml
 
@bentoml.service(
    resources={"gpu": 1},
    traffic={"timeout": 10},
)
class OcrService:
    def __init__(self):
        # 모델 로딩 등 초기화
        self.model = load_model()
 
    @bentoml.api
    def recognize(self, image: bytes) -> dict:
        # 전처리 → 추론 → 후처리를 그냥 Python으로
        return self.model.infer(image)
  • @bentoml.service: 클래스를 서비스로 표시. resources로 GPU 개수, traffic으로 타임아웃 등 지정.
  • @bentoml.api: 메서드를 HTTP 엔드포인트로 노출(기본 POST).

주목할 점은 전후처리가 그냥 평범한 Python 메서드라는 것이다. Triton에서 Python backend나 BLS 규약에 맞춰야 했던 부분을, 여기서는 아무 제약 없이 파이썬으로 쓴다. 이게 BentoML이 파는 편의의 핵심이다.

핵심 개념 2 — Bento와 bentofile.yaml (패키징)

Bento는 소스 코드·의존성·모델 파일과 자동 생성된 Dockerfile을 묶은 배포 단위다. bentofile.yaml에 빌드 설정을 적고 bentoml build로 찍는다.

yaml
# bentofile.yaml
service: "service:OcrService"
python:
  packages:
    - torch
    - pillow
docker:
  python_version: "3.11"

1.4부터는 YAML 없이 service.py 안에서 순수 Python으로 빌드 스펙을 정의하는 방식도 생겼다. 어느 쪽이든 목적은 같다 — 모델·코드·환경을 재현 가능한 하나의 아티팩트로 봉인하는 것이다. 여기서 컨테이너 이미지까지 한 흐름으로 이어진다.

핵심 개념 3 — Adaptive batching

BentoML도 배칭을 한다. 서버 쪽 dispatcher가 요청을 모아 배치가 차거나 타임아웃에 닿으면 모델로 넘긴다.

  • max_batch_size, max_latency_ms로 상한을 준다.
  • "adaptive"인 이유: 과거 요청 패턴을 회귀 모델로 학습해 실제 배치 크기·대기 시간을 트래픽에 맞춰 스스로 조절한다.

Triton의 dynamic batching과 목적은 같다(처리량 향상). 차이는 BentoML은 이걸 Python 프레임워크 층에서, 트래픽 적응형으로 한다는 점이다. 다만 뒤에 나오는 Triton 통합을 쓰면 이 로직은 우회된다.

GPU 지원과 Triton 통합 — 유보를 달아야 하는 부분

GPU는 @bentoml.service(resources={"gpu": 1})로 붙인다. 멀티 GPU는 개수를 늘리고 코드에서 cuda:0, cuda:1로 배치한다. 저수준 분산은 PyTorch의 DistributedDataParallel 같은 프레임워크 기본 기능에 위임한다 — BentoML 자체의 저수준 분산 추론 엔진은 없다.

Triton 통합은 조심해서 말해야 한다. BentoML 1.0.16부터 Triton을 Runner로 감싸 "Python 편의 + Triton의 C++ 런타임 효율"을 함께 얻는 하이브리드 구조가 있었다. 그런데:

  • 이 통합 문서는 아카이브된 1.1 문서 경로에만 있다.
  • Runner 개념 자체가 1.2부터 legacy다.
  • 최신(1.4) 문서와 발표 블로그에는 Triton 언급이 없다.

공식적으로 "제거했다"는 공지는 못 찾았지만, 최신 문서에서 완전히 빠졌다는 사실 자체가 근거다. "1.1 시절 기능이며 현행 문서에서는 다뤄지지 않는다"로 이해하는 게 정확하다. 지금 BentoML로 Triton을 감싸는 조합을 전제로 설계하는 건 위험하다.

배포 — BentoCloud가 1차, 자체 K8s는 답보

bentoml containerize <bento>로 OCI 이미지를 뽑는다. 그다음 배포 대상이 갈린다.

  • BentoCloud: BentoML의 공식 관리형 배포 대상. 원클릭 배포, GPU 타입 지정 등. 문서가 사실상 이쪽을 1차 경로로 민다.
  • 자체 호스팅 K8s(Yatai): 마지막 태그 릴리스가 2023년 10월이고 1.2용은 "under construction". 관련 도구 bentoctl도 deprecated. 여전히 동작은 하지만 활발히 진화하지 않는다.

이 대목이 도입 판단에 중요하다. 사내 K8s에 자체 배포하려는 조직이면, BentoML의 자체 호스팅 경로가 답보 상태라는 점을 감안해야 한다. 관리형(BentoCloud)에 올릴 수 없는 환경이라면 이 부분을 별도로 검증해야 한다.

성능 — "BentoML이 빠르다"는 근거는 없다

솔직하게 짚을 부분이다. BentoML 프레임워크 자체의 처리량·지연 공식 벤치마크(오버헤드가 얼마다)는 찾지 못했다.

BentoML이 공개하는 벤치마크는 성격이 다르다. llm-optimizer나 LLM Performance Explorer는 BentoML 위에서 돌린 여러 추론 백엔드(vLLM·TensorRT-LLM 등) 간 비교다. 즉 "BentoML이 빠르다"가 아니라 "BentoML이 벤치마킹 인프라를 제공한다"는 근거다. 성능을 이유로 BentoML을 고르는 건 층위 오해다 — 성능은 아래 엔진의 몫이고, BentoML은 그 위 편의를 판다.

언제 쓰나 / 언제 피하나

강점:

  • Python 타입 힌트만으로 프로덕션급 REST API를 빠르게. 전후처리에 프레임워크 제약이 없다.
  • 모델 패키징(Bento) → 컨테이너화 → 배포까지 하나의 워크플로.
  • bentoml.depends()로 여러 서비스를 묶어 멀티 모델 파이프라인 구성.

약점 / 피할 상황:

  • 저수준 GPU 최적화가 목적 → 그건 Triton/TensorRT의 몫. BentoML 자체 기능으로는 부족.
  • 자체 인프라에 대규모 분산 서빙 → Ray 수준의 클러스터 스케줄링은 없다.
  • 자체 호스팅 K8s가 필수 → Yatai 답보 상태를 감안해야.

한 줄 요약: 모델을 빠르게 API로 만들고 컨테이너로 배포하는 개발 속도가 중요하면 BentoML, GPU를 짜내는 성능이나 대규모 분산이 중심이면 다른 층을 봐야 한다.

다음 편

다음 글은 Ray Serve다. BentoML이 "한 모델을 편하게 API로"라면, Ray Serve는 "여러 모델·여러 노드에 걸쳐 분산·오토스케일"이 주제다. 세 프레임워크의 층위가 모두 나오면, 비교편에서 이들을 조합하는 실전 패턴과 OCR 맥락 판단으로 넘어간다.

참고 링크

  • What is BentoML?
  • Create online API Services (@bentoml.service)
  • Introducing BentoML 1.2
  • Adaptive batching
  • GPU inference
  • Packaging for deployment (containerize)
  • Triton 통합 (1.1 아카이브 문서)
on this page
  • 01BentoML이 정확히 무엇인가 — 패키징 + 서빙 층
  • 02핵심 개념 1 — @bentoml.service로 클래스를 API로
  • 03핵심 개념 2 — Bento와 bentofile.yaml (패키징)
  • 04핵심 개념 3 — Adaptive batching
  • 05GPU 지원과 Triton 통합 — 유보를 달아야 하는 부분
  • 06배포 — BentoCloud가 1차, 자체 K8s는 답보
  • 07성능 — "BentoML이 빠르다"는 근거는 없다
  • 08언제 쓰나 / 언제 피하나
  • 09다음 편
  • 10참고 링크
tags
#모델 서빙#추론 프레임워크#입문📚 추론 서빙 프레임워크 비교
← PREVIOUSTriton Inference Server — GPU 추론을 짜내는 모델 실행 런타임NEXT →Ray Serve — 여러 모델을 분산·오토스케일하는 오케스트레이션 층

이런 글도

  • Ray Serve — 여러 모델을 분산·오토스케일하는 오케스트레이션 층
    > 추론 프레임워크 비교 시리즈의 세 번째 편이다. > 앞의 Triton(런타임 층)과 BentoML(패키징 층)을 먼저 읽으면 Ray Serve가 어느 층에 있는지 대비가 선명하다. Triton이 "한 GPU에서 모델을 빠르게", BentoML이 "한 모델을 API로 편하게"였다면, Ray Serve의 질문은 규모 쪽이다. 여러 모델을, 여러 노드에 걸쳐...
    📁 mlops
    mlops
    2026.07.14
  • Triton Inference Server — GPU 추론을 짜내는 모델 실행 런타임
    > 이 글은 추론 프레임워크 비교 시리즈의 첫 편이다. > 배칭이 왜 GPU 처리량을 올리는지 원리가 궁금하면 배칭과 GPU 활용률을 먼저 읽으면 좋다. 여기서는 그 원리를 Triton이 어떤 설정으로 실현하는지에 집중한다. 추론 프레임워크를 비교하기 전에 한 가지를 먼저 못박아야 한다. Triton, BentoML, Ray는 흔히 "vs"로 묶이지만 같은...
    📁 mlops
    mlops
    2026.07.14
  • Triton vs BentoML vs Ray Serve — 층이 다른 셋을 어떻게 고르나
    > 추론 프레임워크 비교 시리즈의 마지막 편이다. > 각 프레임워크 입문편(Triton · BentoML · Ray Serve)을 먼저 읽으면 이 글의 비교가 훨씬 잘 붙는다. 세 프레임워크를 공부하며 얻은 가장 중요한 결론을 먼저 박아둔다. Triton vs BentoML vs Ray 는 사실 틀린 질문이다. 셋은 경쟁 제품이 아니라 서로 다른 층에 있고...
    📁 mlops
    mlops
    2026.07.14
  • 배칭과 GPU 활용률 — batch 1이 GPU를 놀리는 이유부터 continuous batching까지
    > GPU로 LLM을 서빙한다는 것을 먼저 읽으면 이 글이 훨씬 쉽다. 거기서 유도한 "decode는 memory-bandwidth bound"라는 결론을 전제로 깔고 시작한다. 앞 글에서 이런 수치를 봤다. Llama 70B를 H100에서 요청 하나씩(batch 1) 디코딩하면, 텐서코어 활용률이 약 0.34%다. 989 TFLOP/s짜리 연산 유닛의 9...
    📁 mlops
    mlops
    2026.07.10

댓글 (0)