MLOPS · SERVING-FRAMEWORKS
BentoML — Python 코드를 프로덕션 API로 포장하는 프레임워크
> 추론 프레임워크 비교 시리즈의 두 번째 편이다. > 첫 편 Triton Inference Server를 먼저 읽으면 "런타임 층"과 "프레임워크 층"의 차이가 잡힌다. 이 글은 Triton 바로 위 층에 있는 BentoML을 다룬다. Triton이 "GPU에서 모델을 어떻게 빠르게 돌리나"였다면, BentoML의 질문은 다르다. 내 Python 추론 코...
Ray Serve — 여러 모델을 분산·오토스케일하는 오케스트레이션 층
> 추론 프레임워크 비교 시리즈의 세 번째 편이다. > 앞의 Triton(런타임 층)과 BentoML(패키징 층)을 먼저 읽으면 Ray Serve가 어느 층에 있는지 대비가 선명하다. Triton이 "한 GPU에서 모델을 빠르게", BentoML이 "한 모델을 API로 편하게"였다면, Ray Serve의 질문은 규모 쪽이다. 여러 모델을, 여러 노드에 걸쳐...
Triton Inference Server — GPU 추론을 짜내는 모델 실행 런타임
> 이 글은 추론 프레임워크 비교 시리즈의 첫 편이다. > 배칭이 왜 GPU 처리량을 올리는지 원리가 궁금하면 배칭과 GPU 활용률을 먼저 읽으면 좋다. 여기서는 그 원리를 Triton이 어떤 설정으로 실현하는지에 집중한다. 추론 프레임워크를 비교하기 전에 한 가지를 먼저 못박아야 한다. Triton, BentoML, Ray는 흔히 "vs"로 묶이지만 같은...
Triton vs BentoML vs Ray Serve — 층이 다른 셋을 어떻게 고르나
> 추론 프레임워크 비교 시리즈의 마지막 편이다. > 각 프레임워크 입문편(Triton · BentoML · Ray Serve)을 먼저 읽으면 이 글의 비교가 훨씬 잘 붙는다. 세 프레임워크를 공부하며 얻은 가장 중요한 결론을 먼저 박아둔다. Triton vs BentoML vs Ray 는 사실 틀린 질문이다. 셋은 경쟁 제품이 아니라 서로 다른 층에 있고...