MLOPS
GPU 기반 ML 서비스를 운영하며 정리한 학습 기록. CUDA 버전 생태계, GPU 컨테이너 최적화, 모델 서빙 워커 풀, 추론 성능 분석을 묶었다.
모델 호출이 지나는 한 지점에서 어느 모델과 어느 인스턴스로 보낼지 정하는 계층을 정리한 스터디 시리즈. 관리형 라우터로 충분한 구간과 자체 구축으로 넘어가는 조건을 가르기 위한 기록이다.
llm-serving
model-router