fos-blog/study
01 / 홈02 / 카테고리03 / 시리즈
01 / 홈02 / 카테고리03 / 시리즈

카테고리

  • AI 페이지로 이동
    • RAG 페이지로 이동
    • agent 페이지로 이동
    • claude-code 페이지로 이동
    • harness 페이지로 이동
    • llm 페이지로 이동
    • ops 페이지로 이동
    • practice 페이지로 이동
  • algorithm 페이지로 이동
    • Alias Method: 가중치 랜덤 선택을 전처리 O(n), 추출 O(1)로 바꾸기
    • Welford's Online Algorithm: 값을 저장하지 않고 평균과 분산 계산하기
  • architecture 페이지로 이동
    • distributed-systems 페이지로 이동
    • domain 페이지로 이동
    • evolution 페이지로 이동
    • patterns 페이지로 이동
  • database 페이지로 이동
    • milvus 페이지로 이동
    • mysql 페이지로 이동
    • opensearch 페이지로 이동
    • qdrant 페이지로 이동
    • redis 페이지로 이동
    • vespa 페이지로 이동
    • DB Connection Pool Saturation과 Thread Pool 격리
    • 커넥션 풀 크기는 얼마나 조정해야 할까?
    • MyBatis 기본기 — XML Mapper, resultMap, 동적 SQL, 운영 패턴 정리
    • MyBatis와 JPA/Hibernate 트레이드오프 — 레거시 백엔드를 다루는 시니어 관점
    • 한국어 형태소 분석기 Nori vs Lindera — OpenSearch에서 Milvus로 갈 때 어휘 검색은 유지되나
    • 정규화와 역정규화: 무결성과 조회 비용 사이의 선택
    • 벡터 DB 5종, 아키텍처는 어떻게 다른가
    • 벡터 DB 5종을 실제로 벤치마크했다 — 같은 recall에서 QPS는 얼마나 갈리나
    • 벡터 DB 어떻게 고를까 — OpenSearch · Milvus · Qdrant · Vespa · pgvector 비교
    • 벡터 DB를 실제로 도입한 사례 — 빅테크 프로덕션
  • devops 페이지로 이동
    • docker 페이지로 이동
    • k8s 페이지로 이동
    • Envoy Proxy
    • Graceful Shutdown
    • 종료 신호는 어디서 멈추는가
  • http 페이지로 이동
    • HTTP Connection Pool
    • HTTPS와 TLS: 핸드셰이크, 인증서, 종료 지점
  • java 페이지로 이동
    • concurrency 페이지로 이동
    • jdbc 페이지로 이동
    • spring 페이지로 이동
    • spring-batch 페이지로 이동
    • testing 페이지로 이동
    • Java 동시성 락 정리 — 커머스 메뉴/프로모션 정책 캐시 갱신 관점
    • JVM 튜닝 실전: 메모리 구조부터 Virtual Threads, GC 튜닝, 프로파일링까지
    • 로그에 traceId 남기기 — MDC 부터 OpenTelemetry 까지
    • Java StampedLock — 읽기 폭주에도 쓰기가 밀리지 않는 락
    • Virtual Thread와 Project Loom
  • javascript 페이지로 이동
    • typescript 페이지로 이동
    • AbortController
    • Async Iterator와 제너레이터
    • CommonJS와 ECMAScript Modules
    • 제너레이터(Generator)
    • Http Client
    • Node 백엔드 운영 패턴 — Streams 백프레셔, pipe/pipeline, 멱등성 vs 분산 락
    • Node.js
    • `setImmediate()`
  • kafka 페이지로 이동
    • Kafka 클러스터 아키텍처: Broker, KRaft Controller와 복제
    • Kafka 기본 개념: Topic, Partition, Offset과 Segment
    • Kafka 실전 설계: 파티션 전략, 컨슈머 그룹, 전달 보장, 재시도, 순서 보장 트레이드오프
    • Kafka 파티션·리밸런스·컨슈머 지연 운영
    • Kafka를 로그로 이해하기: 복제, 재처리, 상태와 데이터 통합
    • Spring Kafka 컨슈머 오프셋 커밋과 트랜잭션 정렬: AckMode, manual ack, 멱등 처리
  • linux 페이지로 이동
    • fsync — 리눅스 파일 동기화 시스템 콜
    • SSH forced command 로 배포 키가 실행할 수 있는 명령 제한하기
  • mlops 페이지로 이동
    • llm-serving 페이지로 이동
    • model-router 페이지로 이동
    • Python CUDA 버전 생태계 — nvidia-smi, nvcc, pip, conda가 다 다른 버전을 말하는 이유
    • GPU 컨테이너의 CUDA 버전 호환성 — nvidia-smi부터 이미지 다이어트까지
    • Kubernetes GPU 노드에서 /run tmpfs가 꽉 차서 Pod가 안 뜰 때
    • GPU·CUDA·MPS 기초 — 자바 백엔드 개발자가 처음 만나는 그림
    • Multi-process GPU 워크로드 — 자바 ThreadPool 사용자가 만나는 모델 차이
    • ML 서비스 성능 분석 워크플로 — 자바 백엔드 트러블슈팅과 다른 점
    • 한 GPU 를 여러 프로세스가 나눠 쓰기 — Time-Slicing 과 MPS
  • network 페이지로 이동
    • Connection reset by peer는 누가 보낸 걸까 — 리버스 프록시 홉마다 TCP 연결은 따로 논다
    • L2(스위치)와 L3(라우터)의 역할 차이
    • L4와 VIP(Virtual IP Address)
    • IP Subnet
  • observability 페이지로 이동
    • Observability 입문: 시니어 백엔드가 장애를 탐지하고 대응하는 방식
    • K8s 위 Spring Boot 앱의 메트릭 수집
  • python 페이지로 이동
    • Python async/await — CompletableFuture·Reactor 와 다른 점, 그리고 blocking I/O 함정
    • Python 의존성 관리 — Java Maven/Gradle 사용자가 만나는 첫 충격
    • FastAPI 기초 — Spring Boot 사용자가 빠르게 익히는 법
    • Java 개발자를 위한 Python 심화 — OOP·데코레이터·컨텍스트 매니저
    • PyTorch 기초 — 텐서, 디바이스, 그리고 모델 로딩이 무거운 이유
    • Java 개발자를 위한 Python 문법 핵심
    • ThreadLocal 에서 contextvars 로 — Python 의 요청 컨텍스트 전파
    • OCR 동작 원리 — Layout · Text · Post-process 3단계
    • Python 서버의 RSS가 줄지 않는 이유: CPython, gc.collect(), malloc_trim
  • rabbitmq 페이지로 이동
    • RabbitMQ Basics — 실전 백엔드 관점에서 정리하는 메시지 브로커 기본기
    • RabbitMQ vs Kafka — 백엔드 메시징 선택 기준과 실전 운영 관점
  • resume 페이지로 이동
    • 경험 및 경력기술서
    • 김병태 경력기술서
    • 김병태 포트폴리오
  • task 페이지로 이동
    • ai-service-team 페이지로 이동
    • nsc-slot 페이지로 이동
    • sb-dev-team 페이지로 이동
    • the-future-company 페이지로 이동
  • thinking 페이지로 이동
    • 자기주도 학습: 질문에서 시작해 글로 검증하기
    • 좋은 일을 넘어 중요한 일을 하는 법
FOS-BLOG · FOOTERall systems normal·v0.1 · 2026.04.27·seoul, kr
Ffos-blog/study

개발 학습 기록을 정리하는 블로그입니다. 공부하면서 기록하고, 기록하면서 다시 배웁니다.

visitors
01site
  • Home↗
  • Posts↗
  • Categories↗
  • Glossary↗
  • About↗
02policy
  • 소개/about
  • 개인정보처리방침/privacy
  • 연락처/contact
03categories
  • AI↗
  • Algorithm↗
  • DB↗
  • DevOps↗
  • Java/Spring↗
  • JS/TS↗
  • React↗
  • Next.js↗
  • System↗
04connect
  • GitHub@jon890↗
  • Source repositoryjon890/fos-study↗
  • RSS feed/rss.xml↗
  • Newsletter매주 1 회 · 한 편의 글→
© 2026 FOS Study. All posts MIT-licensed.
built with·Next.js·Tailwind v4·Geist·Pretendard·oklch
fos-blog/AI/멀티모달 LLM (Multimodal Lar…
ai

멀티모달 LLM (Multimodal Large Language Model)

여러 종류의 입력을 동시에 이해하고 처리할 수 있는 LLM 즉, 기존 LLM이 텍스트만 이해했다면, 멀티모달 LLM은 다음을 모두 처리할 수 있다 텍스트 이미지 음성 비디오 코드 이미지와 텍스트를 함께 다루는 모델을 특히 VLM(Vision-Language Model)이라고 부른다. 요즘 쓰는 GPT-4o, Claude, Gemini가 모두 이 계열이다....

2026.09.08·3 min read·49 views·SERIES · AI 서빙 인프라: GPU부터 문서 파싱까지 · 10/11
  • 여러 종류의 입력을 동시에 이해하고 처리할 수 있는 LLM
  • 즉, 기존 LLM이 텍스트만 이해했다면, 멀티모달 LLM은 다음을 모두 처리할 수 있다
    • 텍스트
    • 이미지
    • 음성
    • 비디오
    • 코드

이미지와 텍스트를 함께 다루는 모델을 특히 VLM(Vision-Language Model)이라고 부른다. 요즘 쓰는 GPT-4o, Claude, Gemini가 모두 이 계열이다.

멀티모달(Multimodal)의 의미

  • Modal(모달) = 정보의 형태(표현 방식)
    • 텍스트 = 언어 모달
    • 이미지 = 시각 모달
    • 음성 = 오디오 모달
  • Multi-modal = 여러 모달을 한 번에 다루는 것
    • 예:
      • 이미지 + 텍스트
      • 음성 + 텍스트
      • 비디오 + 텍스트
      • 이미지 + 텍스트 + 오디오

모델은 이미지를 어떻게 "이해"하나

텍스트만 받던 LLM이 어떻게 이미지를 같이 읽는지가 핵심이다. VLM은 보통 세 부품으로 나뉜다.

  1. Vision encoder — 이미지를 패치(작은 사각형)로 쪼개고, 각 패치를 벡터(visual token)로 바꾼다. CLIP·SigLIP 같은 인코더가 이 역할을 한다.
  2. Projector — vision encoder가 만든 visual token을, LLM이 알아듣는 텍스트 토큰과 같은 공간으로 옮긴다. MLP 한 층이거나 Q-Former 같은 구조를 쓴다.
  3. LLM — 이렇게 변환된 이미지 토큰을 텍스트 토큰과 나란히 이어 붙여, 평소처럼 다음 토큰을 생성한다.

흐름을 한 줄로 줄이면 이렇다.

text
이미지 → 패치 분할 → vision encoder → visual token → projector → (텍스트 토큰과 결합) → LLM

즉 모델은 이미지를 "픽셀"로 보는 게 아니라, 텍스트와 같은 좌표계의 토큰으로 바꿔 놓고 언어처럼 읽는다. 이 발상은 임베딩이 텍스트를 벡터 공간에 올리는 것과 같은 계열이다 — 다른 모달을 공통 벡터 공간에서 만나게 한다.

텍스트와 이미지를 합치는 방식 (fusion)

두 모달을 어느 지점에서 섞느냐로 갈린다.

  • Early fusion — 이미지 토큰을 입력 시퀀스에 텍스트 토큰과 함께 넣어 처음부터 같이 처리한다. 시각적 근거(visual grounding)를 일찍 잡는다.
  • Cross-attention fusion — 텍스트는 텍스트대로 흐르고, 중간중간 cross-attention으로 이미지 정보를 끌어와 참조한다. 깊은 층에서 효율이 좋다.

요즘 모델은 둘을 섞은 hybrid가 많다 — 앞쪽 몇 층은 early fusion으로 근거를 잡고, 이후는 sparse cross-attention으로 비용을 아낀다.

멀티모달 LLM이 할 수 있는 일

  • 이미지 분석 + 설명
    • "이 사진에서 문제가 뭐야?"
  • 이미지 기반 Q&A
    • "이 에러 로그가 뜻하는 게 뭐야?"
    • "이 설계도에서 문제점을 찾아줘."
  • 문서 이미지 → 내용 이해
    • 스캔된 PDF를 이해하고 요약하기 (문서 파싱은 Docling·STORM Parse에서 더 다룬다)
  • 음성 → 의미 분석
    • 통화 녹음 요약, 감정 분석, 지시사항 추출
  • 비디오 기초 분석
    • 장면 요약, 객체 설명 등
  • 여러 모달 결합 reasoning
    • 사진 속 화이트보드 그림을 보고 코드 생성
    • UI 캡처 화면을 보고 UX 개선안 도출
    • 시스템 구조도를 보고 리뷰 작성

실제 모델들 (2025~2026)

  • proprietary — GPT-4o, Claude, Gemini가 이미지·텍스트(일부는 음성·비디오)를 함께 다룬다.
  • vision encoder의 진화 — SigLIP 2가 다국어와 dense feature를 더해 Qwen3-VL·Gemma 3의 기본 인코더로 쓰인다. 여러 인코더를 묶어 더 풍부한 표현을 얻는 시도(Cambrian-1)도 있다.
  • open-source의 추격 — Qwen2.5-VL, InternVL3 같은 오픈 모델이 상용 모델과 5~10% 차이까지 좁혔다. Qwen-VL 계열은 임의 해상도 입력을 지원하고 visual token을 75%까지 압축한다.

참고 링크

  • Vision Encoders in Vision-Language Models: A Survey (Jina AI)
  • VLM: How Vision-Language Models Work (Label Your Data)
  • FastVLM — Efficient Vision Encoding (Apple ML Research)
on this page
  • 01멀티모달(Multimodal)의 의미
  • 02모델은 이미지를 어떻게 "이해"하나
  • 03텍스트와 이미지를 합치는 방식 (fusion)
  • 04멀티모달 LLM이 할 수 있는 일
  • 05실제 모델들 (2025~2026)
  • 06참고 링크
tags
#study📚 AI 서빙 인프라: GPU부터 문서 파싱까지
← PREVIOUSSTORM ParseNEXT →ML 서비스 성능 분석 워크플로 — 자바 백엔드 트러블슈팅과 다른 점

이런 글도

  • ai

    하네스 회고는 새 문서로 쌓지 않고 종류에 맞는 기존 단일 소스에 환원한다

    2026.10.02
  • ai

    에이전트가 배운 회피 패턴은 조건을 통과한 것만 파일로 쌓고 주기적으로 지운다

    2026.10.02
  • ai

    ADR 은 되돌리기 어려운 결정의 이유만 남기고, 대안 기각은 옵션마다 줄을 나눈다

    2026.10.02
  • ai

    스킬 문서는 반복 실행을 스크립트로 내리고 같은 지시를 한 곳에서만 소유하게 쓴다

    2026.10.02

댓글 (0)