여러 종류의 입력을 동시에 이해하고 처리할 수 있는 LLM 즉, 기존 LLM이 텍스트만 이해했다면, 멀티모달 LLM은 다음을 모두 처리할 수 있다 텍스트 이미지 음성 비디오 코드 이미지와 텍스트를 함께 다루는 모델을 특히 VLM(Vision-Language Model)이라고 부른다. 요즘 쓰는 GPT-4o, Claude, Gemini가 모두 이 계열이다....
이미지와 텍스트를 함께 다루는 모델을 특히 VLM(Vision-Language Model)이라고 부른다. 요즘 쓰는 GPT-4o, Claude, Gemini가 모두 이 계열이다.
텍스트만 받던 LLM이 어떻게 이미지를 같이 읽는지가 핵심이다. VLM은 보통 세 부품으로 나뉜다.
흐름을 한 줄로 줄이면 이렇다.
이미지 → 패치 분할 → vision encoder → visual token → projector → (텍스트 토큰과 결합) → LLM즉 모델은 이미지를 "픽셀"로 보는 게 아니라, 텍스트와 같은 좌표계의 토큰으로 바꿔 놓고 언어처럼 읽는다. 이 발상은 임베딩이 텍스트를 벡터 공간에 올리는 것과 같은 계열이다 — 다른 모달을 공통 벡터 공간에서 만나게 한다.
두 모달을 어느 지점에서 섞느냐로 갈린다.
요즘 모델은 둘을 섞은 hybrid가 많다 — 앞쪽 몇 층은 early fusion으로 근거를 잡고, 이후는 sparse cross-attention으로 비용을 아낀다.